SEO学习:网站基础健康与收录指标、索引覆盖率怎么查?
做SEO时间久了,很容易把网站健康度简化成一句话:
我网站有多少页面被收录?
比如网站有500个URL,Google收录300个,百度收录200个,然后马上得出:
Google收录率60%,百度收录率40%,网站SEO有问题。
这个算法看起来很直观,实际很容易算错。
因为一个网站的全部URL里,可能同时存在文章、产品、服务页、Tag、分页、搜索页、重定向URL、重复页面、Canonical页面、主动Noindex页面和已经删除的404页面。
并不是网站产生的所有URL都应该进入搜索引擎索引。
所以真正判断一个网站SEO基础是否健康,要把三个问题分开:
搜索引擎知道多少URL?
其中有多少URL本来就应该被索引?
这些应该被索引的URL,最终有多少真正进入了索引?
理解这三个问题以后,再看Google Search Console、Bing Webmaster Tools和百度搜索资源平台的数据,很多所谓“收录率低”的问题才会看得更清楚。
第一:先搞懂抓取、收录和索引到底是什么关系
SEO里经常把“收录”和“索引”混在一起说。
从实际分析角度,可以简单理解成一条链:
发现URL → 抓取页面 → 分析页面 → 判断是否进入索引 → 获得搜索展示机会。
Google对“Indexed”的官方定义是:Googlebot已经访问页面、分析页面内容和含义,并把页面存储进Google索引;只有进入索引的页面,才具备出现在Google搜索结果中的可能。
所以一个页面没有搜索排名,可能发生在完全不同的阶段。
比如:
搜索引擎根本没发现URL;
已经发现,但还没抓取;
已经抓取,但没有索引;
已经索引,但没有排名;
已经有排名,但排名太低没有流量。
这五种情况的解决方法完全不同。
所以看到网站流量低以后,不应该马上归因于:
内容不够多。
第一步应该先知道:
网站到底卡在哪一层。
第二:网站基础健康,先看“应该被索引的页面”有没有正常工作
如果是一个普通企业官网,我通常建议先把网站URL分成两类。
第一类是:
希望用户通过搜索找到的页面。
例如:
首页;
产品;
服务;
解决方案;
案例;
行业页面;
高质量文章;
重要FAQ。
这些属于应该重点进入索引的URL。
第二类则是:
存在,但没有必要单独进入搜索结果的URL。
例如:
部分分页;
站内搜索结果;
重复Tag;
参数URL;
重复筛选页;
后台页面;
重定向URL;
某些主动设置Noindex的页面。
这一点非常重要。
假设WordPress网站一共被Google发现了1000个URL。
其中只有:
500篇真正有价值的文章和业务页面。
另外500个全部来自Tag、分页、附件、参数和重复URL。
最后Google索引450个。
如果直接使用:
450 ÷ 1000 = 45%
然后判断:
索引覆盖率只有45%,很差。
这个结论很可能完全错误。
因为真正应该计算的是:
450 ÷ 500 = 90%。
所以网站SEO健康度的第一步,不是追求“所有URL全部收录”。
而是:
该收录的尽量收录,不该收录的尽量不要制造索引噪音。
第三:Google索引覆盖情况,现在主要看Search Console的“网页索引”报告
如果网站规模已经达到几百个URL以上,Google Search Console里的Page Indexing,也就是网页索引报告,是最重要的检查入口之一。
Google官方说明,这个报告可以查看Google已经发现的页面中,哪些已经进入索引,哪些没有进入索引,以及没有索引的原因。对于500页以上的网站,Google也明确建议使用这个报告来了解整体索引情况。
打开报告以后,首先会看到两个大的数字:
已编入索引。
未编入索引。
但千万不要只比较这两个数字。
真正有价值的是继续点进:
为什么网页未编入索引。
不同原因代表完全不同的问题。
第四:“已发现,目前未编入索引”和“已抓取,目前未编入索引”要分开看
这是Search Console里最常见,也最容易让站长焦虑的两种状态。
已发现,目前未编入索引
Google官方解释是:
Google已经知道URL存在,但还没有抓取页面。通常Google原本准备抓取,但考虑到网站负载等因素而暂时调整了抓取时间。
简单理解就是:
知道有这个URL,但还没真正来看。
如果网站只有少量新页面处于这种状态,不一定需要紧张。
但如果几百、几千个重要页面长期停留在这里,就应该继续检查:
网站URL是不是太膨胀;
内部链接是不是太弱;
服务器是不是不稳定;
网站是不是持续制造大量低价值URL;
新内容是否距离首页太深。
已抓取,目前未编入索引
这种状态不一样。
Google已经访问了页面,但目前没有把它放进索引,而且官方明确表示无需因为这个状态反复提交抓取。
这时候真正应该检查的是:
内容是否高度重复;
页面是否过于薄弱;
和其他文章是不是同一搜索意图;
页面有没有独特信息;
是否存在Canonical或重复内容问题。
如果一个网站大量文章都处于:
Crawled – currently not indexed
继续批量发布内容通常只会把问题越做越大。
第五:另外几类未索引URL,其实可能完全正常
并不是Search Console里“未索引”越少越好。
比如这些情况有时就是正常状态:
重定向页面;
设置Noindex的页面;
重复页面;
Canonical指向其他URL的页面;
404页面。
如果这些URL本来就不希望进入搜索结果,那么Google不索引完全符合预期。
真正需要警惕的是:
企业希望获得搜索流量的重要产品、服务、案例和文章,被放进了这些分类。
比如你明明希望:
/seo-service/
进入索引。
结果Google认为:
另一个URL才是Canonical。
这时候才需要处理。
所以看索引报告最重要的不是:
未索引有多少。
而是:
这些未索引URL里有没有本来应该获得搜索流量的重要页面。
第六:索引覆盖率到底应该怎么算?
“索引覆盖率”严格来说不是所有搜索引擎统一提供的一个官方KPI,所以企业完全可以自己定义。
但建议不要用:
已索引URL ÷ 搜索引擎发现的全部URL
来计算。
更加实用的公式是:
索引覆盖率 = 已索引的目标URL ÷ 应该被索引的有效URL × 100%
假设网站现在有:
300篇文章;
30个页面;
20个案例;
10个产品页。
合计360个希望获得搜索流量的URL。
其中Google实际索引330个。
那么:
330 ÷ 360 ≈ 91.7%
这个91.7%才更具有SEO判断价值。
因为分母里没有把:
分页;
Tag;
搜索结果;
跳转URL;
主动Noindex页面,
全部算进去。
第七:如果已经提交Sitemap,可以再计算一个更实用的“Sitemap索引率”
大型网站最好再增加一个指标:
Sitemap索引覆盖率。
Google Search Console的网页索引报告支持直接按Sitemap过滤,可以查看某个已提交Sitemap中的URL分别有多少已经索引、多少没有索引。
所以可以计算:
Sitemap索引覆盖率 = Sitemap中已索引URL ÷ Sitemap中有效目标URL × 100%
这里有一个重要原则:
Sitemap最好只放真正希望搜索引擎索引的URL。
比如:
200篇文章;
20个服务页;
10个案例。
那么Sitemap就是一张非常清楚的:
我希望搜索引擎重点处理这些页面。
的URL清单。
这样再看索引率,就比拿整个网站所有被发现的URL计算准确得多。
第八:单个重要页面到底有没有索引,用URL Inspection检查
整体报告适合看趋势。
但如果你现在最关心的是:
GEO服务页为什么没收录? 昨天发的新文章有没有索引? 某个产品页面Google到底怎么看?
这时候应该使用Search Console的URL Inspection,也就是网址检查。
输入完整URL以后,可以检查:
页面当前是否在Google索引中;
Google最后抓取时间;
是否允许抓取;
用户声明Canonical;
Google选择Canonical;
页面是否可以正常访问。
如果刚刚修改了一个重要页面,也可以通过URL Inspection请求重新索引。
Google官方建议,单个页面可以通过URL Inspection请求抓取;如果大量页面需要搜索引擎发现,则应该使用Sitemap,而不是逐条人工提交。
所以两种工具要分工:
网页索引报告看全站。
URL Inspection看单页。
第九:不要把Google的site命令当成精确收录数字
很多SEO人员习惯搜索:
site:example.com
然后看到:
大约238个结果。
马上记录:
Google收录238。
不建议这么做。
Google官方在针对小型网站的索引说明里,会建议使用site:命令快速检查Google是否知道网站的一些页面,但真正要查看网站整体索引覆盖情况,仍然应该使用Search Console的Page Indexing报告。
换句话说:
site命令很适合做快速检查。
例如:
首页有没有;
某个目录有没有;
某篇文章能不能搜出来。
但不适合拿搜索结果页顶部那个估算数字做精确SEO报表。
第十:百度索引量也不要使用site结果代替搜索资源平台
百度这一点说得更加明确。
百度搜索资源平台官方专门说明:
site查询只能作为估值,站长判断索引量应该以搜索资源平台“索引量”工具的数据为准。
百度搜索资源平台的索引量工具可以查看:
网站总体索引量;
指定目录的索引量;
最近一段时间索引趋势。
百度也提醒,索引量本身会存在波动,上下10%甚至更多都有可能属于正常情况,而且索引量上涨并不意味着搜索流量一定同比上涨。
所以百度SEO同样不要每天看到:
今天少收录20篇。
就马上修改网站。
真正值得关注的是:
索引突然长期、大规模下降,并且搜索流量同步下降。
这种情况才应该重点排查。
第十一:Bing怎么检查索引和网站健康度?
如果企业同时做Bing,可以使用Bing Webmaster Tools。
其中Site Explorer可以按网站目录查看:
已经发现多少URL;
多少已经Indexed;
多少存在Error;
多少存在Warning;
多少被Excluded。
同时还能查看点击、展示、外链以及具体URL的抓取状态。
对于单独页面,则可以使用Bing的URL Inspection。
Bing官方说明,该工具能够查看URL:
发现时间;
抓取状态;
索引状态;
HTTP响应;
SEO问题;
结构化数据;
并且可以在必要时请求重新索引。
所以Google、百度和Bing的数据虽然界面不同,底层逻辑其实很接近:
先知道搜索引擎有没有发现。
然后看有没有抓取。
再看有没有进入索引。
最后才进入:
有没有展示、点击和排名。
第十二:网站基础健康,我更建议同时看这5个指标
如果自己做SEO报表,不需要搞几十个数字。
先看五个核心指标就够了。
1. 目标URL总数
也就是:
网站真正希望参与搜索的有效页面到底多少。
这个数字最好由自己控制。
2. 已索引URL数量
分别记录:
Google;
百度;
Bing。
不要把不同搜索引擎混成一个数字。
3. 索引覆盖率
使用:
已索引目标URL ÷ 应索引URL
长期记录趋势。
4. 异常未索引数量
特别关注:
重要页面进入“已抓取未索引”;
重要页面长期“已发现未索引”;
Canonical错误;
Noindex错误;
服务器错误;
404。
5. 有搜索展示的页面比例
这一项比“有没有索引”更往前一步。
页面进入索引只能说明:
有资格参加搜索。
如果半年过去,一个网站300篇文章里只有20篇真正获得搜索展示,那问题就不再只是收录。
还需要继续看:
内容有没有真实搜索需求;
页面是否与搜索意图匹配;
大量文章是不是重复;
站内主题是不是过散。
第十三:真正危险的不是索引率低,而是“URL越来越多,有价值索引越来越少”
这是做大型内容站特别需要注意的问题。
假设第一年:
网站200个URL。
180个有效页面被索引。
覆盖率90%。
第二年疯狂增加内容以后:
网站变成2000个URL。
真正有搜索价值的页面只有400个。
剩下大量:
Tag;
重复文章;
模板页;
低质量AI内容;
参数页。
这时候看起来:
网站规模扩大了10倍。
实际搜索资产可能只增长了一点点。
甚至搜索引擎还需要把大量资源浪费在这些低价值URL上。
所以SEO规模化以后,真正应该管理的是:
有效索引。
而不是:
URL数量。
尤其现在AI生成内容越来越容易,一天创造几百个URL没有任何技术难度。
真正困难的反而是判断:
这些页面到底值不值得进入索引。
第十四:收录正常以后,下一步就不要继续纠结“为什么没有100%”
Google本身也从未承诺一个网站所有可抓取页面都会进入索引。
Page Indexing报告里的“Crawled – currently not indexed”官方说明也明确指出,一个页面即使已经被抓取,仍然可能暂时没有进入索引。
所以网站有500个目标URL,最终收录480个,完全没有必要为了追求:
100%收录。
不断人工提交剩下20个。
更值得先看:
这20个是不是重要页面?
如果是:
重点处理。
如果只是价值很低的历史文章:
优先级完全可以降低。
SEO真正追求的是:
重要页面稳定进入索引,并且开始产生搜索展示。
不是后台数字必须全部变绿。
最后:网站SEO健康度,可以按照这条链来检查
以后再分析一个网站,可以按照下面这条路径:
第一步:网站到底有多少有效目标URL?
先把真正希望获得搜索流量的页面数出来。
第二步:Sitemap里有多少有效URL?
检查是否混入重复、跳转、Noindex和无价值URL。
第三步:Google、百度和Bing分别索引多少?
Google看Search Console。
百度看搜索资源平台索引量。
Bing看Webmaster Tools。
第四步:计算索引覆盖率。
已索引目标URL ÷ 应索引有效URL。
第五步:分析未索引原因。
特别检查重要页面。
第六步:继续看搜索表现。
索引以后有没有:
展示;
排名;
点击;
流量。
因为:
收录从来不是SEO的最终结果。
一个页面进入索引,只是获得了参与搜索竞争的资格。
真正健康的网站应该做到:
该抓取的能够被抓取;
该索引的尽量被索引;
不该索引的URL得到控制;
进入索引的重要页面能够逐渐获得搜索展示。
所以以后再有人问:
我的网站一共有1000个URL,只收录了400个,收录率是不是只有40%?
先不要急着回答。
真正应该先问一句:
这1000个URL里面,到底有多少页面本来就值得进入搜索结果?
把这个数字搞清楚以后,索引覆盖率才真正有意义。
©特别声明
文本来源:https://www.yuezengzhang.com/content/7767.html
原创作者:悦增长GEO服务商





