网站只收录主页,内容页一直不收录的原因有哪些?
新网站上线以后,经常会出现一种情况:
搜索企业域名,首页已经能够在百度、Google里找到;继续检查产品页、服务页、文章页,却发现发布几十篇甚至上百篇内容以后,搜索引擎还是只收录主页。
很多站长看到这种情况,会开始反复提交URL、每天更新文章、修改Title,甚至怀疑域名是不是“没有权重”。
实际上,只收录首页通常说明搜索引擎已经知道这个网站存在,但从首页继续发现、抓取、评估内容页的过程中,某一层出现了问题。
整个过程可以拆成:
发现URL → 抓取URL → 解析页面 → 判断规范URL → 评估内容 → 进入索引。
所以排查时不要只问:
为什么不收录?
更应该先确认:
内容页到底卡在哪一步?
第一:首页已经收录,至少说明域名本身已经被搜索引擎发现
如果网站首页已经进入百度或者Google索引,至少能够确认几个基础事实:
域名可以正常访问;
搜索引擎已经发现网站;
首页具备基本抓取条件。
这时候内容页长期没有收录,排查重点就应该从:
“搜索引擎知不知道这个网站”
继续深入到:
“搜索引擎知不知道这些内容页,以及为什么没有把它们加入索引”。
例如网站有:
/
首页
/services/
服务页
/products/
产品页
/blog/article-a/
文章页
首页能够收录,不代表后面三个页面一定会自动收录。
搜索系统仍然需要分别发现、抓取和判断这些URL。
第二:先确认内容页到底有没有被搜索引擎发现
这是第一步。
很多网站看起来发布了100篇文章,但搜索爬虫能够发现的入口非常少。
例如文章:
没有出现在首页;
没有分类页;
没有相关文章;
没有内链;
导航也没有入口;
只存在后台数据库里。
对于搜索系统来说,这种页面非常接近:
孤岛页面。
百度搜索资源平台公开资料也提到,页面长期没有被发现的原因之一,就是缺乏可以被搜索引擎访问的链接,页面形成孤岛。百度同时建议通过站内链接和资源提交帮助搜索蜘蛛发现新URL。
所以先检查:
新文章发布以后,用户能不能从首页或者栏目页一路点击进去?
如果正常用户都很难找到,搜索爬虫同样很难稳定发现。
第三:检查robots.txt有没有只允许首页、误封内容目录
这是特别常见的技术问题。
比如:
User-agent: *
Disallow: /blog/
网站首页:
/
没有被禁止。
所以首页能够收录。
但文章全部位于:
/blog/
搜索爬虫根本没有正常抓取机会。
百度搜索资源平台明确说明,robots.txt用于指定搜索蜘蛛的抓取范围;如果希望网站内容正常被收录,就需要避免误封需要搜索的页面。百度现在也提供Robots工具和抓取诊断帮助站长检查这类问题。
所以遇到“只收录首页”,优先打开:
你的域名/robots.txt
重点检查:
文章目录;
产品目录;
服务目录;
分类目录;
有没有被误封。
第四:再检查内容页有没有设置noindex
robots控制抓取。
noindex控制是否进入索引。
例如某个文章模板意外输出:
<meta name="robots" content="noindex">
那么:
首页模板正常;
文章模板全部noindex;
最终就可能出现首页正常收录、文章大量不收录的情况。
这种问题在:
更换SEO插件;
开发测试站迁正式站;
主题模板修改;
时特别容易发生。
Google Search Console的Page Indexing报告会直接显示因noindex等原因无法进入索引的页面,所以Google站点可以先在索引报告和URL Inspection里抽查几个典型文章URL。
不要只检查首页源码。
一定要单独检查内容页模板。
第五:Canonical写错,也可能让搜索引擎放弃内容页
另一个很隐蔽的问题是:
所有文章都能正常访问。
状态码也是200。
但页面Canonical全部错误指向首页。
例如文章:
https://example.com/blog/seo-guide/
HTML却写:
<link rel="canonical"
href="https://example.com/">
这相当于持续向搜索系统表达:
首页才是这个页面更希望作为规范版本的URL。
如果一批内容页都发生这种错误,就可能造成严重的索引异常。
正常独立文章通常应该检查是否使用:
<link rel="canonical"
href="https://example.com/blog/seo-guide/">
也就是Self Canonical。
所以“首页有收录、内容页不收录”时,Canonical属于必须抽查的一项。
第六:Sitemap提交了,不代表内容页一定会收录
很多站长的逻辑是:
我已经提交Sitemap了。
里面有500个URL。
为什么只收录首页?
因为Sitemap解决的主要是:
URL发现。
百度搜索资源平台目前的普通收录说明非常明确:资源提交可以缩短爬虫发现网站链接的时间,但无法解决页面最终是否被收录的问题,提交以后也不保证每个URL都进入索引。
百度关于Sitemap的工具说明同样指出:
提交的数据不保证全部抓取和收录,是否进入网页搜索仍然和页面质量有关。
所以:
Sitemap里有URL
只能说明你主动告诉了搜索引擎:
“这里有页面。”
不能直接推导成:
“搜索引擎必须收录。”
第七:确认搜索蜘蛛是否真的抓到了内容页
这一点对于百度特别实用。
可以进入百度搜索资源平台使用:
抓取诊断。
选择一个长期没有收录的文章页,让百度蜘蛛实际抓一次。
百度官方对抓取诊断的定义就是:
从百度蜘蛛视角查看网页,判断抓取内容和站长预期是否一致,同时检查网站与百度之间的连接是否正常。
重点看:
是否抓取成功;
返回什么状态码;
正文是否完整;
有没有被WAF阻止;
蜘蛛看到的内容和用户看到的是否一致。
有时候站长浏览器打开:
完全正常。
百度蜘蛛访问却遇到:
403;
连接超时;
安全验证;
CDN拦截。
这种情况下继续每天写文章,没有解决真正问题。
第八:服务器不稳定,也可能导致首页收录、深层页面长期抓取不足
首页通常拥有:
最多外部链接;
最高站内链接;
最高抓取优先级。
所以服务器性能较差时,搜索蜘蛛可能仍然能够比较稳定地抓首页,但新文章和深层URL的抓取效率很低。
百度公开的不收录原因说明中,就把:
网站封禁;
页面质量筛选;
抓取失败;
抓取配额;
列为影响内容抓取和收录的重要因素,并特别提醒,如果站点页面突然大量增长,也可能影响优质URL的抓取。
所以需要看:
服务器有没有频繁5xx;
TTFB是否特别高;
蜘蛛抓取有没有大量失败;
CDN是否不稳定;
网站是不是一次性生成了几十万个URL。
对于只有几百个正常页面的企业网站来说,如果搜索爬虫大量时间被:
Tag;
参数;
站内搜索页;
动态垃圾URL;
占用,也会降低真正内容页面的抓取效率。
第九:如果已经抓取了,却还是不收录,就要开始检查内容价值
这一层非常重要。
Google Search Console里有一种状态:
Crawled – currently not indexed
意思是:
Google已经抓取这个页面,但目前没有把它加入索引。Google官方明确表示,这种页面未来可能或者可能不会进入索引,也没有必要反复提交抓取。
到了这一步,继续研究:
Sitemap有没有提交
已经没有太大意义。
因为页面已经被发现并抓过了。
需要重点研究:
内容是否太薄;
和其他页面是否高度重复;
有没有真正独立的搜索需求;
有没有提供新的信息。
如果网站有:
100篇文章;
其中80篇只是同一个问题换标题重新写,
搜索系统没有必要全部收录。
第十:新网站最容易出现的问题,是文章很多,但内容差异太小
例如连续发布:
企业SEO怎么做?
公司SEO怎么做?
企业网站怎么做SEO?
企业SEO优化方法有哪些?
如果正文结构和答案高度一致,表面上网站新增了4个URL,实际只覆盖了一个核心问题。
同样,AI批量内容以后特别容易出现:
标题不同;
开头不同;
正文观点基本一样。
这种情况下:
继续增加页面数量,未必能够改善收录。
反而可能把网站有效内容比例越做越低。
更合理的方法是:
一个主要搜索意图,一个核心页面。
然后让真正不同的问题继续建立新URL。
第十一:产品页、分类页如果内容过薄,同样可能长期不收录
内容页不只是文章。
很多企业真正不收录的是:
产品;
案例;
解决方案。
例如一个产品页只有:
产品名称;
一张图片;
联系电话。
搜索系统能够获得的信息非常有限。
可以继续补充:
产品是什么;
解决什么问题;
参数;
应用场景;
不同型号;
真实图片;
案例;
常见问题。
案例页则应该至少说明:
客户类型;
问题;
解决方案;
实际过程;
结果。
页面内容越能够独立解决一个真实问题,进入搜索索引的理由才越充分。
第十二:检查网站有没有大量重复Tag、分类和参数页
假设网站真正只有:
300篇文章。
搜索爬虫却发现:
300篇文章;
100个Tag;
50个分类;
大量分页;
作者页;
日期归档;
站内搜索页;
参数页。
最终可访问URL可能已经变成几千个。
对于新站来说,这会明显增加搜索系统理解网站的成本。
所以建议统计:
后台真实内容URL;
Sitemap URL;
搜索引擎发现URL。
如果三者差距特别大,就需要治理:
Tag;
归档;
参数;
重复分页;
低价值模板。
让搜索系统把更多注意力放回:
真正值得索引的内容页面。
第十三:首页到内容页的点击层级不要太深
例如网站文章想进入:
首页;
内容中心;
分类;
子分类;
分页;
文章。
需要连续点击五六次。
对于规模并不大的企业网站,完全没有必要把架构设计这么深。
更清楚的结构可以是:
首页
↓
内容中心 / 核心栏目
↓
文章
同时利用:
相关文章;
主题页;
面包屑;
正文内链;
增加发现入口。
百度官方历史资料在解释新页面长期不收录时,同样提到页面没有外部或可发现链接、形成孤岛,是影响搜索发现的重要原因。
所以内链不只是为了所谓“传权重”。
它首先帮助:
发现URL。
第十四:新站只收首页,有时候确实需要给搜索引擎一点时间
如果网站:
刚上线三天;
首页已经进入索引;
内容只有十几篇;
技术检查正常;
这种情况没有必要每天大改网站。
搜索引擎并没有承诺:
发现一个新站以后立即把全部页面收录。
Google明确表示:
并不会抓取互联网上的所有页面,也不会把所有已经抓取的页面全部加入索引。
百度公开资料同样说明,新页面从产生到收录本身存在处理周期,实际速度会和页面搜索价值、重要程度等因素相关。
所以:
刚上线
和:
已经运营三个月、只收首页
需要分开判断。
后者明显更值得系统排查。
第十五:不要每天重复提交同一批URL
这是新站特别常见的操作。
今天提交100条。
没有收录。
明天再提交。
后天继续提交。
百度搜索资源平台已经明确说明,普通收录和链接提交工具可以帮助蜘蛛更快发现链接,但不能直接解决页面是否收录。
所以页面已经被发现以后,反复提交没有解决新的问题。
真正需要判断的是:
抓了吗?
如果没抓:
查发现、内链、服务器、robots。
如果抓了:
查页面质量、重复、Canonical和搜索价值。
这个区分非常重要。
第十六:Google可以直接按照这几个状态判断卡在哪里
如果主要排查Google,可以进入Search Console的Page Indexing报告。
比较常见的状态包括:
Discovered – currently not indexed
Google已经知道URL,但还没有完成抓取。
Google官方说明,这通常表示Google发现页面以后暂时没有抓取,可能和站点抓取负载等因素有关。
这时候重点看:
服务器;
URL数量;
网站结构;
抓取需求。
Crawled – currently not indexed
Google已经抓取,但目前没有加入索引。
这时候重点转向:
内容;
重复;
搜索价值;
页面质量。
Duplicate / Canonical相关状态
检查:
是不是另一个URL被Google选成规范页面。
这样比单纯搜索:
site:example.com
判断问题准确很多。
第十七:百度可以按照“抓取—索引—流量”三个层次检查
百度网站可以直接按照这个顺序。
第一层:抓取
看:
抓取频次;
抓取诊断;
抓取异常。
第二层:索引
观察索引量有没有从首页逐渐扩展到内容页。
第三层:搜索表现
已经收录以后,再看:
流量与关键词。
百度搜索资源平台当前仍然把抓取、资源提交、索引和搜索表现作为相互连接但不同的站长管理环节。
不要把:
提交量
直接当成:
收录量。
第十八:网站只收首页,可以直接按照这张清单排查
如果现在遇到这个问题,可以按照下面顺序执行。
1. 随机选择5~10个内容页
不要只测试一篇。
2. 检查HTTP状态码
正常页面应该稳定返回200。
3. 检查robots.txt
确认没有封禁文章或产品目录。
4. 检查Meta Robots
有没有误设noindex。
5. 检查Canonical
有没有全部指向首页或其他URL。
6. 检查站内入口
内容页能不能从栏目、首页或相关文章发现。
7. 检查Sitemap
是否已经包含正确Canonical URL。
8. 使用抓取诊断 / URL Inspection
判断搜索蜘蛛到底有没有抓到页面。
9. 检查服务器和WAF
有没有403、5xx、验证码或蜘蛛拦截。
10. 检查内容重复度
是不是大量页面解决同一个问题。
11. 检查低价值URL膨胀
Tag、参数、归档是否远多于正常内容。
12. 再决定是否继续增加内容
如果前面问题没有解决,先别急着一天增加50篇。
这一套基本可以覆盖大多数“只收首页”的常见原因。
最后:只收录主页,真正需要找的是内容页卡在搜索链路的哪一步
所以网站只收录主页,内容页一直不收录,最常见的原因可以归纳成五类:
第一类:没有被发现。
孤岛页面、内部链接不足、Sitemap没有提交正确URL。
第二类:抓取受阻。
robots、服务器、WAF、蜘蛛访问异常。
第三类:索引设置错误。
noindex、Canonical错误、重复URL。
第四类:网站结构有问题。
大量Tag、参数、分页和低价值URL挤占正常内容发现。
第五类:内容本身缺少索引价值。
页面过薄、高度重复、AI批量同质内容、没有独立搜索需求。
百度目前已经明确说明,普通收录工具只能加快链接发现,无法解决内容是否最终被收录的问题。
Google同样明确区分:
已经发现但没有抓取;
已经抓取但没有索引;
不同状态对应完全不同的处理方向。
所以真正正确的排查逻辑应该是:
内容页有没有入口
↓
蜘蛛能不能抓
↓
抓到的内容是否正常
↓
Canonical / noindex是否正确
↓
页面有没有独立价值
↓
搜索引擎是否选择进入索引
如果只是首页刚收录、新站才上线几天,可以继续观察。
如果已经运营数月,几十、几百个内容页仍然几乎全部不收录,就不要再把问题简单归结成:
“新站权重低”。
把抓取、索引、网站结构和内容质量一层一层拆开,通常才能真正找到问题。
首页被收录,只代表搜索引擎已经找到门口。
内容页能不能继续进入索引,取决于网站有没有让搜索爬虫顺利走进去,以及里面是否真的有值得继续保存和展示的内容。
©特别声明
文本来源:https://www.yuezengzhang.com/content/8328.html
原创作者:悦增长GEO服务商





