灰度发布时,你只放出一小批新闻页给百度抓取,收录看起来正常;一旦全量上线,却出现大量页面长期不进索引。这个反差通常不是“灰度有效、全量失效”这么简单,而是灰度样本恰好绕开了全量才触发的例外条件。要判断该不该继续全量,先要找出灰度没有覆盖的那一类页面。
灰度方式决定了你能发现什么例外。按页面灰度,是从同一批模板里抽若干条新闻链接,交给百度抓取;按目录灰度,是整块栏目或某个子路径先上线。两者的暴露面完全不同。
如果全量后失效的页面集中在某个子目录或某个内容来源,那么按页面灰度几乎注定发现不了。此时应改用按目录灰度,把可疑的那一类整体先放出去。
小流量阶段一切正常,往往是因为样本量小、入口少、抓取压力低。全量后下面三类例外才会显形。
灰度时,少量新页能从首页或栏目首屏直接拿到链接,路径很短。全量后新页被推到列表第二、第三页,或只在“更多”分页里出现,抓取路径变长。百度能否持续发现这些页,取决于列表分页是否可抓、是否稳定输出链接。判断依据是:对比灰度页与全量页到首页的最短点击距离,如果全量页普遍更深,就应优先修入口,而不是反复提交。
灰度只放几条时,每条都像独立新闻。全量后同一事件被多个栏目、多个来源重复发布,正文高度接近,页面之间互相稀释。这时单看某一条是否被抓没有意义,要看同一主题下有多少近似页在竞争同一批抓取资源。动作是先合并或规范化重复页,再观察剩余页面的抓取变化。
灰度阶段抓取请求集中在少量新页,效率很高。全量后大量标签页、历史归档页、参数页同时暴露,抓取请求被分散。表现是新闻详情页的抓取频次下降,而无关页面的抓取量上升。这时要检查哪些路径在被持续抓取,再决定是否用 robots.txt 限制低价值目录。
多个角色对“收录是否正常”常有不同理解:编辑看的是后台是否出现链接,开发看的是日志里有没有抓取请求,SEO 看的是搜索结果里能否找到。三种说法可以同时成立,也可以同时误导。
做法是把分歧拆成可核对的字段,而不是争论结论。例如建一张对照表,每条灰度页和全量页记录:
当两个角色对同一页判断不一致时,用这五个字段逐项核对,分歧通常会收敛到某一个具体环节,而不是停留在“收录好不好”的层面。
假设某新闻栏目灰度时只放出十条,全部从首页要闻区链接,三天内都被抓取。全量上线两千条后,只有首页要闻区的少量页持续被抓,其余页面停留在列表分页深处。
此时若直接判定“百度不收录新栏目”,证据不足。更可能的解释是:灰度样本全部享有首页入口,全量页没有同等入口。下一步动作应是先让一部分全量页重新获得短路径入口,再对比这批页与仍处深层的页的抓取差异。如果差异明显,问题在入口结构;如果差异不明显,再回去检查内容重复和抓取预算。
灰度是一种抽样,抽样正常只说明被抽中的那部分正常。全量发布前,应明确灰度覆盖了哪些条件、漏掉了哪些条件。站点地图提交不保证收录,robots.txt 的抓取限制也不等于可靠的索引移除——这些手段改变的是发现与抓取环节,不能替代对页面本身质量和入口结构的判断。
把灰度当成一次排除例外的实验,而不是一次收录结果的预演,全量上线时才不会因为一批页面没进索引而误判方向。