先给结论:当入口页能被抓取、也能出现在提交记录里,而深层页迟迟不进入索引时,断点通常不在入口本身,而在“入口到深层页”的某一段链路上。定位方法不是继续加大提交量,而是把这条链路拆成可单独验证的节点,逐段排除。下面给出两个最常见的解释,以及能区分它们的证据。
典型表现是:首页或栏目页在抓取日志里稳定出现,提交接口也返回成功,但第三、第四层的内容页始终没有抓取记录。此时很多人会判断“提交没生效”,于是重复提交。但提交成功只说明请求被接受,不等于链接被跟随、页面被渲染、内容被判定为独立有效。深层页要进入索引,至少需要经过:入口页可访问 → 深层链接出现在可渲染的 HTML 中 → 爬虫愿意跟随 → 目标页返回可索引状态 → 内容被判为有价值。任何一段断开,结果都一样,但原因完全不同。
深层页的入口可能依赖 JavaScript 渲染后才生成,或者藏在需要交互才展开的组件里。如果入口页的初始 HTML 中没有可跟随的 <a href>,而渲染又失败或被跳过,爬虫就看不到通往深层的路径。此时入口页“正常”是假象:它只是自己能被抓,并没有把权重和路径传下去。
可区分的证据:用抓取工具关闭 JavaScript 后查看入口页源码,搜索目标深层 URL 是否以链接形式存在。如果只在开启 JS 后才出现,说明链路依赖渲染。再看渲染后的 DOM 是否包含该链接。若渲染后也没有,问题在链接生成逻辑,而非提交渠道。
另一种情况是链接确实在 HTML 里,爬虫也跟随了,但目标页返回了不该出现的状态:被 robots.txt 限制抓取、返回 4xx/5xx、带 noindex、或需要登录/参数校验才展示正文。这里要特别注意一个常见误解:robots.txt 的抓取限制不等于可靠的索引移除。它只约束抓取行为,已存在的 URL 仍可能因外部链接被索引;反过来,如果目标页被 robots 挡住,爬虫无法读取内容,也就无法确认其可索引性。
可区分的证据:直接请求深层页的 HTTP 状态码和响应头,检查是否有 noindex;核对 robots.txt 是否覆盖该路径;对比同一模板下能收录和不能收录的两类页面,看差异是否集中在某个参数、某个目录或某种状态码上。
假设同一站点有两个栏目 A 和 B,模板相同,A 的深层页有抓取记录,B 没有。可以做如下对照,而不是凭感觉判断:
这个对照的边界是:它只适用于模板一致、仅数据不同的页面。如果 A 和 B 本身结构差异很大,对照结论不能直接照搬,需要先统一模板再比较。
确认断点后,动作顺序会影响下一步判断。若断点在链接暴露,优先把深层入口改为服务端可输出的静态链接,或确保渲染稳定;改完后重新抓取入口页,观察深层 URL 是否首次出现在抓取记录中。若断点在目标页状态,先修状态码和 noindex,再单独提交少量深层 URL 做验证,而不是全量重提。
站点地图不保证收录,它只是提供发现路径;提交接口返回成功也不代表页面会被索引。验证时应以“深层 URL 是否出现抓取记录、返回状态是否可索引、内容是否与入口主题一致”三项为准。若三项都正常但仍未收录,说明瓶颈可能已不在链路可达性,而在内容质量或站点整体信任度,此时继续修链路收益有限,应转向内容与站点结构评估。
最后提醒一点:请求量、抓取量或某项提交统计归零,不能单独证明处理正确。它也可能是抓取预算转移、日志采样变化或提交渠道调整的结果。判断断点是否真正修复,要看深层 URL 的抓取与索引状态是否稳定变化,而不是看某一个数字的瞬时波动。