做百度收录批量查询时,真正需要核对的不是“收录数”本身,而是日志里能证明这次查询是否有效、结果是否可信的字段。核心包括:查询时间、目标URL、查询方式、返回状态、收录判定结果、判定依据、异常信息。缺少其中任何一项,批量结果都可能把“没查到”误判成“没收录”。下面用一个假设例子说明。
假设你手上有 200 条 URL,用脚本逐条向百度搜索提交查询,并记录日志。一条合格的日志行应该类似:
2025-03-01 10:12:33 | https://example.com/a | site:查询 | HTTP 200 | 已收录 | 结果标题匹配 | 无
这条日志里,每个字段都有用途:时间用于判断结果时效;URL 用于对应目标;查询方式决定结果口径;HTTP 状态说明请求是否成功;收录判定是结论;判定依据说明结论怎么来的;异常信息记录失败原因。如果只记“已收录/未收录”,后面出现争议时无法复盘。
site: 查询、URL 直接查询,还是其他方式。不同方式的结果口径不同,不能混在一张表里比较。第一次做批量查询最容易犯的错误,是只看结果数量不看过程字段。以下情况都会导致“未收录”误判:
?from=xxx 的地址查不到,就判定主页面没收录。判断方法很简单:先看 HTTP 状态码和异常信息,只有状态正常且没有验证码、超时等异常时,收录判定结果才可信。否则应把该条标记为“无法判定”,而不是“未收录”。
把日志按“可信结果”和“不可信结果”分开统计。可信结果里,再按“已收录”和“未收录”分类;不可信结果单独列出,安排重试。重试时优先处理 429 和验证码,而不是直接改判定结论。对于“未收录”的 URL,还需要单独核对 robots.txt 是否禁止抓取、页面是否返回 404 或 500、是否有 noindex 标记。注意,robots.txt 的限制不等于可靠的索引移除,站点地图也不保证收录,这些都要靠日志字段和页面状态分别确认。
下一步:先拿 10 条 URL 跑一次小批量查询,把上面七个字段写进日志,人工核对其中 3 条的结果是否与日志一致。确认字段能支撑判断后,再扩大到全量。