百度收录要单独做的几件事
站点在一家搜索引擎上表现好,不代表在另一家也一样。本文说明百度侧需要单独完成的验证、提交与排查动作,以及资源提交的配额限制。
- 几家搜索引擎的抓取器与提交通道各自独立,一家做好不会自动在另一家生效。
- 带 www 与不带 www 被视为两个站点,要添加站点实际使用的那个形式。
- 主动推送管增量和时效,sitemap 管存量和兜底,两者配额分开计算。
- 最隐蔽的拦截来自 CDN 机器人策略,请求到不了服务器,日志里什么也看不到。
- 大陆搜索流量以移动为主,移动端可用性直接影响实际效果。
面向大陆市场的站点,百度侧的工作需要单独做一遍。几家搜索引擎的抓取器不同、提交通道不同、诊断工具也不同,在一家做好的配置不会自动在另一家生效。
先完成站点验证
在搜索资源平台添加站点并完成所有权验证,这是使用后续所有功能的前提。需要注意带 www 和不带 www 被视为两个站点,要添加的是站点实际使用的那个形式 —— 也就是 canonical 和 sitemap 里用的那个。添加错了,后续提交会一直失败。
提交通道有两条,配额不同
- 主动推送:通过接口把新发布的 URL 推过去,适合「今天发的今天就让它知道」。配额有限,新站通常是个位数到几十条每天;
- sitemap 提交:提交一个地址,由对方定期来抓,适合存量页面的全量覆盖。它的配额与主动推送分开计算。
两条通道的分工很清楚:sitemap 管存量和兜底,主动推送管增量和时效。常见的误用是把全站几百个 URL 每天用主动推送反复提交 —— 配额很快用完,而存量页面本来就该走 sitemap。
放行抓取器
robots 里要明确放行对应的抓取器标识。更隐蔽的拦截来自 CDN 的机器人管理策略:它可能默认对不熟悉的客户端做挑战或限速,请求根本到不了服务器,于是日志里看不到任何记录,而 robots 文件看起来完全正常。排查时应当用对应的客户端标识从外部网络实际请求一次,看返回的状态码和正文。
用抓取诊断确认实际看到了什么
平台提供的抓取诊断能显示抓取器实际取回的内容。这一项比任何推测都有用:如果返回的是空壳或挑战页,问题就定位了;如果返回正常但仍未收录,再去看内容层面的因素。
两个容易忽略的前提
一是备案。面向大陆的站点需要完成备案,这是服务器接入的前提,与收录间接相关但绕不开。二是移动端。大陆的搜索流量以移动为主,移动端的可用性和加载表现直接影响实际效果,响应式实现要确保抓取器看到的与用户看到的一致。
常见问题
百度收录和谷歌收录要分开做吗?
要。两者的抓取器标识、提交通道、诊断工具都不同,robots 放行、站点验证、sitemap 提交都需要各做一遍。内容层面的工作可以共用,但接入和提交环节必须分别确认。
主动推送和 sitemap 提交有什么区别?
主动推送是通过接口把新发布的 URL 立即告知,适合增量和时效性内容,但每日配额有限;sitemap 是提交一个地址由对方定期抓取,适合存量页面的全量覆盖,配额与主动推送分开计算。把存量页面反复用主动推送提交会很快耗尽配额。
提交了却一直不收录怎么办?
先用平台的抓取诊断看抓取器实际取回了什么。返回空壳或挑战页说明被 CDN 或渲染方式挡住;返回正常则转而检查内容是否过于单薄或与站内其他页面重复。反复提交对这两类问题都没有作用。
参考资料
- 百度搜索引擎优化指南 2.0 · 百度搜索资源平台
- Robots.txt Introduction and Guide · Google Search Central