上线前核对抓取与索引配置,核心是确认三件事:搜索引擎能抓到页面、抓到的页面允许被索引、最终展示的规范网址唯一。建议用“先屏蔽、后放开”的顺序操作:开发阶段用 robots.txt 或登录态挡住整站,上线时再逐项放开,避免测试页、重复页被提前收录。下面按准备、实施、验证、维护四步展开,其中最关键的一步是上线前用真实域名做一次抓取测试,而不是只看配置文件。
在动手改配置前,先把站点结构列清楚,判断每一类路径的处理方式。常见分法如下:
这里有两种常见处理方案,适用条件不同:
方案A:用 robots.txt 屏蔽。适合整站或整目录级别的控制。缺点是它只阻止抓取,不阻止已收录的网址继续出现在结果里,也不阻止其他页面通过链接传递信号。方案B:用页面级 noindex 屏蔽。适合单个页面或少量模板。它阻止的是索引,但页面仍可能被抓取,因此能读到 noindex 标签。判断原则:如果希望页面完全不出现在结果中,且尚未被收录,优先 noindex;如果只是不想浪费抓取配额,用 robots.txt。两者混用时要注意:被 robots.txt 挡住的页面,搜索引擎读不到它的 noindex,反而可能因外部链接被收录,所以不要对同一批网址同时用这两种方式做“保险”。
配置改动集中在四个位置,建议按顺序检查:
Disallow: / 挡住全站;确认 sitemap 地址写的是正式域名;确认屏蔽规则没有把 CSS、JS 目录一起挡掉。noindex 或 nofollow;确认正式页面输出的是 index,follow 或干脆不写。如果站点有 HTTP 到 HTTPS、带 www 到不带 www 的跳转,要确认跳转是 301 且只跳一次,避免形成跳转链。这一步属于网站建设层面的基础配置,与 SEO 的抓取效率直接相关。
这是本题最关键的一步。配置文件写对不等于搜索引擎看到的就是对的,必须用上线后的真实地址验证。
可执行的操作:
域名/robots.txt 和 域名/sitemap.xml,确认返回 200 且内容为最新版本。判断结果的方式:如果抓取到的 HTML 里出现 noindex,而该页本应被收录,说明模板残留未清理;如果 canonical 指向了别的网址,说明规范配置写错,该页可能不会被单独索引;如果 robots.txt 返回 404 或内容为旧版,说明文件未部署成功。这些现象各有多种可能原因,需要结合具体返回内容定位,不要只凭一个现象就断定是某一处配置的问题。
上线后不要频繁修改 robots.txt 和 canonical,每次改动都可能影响抓取判断。建议固定一个检查节奏:上线当天验证一次,之后按周查看抓取统计中的异常状态码和屏蔽数量。如果发现大量本应收录的页面显示“已发现但未收录”,先排查内链是否可达、sitemap 是否包含,而不是立刻改 robots.txt。
下一步:选一个正式内容页,用官方网址检查工具跑一次抓取测试,把返回的 HTML 与本地模板输出逐项比对,确认 robots、canonical、渲染结果三处一致后再批量放开其他页面。