网站建设与SEO - 上线前抓取与索引配置核对清单

📍 WDQWDWQD987AAAAA:216.73.216.66
📱 Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; ClaudeBot/1.0; +claudebot@anthropic.com)
🔗 /9c0920b034fd.html
📄

网站建设与SEO - 上线前抓取与索引配置核对清单

上线前核对抓取与索引配置,核心是确认三件事:搜索引擎能抓到页面、抓到的页面允许被索引、最终展示的规范网址唯一。建议用“先屏蔽、后放开”的顺序操作:开发阶段用 robots.txt 或登录态挡住整站,上线时再逐项放开,避免测试页、重复页被提前收录。下面按准备、实施、验证、维护四步展开,其中最关键的一步是上线前用真实域名做一次抓取测试,而不是只看配置文件。

准备阶段:先确定哪些目录该抓、哪些该挡

在动手改配置前,先把站点结构列清楚,判断每一类路径的处理方式。常见分法如下:

这里有两种常见处理方案,适用条件不同:

方案A:用 robots.txt 屏蔽。适合整站或整目录级别的控制。缺点是它只阻止抓取,不阻止已收录的网址继续出现在结果里,也不阻止其他页面通过链接传递信号。方案B:用页面级 noindex 屏蔽。适合单个页面或少量模板。它阻止的是索引,但页面仍可能被抓取,因此能读到 noindex 标签。判断原则:如果希望页面完全不出现在结果中,且尚未被收录,优先 noindex;如果只是不想浪费抓取配额,用 robots.txt。两者混用时要注意:被 robots.txt 挡住的页面,搜索引擎读不到它的 noindex,反而可能因外部链接被收录,所以不要对同一批网址同时用这两种方式做“保险”。

实施阶段:逐项核对四类配置

配置改动集中在四个位置,建议按顺序检查:

  1. robots.txt:确认没有误写 Disallow: / 挡住全站;确认 sitemap 地址写的是正式域名;确认屏蔽规则没有把 CSS、JS 目录一起挡掉。
  2. 页面 head 中的 meta robots:检查模板是否残留 noindex 或 nofollow;确认正式页面输出的是 index,follow 或干脆不写。
  3. canonical 标签:每个页面应指向自己的规范网址,且使用绝对地址、与当前域名协议一致(http 与 https 不要混)。列表页分页、带排序参数的 URL,要指向不带参数的主版本。
  4. sitemap:只放允许索引的正式网址,不放 404、重定向、noindex 页面;提交前确认文件可正常访问且格式无误。

如果站点有 HTTP 到 HTTPS、带 www 到不带 www 的跳转,要确认跳转是 301 且只跳一次,避免形成跳转链。这一步属于网站建设层面的基础配置,与 SEO 的抓取效率直接相关。

验证阶段:用真实域名做抓取测试

这是本题最关键的一步。配置文件写对不等于搜索引擎看到的就是对的,必须用上线后的真实地址验证。

可执行的操作:

判断结果的方式:如果抓取到的 HTML 里出现 noindex,而该页本应被收录,说明模板残留未清理;如果 canonical 指向了别的网址,说明规范配置写错,该页可能不会被单独索引;如果 robots.txt 返回 404 或内容为旧版,说明文件未部署成功。这些现象各有多种可能原因,需要结合具体返回内容定位,不要只凭一个现象就断定是某一处配置的问题。

维护阶段:上线后持续观察,不反复改动

上线后不要频繁修改 robots.txt 和 canonical,每次改动都可能影响抓取判断。建议固定一个检查节奏:上线当天验证一次,之后按周查看抓取统计中的异常状态码和屏蔽数量。如果发现大量本应收录的页面显示“已发现但未收录”,先排查内链是否可达、sitemap 是否包含,而不是立刻改 robots.txt。

下一步:选一个正式内容页,用官方网址检查工具跑一次抓取测试,把返回的 HTML 与本地模板输出逐项比对,确认 robots、canonical、渲染结果三处一致后再批量放开其他页面。

图1 图2

nginx