站点改版后搜索收录掉了一半:robots、sitemap与爬虫抓取的排查修复实践

简介: 站点改版后搜索收录掉了一半,问题往往不在内容,而在抓取与索引环节。本文按“能不能抓、能不能解析、愿不愿收录”的顺序给出可复用排查流程:伪装爬虫自测返回状态、核对robots是否误伤、检查sitemap与内链可达性、canonical规范化、旧地址301迁移、避免误封搜索引擎爬虫,并说明用自助建站平台时哪些SEO规则由平台生成、哪些需要自己核对。

导读

一次站点改版上线后没几天,后台看到的搜索收录量掉了将近一半,自然来量跟着往下走。很多人遇到这种情况第一反应是去改标题、堆关键词,其实顺序反了——收录是排名的前提,页面连抓取和索引都没进去,内容做得再好也没有展示机会。这篇按"爬虫能不能抓、能不能解析、愿不愿意收录"的顺序,整理一套可以反复用的排查与修复流程,改版前后照着走一遍,基本能定位到绝大多数问题。

一、先分清掉的是抓取、索引还是排名

动手前先定位断点,否则容易瞎改。这三件事是递进关系:爬虫先来抓取页面,然后决定要不要建索引,最后才谈得上排名。

  • 如果爬虫日志里压根没有请求,问题在"抓不到",多半是 robots 封禁、服务器拦截或者没有入口链接。
  • 如果日志显示抓了,但站长平台的索引覆盖率在掉,问题在"抓了没收录",多半是重复页、规范化指错、内容质量或返回状态异常。
  • 如果收录量稳定、只是流量掉,那才是排名问题,不在本文范围。

粗看收录量级可以用搜索引擎的 site 指令,但它的数据滞后又粗略,只能当参考,真正以站长平台的"索引覆盖率、抓取统计"为准。第一步先模拟爬虫身份去请求页面,看服务器到底返回了什么:

# 伪装成主流爬虫,看返回状态码、重定向和内容是否与普通浏览器一致
curl -A "Baiduspider" -I example.com/robots.txt
curl -A "Googlebot" -I example.com/sitemap.xml
curl -A "Baiduspider" -L -o /dev/null -s -w "%{response_code} %{url_effective}\n" example.com/some-page

如果爬虫身份拿到的是 403、503 或者一段验证码,而普通用户访问正常,问题就出在服务器把正常爬虫误拦了。

二、robots.txt:最容易误伤的第一道门

爬虫到访先读 robots.txt,这里也是改版事故的高发地。它由若干条规则组成:User-agent 指明对哪个爬虫生效,Disallow 表示不允许抓的路径,Allow 表示放行,Sitemap 用来声明站点地图位置。

改版时最典型的事故,是测试环境为了不被收录,整站写了封禁规则,结果上线时这份文件被原样带到生产,等于主动把门焊死。其它常见错误还有:误封了爬虫的 UA、通配符和路径大小写写错、规则顺序写反导致 Allow 被 Disallow 覆盖。需要清楚的是,robots 只是"君子协议",主流搜索引擎会遵守,但它不挡恶意爬虫,安全防护不能指望它。规则改完,务必在站长平台的 robots 检测工具里逐条验证,而不是凭感觉。

三、sitemap 与页面可达性:别让页面变成孤岛

爬虫发现页面主要靠两条路:站点地图和页面里的链接。改版后 URL 结构一变,老的 sitemap 里全是失效地址、新页面又没及时补进去,收录自然断层。sitemap 要覆盖最新的规范 URL,并在更新后主动到站长平台重新提交。

更隐蔽的是"孤岛页面":页面真实存在,但没有任何内链指向它,爬虫顺着链接走根本到不了。改版如果顺手砍掉了导航、面包屑、分类分页,深层页就会成片变成孤岛。另一个高频问题是规范化标签 canonical:改版很容易制造大量重复地址——同一页带不同排序参数、域名前缀带不带 www、协议版本不一致,如果 canonical 指错,搜索引擎会把这些页面合并甚至放弃收录。下面这段脚本用来核对 sitemap 里的地址状态和 canonical 是否自洽:

import xml.etree.ElementTree as ET
import requests

def load_sitemap(path):
    root = ET.parse(path).getroot()
    # 兼容带命名空间的 sitemap,按标签本地名取所有 loc
    return [e.text for e in root.iter() if e.tag.split('}')[-1] == 'loc']

def audit(urls):
    for u in urls:
        r = requests.head(u, timeout=8, allow_redirects=True)
        if r.status_code >= 400:
            print('异常状态', r.status_code, u)
        elif len(r.history) > 2:
            print('重定向链过长', u)
        # 再抓取页面 <link rel=canonical>,核对它是否指向自身或真正的主版本

四、服务器侧:让爬虫顺畅地抓完

返回状态要稳定。 正常页面应返回 200;临时维护别直接返回 404,那会被当成页面永久消失,应该用 503 配合 Retry-After 告诉爬虫稍后再来;页面真的下线才用 404 或 410。

改版迁移用 301。 旧地址要做永久重定向,一一对应地跳到新地址,把历史权重带过去。最忌讳两件事:所有旧页一律跳到首页,以及用 JS 跳转或多次串联跳转,爬虫跟不动也不认可。

别误封爬虫。 限流和风控策略如果只看访问频率,很容易把勤勤恳恳的搜索引擎爬虫当成恶意流量封掉,日志里就会出现成片的 403、503。应当按 UA 给主流爬虫白名单和合理配额。可以从访问日志里直接统计爬虫拿到的状态码分布:

# 统计主流爬虫抓取各状态码的数量,403/503 偏多就要查限流策略
grep -E "Baiduspider|Googlebot|Bingbot" access.log | awk '{print $9}' | sort | uniq -c | sort -rn

对应到 Nginx,可以对已知爬虫 UA 放宽过于激进的连接限制:

map $http_user_agent $is_search_bot {
   
    default 0;
    ~*(Baiduspider|Googlebot|Bingbot|Sogou) 1;
}
limit_req_zone $binary_remote_addr zone=general:10m rate=10r/s;
server {
   
    location / {
   
        # 命中主流爬虫时走更宽松的限流通道
        limit_req zone=general burst=40 nodelay;
    }
}

此外还要留意抓取预算:筛选组合页、各种带参数的无效 URL 如果不做治理,会产生海量低价值地址,爬虫反复抓这些就没精力抓你的正经页面了,用 robots 配合 noindex 收敛即可。

五、用建站平台时的排查边界

我们这个站点是用乔拓云这类自助建站平台搭的。好处是伪静态链接、自动生成的 sitemap、canonical 和基础 301 这些收录相关项,在后台基本是可视化配置或默认生成的,改版时不用自己手写一堆规则。但封装得深也带来一个排查要点:一旦收录异常,要先分清哪层是平台自动生成、哪层能在后台改、哪层只能提工单处理。我们的固定动作是先把平台当前实际输出的 robots 和 sitemap 拉下来逐条核对,确认不是默认规则在改版后变成了阻碍,再去查自己能控制的内链和内容,避免在根本改不到的地方空耗时间。

踩坑清单

  • 坑1:把测试环境整站封禁的 robots 带到线上。 上线后爬虫全被挡在门外,收录断崖式下跌。上线检查清单里必须单列一项核对线上 robots。
  • 坑2:改版不做旧地址 301。 旧收录集体变 404,积累的权重清零。旧 URL 要一一对应地永久跳转到新页面,而不是全部跳到首页。
  • 坑3:canonical 图省事全站指向首页。 内页被当成重复页合并,越优化收录越少。每个规范页应指向它自己或真正的主版本。
  • 坑4:把搜索引擎爬虫当异常流量封掉。 日志里爬虫清一色 403、503,自然抓不动。按 UA 给主流爬虫白名单和合理配额。
  • 坑5:只看 site 指令的收录数字就下结论。 那数据既滞后又粗略。以站长平台的索引覆盖率、抓取统计为准,结合访问日志看真实抓取情况。

结语

收录排查本质上是"把自己当成爬虫,顺着它的路径完整走一遍":robots 让不让进门,sitemap 和内链能不能找到每个页面,canonical 认不认这个规范地址,服务器又是不是回了正常响应。改版真正容易丢分的从来不是什么高深技巧,而是这几个基础项在变更中被悄悄改坏。把它们固化成改版前后的检查清单,收录这件事就从"掉了再救火"变成了"上线前就拦住"。

相关文章
|
20天前
|
缓存 人工智能 监控
最新版阿里云通义千问 Qwen3.8‑Max 功能介绍、计费规则、接入配置流程与选型指南
Qwen3.8‑Max作为通义千问旗舰多模态大模型,凭借百万级上下文、强大代码工程能力、长视频理解、原生工具调用,为复杂智能体、专业文档分析、多模态复杂任务提供强大底座。但旗舰模型对应的调用成本更高,选型核心原则是按需使用,不要所有业务都直接选用Qwen3.8‑Max。开发者可以先使用免费额度完成原型验证,评估输出效果,结合按量计费、资源包、订阅套餐搭配,再结合分层模型路由策略,平衡业务效果与调用成本。
259 0
|
22天前
|
人工智能 数据挖掘 数据处理
更多岗位,更高门槛:2026 年 AI 雇主报告的五个反直觉结论
ZipRecruiter 经济研究团队 2026 年 6 月向 1000 余名美国招聘负责人做了一轮在线调查,给出五个反直觉结论:AI 还没在大规模裁员,说编制反而增加的雇主占 35%;被抬高的是判断力门槛而不是技术门槛;AI 在招聘里的第一大用途是提高候选人评估质量;允许用 AI,但不许用完之后看起来像 AI 写的;最受伤的是还没有作品的新人。
更多岗位,更高门槛:2026 年 AI 雇主报告的五个反直觉结论
|
21天前
|
安全 数据安全/隐私保护
企业防止数据泄密:先从分级开始
该文揭示数据防泄密的核心矛盾:技术加密治标,分级不清治本。因未明确核心资料范围,导致规则僵化、审批低效、绕行频发。强调分级必须由业务与管理层共同定义,技术只是执行工具——先定级、再设防,方能兼顾安全与效率。
企业防止数据泄密:先从分级开始
|
20天前
|
弹性计算 人工智能 Linux
阿里云最新价格最便宜云服务器解析:轻量应用服务器抢购38元,云服务器99元和199元区别与选购指南
本文针对个人站长、学生与小微企业的低成本上云需求,系统梳理阿里云38元/年轻量服务器、99元/年e实例、199元/年u1实例三款低价产品的配置差异、抢购规则、续费政策与适用场景,拆解新用户资格、峰值带宽、续费同价等核心细节,避开低价套餐常见坑点,帮助不同需求的用户精准匹配高性价比云服务器选型方案。
|
21天前
|
人工智能 算法 API
DeepSeek V4.1 Flash 内测上手:新架构多模态模型,快速体验教程
DeepSeek V4.1 Flash内测上线!采用全新架构,原生支持图文多模态,推理更快、成本更低。现仅限内测用户体验,API调用只需切换model名,无需改base_url。适合开发者快速验证多模态原型。
DeepSeek V4.1 Flash 内测上手:新架构多模态模型,快速体验教程
|
21天前
|
人工智能 自然语言处理 前端开发
字节用半年让85%的AI用例跑进CI/CD,你的团队还在为“AI生成不能用”发愁?
本文剖析字节跳动NL2Test Agent成功落地的五大关键:聚焦“用例转译”而非替代、先闭环再优化、LLM与程序分工协作、精准治理上下文、优先生成稳定断言。对比失败案例,揭示AI测试成败核心在工程设计,而非模型能力。
|
22天前
|
人工智能 API 开发者
DeepSeek V4.1‑Flash内测实战全手册:API调用、多模态测试、客户端接入与排错完整教程
在大模型快速迭代的节奏下,很多厂商会放出限时中间内测版本,让开发者抢先体验新架构带来的能力提升。DeepSeek V4.1‑Flash就是一款限时开放的中间内测MoE架构模型,采用全新CED因果编码器‑解码器混合专家架构,原生内置图文多模态理解,推理吞吐速度相比V4‑Flash正式版本得到显著提升,同时沿用原有正式版本的计费标准,不需要额外付费。该内测版本不需要重新申请API密钥,基础网关地址保持不变,开发者仅仅修改请求内部model参数即可完成调用。
378 0
|
22天前
|
人工智能 监控 数据可视化
告别单会话Agent,QoderWake1.0正式发布:7×24值守数字员工如何重塑企业人机协同
在Agent技术快速迭代的今天,绝大多数智能体产品依旧停留在桌面端单人对话模式,任务生命周期局限单次会话,一旦关闭窗口,上下文全部丢失,很难真正嵌入企业日常办公流程。很多AI智能体只能被动接收用户指令,无法融入团队IM协作,不能自动承接定时、业务事件驱动的工作,难以成为真正参与业务流转的虚拟同事。QoderWake 1.0的正式发布,把Agent能力从桌面软件内部延伸到企业真实工作现场,推出完整可运营的数字员工团队平台,以Waker作为数字员工载体,实现“一句话建岗”,支持常驻办公群聊响应指令、多数字员工协同配合、跨任务持久记忆、多种触发模式调度任务,帮助组织落地规模化人机协同,释放AI生产力
210 1
|
21天前
|
Linux Shell 开发工具
【2026最新版】Git官网下载、安装和使用教程(Win/Mac/Linux全涵盖)
Git是全球最流行的开源版本控制工具,可精准记录代码每次改动、支持多人协作不冲突。它免费跨平台(Windows/macOS/Linux),安装简便,GitHub/GitLab等平台均基于Git构建。最新稳定版为2.55.0。(239字)
1157 1
|
24天前
|
存储 运维 供应链
第三方服务商沦陷引发定向钓鱼:Trezor 事件带来的安全启示
2026年9月,Trezor因第三方邮件服务商Brevo遭入侵,致34.7万用户收到高仿钓鱼邮件,诱导提交助记词;2500人点击恶意链接。事件凸显第三方供应链风险——攻击者劫持官方通讯渠道,实施精准定向钓鱼。(239字)
61 3