TL;DR / 核心要点总结
- 改版和迁移是 AI 引用下跌的高频触发事件,断点却通常不在内容上。 模板、URL、抓取指令与渲染方式在改版中被重写,而这些环节大多不在迁移验收清单里。
- 常规 SEO 迁移清单过关,不等于 AI 侧没断。 经典搜索关心权重能否继承,AI 引用还要连过检得到、信得过、摘得走三关——后两关不在迁移清单上。
- 五个断点按”便宜且致命”排序:抓取通道 → 渲染方式 → 指令层 → 实体层 → 可提取性。 前三个是配置与模板级的,不需要重写文章。
- 迁移类掉引用,多数是”内容还在,机器已经拿不到或读不懂”。 先修通道,再谈内容。
- 修完还要能证明。 观测记录不标模型版本,你分不清”修好了”和”模型又换了”。
一、先排除三种「假掉」,再动手查站点
改版或迁移之后发现引用变少、引荐流量下滑,第一反应通常是内容出了问题。但动手前要先排除三件事——它们都会制造”引用掉了”的读数,却与站点无关。
模型又换了。 AI Mode 底层模型已进入”三周一换”的节奏,同一问题在不同模型与版本下的引用结果并不一致(怎么控制住模型变量)。
测量口径变了。 换了提问集或测试入口,或者从没记录测试时的模型版本,两组数值根本不可比(基线怎么建)。
更新时间差。 重新抓取、索引更新、快照替换都要时间,改版当周的读数天然含这段时差。也别拿 GSC 生成式 AI 报告的曝光当唯一判据——它只给曝光不给点击(口径与边界)。
排除之后若旧页面确实拿不到引用,再按五个断点逐条查。
| # | 断点 | 改版时的典型触发动作 | 自查手段 |
|---|---|---|---|
| 1 | 抓取通道 | 重写 robots.txt、更换 CDN/WAF、测试环境配置带上线 | 工具的 Crawler Access Test(声明 × 实际响应) |
| 2 | 渲染方式 | 上 SPA、组件化、懒加载,正文改为客户端渲染 | 工具的内容可读性维度(HTML 直出正文量) |
| 3 | 指令层 | 模板默认 canonical、遗留 noindex、旧域名未做页面级跳转 | 查源码的 canonical 与 robots meta,访问旧 URL |
| 4 | 实体层 | 模板重写丢掉 JSON-LD、关于页与作者页被改版 | 结构化数据覆盖清单 + 工具复核 |
| 5 | 可提取性 | 长文改卡片、折叠面板或图片,结论句换成口号 | 三问测试:段落能否独立回答一个问题 |
二、断点 1|抓取通道:robots 声明放行,不等于 AI 真的进得来
改版时最容易被顺手改坏的配置,三种情形最常见:新 CMS 的 robots.txt 模板覆盖旧规则;测试环境的全站 Disallow 忘记清掉;换 CDN/WAF 后,新规则按 User-Agent 拦掉一部分爬虫。
为什么 AI 侧更敏感: 检索型爬虫是否放行,直接决定你有没有资格出现在这一轮回答里。以 ChatGPT 为例,官方口径是放行 OAI-SearchBot 即可被搜索引用,而训练爬虫 GPTBot 可以单独禁止、不影响引用(三个爬虫的分工)。一刀切很可能关掉检索通道、只留训练通道——恰好搞反。
怎么查: 别只读 robots.txt 文本。声明层与执行层可以不一致——robots 写着 Allow,服务器或 CDN 边缘仍可能返回 403。站内免费工具的 Crawler Access Test 会把八个 AI 爬虫的声明与实际响应并排展示(免费自测)。改版后先跑一遍并存档。
修什么: 放行策略按用途分级:检索型放行,训练型按内容策略单独决定;测试与生产环境隔离;规则调整后重新探测。
三、断点 2|渲染方式:正文进了 JavaScript,AI 抓到的是空壳
组件化、SPA 化、滚动懒加载是改版的常规动作,对浏览器里的用户没影响,对抓取器却可能致命:只有 HTML 里直出的文字才读得到。站内工具的检测口径写得很直白——AI 爬虫通常不执行 JavaScript,看不到的内容等于不存在,“正文纯文本量”因此被单列成一个维度预警 CSR 页面。
为什么致命: 爬虫进得来,但直出的 HTML 里只有骨架和占位注释,这个页面在机器眼里就不是”内容差”,而是”没有内容”——改多少遍文案都不会有效果。
怎么查: 复制新页面里的一句正文,用”查看源代码”(不是审查元素)或命令行拉取,在返回的 HTML 里搜这句话:搜得到是服务端直出,搜不到就是渲染问题。
修什么: 关键正文改为服务端渲染或预渲染;折叠与分页只做视觉层,别把文字藏进客户端组件;重要信息别只放进图片。
四、断点 3|指令层:canonical、noindex 与旧域名把页面指向了别处
canonical 指错。 模板默认值往往是首页或旧域名(迁移场景最常见),页面因此声明”代表这个内容的 URL 是另一个”。
noindex 遗留。 通常来自测试环境或临时下线设置,上线时被一起带了过去。这里有一条官方口径:想让 AI 不索引,用 noindex 没问题,但爬虫必须能抓到页面才能读到 noindex 标签——同时用 robots.txt 禁止抓取,这个指令就永远不会被读到(官方口径)。
旧域名与旧 URL。 引用记录里的 URL 是历史的,不会随改版自动迁移。旧地址没做页面级 301 映射的话,访客与抓取器要么打不开,要么被丢到一个不对应的页面上——全站跳首页是丢信息最多的做法。
怎么查: 批量抓取主要页面,确认 canonical 指向页面自身、域名是新域名;检查 robots meta 与 X-Robots-Tag;访问几个旧 URL,确认是页面级 301 而不是 302 到首页。
修什么: canonical 指向页面自身在新域名下的 URL;清掉生产环境遗留的 noindex 与 X-Robots-Tag;旧域名按页面到页面做 301 映射,首页兜底只作最后手段。
五、断点 4|实体层:模板重写把”你是谁”的证据一起删了
JSON-LD 是改版中最容易丢的一类东西——它不在视觉验收范围内。新模板上线后,Organization、Article、Person 的标记可能整块消失;即使保留,里面的 url 与 @id 还可能指向旧域名,sameAs 指向已失效的档案页。
为什么 AI 侧更敏感: 模型采信页面之前,先要确认发布者是一个确定的对象——这正是实体层要解决的问题(第 2 层:实体层)。语义标注又是”AI 就绪度”三层断层里掉得最狠的一层:机器抓得到页面,不等于理解这页讲什么、谁发布的(断层实测)。
怎么查: 重建结构化数据覆盖清单,逐页确认三件事:类型是否还在、url 与 @id 是否换成新域名、sameAs 的档案页是否有效。首页可用工具复核。
修什么: 把 JSON-LD 纳入模板验收项,与页面同源生成而非事后补;迁移时同步更新 @id、url 与 sameAs。部署细节见结构化数据完全指南。
六、断点 5|可提取性:版式升级把能被摘走的段落改没了
前四个断点是”机器拿不到”,第五个不同——是”拿得到却用不了”。改版常见的版式升级包括:把长段落切成带图标的卡片、把正文塞进折叠面板或标签页、把对照表做成图片、把带结论的句子换成品牌口号。对用户是美观,对引用是灾难。
依据: 引用不是”网页对网页”,而是段落对段落。Gemini 的开发者文档口径是,响应中的每个声明都被关联到具体来源段落并附置信度分数(段落级引用的官方口径)。可摘取的单元是”一个能独立回答问题的段落”——它被拆散或替换掉,引用就无处可摘。
怎么查: 拿改版后的页面做一次三问测试:这句话单独摘走还能看懂吗?回答了哪个问题?结论在第一句吗?任何一问过不去,这段对 AI 就是不可用单元。更省事的办法是翻出改版前被引用过的那几句,看还在不在。
修什么: 把被引用过的段落当作要保护的资产,改版前列一份”引用资产清单”;正文用语义化标签承载,对照表用 HTML 表格而非图片;结论前置、段落独立成意。这一层不做,前四层修好了也只是把内容重新交到机器手上。
七、修复顺序与验收:先通道,后结构,最后内容
顺序与 GEO 的分层逻辑一致:抓取与渲染是入场券,指令与实体决定归属,可提取性决定上限。
| 顺序 | 动作 | 验收标准 |
|---|---|---|
| 1 | 抓取通道复原 | 八个 AI 爬虫的声明与响应一致,关键检索型爬虫无 403 |
| 2 | 渲染与正文复原 | 查看源代码能看到正文段落,而非只有骨架 |
| 3 | 指令层清理 | canonical 指向页面自身的新域名,生产环境无遗留 noindex |
| 4 | 实体层重建 | JSON-LD 类型齐备,url、@id、sameAs 全部指向新域名与新档案 |
| 5 | 可提取性恢复 | 原有被引用段落通过三问测试 |
一个前提容易被忽略:验收要成立,观测口径必须先固定。 测试记录写明引擎、模型版本与日期,改版前后用同一套提问集,否则又会回到”这到底是修好了,还是模型又换了”。
行动清单
今天做
- 跑一次抓取通道探测,把八个爬虫的声明与实际响应存档为基线
- 用”查看源代码”确认核心页面正文是否 HTML 直出
本周做
- 全站扫一遍 canonical、noindex 与 X-Robots-Tag 遗留
- 旧域名与旧 URL 建立页面级 301 映射,逐个访问验证响应
- 重建结构化数据覆盖清单:类型、url、@id、sameAs 逐页核对
本月做
- 列一份”引用资产清单”:改版前被引用过的段落是否仍在页面上
- 固定观测口径:提问集 + 模型版本 + 日期,保证改版前后可比
- 把上述检查写进下一次改版的验收清单,前置到排期里
结语
改版或迁移之后 AI 引用下跌,多数时候不是内容变差,而是内容与机器之间的通道被改断了。五个断点里有三个是配置与模板级的——不需要重写一篇文章,只要把声明、指令和标记改回去。
但也别把所有波动都算在站点账上:先排除模型换代与测量口径两个变量,再动手;修完用同一套口径复测。能被证明的修复,才算修复。
📩 需要帮助?GEO 咨询团队可以为你做什么
改版或迁移之后 AI 引用与引荐流量同时下滑?我们通常从三件事做起:
- 迁移前后对照诊断:五个断点逐条核验,输出断点清单与修复优先级
- AI 抓取与索引现状核查:八个爬虫的声明与执行并置探测,确认关键检索型爬虫没被 CDN/WAF 拦在门外
- 改版前技术评估:把检查项前置到改版排期,避免上线后才发现通道断了
本文为方法说明类内容。五个断点的机制依据来自站内已发布报道所引用的官方口径(OpenAI 帮助中心、Google Search Central、Gemini 开发者文档)与站内工具的公开检测口径,均已给出内链。文中不含自有实验数据,未引用效果类百分比;AI 抓取与渲染口径变化较快,结论截至 2026 年 9 月。