实战指南 2026年10月5日

中英文站点:为什么只有一边进得了 AI 答案

同一个品牌、两套语言站点,一边频繁出现在 AI 答案里,另一边几乎零引用。问题通常不在翻译质量,而在语言层的三处分池。本文给出一套双语站点的 AI 可见度排查方法:先统一观测口径,再依次核对抓取通道、索引配置、实体归属与信源生态,附五层排查表与固定修复顺序。

#GEO #AI搜索 #多语言站点 #AI可见度

TL;DR / 核心要点总结

  • 中英文站”一边被引用、一边零引用”,多数不是翻译质量造成的,而是两边不在同一个池子里:抓取与索引分池、品牌实体分池、第三方信源分池。
  • 先统一观测口径,再动手排查。 同一批问题用两种语言各问一遍,分开记录”被提及 / 被引用 / 被推荐”;跨语言检索与不等价提问会制造大量假差异。
  • 索引层有一类致命却常见的配置:英文页的 canonical 指向中文页——不是排名低,而是不在候选集里。
  • hreflang 不是 AI 可见度开关,它只在 AI 答案建在同一套索引上时间接生效。
  • 修复顺序固定:先抓取、再索引、再实体、最后内容。 前三层改的是配置与标记,不用重写文章。

一、先排除三种”假差异”,否则后面全白查

看到”中文站被引用、英文站零引用”,第一反应通常是去改内容。但在下结论之前,必须先确认差异真实且可重复。

假差异表现怎么排除
跨语言检索中文提问,答案里出现的却是英文页面,或反之两种语言各问一遍,语言与页面语言不一致的结果单独归类
提问集不等价把中文问题逐字翻译去问,得到一个没人会这么问的问题英文提问集按当地用词与比较对象重写,而非翻译
观测波动模型换代或检索策略调整,几周内引用起落固定引擎、版本与提问集,先排除模型换代再查站点侧

观测口径固定成一句话:同一批问题 × 两种语言 × 固定引擎与版本 × 记录日期。三个字段必须分开记——被提及(答案里出现品牌名)、被引用(带链接的出处)、被推荐(进入候选名单)。

三者口径完全不同,混记就会把”提到了但没有链接”错判成”没有可见度”。测法站内已拆过,不再复述:如何让 AI 引用我的网站。

对企业的翻译:双语站点的排查,一半功夫花在证明”差异是真的”上。 口径不统一就改内容,改完也无法证明有没有效果。


二、抓取层:两边的爬虫是不是都进得来

这一层是整条链路上唯一能”当场验证”的:跑一次探测就有结论。

一是 robots.txt 漏掉语言目录。 英文站常放在 /en/ 这类子目录,而 robots 规则是历史上按路径写的——Disallow: /en/ 这样的整目录禁令,很可能是某次测试留下的。

二是”声明放行”不等于”实际放行”。 CDN、WAF 与 Bot Fight Mode 会按 UA 或地域拦截;两个语言版本常挂在不同服务器或 CDN 账号上,拦截策略并不一致。robots.txt 写着允许,边缘节点照样可以返回 403。

三是独立域名等于从零开始。 英文站用独立域名时,在 AI 侧相当于一个全新站点,中文站的积累不会自动继承;用子目录则共用同一份抓取预算与站点权重。站点结构怎么选是另一个决策;本文只处理”结构已定、两边表现却不一样”。

自查手段:两个语言版本各跑一次 AI 爬虫探测,把 robots.txt 的声明与八个爬虫的实际响应并列对照,看有没有”声明允许、实际被拦”的冲突。免费 GEO 工具 提供这项检测;通道原则见 GEO 优化怎么做 第 1 层。


三、索引层:语言版本最容易被自己屏蔽的四处配置

这一层的共同特征是:页面没被拒绝,而是压根没进候选集。 表现很像”AI 不引用我”,实际在索引阶段就出局了。

第一处,canonical 跨语言互指,杀伤力最大。 英文页如果写成 <link rel="canonical" href="https://example.com/zh/…">,等于告诉搜索引擎”这两页是同一份内容,以中文版为准”。

后果是英文页被合并、不进索引——不是排名低,而是从未参与过排序,反向同理。正确做法是每个语言版本各自 self-canonical,跨语言关系交给 hreflang。

第二处,hreflang 三件套缺一。 完整标注要求自引用、双向 return tag 与 x-default 齐备;最常见的错误是只写单向——英文页指向中文页,中文页没指回来,有一侧的对应关系根本没建立。

第三处,noindex 与 X-Robots-Tag 遗留。 语言站试运行或临时替换期间加的指令忘了撤。这类遗留写在响应头里,页面源码看不见,需要专门扫。

第四处,sitemap 没有按语言拆分。 两套语言版本混在一个 sitemap 里,既不利于分别确认收录状态,出问题也难定位是哪一边。

这里要交代一条边界:canonical 与 hreflang 都是经典搜索层面的机制,不是 AI 检索的独立参数。 Google 的 AI 概览与 AI Mode 建在同一套索引上,这层卫生会间接决定你在 Google 侧 AI 答案中的资格。

而 ChatGPT、Perplexity 这类自建索引的引擎,官方文档没有把 hreflang 列为检索输入。所以别用它承诺效果;各家引擎口径见 六大模型官方规则。


四、实体层:两边得被认成”同一个品牌”

抓取和索引都通了,还有一类落差来自实体:AI 不认为两个站点是同一个主体。

  • 英文写法必须唯一。 拼音全称、官方英文名、旧译名混用,等于把一个实体拆成两三个,引用统计也跟着拆散。
  • Organization 标记要互指。 两套站点的品牌实体使用一致的 @id,并用 sameAs 指向同一组官方资产,AI 才有依据把它们合并理解。写法见 结构化数据完全指南。
  • 基础信息两边一致。 About 页、联系方式、注册主体与创始人信息两侧不一致时,实体可信度会被削弱。
  • 第三方实体记录往往一边有一边空。 中文侧通常有百科、问答与行业门户条目;英文侧要靠维基、领英与行业评价站。这类记录无法由官网补齐,却恰恰是英文侧 AI 最常用的判断依据。

对企业的翻译:实体层的目标是让 AI 回答”这是谁”时给出同一个答案。 两边各自写清楚但互不指向,AI 会当成两个主体,引用也就各算各的。


五、信源层:两边的引用池本来就不是同一批站

这一层最容易被忽略,也最能解释”内容明明更好,为什么另一边不引用我”。

同一个问题,中英文 AI 答案的取样范围本来就不同。 站内此前的实测整理显示:DeepSeek 联网回答的中文侧信源里,门户、垂直媒体与开发者社区占比很高,微信公众号几乎不被抓取;同一个知乎,在千问里被高频引用,在 DeepSeek 里却是零。

国内信源池的分层机制见 豆包与 DeepSeek 双引擎指南。英文侧则更偏向官网直出、维基类词条、评价站与行业媒体。

结果是:同一篇内容在两个池子里的”可引用性”不一样。 中文侧可能因被社区讨论、被门户转载而顺带带出;英文侧没有这层转手,官网能否被直接摘走权重更高。

这也解释了机翻内容为什么表现更差:术语直译后,英文用户不这么问、引擎也不这么匹配;中英混排与残留的中文标点,同时降低可提取性与可信度。

对企业的翻译:英文站不是中文站的翻译版本,而是给另一套提问方式和另一批信源重写的内容资产。 两边共享事实与结论,但标题、术语与证据形态要分别重做。


六、五层排查表与固定修复顺序

把前五节压成一张可以照着执行的表:

层典型症状自查手段成本
抓取爬虫被 CDN 拦,声明与实际响应不一致两个语言版本各跑一次爬虫 UA 探测并排对照低
索引英文页不进索引,canonical、hreflang、noindex 有遗留逐版本核对三项配置、响应头与 sitemap低到中
实体两边被当成不同主体,英文侧无实体记录比对品牌写法、@id 与 sameAs、About 与外部条目中
内容英文页是机翻,术语与本地提问方式不符用本地提问集实测,检查术语、标点与可提取性高
信源英文侧缺少可被引用的第三方来源盘点两个引用池各自出现哪些站点高

修复顺序固定为:抓取 → 索引 → 实体 → 内容 → 信源。 前三层属于配置与标记,改一次长期生效;不修的话后面的投入全部悬空——给没进索引的页面做精装修,不会带来任何引用。内容与信源才是长周期投入,放在通道确认通畅之后。

最后补一条业务判断:英文侧要不要修,取决于客户在不在英文侧提问。 目标市场在中文侧时,英文站零引用可能只是”没有业务后果的可见度缺口”——记进台账定期复测即可。可见度缺口和业务缺口是两件事。


行动清单

今天做

  • 两个语言版本各跑一次 AI 爬虫探测,把”声明 vs 实际响应”存档为基线
  • 用英文提问集实测 10–15 个核心问题,记录被提及、被引用、被推荐

本周做

  • 逐版本核对 canonical 是否 self-canonical,重点查跨语言互指
  • 核对 hreflang 是否自引用、双向、含 x-default
  • 扫一遍响应头里的 noindex 与 X-Robots-Tag 遗留
  • 比对两侧品牌的英文写法、@id 与 sameAs 是否一致互指

本月做

  • 盘点两个引用池:各自常出现哪些站点,英文侧缺哪一类来源
  • 英文侧内容按”重写”而非”翻译”排期,优先处理被搜索最多的页面
  • 固定双语观测口径,每月复测一次

结语

双语站点的可见度落差,几乎从不是一个问题,而是四五处不同性质的问题叠在一起:一头是被配置挡在门外的抓取与索引,另一头是实体与信源在两种语言生态里的天然不对称。

排查的价值在于把它们分开——配置层的问题改一次就长期生效,内容层的问题才需要长期投入。 顺序反了,投入就会打水漂。

对同时运营中英文站点的团队,可长期复用的判断是:先确认差异是真的,再确认通道是通的,最后才谈内容好不好。


📩 需要帮助?GEO 咨询团队可以为你做什么

中英文站点的可见度落差,通常不是某篇文章的问题,而是几处配置与实体记录叠加的结果。

  • 双语可见度对照实测:同一批问题分别用中英文提问,定位落差出现在哪一层
  • 语言版本技术核查:canonical、hreflang、noindex 与两侧爬虫放行逐项核验,先分清”没进索引”和”进了但没被引用”
  • 信源结构评估:对照两个引用池的偏好,指出英文侧还需补哪一类第三方来源

了解 GEO 审计与 AI 搜索诊断服务 →


本文为方法说明类内容。机制与口径来自 Google Search Central、OpenAI 帮助中心等官方文档,以及站内已发布报道对第三方实测的公开整理,均已给出内链。文中不含自有实验数据,未引用效果类百分比;各引擎策略变化较快,结论截至 2026 年 10 月。