为什么 33% 的 GEO 监测数据可能是错的:回声污染实测
直接答案
我们在自己的监测管道里发现了一个行业级问题:监测 prompt 含品牌词时,AI 模型会在回答中复述问题——naive 工具把这种「回声」计为自然提及,我们实测假提及率高达 33%。本文公开检测与剔除方法。
这是一个我们本可以不公开的发现:AIHonest 自己的监测管道,第一版就犯了这个错。
一、发现过程
2026-09-13,我们的监测报告显示 DeepSeek 对某测试品牌的提及率 33%。数字看起来不错——直到我们人工核查原始回答。
真相:监测 prompt 本身包含品牌词(「AI热榜 这个网站怎么样……」),而模型在回答开头复述了问题(「关于 AI热榜 这个网站怎么样……」)。naive 的提及计数把这次复述算成了自然提及。1/3 的「提及」是模型在鹦鹉学舌。
二、为什么这是行业级问题
几乎所有 GEO 监测工具的 prompt 都会包含品牌词——这是监测的定义。而主流模型(尤其中文引擎)有明显的 prompt 复述倾向。也就是说:
- 如果工具不做回声剔除,它的「提及率」系统性偏高
- 偏高幅度与 prompt 措辞相关——措辞越接近自然提问,回声越多
- 用户拿这个虚高数字去做决策(投放/SEO/竞品对比),全是错的方向
三、剔除规则(可直接抄)
我们的生产规则:回答中的品牌提及若与 prompt 文本存在 ≥12 字符连续重叠,判定为回声,不计入自然提及率。
实现要点:
- 在回答全文中找品牌词的每一次出现位置
- 检查该位置是否落在「回声区间」内(prompt 与回答的最长公共子串覆盖区)
- 回声区间内的提及不计分;区间外的才是自然提及
- 阈值 12 字符是平衡点:太短会误伤正常引用,太长漏检
四、验证你的工具是否踩坑
一个简单测试:构造一个明确包含品牌词的问题(「AI热榜 怎么样?」),喂给你在用的监测工具对应的引擎。如果报告里的提及率因此上升,而回答只是复述了你的问题——你的工具在数回声。
或者直接用我们的在线验证工具:粘贴问题和回答,30 秒看到 AIHonest 的判定。
五、我们的立场
这个 bug 我们可以悄悄修掉,但我们选择公开——因为「口径透明」不是营销话术,是产品原则。监测行业的信任赤字已经够大了(软文横行、数字黑箱),AIHonest 想做的是那个把数字算对、并且告诉你怎么算的玩家。
想看剔除了回声的真实提及率(含稳定提及率),免费开始——四引擎,口径公开。