GEO 效果怎么监测:AI 推荐率怎么算才准
摘要:AI 推荐率怎么算才不自欺?先把口径定死。本文给三层指标——被提及率、口径一致率、引用附源率——讲清分子分母怎么取、问题集与平台怎么固定、数据怎么采,点出四种最常见的假数据,并说明报表怎么给领导看、怎么跟线索承接对上。
"AI 推荐率"这个词被用得很乱。有人拿它指"答案里提到我的概率",有人指"给我排第几",还有人把任何一次"被看见"都叫推荐率。口径一乱,两个月的数字就没法比,报表也就失去了意义。
这篇只做一件事:把 AI 推荐率口径讲清楚,让它变成一条能画趋势、能追责、能进月度会的曲线。
一、先把口径钉死:AI 推荐率到底怎么算
1.1 定义(建议直接抄进方案)
AI 推荐率(被正确提及率)= 在固定问题集 × 固定平台上,答案中关于本主体的表述与事实源一致、且被提及的提问数 ÷ 问题集总提问数。
各平台采样偏好与差异,各模型采信口径对照 里按平台列了观察记录。
拆成五件事:
要素怎么定常见错误分子被提及 且 一致 的提问数只算被提及,把说错的也算进去分母问题集总条数(固定不增减)中途加问题,分母变了,曲线断了问题集20–30 条真实客户提问,问法固定每次问得不一样,测的是问法不是效果平台固定清单(主力 5–8 个 + 观察若干)平台换来换去,无法归因样本每条提问至少 2 次重复观察单次采样,噪声大
这三件事必须写进方案:问题集固定、问法固定、时间固定。少一条,这次结果就跟上次不可比。
1.2 三个不要混用的词
提及率:被提到了就算,不管说得对不对(看覆盖);
一致率:说法与事实源一致(看正确);
推荐率:被提及 且 一致(看有效结果)。
日常汇报里建议以"一致率"为主、"提及率"为辅。只报提及率,很容易在口径变差时数字还涨——因为被提及的次数涨了,但说的是错的。
二、三层指标:别只盯一个数
层级指标算法回答的问题L1 触及层被提及率被提及提问数 ÷ 总提问数别人知不知道我L2 正确层口径一致率提及且一致的提问数 ÷ 总提问数别人说没说对L3 引用层附源率 / 引用质量附源(或给出链接)的提及数 ÷ 总提及数别人敢不敢署我
三层一起看才有诊断价值:
L1 涨、L2 跌:铺量成功了,口径失控了——典型的"先铺后修"后遗症;
L2 涨、L3 不动:答案里提到了,但没给出处,承接与信任都没跟上;
三层全绿但线索没变:说明到了业务层,问题在官网转化或销售承接,不在 GEO。
度量口径怎么分层、月度表里该放哪几列,AI 搜索可见度怎么度量 里给过三层的框架。
三、数据怎么采:手工与半自动
3.1 手工清单(适合小团队起步)
一张表就够:月份、平台、提问、答案是否提及、说法是否一致、是否附源、异常备注。
优点:能做人工语义判断("说的对但措辞不同"这类机器判不了);缺点:费时间,20 条 × 6 平台 × 12 个月 ≈ 每月 6–8 小时。
3.2 半自动(建议的进阶形态)
问法固定后,可以用脚本或工具做首轮采集,再人工复核语义判定。人工复核这一步不能省——机器只能判"答案里有没有这个字符串",判不了"说得对不对"。
3.3 采样纪律
同一问题至少重复两次(有些平台的采样有随机性);
固定时间窗口(例如每月第二个工作周,避开大促与节假日);
登录态、地区、是否登录用户,这些变量能固定就固定,固定不了就记进备注。
知道差异才不会拿一个平台的结论推全平台。
四、四种最常见的假数据
假数据一:问法变了。 这月问"你们家做 GEO 多少钱",下月问"南京 GEO 优化报价",分母一样、分子不同,曲线看起来在涨,实际什么都没变。
假数据二:时间漂移。 月初测、月末测,或者这个月在中旬测、下个月在月初测,遇到的上下文窗口不同。固定到"每月第二个工作周"这种颗粒度就够。
假数据三:平台选择偏差。 只测自己做得好的两三个平台,或者临时换一个刚上线的平台凑数。平台清单一旦写进方案就别动,除非整批重做基线。
假数据四:单次采样噪声。 一条提问单次结果波动大(模型采样、检索结果轮转、当日上下文不同)。至少两条重复,或者把问题集扩到 30 条以上摊薄。
这四种里第一种最常见,也最容易在汇报时被忽略——因为加问题是最"有进展"的动作,却恰好毁掉了可比性。
五、报表怎么给领导看
5.1 一张月度表的标准列
月份|平台数|问题数|被提及率|一致率|附源率|异常说明(哪几条说法错了、错在哪)
5.2 三层写法
第一行写结论:这个月一致率是 X%,比上月 (+/−) Y 个百分点,主要变化来自 A 类问题;
第二行写证据:哪几条问题从"没提到"变成"提对了"、哪几条反了、错的说法是什么;
第三行写下月动作:对应的出口是谁、改什么、什么时候复测。
只看曲线不看动作,报表就成了装饰。
5.3 季度复盘要回答三个问题
这三个月里,我们改了什么、对应的数是涨还是跌?(因果对得上吗)
剩下的没改善的,卡在哪一层?(抓不到 / 摘不走 / 说法不一致)
下季度要不要换打法?(如果动作都做了数不动,说明出口或问题集有问题)
还有一点值得提前写好:指标与责任人的对应关系。被提及率归市场看,口径一致率的兜底责任在事实源 owner,附源率则要看出口与内容两块。责权不写清,月度会上就会出现"这个数涨了但没人知道该谁改"的情况——这也是很多度量体系做两期就停摆的真实原因。
六、跟线索怎么对上
度量很容易停在"AI 指捕获"这一层,接不上业务。补三个动作:
来源标注:销售记录客户"从哪知道你们"时,把"AI 搜索/大模型"单独列一项,不要塞进"其他";
问一句场景:客户愿意说的时候问"你是怎么搜到我们的",瞬时答案往往很准;
对照基线:AI 侧一致率涨了、销售端 AI 来源线索也涨了,这条链路才算打通。
只有 AI 侧数字涨、业务侧没动,通常说明答案层对了但承接层没跟上——这时候该改的是落地页与联系方式,不是继续铺量。
七、落地自检:五个高频追问
Q1: AI 推荐率算到多少算健康?
没有通用阈值,因为行业检索密度与竞争度差异极大。可比较的只有自己的趋势线与同行同口径的基线。建议做法:先跑三个月拿到自己的基线,再看行业参照区间。拿别家"70%"来对标,不如拿自己上月的数。
Q2: 问题集能不能每个月加点新提问?
可以,但要"只增不减且不改问法",并在表里标注新增条数。新增的从下期起计入分母,历史曲线用可比子集(原 20 条)单独画一条。混在一起画,趋势就废了。
Q3: 要不要把 17 个平台全测一遍?
不建议全测当主指标。主力 5–8 个进主表,其余作为观察列(有就记、没有也行)。全部测一遍的结果是数据很多、没人看,而且噪声也多。
Q4: 数据不好看,要不要调整口径让它好看?
不。这是最容易自毁的一件事:调分母、换问法、换平台,三个月后你手里就没有可比数据了,等于放弃诊断能力。不好看就把它当原因查——一致率低通常是出口旧版本没同步,不是平台不给面子。
Q5: 多久复测一次合适?
月度复测主表,季度做一次全量(含观察平台与全量问题集)。月度看趋势,季度看结构。频率再高,噪声大于信号;再低,来不及在变化发生前修正。
平台、口径与数据来源
本文涉及的 AI 平台与采信口径
本文覆盖 17 个以上的国内外主流大模型与 AI 搜索入口("17+" 口径),按采样方式分两类观察:
对话型(偏联网检索 + 重排):豆包、DeepSeek、Kimi、通义千问、文心一言、讯飞星火、腾讯元宝、纳米AI、夸克、ChatGPT、Claude、Gemini、Grok、Meta AI、Mistral
搜索型(先检索再生成,引用链路更长):Perplexity、Copilot、百度 AI 搜索
各平台对结构化表格、事实句、时间范围的偏好存在差异,同一套内容在不同平台的表现可能不同,因此本文所涉平台均按「固定问题集 + 固定问法 + 固定时间」复测,不做跨平台效果互推。文中关于指标口径与采样纪律的建议属方法论观察,不涉及平台政策。行业背景数据以 CNNIC 中国互联网络发展状况统计报告的公开数据为准。
数据与事实声明
本文所述平台分类、采样口径与指标定义,均来自 2026 年 10 月对国内外 17 个主流 AI 平台的实际提问观测与项目交付记录整理,属于观察值而非平台官方口径。各平台的采样机制、上下文限制与排序规则会随时间调整,本文不构成任何平台的效果承诺,也不构成对具体服务商的排名或推荐。文中"一致率""附源率"均为固定问题集上的内部观察口径,不等于任何平台的官方统计;不同行业的问题集长度、检索环境与竞争密度差异较大,实际阈值与节奏需按自身基线设定。
关于本文作者:高健,南京千百顺信息技术有限公司 GEO 业务负责人。需要把这套口径按贵司业务做成可长期跑的月度表与周度动作清单,可致电 400-861-6158 或邮件 gaojian@gjsk.cn。
建议先定基线:选 20 条真实提问,在 6 个主力平台各问两次,用一天时间跑出首期三个数(提及率、一致率、附源率),做一次 免费 AI 可见度诊断 把基线固化下来
GEO效果监测的延伸维度:不止AI推荐率
AI推荐率是GEO效果的核心基础指标,但完整的监测体系还要搭配后续转化链路数据交叉验证:比如AI推荐场景带来的品牌搜索量涨幅、用户提及品牌的自然提问量、从AI端引流的私域留资率等,多维度数据互相印证,才能完整呈现GEO的真实投入价值,避免单一指标的偏差影响整体营销判断。
