国内 GEO 监测工具清单与免费档对比

GEO 优化效果怎么评估:漏斗指标、KPI 定义与行业披露现状

想知道 GEO 优化到底有没有效果,只看「AI 提没提到我」不够——那是结果,不是原因。 可用的做法是把 AI 回答拆成六段漏斗,每段单独计量,再用实验把因果分出来。

先说一个必须知道的前提:在 19 份公开产品档案的逐字段统计里, 没有任何一家 GEO 监测产品公开每 prompt 采样次数、置信区间、噪声地板或模型版本锁定 (见披露率矩阵,可用 python3 tools/disclosure_matrix.py 重算)。 这意味着任何厂商给你的「效果提升 X%」,你都无法从公开材料判断它是否超过自然波动。 指标口径必须由采购方自己定义并持有。

六段漏斗与对应指标

漏斗 指标 它回答什么 失败时说明
供给 → 候选 candidate recall 内容有没有机会被看到 已收录但从不进入相关来源
候选 → 引用 candidate-to-citation rate 有没有成为答案的证据 进了候选但引用率低
引用 → 提及 citation-to-mention rate 引用有没有转成品牌出现 内容被引但品牌名没出现
提及 → 推荐 mention-to-recommend rate 有没有进决策短名单 被提及但推荐了竞品
推荐 → 可见 above-fold / card visibility 用户终端上是否真的看得到 答案里有但首屏不可见
可见 → 行动 click / card / action rate 有没有形成业务动作 可见但无点击

只报最后一个数字(提及率、SoV)会掩盖失败发生在哪一层。 同样是「没被推荐」, 卡在第 2 段(没进候选)和卡在第 4 段(被引用了但推荐了竞品)需要完全不同的动作: 前者是内容与渠道问题,后者是可信证据与适用场景问题。

KPI 定义必须写死的五件事

一个指标只有把下面五项写清楚才可比较:

  1. 分子:明确提及?进推荐名单?带链接引用?三者不能混算。
  2. 分母:全部采样数,还是「有效回答数」?失败样本、拒答样本计不计入?
  3. 别名:品牌别名、英文名、简称是否计入分子。
  4. 重复提及:同一条回答里出现多次,算 1 还是算 N。
  5. 采样口径:每题每终端重复几次、在什么时间窗内、Web 与移动是否分开计算。

第 5 条是最常被跳过的。Web/PC 与移动端不能混进同一个分母——账号历史、地区、 App 版本灰度、答案截断都会让两端结果不同。

为什么必须先测自然波动

在没有做任何优化的情况下,同一条问题在不同时间跑,结果本身就会变。 不先测出这个波动区间,任何「提升」都无法与噪声区分。

可执行做法:选定 20–50 个核心问题,固定终端与账号,连续采样两周,先得到基线波动, 再开始任何优化动作。 之后的变化只有超过这个区间才算数。

用 2×2 把「写什么」和「发哪里」分开

把仿写内容直接发到高引用网站,即使结果改善,也无法知道是内容、渠道、时间还是波动导致:

  既有渠道 新渠道
原内容结构 A:基线 B:只改变渠道
新内容结构 C:只改变内容 D:组合

配合规则:保留 holdout(一组不做任何改动的问题);不同时修改标题、正文、域名和问题集; 记录发布、抓取、索引、首次候选、首次引用、首次推荐的时间线。

验收供应商效果报告的四个问题

  1. 分母是什么,失败样本怎么处理?
  2. 每题采样几次,波动区间是多少?
  3. 能否返还原始回答、引用、截图或录屏,让我自己复算?
  4. 有没有 holdout?没有 holdout 的「提升」如何排除自然波动?

第 4 个问题目前 19 家里没有一家能从公开材料回答。 这不是挑刺,是采购前必须现场问清的事。


本页的漏斗与口径来自 ARIS-GEO 报告——一条可复现的 GEO 评估流水线, 以及它产出的产品选型报告。披露率数据由 tools/disclosure_matrix.py 从 19 份证据化档案 重算得出,证据快照带 SHA-256 校验。