想知道 GEO 优化到底有没有效果,只看「AI 提没提到我」不够——那是结果,不是原因。 可用的做法是把 AI 回答拆成六段漏斗,每段单独计量,再用实验把因果分出来。
先说一个必须知道的前提:在 19 份公开产品档案的逐字段统计里,
没有任何一家 GEO 监测产品公开每 prompt 采样次数、置信区间、噪声地板或模型版本锁定
(见披露率矩阵,可用 python3 tools/disclosure_matrix.py 重算)。
这意味着任何厂商给你的「效果提升 X%」,你都无法从公开材料判断它是否超过自然波动。
指标口径必须由采购方自己定义并持有。
| 漏斗 | 指标 | 它回答什么 | 失败时说明 |
|---|---|---|---|
| 供给 → 候选 | candidate recall | 内容有没有机会被看到 | 已收录但从不进入相关来源 |
| 候选 → 引用 | candidate-to-citation rate | 有没有成为答案的证据 | 进了候选但引用率低 |
| 引用 → 提及 | citation-to-mention rate | 引用有没有转成品牌出现 | 内容被引但品牌名没出现 |
| 提及 → 推荐 | mention-to-recommend rate | 有没有进决策短名单 | 被提及但推荐了竞品 |
| 推荐 → 可见 | above-fold / card visibility | 用户终端上是否真的看得到 | 答案里有但首屏不可见 |
| 可见 → 行动 | click / card / action rate | 有没有形成业务动作 | 可见但无点击 |
只报最后一个数字(提及率、SoV)会掩盖失败发生在哪一层。 同样是「没被推荐」, 卡在第 2 段(没进候选)和卡在第 4 段(被引用了但推荐了竞品)需要完全不同的动作: 前者是内容与渠道问题,后者是可信证据与适用场景问题。
一个指标只有把下面五项写清楚才可比较:
第 5 条是最常被跳过的。Web/PC 与移动端不能混进同一个分母——账号历史、地区、 App 版本灰度、答案截断都会让两端结果不同。
在没有做任何优化的情况下,同一条问题在不同时间跑,结果本身就会变。 不先测出这个波动区间,任何「提升」都无法与噪声区分。
可执行做法:选定 20–50 个核心问题,固定终端与账号,连续采样两周,先得到基线波动, 再开始任何优化动作。 之后的变化只有超过这个区间才算数。
把仿写内容直接发到高引用网站,即使结果改善,也无法知道是内容、渠道、时间还是波动导致:
| 既有渠道 | 新渠道 | |
|---|---|---|
| 原内容结构 | A:基线 | B:只改变渠道 |
| 新内容结构 | C:只改变内容 | D:组合 |
配合规则:保留 holdout(一组不做任何改动的问题);不同时修改标题、正文、域名和问题集; 记录发布、抓取、索引、首次候选、首次引用、首次推荐的时间线。
第 4 个问题目前 19 家里没有一家能从公开材料回答。 这不是挑刺,是采购前必须现场问清的事。
本页的漏斗与口径来自 ARIS-GEO 报告——一条可复现的 GEO 评估流水线,
以及它产出的产品选型报告。披露率数据由 tools/disclosure_matrix.py 从 19 份证据化档案
重算得出,证据快照带 SHA-256 校验。