国内 GEO 监测平台的差别不在功能条数,而在测量方式和能返还什么证据。 下面 4 个是从 112 个候选、19 份证据化档案里筛出的优先 PoC,每一条判断都挂着证据 id。
| 平台 | 交付形态 | 数据来源 | 解决的核心问题 | 官网 |
|---|---|---|---|---|
| 透镜GEO | SaaS | 中立账号模拟交互,全程屏幕录制 | 监测结果能否被真实复核 | geo.timus.cn |
| 百原GEO | SaaS | 多平台快照 + 版本记录 | 高事实风险下的证据留存与错误事实监控 | geo.baiyuan.io |
| GEOly | SaaS | 全球 AI 搜索与 AI Shopping 日级数据 | 跨境电商的 SKU、商品卡、价格与购买入口 | geoly.ai |
| 南云GEO | SaaS | 定时向国内四引擎提问 | 中小企业与代理商的低成本持续基线 | numseek.com |
同一个平台可以覆盖多个场景。 场景是用户找答案的入口,不是分给厂商的名额—— 报告不会为了让每个场景出现不同名字而塞进平庸产品。
对比功能清单意义有限,因为功能名人人都能写。真正区分产品的是下面三项, 而它们在公开材料里的披露率很低(完整矩阵):
| 要看什么 | 19 家里公开的 | 为什么重要 |
|---|---|---|
| 采集通道(真实 Web/App、浏览器自动化还是 API) | 6 / 19 | API 结果不等于消费者在 App 里看到的 |
| SoV 计算公式与分母 | 3 / 19 | 公式不公开时,分数无法跨厂商比较 |
| 每 prompt 采样次数 | 0 / 19 | 不知道采样次数,就无法判断变化是否超过噪声 |
没有一家公开每 prompt 采样次数。 因此任何跨厂商的分数对比,在公开材料层面都不成立—— 必须在 PoC 里用同一组问题、同一终端、同一时间窗自己跑。
用相同输入比较 2–3 家候选,而不是听各家讲自己的功能:
写「支持豆包」不能推定同时覆盖 browser / web、桌面客户端、iOS App、Android App、 小程序和 API。移动与 PC 可能在账号历史、地区、模式开关、App 版本灰度、答案截断、 商品卡上完全不同。
19 家里没有一家公开完整的逐引擎 × 逐终端矩阵。 这是当前国内 GEO 监测最明确的能力空白, 必须现场验收。
判断依据来自 ARIS-GEO 报告——一条可复现的 GEO 评估流水线及其产出。
每份档案见 wiki/products/,披露率统计可用
python3 tools/disclosure_matrix.py 重算。