「我想看我们品牌在豆包、DeepSeek 里排第几」是个合理诉求,但它和查百度排名不是一回事。 先弄清差在哪,再谈用什么工具,否则拿到的数字没法用。
传统搜索同一个词在同一时刻结果基本固定。AI 回答不是——同一条问题连续问多次, 被引用的网页集合会明显不同。这意味着单次查询得到的「排名」是一次抽样,不是一次测量。
可操作的结论:任何排名结论都必须来自重复采样,并报告样本量。 只跑一次拿到的名次,无法与下一次的名次比较。
「没排上」在 AI 回答里至少有四种不同的失败,动作完全不同:
| 卡在哪 | 现象 | 该做什么 |
|---|---|---|
| 没被检索到 | 页面从不出现在任何来源 | 先修可抓取性与收录 |
| 检索到了没被引用 | 进了候选但答案没引 | 摘要段是否直接回答了这个问题 |
| 引用了但没提品牌 | 内容被引,品牌名没出现 | 主体名是否出现在可摘取的句子里 |
| 提及了但推荐竞品 | 品牌出现但不在推荐名单 | 缺适用场景、比较维度与可信证据 |
只看最终名次,这四种会被压成同一个「排名低」,无法定位。
Web、iOS App、Android App、小程序、API 五个入口的答案可能不一样——账号历史、地区、 搜索或深度思考开关、App 版本灰度、答案截断、商品卡都会造成差异。
不同终端不能混进同一个分母。 拿 API 结果汇报「用户看到的排名」是错的, 因为真实用户在 App 里。
这五项任缺一项,两次结果就不可比。
不问功能条数,问这四件事:
数据来源见披露率矩阵,可用 python3 tools/disclosure_matrix.py 重算。
国内主流可做持续排名监测的产品,按解决的问题分: 透镜GEO(中立账号 + 全程录屏,便于复核)、百原GEO(快照与版本记录)、 南云GEO(免费档建基线)、GEOly(商品级而非品牌级)。逐项对比见 平台对比。
想自建的话,本仓库的流水线可直接运行——python3 tools/geo_loop.py 跑 8 阶段调研循环,
网络请求全部在 Python 侧完成,模型只能读已落盘的证据文件。
方法来自 ARIS-GEO 报告,一条可复现的 GEO 评估流水线及其产出的选型报告。