为什么自己去问一遍 ChatGPT 没用
几乎每个团队都是这么开始的:有人打开 ChatGPT,输入品类问题,看到竞品排在第一,然后把截图转发到群里。这个刺激是有用的,但它不是衡量;基于它做计划,会在四个具体的地方出问题。
- 答案不是确定性的。同一个问题问两次,可能得到两份不同的品牌名单。单次采样根本分不清真实变化和正常波动。
- 你的账号是个性化的。记忆、历史对话和地理位置都会影响你看到的内容,所以你观察到的不是一个新客户会看到的。
- 一条提问代表不了一个品类。客户会用几十种不同措辞去问,而你在其中的可见度往往差异巨大。
- 一个引擎代表不了整个市场。各家的检索链路不同,你在 Perplexity 很强,说明不了 Gemini 的情况。
解法不是更仔细地手动检查,而是采样:一组固定的提问,横跨多个引擎,按固定节奏跑,并把原始答案存下来,这样你才能回头去看到底变了什么。
第一步,搭一组映射购买旅程的提问集
提问集就是你的量具。之后所有报表都会继承它的偏差,所以它值得花一个下午认真想,而不是拍脑袋列一串品牌词。
覆盖四个阶段,措辞保持口语化。人们对搜索框输关键词,对 AI 说完整句子;如果你的提问集读起来像关键词表,那它一开始量的就是错的东西。
- 认知阶段,不带品牌名:「有什么工具能看出 AI 有没有提到我公司」
- 考虑阶段,品类比较:「面向 B2B SaaS 营销团队的 AEO 平台,哪些比较好」
- 评估阶段,具体约束:「哪些 AI 可见度工具能追踪 DeepSeek 和 Qwen」「AI 品牌监测大概什么价位」
- 决策阶段,带品牌名:「Okaeo 怎么样」「Okaeo 和人工手动查有什么区别」
每个品牌 40 到 60 条是个可行的起点。低于 30 条,每周的噪声会盖过信号。定下来之后就冻结它:季度中途改提问,会让你之前攒的所有趋势线作废。
第二步,按客户真正在哪来选引擎
选引擎是市场决策,不是技术决策。一个欧洲 B2B 品牌和一个卖到中国的消费品牌,需要的覆盖范围完全不同;去追踪客户根本不打开的引擎,只会增加成本和噪声。
- 几乎必选:ChatGPT 和 Google AI Overviews,在多数西方市场,二者合计占了 AI 答案曝光的大头。
- 通常要加:Gemini、Perplexity 和 Claude,研究型和技术型客户集中在这里。
- 如果你卖给大企业:加 Copilot,因为它就长在这些客户本来就开着的微软套件里。
- 如果你面向中文市场:加 DeepSeek、Qwen 和 Kimi,它们的行为差异大到西方的结果无法迁移。
第三步,测五件事,不是一件
「我们在不在 AI 里」不是一个指标。下面这五个才是,而且每一个都指向不同的动作。
- 提及率:有多少比例的答案点了你的名。这是你的地板线。
- 答案内排位:被第一个点名读起来是推荐,被第五个点名读起来是脚注。
- 引用:引擎实际链向了你的哪些 URL。这告诉你到底是哪些页面在出力。
- 声量份额:在同一批提问下,你的提及率对比每个竞品的。这是管理层一定会要的那个数。
- 口径与准确性:你被怎么描述。一段把你价格说错的提及是负分,不是战果。
把完整答案原文存下来,不要只存指标。六周后声量份额掉了四个点,唯一能解释清楚的办法,就是把两个时期的答案并排读一遍。
第四步,按固定节奏采样,别天天盯着看
每日采样对「收集」是对的,对「解读」是错的。答案引擎的输出每天都会因为和你无关的原因变化:索引刷新、模型更新、检索策略调整。每日收集,但看周均值,并且只对连续两周都成立的变化采取行动。
例外是真正的事件:发布、融资公告、竞品大动作、一条差评开始扩散。这些节点前后值得盯日数据,因为一个错误说法可能在几天内就扩散到各个引擎。
第五步,把数据变成三个决定
多数 AI 可见度看板最后没人用,是因为没人知道周一早上该干什么。三个问题能把数字变回工作。
- 哪些地方我们缺席、但品类问题正在被回答?这些提问就是内容选题,而且往往是你完全没占位、价值又最高的那批。
- 在我们缺席的位置上,是谁、用哪个页面被引用了?去读那一页。十有八九它不是写得更好,而是把问题答得更直接。
- 哪些地方我们被提到了、却被描述错了?那是你自己站点的「事实供给」问题,通常也是这张单子上最快能修好的一项。
常见问题
建议每日收集,保证记录足够密;但按周均值来解读。答案引擎每天的输出会因为和你无关的原因波动,所以只对连续两周都成立的变化采取行动。
每个品牌 40 到 60 条是可行的起点,分布在认知、考虑、评估、决策四个阶段。低于 30 条左右,每周的噪声会盖过信号。
手动查一次是有用的刺激,但不是衡量。答案不是确定性的,你的账号会被记忆和地理位置个性化,而且一条提问、一个引擎代表不了整个品类。可靠的追踪需要用固定提问集在多个引擎上反复采样。
有时会,但流量会低估这个效果。很多 AI 答案不会产生点击,所以一个品牌可能在成千上万段答案里被正面描述,却几乎在分析后台看不到。建议直接测提及、答案内排位、引用和声量份额,而不是靠会话量去倒推。
