okaeo

指南

如何追踪品牌在 AI 答案里的表现

一套可重复的方法,用来衡量 ChatGPT、Gemini、Perplexity 和 AI Overviews 有没有点你的名、你在答案里排第几、以及它们引用了哪些页面

约 9 分钟 · 更新于 2026-09-18

为什么自己去问一遍 ChatGPT 没用

几乎每个团队都是这么开始的:有人打开 ChatGPT,输入品类问题,看到竞品排在第一,然后把截图转发到群里。这个刺激是有用的,但它不是衡量;基于它做计划,会在四个具体的地方出问题。

  • 答案不是确定性的。同一个问题问两次,可能得到两份不同的品牌名单。单次采样根本分不清真实变化和正常波动。
  • 你的账号是个性化的。记忆、历史对话和地理位置都会影响你看到的内容,所以你观察到的不是一个新客户会看到的。
  • 一条提问代表不了一个品类。客户会用几十种不同措辞去问,而你在其中的可见度往往差异巨大。
  • 一个引擎代表不了整个市场。各家的检索链路不同,你在 Perplexity 很强,说明不了 Gemini 的情况。

解法不是更仔细地手动检查,而是采样:一组固定的提问,横跨多个引擎,按固定节奏跑,并把原始答案存下来,这样你才能回头去看到底变了什么。

第一步,搭一组映射购买旅程的提问集

提问集就是你的量具。之后所有报表都会继承它的偏差,所以它值得花一个下午认真想,而不是拍脑袋列一串品牌词。

覆盖四个阶段,措辞保持口语化。人们对搜索框输关键词,对 AI 说完整句子;如果你的提问集读起来像关键词表,那它一开始量的就是错的东西。

  • 认知阶段,不带品牌名:「有什么工具能看出 AI 有没有提到我公司」
  • 考虑阶段,品类比较:「面向 B2B SaaS 营销团队的 AEO 平台,哪些比较好」
  • 评估阶段,具体约束:「哪些 AI 可见度工具能追踪 DeepSeek 和 Qwen」「AI 品牌监测大概什么价位」
  • 决策阶段,带品牌名:「Okaeo 怎么样」「Okaeo 和人工手动查有什么区别」

每个品牌 40 到 60 条是个可行的起点。低于 30 条,每周的噪声会盖过信号。定下来之后就冻结它:季度中途改提问,会让你之前攒的所有趋势线作废。

第二步,按客户真正在哪来选引擎

选引擎是市场决策,不是技术决策。一个欧洲 B2B 品牌和一个卖到中国的消费品牌,需要的覆盖范围完全不同;去追踪客户根本不打开的引擎,只会增加成本和噪声。

  • 几乎必选:ChatGPT 和 Google AI Overviews,在多数西方市场,二者合计占了 AI 答案曝光的大头。
  • 通常要加:Gemini、Perplexity 和 Claude,研究型和技术型客户集中在这里。
  • 如果你卖给大企业:加 Copilot,因为它就长在这些客户本来就开着的微软套件里。
  • 如果你面向中文市场:加 DeepSeek、Qwen 和 Kimi,它们的行为差异大到西方的结果无法迁移。

第三步,测五件事,不是一件

「我们在不在 AI 里」不是一个指标。下面这五个才是,而且每一个都指向不同的动作。

  • 提及率:有多少比例的答案点了你的名。这是你的地板线。
  • 答案内排位:被第一个点名读起来是推荐,被第五个点名读起来是脚注。
  • 引用:引擎实际链向了你的哪些 URL。这告诉你到底是哪些页面在出力。
  • 声量份额:在同一批提问下,你的提及率对比每个竞品的。这是管理层一定会要的那个数。
  • 口径与准确性:你被怎么描述。一段把你价格说错的提及是负分,不是战果。

把完整答案原文存下来,不要只存指标。六周后声量份额掉了四个点,唯一能解释清楚的办法,就是把两个时期的答案并排读一遍。

第四步,按固定节奏采样,别天天盯着看

每日采样对「收集」是对的,对「解读」是错的。答案引擎的输出每天都会因为和你无关的原因变化:索引刷新、模型更新、检索策略调整。每日收集,但看周均值,并且只对连续两周都成立的变化采取行动。

例外是真正的事件:发布、融资公告、竞品大动作、一条差评开始扩散。这些节点前后值得盯日数据,因为一个错误说法可能在几天内就扩散到各个引擎。

第五步,把数据变成三个决定

多数 AI 可见度看板最后没人用,是因为没人知道周一早上该干什么。三个问题能把数字变回工作。

  • 哪些地方我们缺席、但品类问题正在被回答?这些提问就是内容选题,而且往往是你完全没占位、价值又最高的那批。
  • 在我们缺席的位置上,是谁、用哪个页面被引用了?去读那一页。十有八九它不是写得更好,而是把问题答得更直接。
  • 哪些地方我们被提到了、却被描述错了?那是你自己站点的「事实供给」问题,通常也是这张单子上最快能修好的一项。

常见问题

建议每日收集,保证记录足够密;但按周均值来解读。答案引擎每天的输出会因为和你无关的原因波动,所以只对连续两周都成立的变化采取行动。

每个品牌 40 到 60 条是可行的起点,分布在认知、考虑、评估、决策四个阶段。低于 30 条左右,每周的噪声会盖过信号。

手动查一次是有用的刺激,但不是衡量。答案不是确定性的,你的账号会被记忆和地理位置个性化,而且一条提问、一个引擎代表不了整个品类。可靠的追踪需要用固定提问集在多个引擎上反复采样。

有时会,但流量会低估这个效果。很多 AI 答案不会产生点击,所以一个品牌可能在成千上万段答案里被正面描述,却几乎在分析后台看不到。建议直接测提及、答案内排位、引用和声量份额,而不是靠会话量去倒推。

现在换成你自己的品牌看看