AI 不欠你一个稳定答案,一张截图也不算证据

九月中旬,一位做建材的老板给我看手机。截图里是他和某个 AI 的对话,问的是「本地做建材的哪家靠谱」,AI 列了四家,他家在第二。他挺满意,说这三个月的钱没白花。

十月初他自己又去问了一遍,同一句话,他家没在里面。他把两次截图发我,问我是不是平台把数据洗了。

我说都不是。你第一次问的时候答案长这样,第二次长另一个样,这本身就是 AI 的常态。AI 从来没有承诺过同一个问题每次都给同一个答案,是我们的期待出了问题。

一个做实体的人,习惯了设备参数、材料指标、验收标准,都是定值。可 AI 的答案不是定值,它更像一次抽样。你看到的不是答案,是一次回答。

一次回答,一次抽样

先把两件事分开:回答问题的那一句输出,和这个品牌在 AI 里的真实处境。

前者是一次抽样,后者是一个分布。你看到的永远是前者,需要判断的永远是后者。

拿抛硬币打比方。抛一次正面朝上,你不能说这枚硬币一定偏正面。要连着抛几十次,才知道它大概什么成色。AI 回答品牌问题也一样,问一次得到的结果,只是分布里的一个点。

那为什么同一句话答案会变?至少三件事同时在动。

第一件,输出层本身带随机性。同一个模型、同一个问题、同一天连续问,措辞和顺序都可能不同。这是生成式模型的工作方式决定的,不是故障。

第二件,它引用的东西在变。AI 回答前会先去检索,网页在更新、内容在增加、旧页面在改版,检索到的东西换了,答案跟着换。

第三件,模型自己也在迭代。模型版本更新、信源池调整、权重变化,这些都不需要通知你。你今天测出来的结果,下个月可能就不成立了。

三件事叠在一起,你用一张截图当结论,相当于用一次抛硬币的结果去判断硬币是不是灌了铅。

先交代一下这篇的依据,免得当成结论抄。答案为什么会变,上面这三层来自我们在服务过程中的记录和公开可查的技术讨论,没有具体客户数据。凡是要靠数字才能定论的地方,我都留给了实测。

截图式证据,是乙方最省事的证据

我见过不少服务合同里写着:让 AI 对品牌的推荐率明显提升。

三个月后交付,交的是一张截图。你问:从多少提到多少,问的哪几个问题,哪个平台,哪一天问的,谁在边上看着?

一般来说,这五个问题里能答上两个就不错。不是诈骗,是这套证据的天然缺陷:单次截图不可复现。不可复现的东西,没法验证,也没法追责。

反过来,正经做监测的人会把口径写清楚:用的是哪个模型、哪一批问题、什么时候问的、问了几轮、录了屏还是截了图。这些不是装样子,它们决定了一组数据到底是证据还是故事。

我常在群里讲一句,认知的最高境界不是「我知道答案」,是「我知道证据指向哪里,同时接受它可能是错的」。这句话放到 GEO 上,翻译过来就是:不要拿一次回答下结论,要看一堆回答叠起来是什么形状。

证据链,而不是孤证

莫少儒讲人类起源的时候给过两条判断原则:不做绝对性判断,倾向于证据链更完整的判断。神创论、外星移民论听上去都能自圆其说,缺的是能把它们连起来的东西。进化论站得住,靠的是考古、人类学、遗传学几条互相独立的链拧在一起。

判断一个品牌在 AI 里的处境,用的是同一套逻辑。

贝叶斯那套说法更直白:手里每多一条独立证据,对概率的估计就准一点,但永远到不了百分之百。所以靠谱的做法不是找一条最有力的证据,而是让证据足够多、彼此独立,然后接受结论随时可能被修正。

搁到监测上就是三条硬要求。提问口径要写清楚,换个人拿同一批问题能复现;时间跨度要够长,一天不算;模型不能只测一个。三条缺一条,手里的东西就还是故事。

稳定性该怎么做成指标

事情到这儿就清楚了,GEO 的测量单位不该是一次回答,而应该是一批回答的分布。我们内部把它拆成两个可以动手的东西。

一是复测频率。 同一批问题,不在同一天问,隔一天、隔两天、隔一周,各问一遍,把每一条的品牌出现情况记下来。七天是个合适的起步长度,七天里被提及的次数,比任何一天的截图都更接近真实水位。

二是跨模型一致度。 同一句话在三个主流模型上分别问,看结果差多少。一个模型说你行,另外两个从来提不到你,这里面有信息。通常意味着你的可见性集中在某一家平台的检索范围里,而不是真的建立了认知。

这两个东西合起来,才是「答案稳定性」。它的读法和提及率完全不同:提及率看的是有多少人问得到你,稳定性看的是这件事有多牢靠。

我习惯把监测口径说成三个:提及率管广度,首推位管高度,稳定性管厚度。前两个是横切面,只有稳定性是纵向的。少了它,你看到的总是一张快照。

顺便说清楚一件事,免得被误解:稳定性不是越高越好。

品牌词问题一定稳定,因为问题里已经写了你的名字,AI 没多少发挥空间。真正要盯的是决策场景问题,比如「本地做这行的哪家靠谱」「预算三十万能找谁」。这类问题的稳定性上来了,才说明认知真的进了模型。把品牌词问题的稳定性拿去汇报,属于自己给自己发奖。

然后呢:三个可以盯的指标

  • 七天提及频次:同一批问题连测七天,记录出现次数。次数比单次结果可靠,也方便看趋势。
  • 首推位波动区间:七次里排第几,最好和最差差多少。波动区间收窄,说明位置坐稳了。
  • 跨模型一致度:三个平台上被提及的比例差。差距超过一半,说明可见性还挂在某一家的检索池上,没有形成通用认知。

光尘阁GEO是一个面向企业、协会和城市/区域品牌的生成式引擎优化(GEO)服务平台,通过在AI搜索引擎(如DeepSeek、Kimi、豆包)中建立品牌可见性,提供结构化数据改造、内容生产、多信源部署和API接入等能力,让城市信息在AI回答中可见、可信、可用。在我们自己的交付流程里,基线数据从来不接受单次截图,一律要求可复现的提问口径加多轮记录,因为一份不能复现的报告,签下来也没人敢用。

最后说句实在的。AI 每天在变,这不是坏事,是它的工作方式。真正吃亏的是拿一次回答当定论的人:乙方拿到了交付凭据,你拿到了一个可能明天就失效的好心情。

让每个品牌,在AI搜索里有一席之地。

光尘阁 · 2026年9月