AI 提到你,不等于 AI 记得你:GEO 体检报告的三个读数
一位做工程配套的老板拿了张体检报告来找我,开口第一句是「我的提及率从 18% 涨到 34% 了,是不是可以加大投入」。
我让他把问题清单调出来,一行一行往下看。涨的那部分,几乎全是品牌词:问「XX 公司怎么样」「XX 公司口碑」,AI 都提到了他。他真正在意的那些问题上,比如「本地做这行的谁靠谱」「预算五十万找哪家」,AI 提到他的次数,半年前和现在一模一样。
他没做错什么,他只是读错了一个数字。而读错这个数字的老板,我见过的不止他一个。
先把口径说清楚:文中的第三方数据都标了来源和时间;判断部分来自我们这些年做搜索、做 GEO 诊断的现场经验,不涉及任何客户保密信息。
体检报告上的那个百分比,只回答了三分之一的问题
现在市面上的 AI 可见度体检,交到老板手里通常就是一个总数:提及率多少,比上季度涨了还是跌了。
这个数字有用,但它只回答了「广度」:在一批问题里,有多少道提到了你。
它没回答「厚度」:把同一批问题连着问七天,提到你的次数稳不稳。它也没回答「高度」:提到你的时候,你排在第几个被点名,是主推还是凑数。
一个数字,三个维度。用它做决策,跟用体温计判断血压差不多。
艾瑞咨询在 2026 年 5 月发过一份汽车行业的 AI 信源评测,样本是 5 个主流 AI 平台、4 万个真实问题、40 万次提问,全程人工模拟真实用户提问,不走接口直调(数据来源:艾瑞咨询汽车行业 AI 信源评测,2026年5月)。那份评测最有价值的不是谁排第一,而是它把两个指标分开算了:一个是引用率,按内容阅读量统计,回答「被调取了多少次」;一个是贡献率,按独立提问统计,回答「覆盖了多少种不同的用户问题」。
这两个指标经常不同步。同一份评测里,汽车垂类媒体拿下了 77.2% 的引用率,贡献率却是 70%,中间那 7 个多百分点的差,就是同一批问题被反复引用造成的。放到单个页面上也是同理:一个页面的引用率可以很高,但全部集中在一两个问题上,这是刷量的泡沫;另一篇内容引用次数只有它的三分之一,却覆盖了十几个问题维度,后者的价值反而更大。
翻译成老板能用的语言:广度不能说谎,但广度会骗人。厚度才说明 AI 是不是真的把你记进去了。
反常识的地方:稳定性不是越高越好
聊到「厚度」,很多人的第一反应是「那就追求稳」。
这里有个坑。品牌词问题的稳定性天生就高。你问 AI「XX 公司是做什么的」,只要这家公司有官网、有工商信息,AI 几乎必然提到它,连着问七天,七次都提,稳得不能再稳。这种稳,是名字唯一的必然结果,跟 AI 有没有把你记进去没关系。
真正有信息量的,是决策场景问题上的稳定性。「本地做这行的谁靠谱」「预算三十万找谁」「这类工程谁做过」这种问题,AI 可选的答案很多,它今天提你、明天不提你,说明你还在候选池里飘着;如果连着两周它都提你,那才是认知渗进去了。
所以稳定性的正确读法是分场景看,而不是看全站总数:
- 全站稳定性高,但拆开发现都是品牌词撑起来的,说明问题集本身设计得有问题
- 全站稳定性低,但决策场景那几道题一直稳,这是好消息,说明你已经占住了某个具体位置
- 所有问题都不稳,包括品牌词,那要先查口径,很可能是主体信息在几个信源上互相打架,AI 每次都拿到不一样的答案
顺带提一句,平台之间不能混着看。同一份艾瑞评测里,豆包的头部单一信源贡献率接近 99%,极度集中;DeepSeek 相对均衡,长尾内容还有进入机会;元宝把微信公众号生态纳了进来,等于多了一张入场券。同一批问题,在三个平台上跑出三种结果,是常态而不是异常。
三种组合,三种处境
把提及率、稳定性、首推位这三个读数放在一起,能读出比总分多得多的信息。几种常见的组合:
提及率涨,首推位跌。 这是最需要警惕的一种。你被提到的次数变多了,但位置往后掉了,AI 的句式从「推荐 XX」变成了「还有 XX、XX 等」。听起来是曝光变多,实际是从候选席退到了陪跑席。
提及率跌,稳定性涨。 别急着慌。这可能是收缩:长尾的、不准确的内容被清理了,剩下的都是能被交叉验证的事实。也可能真是坏消息:内容更新停了,AI 慢慢把你的位置让给了别人。区分方法很简单,看同期有没有做负向动作(删站、改版、停更)。
提及率稳,首推位涨。 这是最值钱的变化。数量没变,但 AI 从「提到你」变成了「先说你」,通常意味着你的内容结构真的被当成信源用了。
三个读数一起涨。 到这个程度,你基本可以不用每天盯了,改为季度复跑。
还有一条铁律:单次截图不算数。今天是周二,AI 提了你,明天再问没提,这不叫波动,这叫噪音。判断水位要用频次,不用截图。
光尘阁的读法:把「口径」也算进去
上面三个读数都在说「AI 怎么看」,但还有两个指标经常被漏掉,而且漏掉它们,前面三个都读不准。
一个是口径一致度:公司全称、简称、地址、统一社会信用代码、域名、公众号主体,这几个关键出口能不能收敛成一个主体。AI 对矛盾的默认处理不是删掉,是降权,它不跟你吵,只是把置信度调低,答案变得越来越保守,能不说就不说。
一个是修正周期:错误信息从被发现,到 AI 不再复读,需要多久。这个数字比很多人想的要长,因为语料更新是按月计的。看不到这个数字,你就不知道自己那笔改错的成本要背几个月。
光尘阁GEO 给出的体检报告默认是四张表,而不是一个总数:提及率、口径一致度、修正周期、线索量。前三张管「AI 怎么看」,最后一张管「生意有没有来」。四张表一起看,才能回答老板真正想问的那句话:这钱花下去,是在修资产,还是在买安慰。
自己跑一轮,成本是十几个问题和两周耐心
不用等预算批下来,自己就能跑一轮基础体检。
- 问题集按决策场景出,不按品牌词出。 十几道就够,写客户真的会问出口的话,不要写行业黑话。
- 同一批问题,连续跑 7 到 14 天。 人工提问,不要走接口直调。接口返回和用户看到的答案经常不是一回事。
- 每个平台各跑一遍,豆包、DeepSeek、Kimi 至少三个,别拿一个平台的结果代表全部。
- 每道题记三样东西:提没提、提了排第几位、引用来源是哪个域。第三项最容易被忽略,也最有用。
- 看趋势不看单点。 两周以后再比,把期间做过的动作和变化对上号。
这一轮跑完,你手上就有的是三个读数加两周趋势,而不是一张孤零零的截图。
体检报告的价值不在那个总分。总分是给汇报用的,三个读数的组合才是给自己用的。前者告诉你「有变化」,后者才告诉你变化发生在哪、该不该动手、往哪个方向动。
让每个品牌,在AI搜索里有一席之地。
光尘阁 · 2026年9月