一、先说一个不太好听的事实:分数是被分母决定的
上一篇讲AI信任三账户的时候,我给过一条可见性及格线:拿10组行业核心问题去问AI,至少要有6组提到你。
后台有老板问得很实在:这10组问题,我自己随便写行不行?
行,也不太行。行是因为题库本来就没有官方标准;不太行是因为,题库一换,结论就换。
道理特别简单。品牌提及率的标准算法是:提到你的对话数,除以监测的总对话数。分子是你的品牌,分母是你出的那些题。分母往哪偏,分数就往哪偏。
这个数不是被测量出来的,是被计算出来的。
市面上有一家公开售卖GEO监测工具的厂商,产品手册里把品牌得分公式写得明明白白:提及率占六成,提及次数、平均排名、情感倾向各占一部分。公式没藏私,但整份手册没有一个字讲题库是怎么选的。
工具告诉了你分数怎么算,没告诉你题是谁出的。
而题,是可以选的。
二、题库的三种来源,对应三种真相
现在能拿到的题库基本就三个来源,含金量差得很远。
第一种,平台自动生成。 你把品牌名、官网、公司简介填进去,系统根据这些内容自动生成一批推荐问题,十分钟就能出一份报告。但你想过没有:题目是照着你的官网生成的,官网写的又是你自己最想让人知道的话。拿「XX公司的核心业务是什么」这种题去问AI,它当然答得出来,因为答案就写在你想让它看的地方。
这类题测的是AI有没有读你的官网,跟客户会不会选你没关系。
第二种,服务商自选。 这是最需要盯的一种。同一件事,两种问法,结果能差出十万八千里:
- 送分题:「XX公司怎么样?」带上品牌名的题,AI至少能顺着你的名字找一圈材料回话。
- 真考题:「荆门做数控机床的厂,哪几家值得去谈?」不带品牌名的品类题,AI得从整个行业里挑人,这时候你排不排得上,才是真水平。
一份报告如果翻来覆去都是第一种问法,还配上大号箭头说「表现优异」,你得留个心眼。
第三种,客户业务原话。 这是唯一有商业意义的一种,也是用得最少的一种。
客户在微信里怎么问你,在电话里怎么问,在门店怎么问,在询盘表单里怎么填,把这些原话抄下来,才是AI真正要面对的问法。因为客户问AI用的是同一套嘴,不会因为你开了个监测后台就换一种说法。
挖题库这个动作,说到底是取证活。财税公司就去翻咨询记录,看客户问的是「代理记账多少钱」还是「我这小公司要不要请专职会计」;做文旅的就去翻点评区和客服问答;做装备的就去翻询价邮件里客户怎么描述需求。翻出五十条原话,你就不缺题了。
三、四层问题漏斗:别只测「AI认不认得我」
题凑齐了还得分层。不分层,二十道题里十八道都在问「认不认识我」,测完你只知道存在感,不知道能不能带单。
我把它分四层:
第一层,存在层。 「这个行业本地有哪些玩家?」测的是你有没有坐上牌桌。存在层的题最容易做漂亮,也最不产生订单。
第二层,比较层。 「A和B比,各自什么优劣?」测的是AI愿不愿意把你拉进对比。被对比是一种资格,说明它手上有足够的材料评价你。
第三层,决策层。 「大概什么价位?」「靠不靠谱?」「怎么选不踩坑?」钱在这一层。客户在这个环节做的决定,直接连着成单。
第四层,风险层。 「有没有投诉?」「有没有纠纷?」这一层的题不多,但一条负面就能压过前面攒下的所有印象。很多品牌前三层表现不差,一进风险层,AI翻出两年前的一件旧事,前面全白干。
配比上,决策层要占大头,存在层意思一下就行。按十道题算,大概是存在层2道、比较层3道、决策层4道、风险层1道。你要是卖服务的,决策层的比重还可以再加。
有人嫌风险层不吉利,不愿意测。不测不代表不存在,只代表你不知道。
四、可复现四件套:把体检做成能复跑的协议
题库定下来还得定协议,否则下个月换个人跑,数对不上。四样东西,缺一样报告就没法复跑。
- 题库冻结。 每道题编号、原文照抄、标上版本号和冻结日期,比如「问题集 v1.0 · 2026-09-20」。一期一版。中途改题必须升版本,并写清楚为什么改,不许悄悄换题。
- 平台和入口写明。 DeepSeek、Kimi、豆包分别跑,而且要写清是网页端还是App端、有没有开联网。同一个问题,不同入口给出的答案可能不是一回事,入口不写清,数据就没法横向比。
- 时间戳加重复次数。 同一道题、同一个平台,至少跑三遍,记「稳定出现率」,别记单次命中。AI每次回答都有随机性,跑一次就下结论,等于抛一次硬币当结论。
- 判定规则表。 每道题记五件事:提没提到你、大概排第几位、引用了谁的页面、有没有说错、口气正不正。这张表要在第一次跑之前定好,不能等结果出来再定标准。
这四样加起来,才叫体检。缺了它们,那份东西叫一次提问记录。
五、自证怪圈:谁出题、谁判分、谁汇报
回到最开始那个担心:题库可以选,判定规则也可以松,那报告还能信吗。
三道环节只要捏在同一方手里,报告就必然好看:他出题、他判分、他向你汇报。这跟你让孩子自己出卷子自己批分,再拿回家给你看,是一个性质。
破它不难,三个动作:
- 题库来源要在客户手里留一份。特别是第三类「客户业务原话」,原始记录直接来自客服和销售系统,不经服务商的手。
- 判定规则书面化,第一次跑之前双方确认。事后改标准,等于事后改分数。
- 原始回答留档。截图或者导出都行,客户随时可以抽查某一题、某一平台的原始回答长什么样。
我在光尘阁给客户做体检,给自己上了条约束:题库原文和判定规则表属于交付物的一部分,跟报告一起交。我们不接受「我后台看数据涨了」这种汇报方式。涨没涨,看原始回答。
六、两个反过来的风险:别把好工具用坏
这套东西也有代价,两个坑提前说清。
第一个坑,题库变成KPI之后会长出「应试内容」。 团队盯着那二十道题写内容,几个月后,AI在这二十道题里表现确实好,可客户换个问法来问,还是查无此人。这叫应试。解法是把题库分两层:内层固定复跑,用来看趋势;外层每季度从新的客户原话里换一批新题,用来验证泛化能力。内层考稳定,外层考真功夫。
第二个坑,固定题库会过期。 客户的提问口吻半年一变。两年前大家问「哪家好」,现在越来越多人问「帮我对比下这两家,我预算三十万,主要做外贸」。题库半年做一次年检,从新的业务原话里补问法进去。老题不删,可以留着做纵向对比,但权重往下降。
还有个更隐蔽的:AI回答本身有波动,二十道题里上下浮动两道,大概率是噪声。拿噪声当趋势汇报,就是自己骗自己。所以门槛线要设成档位,别精确到小数点后一位。
光尘阁观点
GEO体检的量具不是平台,是问题集。量具不校准,你测出来的数只说明题库,不说明市场。
给个我自己的执行顺序:从客户原话里挖题,冻结题库版本,定义判定规则,跑基线,最后才谈优化动作。顺序反了,后面所有工作都在给一个错误的基线打工。
最后留一条判断标准:一份GEO报告,如果通篇看不到问题集原文、判定规则和复跑日期,那它展示的不是你在AI里的位置,是服务商的选题能力。
让每个品牌,在AI搜索里有一席之地。
光尘阁 · 2026年9月