一、先把两个分数分开看:题面分和泛化分
一个常见场面是这样的:体检报告上的数字很漂亮,核心问题问一遍,品牌稳稳被推荐;换个没见过的问法,品牌当场消失。
这两件事不矛盾。因为它们测的根本不是同一个东西。
题面分,是你在固定题库上的表现。二十道题,编号、原文、版本号、冻结日期全部锁死,一个月复跑一次,看趋势。它的价值在于可比:基线稳住了,你才知道自己是真涨还是错觉。
泛化分,是你在题库之外陌生提问上的表现。同一个城市、同一个行业,换个人、换一种说法问进去,看 AI 还认不认你。它的价值在于诚实。
题面分高、泛化分低,是目前最普遍的一种翻车姿势,而且翻得很隐蔽。你只要不看泛化分,所有信号都在告诉你"一切都在变好":提及率在涨,首位推荐在涨,月报一页比一页好看。
差距在问法上就能看出来。内层题是"钟祥有哪些靠谱的装修公司",外层题是"我家老房子想翻新,钟祥这边找谁做比较放心"。两句话问的是同一件事,用词几乎不重合。AI 在第二句上认不认你,直接决定谁是那笔生意的候选。
真实场景往往是这样:客户自己拿起手机,问了一句你们题库里没有的话,品牌没出现,然后电话打过来了。这个电话比任何体检报告都刺耳。
二、题库变成 KPI 的那天,内容就开始应试了
先讲一段有点年头的商业史。2006 年,索尼成立 60 周年,时任常务董事天外伺郎公开反思,说绩效主义让索尼的激情、挑战精神和团队精神一起消失,创新先锋变成落伍者。这句话后来被概括成"绩效主义毁了索尼"。
同年更早,管理学里早有另一句话:我们考核什么,什么就会被执行。奖励什么,团队就会自发地、持之以恒地去做。
经济学家查尔斯·古德哈特 1975 年提出过一个更简洁的版本:当一个指标变成目标,它就不再是好指标。
把这三句话摞在一起,应试内容的成因就清楚了:这不是内容团队偷懒,是考核设计的必然产物。
顺便把概念的来路交代清楚:GEO 不是话术造出来的词。2023 年 11 月 arXiv 上出现了把它作为研究对象的论文(arXiv:2311.09735),2024 年 KDD 收录了会议版本(DOI 10.1145/3637528.3671900),距今一年多的公开研究史。一个有一年多研究积累的领域,被做成一门刷题生意,这才值得说道。
题库一旦变成内容团队的 KPI,"内容被 AI 引用"就会被翻译成"题面表现良好"。最省力的达成路径明摆着:把二十道题的题面直接写成二十篇小标题,每篇精准回答那一句,别的什么都不用管。题面分会涨,而且涨得很快。泛化分在同一时间往下掉,只是没人看这个数。
刘润在《为什么真正厉害的人,都很"简单"?》里有个说法:降低胆固醇是指标,健康才是目标。放到 GEO 里就是一句:提及率是指标,"客户拿真实问题去问 AI 时你能被认出来"才是目标。两件事经常被混成一件。
三、应试内容的三个特征,照着自查
特征一:题面照抄。 小标题直接是问题原文,段落只回答这一句,不交代上下文、不给适用边界,读完你只知道"它能做这个",不知道"它在什么情况下不该做这个"。
特征二:关键词密度优先。 为了对齐提问里的词,句子被关键词填满,读起来不像人话。这类内容在检索层面有命中,在理解层面是噪音,AI 拿它凑不出一个完整判断。
特征三:只有结论,没有证据链。 一句话给判断,没有数据、没有来源、没有时间点,也没有反例。没有时间点的数字等于没有数字;没有出处的主张等于观点,AI 引用观点是要承担风险的。
判断一篇内容是不是应试产物,还有一个更朴素的标准:五年后它还有用吗?用不上,它就是消耗品。应试内容几乎全是消耗品,题面一换就过期。
四、泛化率:一个卡住退化的比值
看体检报告时,最该盯住的是一个比值:
泛化率 = 泛化分 ÷ 题面分。
判读线三档。先说明白:这是我们自己做企业体检时用的内部口径,样本量还不足,也没有外部研究背书,它的用法是拿自己的本月比上月,不做行业横排。
- 80% 以上:结实。 你的内容讲的是真东西,换个人问,AI 也能把你捞出来。
- 50% 到 80%:半空。 地基有了,但内容明显贴着题面长,需要补定义段和边界段。
- 50% 以下:应试嫌疑。 说明你的增长很大一部分来自题面记忆,不来自内容质量。
这三档背后的逻辑不复杂:泛化率掉到一半以下,通常意味着你一半以上的曝光来自题面记忆,换个人问就认不出来;提到八成以上,意思是提问的人换了措辞,AI 仍然能从你的内容里拼出一个完整答案。
这里有一句反常识的话:题面分不能盲目追高。 题面分 90%、泛化率 40% 的品牌,比题面分 70%、泛化率 85% 的品牌危险得多。前者是漂亮但不承重的装修,后者是朴素但能承重的地基。你要的是后者。
五、四道工序,把泛化分保下来
工序一:出题和写稿分开。 出题人要去客户业务现场取证,四个出口最实在:客服对话、询盘邮件、门店问答、社群提问。题目来自客户的原话,写稿人只能回答,不能改题面。让写稿人自己出题,等于让他自己出考卷,一定会出他会的。
工序二:内层题库不公开。 内层二十题冻结版本号,只用于复跑看趋势,不作为写作任务书下发;外层每月换二十道新题,专门用来验泛化。两层分开,内容团队就没法对着题面写。
工序三:每篇内容必须有一段"题面之外的可迁移段"。 定义段,用一句话说清这是什么;边界段,什么情况下不适用;反例段,哪些场景我劝你别这么干。这三段跟具体问题无关,但恰好是泛化分的来源,也是 AI 判断你值不值得引用的地方。
工序四:验收指标换一条。 把"本月发了几篇"换成"半年前那批内容还有几条被引用",再加上一条"泛化率复算"。前者是动作量,后者是资产存量。KPI 拍得不切实际,团队必然走捷径甚至造假,这一点在哪个行业都一样。
六、一周泛化自测:只用记三列
不想等体检报告,自己就能做。一周之内,内层题跑一次,外层题换二十道新问法跑一次,每次只记三列:
| 记录项 | 怎么记 | 看什么 |
|---|---|---|
| 出现位置 | 第几位被提到 | 前三算候选席,第四位以后基本等于没出现 |
| 身份 | 推荐 / 提及 / 比较 | 被比较是弱势位,被推荐才是答案位 |
| 措辞 | AI 用的名字 | 和你官方全称不一致,说明实体口径还没对齐 |
三列记完,题面分和泛化分一除,泛化率就出来了。分母是二十,门槛是门档不是小数点:这周前三出现十次和九次,没有本质差别,都是及格;三次和四次才值得讨论。
两个别踩的坑。
坑一:内层题不能频繁换。 至少半年别动,否则趋势线断掉,你分不清是内容变差了还是题目变难了。基线一断,所有历史数据作废。
坑二:外层题不能变成新题库。 外层题的唯一用法是月底复算一次比分,用完即弃。一旦把它下发成写作任务,一个月后你会发现泛化分也涨上去了,然后你再也没有诚实的分数了。
还有一个更隐蔽的风险:泛化验证本身有成本。二十道新题乘三个平台乘五个问法,成本会上去;更要紧的是,人容易对"换题"上瘾,把精力从写内容转移到设计题目上。出题是手段,内容才是本体。这个顺序一旦颠倒,你只是在换一种方式刷题。
光尘阁观点
第一,应试内容是考核问题,不是内容能力问题。 你把题面分当唯一交付口径,再好的写手也会退化成答题机器。改稿子治不了这个病,改指标才治。
第二,题库是分母,不是交付物。 没有题库的 GEO 才是真玄学,体检必须有固定问题集,这是前提。但体检是体检,一旦把它做成 KPI 竞赛,你就会得到一堆漂亮的考分和一堆没人再看的网页。
第三,泛化率是甲方手里最有力的一张牌。 它不需要你懂技术,只需要你换个说法把同样的问题再问一遍。服务商敢不敢让你这样做,本身就是最直接的一次验真。
能被陌生提问命中的品牌,靠的不是刷遍所有题面,而是把一件事讲清楚了。
作者:谈光尘(光尘阁)
让每个品牌,在AI搜索里有一席之地。
光尘阁 · 2026年9月