📐 调研方法
本文数据来源如下,未开展新的一手调研,未采用问卷、访谈或现场调查手段: 1. 中国互联网络信息中心《第57次中国互联网络发展状况统计报告》(2026年2月5日发布,数据截至2025年12月):生成式AI用户规模、普及率、网民规模与互联网普及率; 2. 光尘阁研究院县域企业数字资产样本检测记录(样本10家,检测日2026年7月11日,检索渠道为百度与Bing,判据为是否存在独立可索引页面、百科条目或第三方媒体报道):样本存在性结论; 3. 地方企业服务平台公开数据库(钟祥人才网注册企业7,509家、沙洋人才网注册企业1,241家,数据提取时间2026年7月):样本框规模; 4. 光尘阁研究院2026年8月至9月发布的前序白皮书(三账户信任框架2026年9月5日、数字资产四层分级与可见度四台阶2026年9月12日、县域文旅落地方法2026年9月19日):术语与框架承接; 5. 《中文互联网内容正在逐步消失》(月光博客,2026年):仅作背景参考,其转引的网站总数数值未回溯原始统计表格,本文不引用具体数值。 核实说明:生成式AI用户规模数据经官方报告页与两家公开转载稿对照,口径一致。文中演示数值(含演示台账表)为方法说明用途,不指向任何真实主体,不得作为实测数据引用。
🔑 核心发现
1. 截至2025年12月,中国生成式AI用户规模6.02亿人,普及率42.8%(CNNIC第57次报告,2026年2月5日发布) 2. 测评结论能否复核由协议四要件决定:问题集、模型集、时间戳、判定规则,与评分模型复杂度关系有限 3. 两次测评不可比的常见原因是要件缺失:问题集改动、模型版本未记录、无时间戳、判定规则主观 4. 三账户权重40/30/30属经验设定,需以三十个主体以上样本做秩序相关校准,该工作尚未完成 5. 县域样本检测记录显示,10家样本中7家无独立可索引页面,对这些主体测量应先停在存在性环节 6. 复测台账连续三期以上才能判断趋势,建议节奏(前三个月双周测、其后月度)尚待实测验证
执行摘要
光尘阁研究院在此前四期白皮书中处理的是「量什么」:把AI可见度拆成可见性、可理解性、可信度三个账户(权重40/30/30),把企业数字资产分为四层,把可见度进程分为存在、可解析、可引用、采信四个台阶。这一期处理另一个问题:量出来的数字,别人能不能复核,能不能与上一期比较,能不能跨主体比较。
结论有三条。其一,测评结论的可比性主要由协议四要件决定,即问题集、模型集、时间戳、判定规则,与评分模型的精细程度关系有限;四要件缺一项,分数就退化为一次性的观察记录。其二,三账户40/30/30的权重及其与四台阶的映射关系属经验设定,在完成跨行业样本校准之前,对外披露分账户得分是稳妥做法,加权总分不宜作为唯一决策依据。其三,趋势判断需要复测台账连续三期以上的记录,单次测评只能作为时点快照,无法区分内容变化与模型变化。
本白皮书提供两份可直接使用的材料:测评协议模板(四要件的记录字段与判定规则),以及复测台账字段清单。文中所有演示数值均已标注为演示值,不指向任何真实主体。
一、调研方法
本文数据来源分四类,逐条列示。
第一类为官方统计报告。中国互联网络信息中心《第57次中国互联网络发展状况统计报告》,2026年2月5日发布,数据截至2025年12月。该报告是文中生成式AI用户规模与网民规模数据的唯一来源,用于说明测量需求的规模基础。
第二类为既有检测记录。光尘阁研究院县域企业数字资产样本检测记录,样本10家,检测日2026年7月11日,检索渠道为百度与Bing,判据为是否存在独立可索引页面、百科条目或第三方媒体报道。文中引用该记录时只使用汇总结论,不涉及具体企业名称。
第三类为地方企业服务平台公开数据库。钟祥人才网注册企业7,509家、沙洋人才网注册企业1,241家,数据提取时间为2026年7月,用于说明样本框规模。
第四类为公开讨论文章。《中文互联网内容正在逐步消失》(月光博客,2026年)转引过中国网站总数的变化情况,该转引未回溯到原始统计表格,本文仅作为背景参考,不引用其具体数值。
时间范围为2025年1月至2026年9月。本文未开展新的一手调研,未采用问卷、访谈或现场调查手段。文中涉及测量流程的部分属于方法设计,涉及分数的部分属于演示数值。框架部分承接光尘阁研究院2026年8月至9月发布的四期白皮书(三账户信任框架、数字资产四层分级、可见度四台阶、县域文旅落地方法),术语与前序保持一致。
二、核心发现
-
截至2025年12月,中国生成式AI用户规模6.02亿人,普及率42.8%,据中国互联网络信息中心《第57次中国互联网络发展状况统计报告》(2026年2月5日发布)。
-
两次测评不可比的原因通常不在评分模型,而在协议四要件缺失:问题集改动、模型版本未记录、时间戳缺失、判定规则主观。
-
问题集不冻结是首要误差来源,改题前后的分数变化无法归因于内容优化。
-
三账户权重40/30/30与四台阶的映射属经验设定,跨行业校准需要锚定样本与秩序相关检验,该工作尚未完成。
-
县域样本检测记录显示,10家样本企业中有7家在2026年7月11日检测时不存在独立可索引页面,对这些主体而言,测量应先停留在存在性环节。
-
复测台账连续三期以上才能支撑趋势判断;建议的复测节奏(前三个月双周测、其后月度)尚未经真实季度数据验证。
三、背景与现状:从「有没有分」到「分数能不能复核」
3.1 需求侧的规模变化
截至2025年12月,中国生成式AI用户规模6.02亿人,普及率42.8%,较2024年底提高25.2个百分点,据中国互联网络信息中心《第57次中国互联网络发展状况统计报告》(2026年2月5日发布)。同一份报告显示,同期中国网民规模11.25亿人,互联网普及率80.1%。生成式AI的用户基数说明,「AI回答里有没有提到你」已经从行业话题变成日常问题,企业对AI可见度的关注由此从品牌部门扩散到经营决策层。
用户使用方式的变化同时发生。据公开信息显示,用户向AI提出的问题正从名词式查询转向句子式委托,例如「本地哪家供应商交期稳定」取代「本地供应商」这样的词。提问方式的变化改变了内容的适配条件:能够被AI引用的材料,需要具备明确的实体归属、可核验的数字事实与清晰的责任主体,这些条件与网页关键词密度无关。
3.2 供给侧的承诺与可验证性缺口
2026年以来,市场上出现了以AI排名为标的的服务承诺。从公开信息看,这类承诺难以被独立验证:模型版本与检索结果不受单一服务方控制,任何一次问答都是模型、检索索引与提问表述三者的联合产物。承诺不可验证的直接后果是,企业拿到一份分数报告,却无法判断这个分数是观察结果,还是服务方愿意给出的说法。
这构成本期白皮书的现实动机。测量方法不统一时,同一家企业委托两家服务方测评,可能得到相差很大的两个分数,而双方都能给出看似合理的解释。行业需要一套基础记录规范,让结论可以被第三方按同样步骤复现。
3.3 前四期完成了什么,还缺什么
第一期白皮书给出了三账户自测总分0至100的三级分段:60分以下属于AI盲区,60分至80分属于半可见,80分以上属于AI友好,并配套了分账户自测表。第二期建立了三账户信任框架与40/30/30的经验权重。第三期给出数字资产四层分级(从依赖平台字段的L4,到统一底稿的L3,到自主站点L2,再到外部引用的L1)与可见度四台阶(存在、可解析、可引用、采信)。第四期把这套框架下放到县域文旅场景,用钟祥与秭归的对照说明内容资产形态(点状与网状)对引用机会的影响。
四期工作解决了「量什么」。仍缺的是「怎么量才算量过」:分数怎么记、谁来判、什么时候再测一次、两次结果怎么比。若这部分缺失,前面的框架在企业日常使用中会退化为一次性演示工具。
3.4 一个测量学的类比
把AI可见度当作测量问题处理,会遇到所有测量都会遇到的问题。同一个人两次上秤称出不同体重,差异可能来自秤、来自时间、来自衣服,未必来自体重本身。AI可见度测量的特殊之处在于量具本身在变化:模型版本会迭代,检索索引会更新,同一条内容在不同时点的可获取性并不相同。因此,测评流程的设计目标不是消除波动,而是把波动来源逐项记录,使观察值能够被解释。这是本白皮书把协议四要件放在主体分析首要位置的原因。
四、主体分析
第一章 协议四要件:缺一项,结论就不可复核
测评协议指一组固定记录项,任何一家机构按同样记录项操作,应能复现出接近的结论。四要件是问题集、模型集、时间戳、判定规则。以下逐项说明定义、操作方式与常见失效模式。
1.1 问题集
问题集是一组表述固定、顺序固定、数量固定的提问,构成测评的取样框。取样框不公开,测评分数就无法复核,因为读者不知道这家主体是在哪些问题上被问到的。
第一个设计要点是提问层级。建议按三类分层:认知型问题考察基本识别,例如「钟祥有哪些数控机床企业」;对比型问题考察相对位置,例如「钟祥与荆门其他县市的机床企业相比,哪家配套能力更强」;决策型问题考察采购或出行的最终选择,例如「湖北做磷酸铁锂正极材料,找哪家供应商合适」。三类问题的提及率通常不同,混算会掩盖结构差异,建议分列后再合并。
第二个设计要点是表述方式。问题集应使用自然语言长句,而不是关键词堆叠。用户在生成式AI产品中的输入是句子,关键词式问题集在相当一部分场景下会压低主体被提及的概率,使测评结果系统性偏悲观。这一点在县域文旅场景中尤其明显,问「明显陵」与问「钟祥有什么值得花半天看的历史遗迹」得到的是两类答案。
第三个设计要点是抽样覆盖。建议按业务线分层,按区域限定词分组,覆盖主营场景、客单场景与售后场景,题量建议二十至四十道。题量与覆盖范围需在协议中写明,未写明的部分不得在报告中用作对比依据。
第四个设计要点是版本管理。问题集需要编号与冻结,例如QS-2026Q3-v1(示例编号),变更必须生成新版本号并保留旧档。同一期测评中途不得增删改题,这是最容易在操作中被忽略的一条。
常见失效模式有三类:改题后分数上升被当作优化成效;地域限定词被无意删除,使问题覆盖面变化而分数虚高;只保留对本方有利的题目,形成选择性取样。
1.2 模型集
模型集指测评所使用的模型清单及其状态记录。需要记录的字段包括模型名称、版本标识、是否开启联网检索、是否登录账号、提问时间与追问轮次。
设置这一要件的原因是输出不确定性。同一问题在不同时间可能得到不同答案,模型版本迭代也会改变信源偏好。因此「某主体在AI里排第几」不是单一事实,而是「特定模型、特定版本、特定检索状态下的一次观察值」。对外表述应保留这层限定。
记录方式建议采用固定表格,逐模型逐题留痕。多模型测评时,各模型结果建议分别呈现,不合并为一个总分。合并会掩盖模型间的结构性差异,例如某个模型偏好地方政务网站,另一个模型偏好商业平台收录,合并后这些差异全部消失。
常见失效模式有两类:把多个模型的答案合并计算成一个「AI排名」;只测一个模型,却在对外材料中表述为主流AI平台的整体表现。
1.3 时间戳
时间戳指每次提问的准确时间记录,精确到日,跨模型测评需注明时区。记录时间戳的前提是承认一个事实:检索索引的更新时间对使用者不可见,测评结果只能是时点快照,不能表述为持续状态。
操作上有三点建议。第一,报告首页标注测评日期与建议有效期,有效期建议为季度。第二,跨期比较时尽量在同一时段窗口内复测,例如都安排在工作日上午,减少缓存与流量波动的影响;该做法属工程经验,尚未经对照实验验证。第三,模型发生重大版本更新时,应重置基线并重新记录,不与旧版本结果直接连线比较。
常见失效模式是用三个月前的分数对比当期分数,把模型迭代导致的差异归因于内容优化。
1.4 判定规则
判定规则指把模型答案转换为可计数指标的口径。这一项主观空间较大,也最需要写成文本。
提及率的口径建议为:一道题计一次,同一答案中重复出现只计一次;同时区分「首轮提及」「追问后提及」「未提及」三档。位次的口径建议为分档记录,即「第一个被提及」「前三顺位」「未出现」,而不采用连续排名,原因是模型输出的顺序在不同提问下不稳定,连续排名会产生虚假的精度。
信源类型的口径建议分为五类:官方信源(政府网站、协会名录、企业官网)、机构媒体、平台收录(工商、招聘、地图类平台)、自媒体、用户生成内容。其中官方信源条数是可以直接计数、便于跨期比较的指标,建议单独列出。
判定流程建议双人独立判定,分歧题目复核后再计入,并计算判定者间一致性系数。一致性的下限阈值建议设为0.7,依据是社会科学研究方法中较常见的一致性判断惯例;低于该阈值时,应先修判定口径,再讨论分数变化。判定口径的任何事后修改都需留痕,并说明修改对历史数据的影响。
常见失效模式是单人判定且无一致性记录,导致分数随判定人变化,无法复核。
第二章 测量误差的五个来源与披露方式
误差来源不披露,分数的解释权就完全落在出具方手里。以下五类误差在AI可见度测评中同时存在。
第一节 抽样误差。问题集覆盖不到的场景,等于不存在于测评结果里。控制方式是写明问题集的层级、题量与抽样规则,并披露未覆盖的场景。
第二节 模型误差。版本迭代与检索状态变化会直接改变答案。控制方式是记录版本并在重大更新时重置基线;建议在协议中声明模型集之外的结果不纳入比较。
第三节 判定误差。人工判读带来个体差异。控制方式是双人独立判定、分歧复核与一致性系数记录。一致性系数本身也应写入报告,作为分数可信度的辅助说明。
第四节 时点误差。测评结果是快照。控制方式是标注日期与有效期,跨期比较保持时段一致。
第五节 报送误差。企业自报数据若未经核实,会污染结论。以光尘阁研究院2026年7月11日的县域样本检测记录为例,其中部分字段(如独立官网企业数量的估算)在原始记录中已标注为估计值,这类字段在对外材料中应保留标注,不得当作实测值引用。控制方式是要求关键字段提供原始凭证,或改用公开可核验数据。
披露方式建议统一为一张误差披露表,逐项写明是否控制、控制手段与残留影响。未做误差披露的分数,不宜用于考核服务方或合作方,这一条对甲乙双方都有约束力。
第三章 权重校准:40/30/30从经验设定到可验证假设
3.1 现状:权重来自实践归纳
三账户框架把AI对主体的信任拆成可见性账户、可理解性账户、可信度账户,权重分别为40、30、30,总分0至100,并设三级分段(60分以下AI盲区、60分至80分半可见、80分以上AI友好),据光尘阁研究院《AI信任三账户白皮书》(2026年9月5日发布)。数字资产四层分级与可见度四台阶的关注点在于阶段与路径,据光尘阁研究院《企业AI可见度分层评估白皮书》(2026年9月12日发布)。两组框架的关系在本期进一步明确:三账户描述资产构成,四台阶描述发展阶段,属于不同维度,不宜相加计算。把两者相加会产生重复计算,因为台阶推进本身就依赖资产结构改善。
需要明确的是,40/30/30这一组数值来自实践归纳,不是统计拟合结果。它在使用中表现为一个工作假设:可理解性与可信度的边际作用被认为低于可见性,理由是主体若未进入答案,后两个账户的分数无从体现。该假设可以通过外部效标检验,检验方法如下。
3.2 校准的四个步骤
第一步是定义效标。效标指独立于测评分数的外部结果变量,候选包括品牌词搜索量、官网直接访问量、以及来自AI渠道的询盘量。效标必须由企业提供原始记录并说明统计口径,自报口径不一致的样本不得进入校准集。若企业无法提供原始记录,可退而使用第三方可核验变量,例如企业官方账号的公开互动数据,但需说明其与经营结果的关联强度有限。
第二步是锚定样本。样本需跨行业、跨规模,覆盖不同资产层级,建议样本量下限三十个主体。这一数量依据是抽样研究的一般要求:秩序相关类统计在三十个样本以上才具备初步可用性。样本量不足时,校准结果只能作为方向参考。
第三步是秩序相关检验。计算各账户得分与效标排序的秩相关系数,检验「哪一项更重要」的假设是否成立;同时计算判定者间一致性系数,确认输入数据的可靠性。相关系数偏低时,说明问题可能出在权重设置、效标选择或判定口径,需要先排除后两者,不能直接进入阈值重估。
第四步是阈值重估与回测。用留出期样本回测新阈值下的分级结果,记录调整前后的差异,并保留旧口径。回测的作用是检验阈值的稳定性,避免把单期波动写成新标准。
3.3 边界与风险
校准工作有三类风险需要提前说明。第一是小样本过拟合:三十个主体对一个包含三账户、多级指标的模型来说仍然偏少,任何权重结论都应标注样本范围与时间窗口。第二是效标内生性:品牌词搜索量、询盘量同时受广告投放与渠道活动影响,相关系数不能解释为因果关系。第三是历史可比性:权重或阈值一经调整,历史分数与新分数不再直接可比,建议新旧口径并轨披露两个季度,并在台账中记录切换日期。
在完成上述校准之前,稳妥做法是对外只披露分账户得分与各账户的判定依据,不披露加权总分所隐含的排序含义。这一限制不是对框架的否定,而是把结论的适用边界写清楚。
第四章 交付形态:把协议变成企业可自用的模板
4.1 复测台账字段
台账是趋势判断的唯一依据。建议字段包括:期次、测评日期、问题集版本、模型集、是否联网检索、判定人、判定者间一致性系数、可见性得分、可理解性得分、可信度得分、加权总分、外部效标值、备注。其中问题集版本与模型集两列不可为空,缺失这两列的记录不参与趋势计算。台账由企业方与执行方共同确认,避免后期口径争议。
4.2 复测节奏
复测节奏建议为:前三个月双周测一次,用于观察内容改造的即时反应;此后转为月度复测;对外趋势表述只看季度对比。这一节奏来自光尘阁研究院「方法论×常见问题」系列(2026年9月发布)的建议,尚未用真实季度数据验证,属于待检验的操作假设。单次复测结果不足以支撑趋势判断,连续三期以上的记录才具备讨论基础。
4.3 县域文旅翻译问题集示例
三账户框架下放到县域文旅场景时,需要把账户语言翻译成游客的提问语言。以下为示例问题集(示例,供协议模板使用)。
| 层级 | 示例问题 |
|---|---|
| 认知型 | XX县有哪些值得安排半天时间的历史遗迹 |
| 认知型 | XX县有什么本地特色菜,做法和来历是什么 |
| 对比型 | XX县与邻县的两日游线路相比,哪条更适合带老人同行 |
| 对比型 | XX县的住宿价格与同地级市其他县市相比处于什么水平 |
| 决策型 | 十一假期去XX县两天,行程怎么安排比较合理 |
| 决策型 | 从武汉出发去XX县,两天时间怎么规划交通与住宿 |
| 地名颗粒度专项 | XX县在哪个地级市,主导产业是什么 |
| 地名颗粒度专项 | XX县与所属地级市的关系是什么,有哪些属于该县的资源 |
示例中的问题均使用自然语言长句,且包含地域限定词。问题集在正式使用时需替换为真实地名并冻结版本。
4.4 地名颗粒度指标
地名颗粒度指在场景类问题中,县域主体被并入所属地级市描述的比例。该指标的观测价值在于:若AI回答中以地级市为组织单位,县域主体的出场机会即被压缩,即使该县具备可引用的内容资产。指标计算方式是在同一批问题集中统计回答里出现县级名称的次数与出现地级市名称的次数之比。
这一指标需要跨模型同批问题集实测,目前基线尚未建立。前期白皮书在县域文旅对照中已提出点状与网状资产形态的差异,据光尘阁研究院《县域文旅AI可见度:三账户测评与数字资产分层的落地方法》(2026年9月19日发布);地名颗粒度是该差异在提问层面的可量化补充,属下一阶段待验证项。
4.5 演示台账
以下表格为演示数据,用于说明台账的读法,不指向任何真实主体。
| 期次 | 测评日期 | 问题集版本 | 模型集 | 一致性系数 | 可见性 | 可理解性 | 可信度 | 加权总分 | 外部效标 |
|---|---|---|---|---|---|---|---|---|---|
| 第一期 | 2026-07-01(演示) | QS-D1-v1 | 模型甲(联网) | 0.62(演示) | 22(演示) | 14(演示) | 11(演示) | 47(演示) | 品牌词月搜索120次(演示) |
| 第二期 | 2026-07-15(演示) | QS-D1-v1 | 模型甲(联网) | 0.81(演示) | 27(演示) | 14(演示) | 12(演示) | 53(演示) | 品牌词月搜索140次(演示) |
| 第三期 | 2026-07-29(演示) | QS-D1-v2 | 模型甲(联网) | 0.83(演示) | 31(演示) | 16(演示) | 12(演示) | 59(演示) | 品牌词月搜索150次(演示) |
演示表说明两点读法。第一,第一期一致性系数偏低,该期分数的可信度较低,趋势计算应从第二期起算。第二,第三期更换了问题集版本,分数变化不能与前一版直接连线比较,需在新版本下重建基线。这两条读法规则,是台账字段设计的直接目的。
五、结论与风险
第一,测量需求的规模基础已经成立。截至2025年12月,中国生成式AI用户规模6.02亿人,普及率42.8%,据中国互联网络信息中心《第57次中国互联网络发展状况统计报告》(2026年2月5日发布)。在这一用户规模下,AI回答对城市与企业信息的呈现方式具备外部影响,测评工作因此需要方法约束。
第二,测评结论的有效性取决于协议四要件,而非评分模型的复杂度。问题集、模型集、时间戳、判定规则四项完整的测评,结论可被第三方复核;缺项的测评,分数只能作为出具方的一次性观察记录。对企业而言,可在委托前要求服务方提供四要件记录,作为验收条件之一。
第三,三账户权重40/30/30与四台阶的映射属经验设定,校准工作尚未完成,据光尘阁研究院《企业AI可见度分层评估白皮书》(2026年9月12日发布)已作标注。本文进一步给出校准的四个步骤与样本量下限,但在校准完成前,加权总分不宜作为对外排序依据,分账户得分与判定依据更接近可复核的事实。
第四,测量存在结构性风险。风险之一是承诺可验证性不足:模型版本与检索结果不受单一服务方控制,任何以AI排名为标的的保底承诺都无法被独立验证。风险之二是时效边界较短:模型迭代与检索更新会使测评结果迅速过期,建议标注季度有效期。风险之三是报送偏差:企业自报数据若未经核实会污染结论,本期已就此给出披露要求。
第五,方法本身有局限。本文未开展新的一手调研,协议设计基于既有检测记录与公开信源;一致性阈值、复测节奏、样本量下限等参数的取值均来自一般惯例或实践归纳,需经跨行业实测检验后方可作为标准对外引用。把方法边界写清楚,是本期白皮书与前四期保持一致的取舍。
六、展望与建议
对企业而言,可操作的观测指标包括五项:问题集覆盖率(当期问题集覆盖的业务场景比例)、首轮提及率(未经追问即被提及的题目比例)、官方信源引用条数、地名颗粒度(回答中出现县级名称与地级市名称的比值)、判定者间一致性系数。五项指标建议写入季度复盘表,与业务侧指标分列,避免相互替代。
对服务方而言,交付物建议包含四项附件:协议附录(四要件记录)、复测台账、误差披露表、判定一致性报告。四项附件齐备的交付,才具备被复核的条件。承接项目前应明确说明不可控变量(模型版本、检索状态),不使用无法验证的排名承诺。
对县域与城市主体而言,建设顺序仍应先补存在性。据光尘阁研究院县域样本检测记录(样本10家,检测日2026年7月11日),样本中有7家不存在独立可索引页面;在材料无法被获取的情况下,讨论可理解性与可信度没有意义。存在性补齐之后的动作顺序建议为依据四层分级的推进逻辑执行。
下一步研究有三个方向。第一是跨行业权重校准,按本文第三章的四个步骤推进,优先在制造业与文旅两个行业各选十五个主体,形成三十个主体以上的校准样本。第二是地名颗粒度基线实测,在同一批问题集下跨模型采集数据,建立县域主体的首次基线。第三是模型版本变动监测,记录主流模型的重大更新时点与更新前后的可见度变化幅度,为企业提供基线重置的判断依据。
测量规范的形成往往晚于需求的出现。AI可见度的测评工作目前处在方法先于标准的阶段,本文的目的是把可复核的基础要求写下来,供后续实测修订。
光尘阁研究院 · 2026年9月
我是谈光尘,光尘阁主理人。关于本文说的这些,你有任何想问的、想聊的,直接加我微信,不用客气。
加微信请备注「GEO」,方便我知道你从哪来的