一、内容管线里最贵的动作不是「写」,是「判」
先算一笔账。
一篇长文的生产流程里,真正需要大模型「写」的只有正文那一步。剩下的动作全是判断:这个选题和三个月前那篇撞不撞车、这段素材够不够硬、三个标题里哪个更合适、稿子能不能过质检门槛、这条线索值不值得跟。
判断和生成是两种活。判断要的是结论、强度、能不能过线;生成要的是一段读起来顺的话。过去我们把两种活塞进同一个模型、同一套提示词里,代价有三笔。
第一笔是钱和延迟。生成的 token 贵,判断只要一个词,却按生成的价格付。 第二笔是稳。同一段输入跑十遍,选出来的类别有时会变。带随机性的接口在流水线上就是故障源。 第三笔最贵:解析。让模型「只输出 JSON」,然后祈祷它真的只输出 JSON,每个写过 Agent 的人都被这件事坑过。多一个逗号、多一对反引号,管线就崩。
所以当我看到有一类模型专门只做判断、不生成任何文本时,第一反应是:这东西该进管线,不该进聊天框。
二、Jev 是一台不说话的判断机
TypeSafe 在 2026 年 9 月发布了 Jev,称它是第一个 System One 模型。它的定位很窄:你给它一段材料,加上提前定义好形状的问题,它返回类型化的答案、每个选项的概率,还有一个 confidence。
它不会写作文,也不跟你聊天。注册控制台的第一道门禁是一道选择题:「Jev 能聊天吗?」答「能」,弹窗会告诉你答错了。这个梗挺妙,因为大多数人对 AI 的默认期待就是聊天。
它的提问只有三种形状:
- Choice:从你给定的选项里选一个,比如这条线索属于哪个渠道
- Score:按你定义的档位打分,比如紧急性从「没压力」到「很急」
- Noul:回答一个概率,比如这条消息表达砍价意图的概率是 0.98
一次请求可以混搭多个问题,每个问题独立返回概率分布。返回里的 confidence 是另一回事:概率说的是选项之间谁更可能,confidence 说的是这次判断本身有多确定。这两个数一起看,才够决定要不要放行。
价格是输入 0.042 美元/百万 token,输出免费。对,输出免费。这句话背后是它的商业逻辑:它真正在卖的是决策,字数只是副产品。9 月 20 日起注册也不用排队了,想试可以直接建号。
三、四组实测:延迟、稳定性、并发、成本
下面全是 2026 年 9 月 22 日我自己跑出来的数,跟官方标称值分开看。
第一组,延迟跟输入长度几乎无关。
| 输入长度 | 单次调用 p50 |
|---|---|
| 355 token | 753 ms |
| 562 token | 706 ms |
| 940 token | 707 ms |
从 355 到 940 token,延迟基本没动。判断型任务的开销在「读懂」,不在「写出来」,这个特征在数字上体现得很直接。
第二组,700 毫秒里有 500 毫秒是握手。
官方标称延迟 70 到 500 毫秒,我第一次测出来全是 700 毫秒以上,本来准备写一句「虚标」。拆开网络计时才发现:TCP 建连 230 到 280 毫秒,TLS 握手完成在 440 到 500 毫秒之间。也就是说从国内直连这台 API,光握手就花掉 500 毫秒。
换成同一条连接连续调用:
| 调用方式 | 观测延迟 |
|---|---|
| 每次新建连接(首次) | 793 ms |
| 复用连接 p50 | 292 ms |
模型本身的推理时间大约 290 毫秒,跟官方标称对得上。所以生产环境头一件要做的事就是换连接池。提示词调得再漂亮,也补不回那 500 毫秒的握手。
第三组,标签稳定,概率会抖。
同一段材料重复调用 12 次:分类标签 12 次全落在同一个选项上,但连续量在小范围浮动,一个从 0.66 到 0.69,另一个从 0.98 到 1.00。
这组数字带来一条工程规矩:别拿极限阈值做业务判断。如果你写「概率大于 0.99 就自动执行」,同一条数据会一会儿过、一会儿不过。门槛设在 0.9 或者 0.7 这种位置,拿到的是稳定结论;设在边界上,拿到的是噪声。
第四组,并发吞吐够用。
20 条材料、每条 3 个问题,并行发出去:总共 0.87 秒跑完,约 23 QPS,比串行快 17 倍。拿几千条历史数据打标,是几分钟的事。
成本:562 token 输入做一次判断,花 0.0000236 美元,按 7.1 折算约 0.00017 元。一万次判断不到 1.8 元。我给 25 条真实台账做三项判定,一共消耗 12,492 token,花了 0.0005 美元,不到 4 厘人民币。
四、A/B:拿 25 条真实台账,它跟大模型打平
便宜不等于能用,还得看准不准。
我拿执行秘书台账里 25 条真实的口述待办做了对照实验,让 Jev 和 DeepSeek 分别判断三件事:分类(自己做、等对方、知会、风险)、责任方归属、原文有没有明确期限。
| 判定项 | Jev | DeepSeek |
|---|---|---|
| 四分类 | 84% | 88% |
| 责任方归属 | 72% | 88% |
| 是否含期限 | 88% | 88% |
结论很清楚:它不比大模型更聪明。三项里两项打平,一项落后 16 个百分点。
这里要交代局限:样本只有 25 条,16 个百分点换算成绝对数就是 4 条,而台账标注本身就有噪声,这个差距说明不了谁更强,只说明它够用。
那它的价值在哪?在另外三处:一次调用同时问三个问题,返回的是结构化字段,代码直接分支,不用解析;标签稳定,不必为随机性兜底;输出免费,成本只剩输入那一段。
这个实验还教了我一课,比结论本身值钱。
第一轮我把台账字段当标准答案,跑出来责任方归属只有 24% 准确率,看着像模型废了。检查后发现是标签的问题:台账里责任方字段存的是笔名,跟真名对不上;期限字段大量留空,可原文里明明写着「周五前」和「9.10 启动」。换句话说,模型的答案是对的,我的标准答案错了。
拿脏标签评模型,结论会反着来。这条教训对做内容的人同样成立:想用 AI 做判断,先把判定标准写清楚,否则你测出来的是自己的手写习惯,不是模型的水平。
五、判断节点四问
我把这次实测沉淀成四个问题,用来筛自己管线里的节点。任意一个节点,四问过一遍,就知道该不该换。
第一问:你要的是一个可判定的结果,还是一段给人看的话? 要语气、要故事、要给人读的,继续用大模型。只要是「选一个」「打个分」「是或否」,就属于判断节点。
第二问:标准能不能写成清楚的档位? 「这段素材够不够硬」这种问法没法用,要拆成「有没有具体数字」「有没有时间点」「有没有可核实的主体」。定义越具体,判断越稳;定义模糊时,模型返回的 confidence 会掉下来,这是它给你的信号。
第三问:判错一次的代价多大? 代价低,比如给线索打标签,直接批量跑。代价中等,卡 confidence 门槛,低于阈值的转人工。代价高,比如结算、合规,别让它单独拍板,让它做初筛,人做终审。
第四问:这个节点一天要跑多少次? 一天几次的判断,顺手问一句大模型就行,没必要为它搭接口。一天几百上千次的,值得固化成原语:写一次 criteria,反复调用,单次成本低到可以忽略。
也有些活别找它:要给理由的解释题、要多步推理的规划题、依赖专业领域知识的判断,以及对延迟极端敏感的同步场景。
六、这跟 GEO 是同一件事
我在上一篇写知识库时提过一个词,内容复利引擎。知识库是一次结构化、被 AI 反复引用的复利资产。
判断节点是同一个逻辑的另一半:一次定义标准,反复调用结论。过去每判一次都要重新生成一遍思路,像每次点火都重新造一台发动机。
更值得说的是它和 GEO 的关系。GEO 做的是让机器读懂你的内容,判断节点做的是让机器读懂你的业务规则,底层动作是同一个:把人话翻译成机器能直接消费的结构。你在页面上加结构化数据,是给 AI 搜索递一份它好读的简历;你把判定标准写成 criteria,是给代码递一份它好执行的分工表。小红书那套用结构化 UGC 去喂养 AI 搜索的打法,也是同一个路子。
我们内部的用法很朴素:探针抓来的线索先过一遍判断节点,扫出值得跟的;内容发布前用打分节点扫一遍,把明显不达标的挡在门外;台账入库前判一次类别,省掉人工翻记录。都不复杂,唯一的变化是这些判断不再需要一段文字做中介。
光尘阁观点
评价一个 AI 环节做完没有,我的标准是:如果它还要人读一遍输出才能往下走,这个环节就没做完。
判断和生成会继续分开。以后搭 AI 系统,先分清哪些活是说给人听的,哪些活是给代码判的。后一类活,不该交给会聊天的模型去干。
最后给一条自查标准:把你管线里所有的模型调用列出来,标一下每次调用的输出形态。如果一半以上的调用其实只要一个标签、一个分数或者一个概率,那你有一半的算力和延迟花在了不需要的地方。
让每个品牌,在AI搜索里有一席之地。
光尘阁 · 2026年9月