Claude Code 到底多费 Token?三大框架实测差 30 倍,这才是 Agent 隐形成本

机器之心 7 月 31 日出了个对比测评,把同一套编程任务扔给三个主流 Agent 框架跑,结果触目惊心:

Claude Code 的 Token 消耗量,是最省的那家的 30 倍。

不是模型贵,是框架吃 Token

具体数据(同一任务,同一基础模型):

框架 Token 消耗 相对值
框架 A(最省) 1x 基准
框架 B ~8x 中等
Claude Code ~30x 最高

30 倍什么概念?如果框架 A 跑一个任务花 1 块钱的 Token,Claude Code 要花 30 块。一天跑 100 个任务,差 2900 块。一个月差 8 万 7。

有人管这个叫 "Harness Tax"——Agent 框架本身的运行开销。

Harness Tax 从哪里来

Agent 框架不是直接把你的问题扔给模型。它要做一堆"额外动作":

  • System Prompt(可能几百到几千 Token)
  • 多轮工具调用的上下文累积
  • 每次调用的输入/输出格式包装
  • 错误重试时的完整上下文回放
  • 历史对话摘要

框架设计得好不好,这些"额外动作"的效率天差地别。差的框架每轮对话都在反复传同样的 System Prompt、同样的工具定义、同样的历史记录。30 倍的差距就是这么来的。

这事跟 Token 价格战放一起看更有意思

前两天 DeepSeek V4 Flash 把价格打到 GPT-5.6 的 40%。所有人欢呼"Token 不要钱了"。

但如果你用的是那个 30x 框架——模型再便宜,框架帮你把成本吃回去了。Token 价格降 60%,框架浪费涨 30 倍,算总账还是亏。

换句话说:模型侧在拼命降成本,框架侧在大手大脚花钱。

光尘阁的判断

选 Agent 框架,Token 效率应该进核心评估指标。 现在大多数人选框架看的是 "功能全不全""社区大不大",很少有人把 Token 消耗量放在第一位。但如果你是要规模化跑 Agent 的公司——日跑上万次调用——Token 效率比功能列表重要得多。

框架优化会成为下一波竞争力。 谁的框架能把同一个任务的 Token 消耗压到最低,谁就能在模型降价之后吃到最大的利润差。这跟云计算时代的"资源调度效率"是一个逻辑——AWS 赚钱不是因为服务器便宜,是因为它能比别人用更少的机器跑更多的负载。

对 OPC 部署也有启发。 如果你做的是本地化 Agent 部署(每个客户一套),框架的 Token 效率直接等于客户的 API 账单。省 30 倍的 Token = 客户的月成本降 97%。这事对销售来说比任何功能都好使。