文章通过Composio团队对比实验揭示,不同agent框架(harness)对token消耗影响巨大:Claude Code在任务成功率相近情况下,token用量达Kimi Code的6倍、成本高达2美元,而Hermes最快、Kimi Code最省;实验证明harness选择对成本、延迟和效率的影响远超模型本身,凸显其在AI agent架构中的核心地位。
大家都说 Claude Code 浪费 Token,究竟有多费?这回终于有人算出数来了。
最近有个挺有意思的对比实验,来自 Composio 团队。他们用同一个模型

结果,三个 harness 完成任务的成功率差不多:
真正拉开差距的,是 token 消耗。同样一个任务,用不同 harness 跑下来,token 用量最多能差到 30 倍!
中位数来看,

按
速度方面也不一样。中位数耗时,Hermes 最快,179 秒;
所以最快的是 Hermes,最省 token 的是
Composio 团队由此得出一个直接的结论:如果你想降低 agent 的成本,先看看用的是哪个 harness,而不是急着换模型。他们的数据里,harness 本身就能把成本拉开 9 倍,而模型的能力表现其实差不多。

Sebastian Raschka 看到这个结果后也发了帖,说这和他之前用 Qwen3.6 做的观察类似:Claude Code 在成功率相近的情况下,token 用量往往是其他很多 harness 的 2 到 3 倍。

他提出了几个可能的原因:是没怎么优化?是有 bug?还是故意设计成这样(因为在更难的任务上可能有帮助)?他表示需要再花时间仔细查一下。
接着他补充了上个月自己写本地 coding agent 文章时的观察。当时他分析过为什么 Claude Code 用更多 token,发现差异主要出在输入 token,而不是输出 token。也就是说,Claude 并没有多写一倍的内容。日志显示,Claude 的 harness 在多轮交互中会反复把更多上下文塞回模型,包括之前的消息、工具调用、命令输出和文件内容。举个例子,某次 Claude 跑完大约用了 57.8 万输入 token,但输出只有大约 4500 token,跨了 25 轮。所以更可能的解释是,Claude 的 harness 在多步 agent 运行时,会累积或计入更大的 prompt 端历史。

这些测试结果似乎揭示了一个不容忽视的趋势:harness 的重要性已经不亚于模型本身。
最近的一篇论文(来自 Writer,一家做企业级 AI Agent 平台的公司)系统揭示了这一点:它用控制变量实验证明,换一套 harness 层比换模型更能砍成本,而且所有模型都受益。

具体来说,他们开展了一项严格的「控制变量」实验:在 22 个企业任务和 6 个基础模型(Claude Sonnet 4.6、Gemini 3.1、Gemini Flash 3.5、Qwen 3.6、GLM 5.1、Palmyra X6)固定不变的前提下,仅替换编排层 —— 将传统的生产级智能体循环替换为 Writer 自家的 Harness。
实验结果显示:每项任务的平均成本降低 41%(0.21 美元→0.12 美元),中位延迟缩短 44%(48 秒→27 秒),Token 消耗量减少 38%(14.2k→8.8k),而任务完成质量基本持平(0.78→0.81,因样本量较小可视为无显著差异)。在性价比方面,每美元成本所能获得的质量提升高达 82%,同时每百万 Token 能完成的任务数从 54.9 跃升至 92.0。
所以,在模型变成「水电煤」之后,harness 才是那个决定你电费账单的空调?换句话说:以前有人说「模型即产品」,现在是「harness即产品」?

既然 harness 如此重要,那之后的账是不是也应该算得更细一些了?
有人指出,我们有必要在现有的 benchmark 中加入「harness 税」这一项。尤其是考虑到一旦工具调用和重试进入 loop,这笔税不是线性增长。

换句话说,未来的 agent 竞赛,上半场比的是「能不能做」,下半场比的将是「做同样的事,谁更省」—— 而省钱的秘密,不在模型,在 harness。

在跑 Agent 的过程中,你有没有过类似的体验?欢迎在评论区讨论。
本文来自微信公众号 “机器之心”(ID:almosthuman2014),作者:机器之心