AI资讯

Claude Code到底有多费token?对比实验来了:三大框架最多差30倍

作者:机器之心0 次浏览 来源:机器之心
Claude Code到底有多费token?对比实验来了:三大框架最多差30倍

最近有个挺有意思的对比实验,来自 Composio 团队。他们用同一个模型 Kimi K3,分别放进三个不同的 agent 框架(harness)里跑 ——Claude Code、Hermes 和 Kimi Code—— 一共测了 28 个完全相同的任务。

大家都说 Claude Code 浪费 Token,究竟有多费?这回终于有人算出数来了。

最近有个挺有意思的对比实验,来自 Composio 团队。他们用同一个模型 Kimi K3,分别放进三个不同的 agent 框架(harness)里跑 ——Claude Code、Hermes 和 Kimi Code—— 一共测了 28 个完全相同的任务。

文章配图

结果,三个 harness 完成任务的成功率差不多:Kimi Code 是 28 个里成功 22 个,Hermes 是 21 个,Claude Code 是 20 个。差距不算大。

真正拉开差距的,是 token 消耗。同样一个任务,用不同 harness 跑下来,token 用量最多能差到 30 倍

中位数来看,Kimi Code 大约用 6.1 万 token,Hermes 大概 6.7 万,而 Claude Code 直接飙到 34 万,差不多是 Kimi Code 的 6 倍。

文章配图

按 Kimi K3 每百万输入 token 3 美元的价格算(agent 工作流里输入 token 通常占到 95% 左右),平均每个任务的成本大概是:Kimi Code 0.22 美元,Hermes 0.28 美元,Claude Code 则到了 2 美元。差距很明显。

速度方面也不一样。中位数耗时,Hermes 最快,179 秒;Kimi Code 297 秒;Claude Code 348 秒。

所以最快的是 Hermes,最省 token 的是 Kimi Code,两者并不重合。

Composio 团队由此得出一个直接的结论:如果你想降低 agent 的成本,先看看用的是哪个 harness,而不是急着换模型。他们的数据里,harness 本身就能把成本拉开 9 倍,而模型的能力表现其实差不多。

文章配图

Sebastian Raschka 看到这个结果后也发了帖,说这和他之前用 Qwen3.6 做的观察类似:Claude Code 在成功率相近的情况下,token 用量往往是其他很多 harness 的 2 到 3 倍。

文章配图

他提出了几个可能的原因:是没怎么优化?是有 bug?还是故意设计成这样(因为在更难的任务上可能有帮助)?他表示需要再花时间仔细查一下。

接着他补充了上个月自己写本地 coding agent 文章时的观察。当时他分析过为什么 Claude Code 用更多 token,发现差异主要出在输入 token,而不是输出 token。也就是说,Claude 并没有多写一倍的内容。日志显示,Claude 的 harness 在多轮交互中会反复把更多上下文塞回模型,包括之前的消息、工具调用、命令输出和文件内容。举个例子,某次 Claude 跑完大约用了 57.8 万输入 token,但输出只有大约 4500 token,跨了 25 轮。所以更可能的解释是,Claude 的 harness 在多步 agent 运行时,会累积或计入更大的 prompt 端历史。

文章配图

这些测试结果似乎揭示了一个不容忽视的趋势:harness 的重要性已经不亚于模型本身

最近的一篇论文(来自 Writer,一家做企业级 AI Agent 平台的公司)系统揭示了这一点:它用控制变量实验证明,换一套 harness 层比换模型更能砍成本,而且所有模型都受益。

文章配图

具体来说,他们开展了一项严格的「控制变量」实验:在 22 个企业任务和 6 个基础模型(Claude Sonnet 4.6、Gemini 3.1、Gemini Flash 3.5、Qwen 3.6、GLM 5.1、Palmyra X6)固定不变的前提下,仅替换编排层 —— 将传统的生产级智能体循环替换为 Writer 自家的 Harness。

实验结果显示:每项任务的平均成本降低 41%(0.21 美元→0.12 美元),中位延迟缩短 44%(48 秒→27 秒),Token 消耗量减少 38%(14.2k→8.8k),而任务完成质量基本持平(0.78→0.81,因样本量较小可视为无显著差异)。在性价比方面,每美元成本所能获得的质量提升高达 82%,同时每百万 Token 能完成的任务数从 54.9 跃升至 92.0。

所以,在模型变成「水电煤」之后,harness 才是那个决定你电费账单的空调?换句话说:以前有人说「模型即产品」,现在是「harness即产品」?

文章配图

既然 harness 如此重要,那之后的账是不是也应该算得更细一些了?

有人指出,我们有必要在现有的 benchmark 中加入「harness 税」这一项。尤其是考虑到一旦工具调用和重试进入 loop,这笔税不是线性增长。

文章配图

换句话说,未来的 agent 竞赛,上半场比的是「能不能做」,下半场比的将是「做同样的事,谁更省」—— 而省钱的秘密,不在模型,在 harness。

文章配图

在跑 Agent 的过程中,你有没有过类似的体验?欢迎在评论区讨论。

文章来自于微信公众号 “机器之心”,作者 “机器之心”

相关主题

读完之后

加入 AINRK 交流群

了解加入交流群的方式,与更多 AI 从业者交流。

查看交流群说明(在新窗口打开)