在人工智能领域,模型与框架的协同效果正成为行业关注的新焦点。近期一项对比实验显示,同一模型在不同智能体框架(harness)下的运行表现存在显著差异,这种差异甚至超过了模型本身的能力差距。实验团队使用Kimi K3模型,分别在Claude Code、Hermes和Kimi Code三个框架中执行28项相同任务,发现任务完成成功率差异不足10%,但Token消耗量最高相差达30倍。
数据显示,Kimi Code框架以中位数6.1万Token完成单个任务,Hermes框架消耗6.7万Token,而Claude Code框架的用量高达34万Token,是前者的近6倍。按照每百万输入Token 3美元的定价计算,三种框架执行单个任务的平均成本分别为0.22美元、0.28美元和2美元。这种成本差异在多轮交互任务中更为突出,某次测试中Claude Code框架的输入Token达到57.8万,而输出仅4500 Token,跨25轮交互的上下文累积成为主要消耗源。
运行效率方面,Hermes框架以179秒的中位数耗时领先,Kimi Code需要297秒,Claude Code则需348秒。这种性能分化促使研究者重新审视框架设计的重要性。实验团队指出,在模型能力趋同的背景下,框架选择可使整体成本产生9倍波动,而更换模型带来的收益远不及优化框架显著。
企业级AI平台Writer的专项研究进一步印证了这一发现。该团队在固定6个基础模型的前提下,仅替换编排层框架进行对照实验。结果显示,采用新框架后任务平均成本降低41%,中位延迟缩短44%,Token消耗减少38%,而任务完成质量保持稳定。这种改进使每美元成本获得的质量提升达82%,每百万Token可处理的任务数从54.9个跃升至92个。
行业专家分析指出,框架对运行成本的影响主要体现在上下文管理机制。Claude Code框架在多轮交互中会持续将历史消息、工具调用记录和文件内容等全部信息重新注入模型,导致输入Token指数级增长。相比之下,优化后的框架通过智能截断历史记录、压缩冗余信息等技术手段,在保持任务连贯性的同时显著降低资源消耗。
这种技术分化正在重塑行业评价体系。有研究者建议将"框架开销"纳入现有评测基准,特别是针对需要工具调用和重试机制的任务场景。数据显示,当交互轮次超过10次时,低效框架的Token消耗可能呈现几何级增长,这种非线性成本增加在传统评测中往往被忽视。
随着基础模型逐渐成为标准化组件,框架优化正成为新的竞争维度。实验团队形象地比喻:"当模型像水电一样普及后,框架就是决定使用成本的空调设备。"这种转变促使开发者在模型选型之外,更加关注框架的架构设计、上下文管理策略和资源调度算法等底层技术细节。











