近日,开源AI智能体工具集成平台Composio在X平台公布了一项重要测试结果。该平台通过30项真实场景任务,对四个AI编程智能体框架展开对比评估,旨在验证DeepSeek V4 Flash正式版模型在不同框架下的性能表现。测试覆盖Gmail、GitHub、Slack及Notion等常用工具,所有任务均统一调用该模型进行操作。
在参与测试的框架中,Oh My Pi以17项任务完成的成绩位列第一,但每个任务平均耗时达272秒,速度表现相对滞后。紧随其后的是Claude Code与Codex,二者均完成16项任务,其中Claude Code以122秒的单任务耗时成为速度最快的框架,但其每个成功任务的成本高达0.195美元,在成本控制方面表现欠佳。OpenCode虽然仅完成14项任务,但以每个成功任务0.073美元的成本成为最经济的选择。
测试数据显示,各框架在工具调用效率上存在显著差异。Claude Code虽然速度领先,但工具调用次数和输出令牌数量均为最少,这种精简操作模式直接推高了其使用成本。Oh My Pi尽管任务完成率最高,但耗时过长的问题可能影响实际应用中的效率。Codex的表现与Claude Code接近,而OpenCode在成本控制方面展现出独特优势,为预算敏感型场景提供了新选择。
Composio作为此次测试的组织方,其核心定位是构建大语言模型与外部应用的连接桥梁。该平台通过标准化测试流程,为开发者提供了多维度的性能参考指标。测试结果不仅反映了不同框架在任务处理能力上的差异,更揭示了速度、成本与完成率之间的制衡关系,为AI编程工具的选型提供了实证依据。
此次对比测试采用的真实工具场景,涵盖邮件处理、代码管理、团队协作及文档编辑等典型工作流。每个框架均需在统一环境下完成相同任务,确保评估结果的客观性。测试过程中记录的任务耗时、成本消耗等数据,为后续框架优化提供了明确方向,同时也为行业用户选择适配工具提供了量化参考。











