在人工智能领域,训练能够操作电脑终端的智能体正成为新的研究热点。这类智能体需要像人类工程师一样,在命令行界面中完成安装软件、整理文件、运行数据处理脚本等复杂任务。然而,研究人员发现,制约这类智能体发展的关键因素并非算法不够先进或算力不足,而是缺乏高质量的训练题目。
中国科学技术大学与上海AI实验室的联合研究团队针对这一问题提出了创新解决方案。他们开发的FACET框架通过让AI自主完成出题、解题、判卷的完整闭环,有效解决了训练任务中各环节不匹配的难题。研究显示,在未经优化的传统流程中,AI生成的任务包仅有27.8%能通过完整验证,而FACET框架将这一比例大幅提升至70%。
一个合格的终端训练任务包含四个关键要素:明确的任务说明、预配置的运行环境、可行的参考答案以及准确的判分程序。这四个部分必须严格对应,任何环节的偏差都会导致整个任务失效。研究团队形象地比喻道,这就像组装家具时说明书与零件不匹配,即便文字描述再详尽,实际组装时仍会遇到各种问题。
FACET框架的创新之处在于重新设计了任务生成流程。首先通过收集超过7.1万个公开技能包,构建起庞大的基础素材库。这些技能包经过安全过滤和结构化处理后,系统会分析技能间的潜在关联,形成有逻辑的技能组合。例如,"读取Excel表格"与"生成可视化图表"这两个技能常被识别为配套组合,因为实际工作中用户往往需要先处理数据再制作图表。
框架的核心创新在于"场景重构"阶段。系统不直接将技能组合转化为任务描述,而是通过五个维度(目标、场景背景、能力关系、状态变化、输入输出与工具)深入理解技能间的协作方式。这个过程类似于厨师设计菜单,需要先确定整体用餐体验,再安排各道菜品的制作顺序和搭配关系。通过这种设计,系统能够恢复出技能间的真实依赖关系和中间状态。
在环境搭建阶段,FACET采取"先建环境再出题"的策略。系统根据场景说明预先配置好所有需要的文件、服务和依赖包,甚至会联网获取真实资源并进行适当扩充。这种设计确保了任务说明、解决方案和判分程序都基于同一个真实的运行环境,避免了各环节"自说自话"的问题。研究显示,这种共享容器状态的设计使文件路径和数据结构错误率显著降低。
实验数据验证了FACET框架的有效性。在与其他终端智能体数据集的对比中,FACET生成的任务虽然数量较少(1.2K个),但每个任务包含22.77个独立检查点,远高于其他数据集。用这些任务训练的模型在Terminal-Bench 2.1基准测试中表现优异,27B参数的模型经过微调后得分达到47.57,接近参数量是其15倍的同类模型水平。
研究还揭示了一个有趣现象:AI在单个检查项上的通过率高达89.4%,但整体任务完全成功率只有20.94%。这表明终端任务的难度不在于单个步骤的复杂性,而在于需要同时满足多个相互关联的要求。就像驾照考试中,即使前四个项目完美完成,最后一个项目的小失误仍会导致整体不及格。
通过对照实验,研究团队验证了生成顺序对任务质量的重要影响。采用"先解决方案后判分程序"的正序生成方式,初始有效率达到46.5%,显著高于逆序生成(24.2%)和联合生成(37.5%)方式。这种差异源于判分程序需要基于实际可行的解决方案来设计,而不是凭空想象检查标准。
在实际应用中,FACET框架展现出显著优势。在相同技能对输入的测试中,该框架生成的任务包通过验证率高达70%,远高于基线流程的15.6%和TerminalWorld风格的27.8%。更重要的是,这些任务保持了较高复杂度,AI模型平均需要执行21.5条终端命令才能完成任务,证明框架没有通过降低难度来提高通过率。











