ITBear旗下自媒体矩阵:

苹果团队突破AI训练瓶颈:无需真实环境,语言模型“造”出高质量数据

   时间:2026-07-31 03:03:17 来源:互联网编辑:快讯 IP:北京 发表评论无障碍通道
 

苹果公司研究团队近期提出一项创新方法,通过语言模型直接生成手机AI助手训练数据,跳过传统数据收集所需的复杂环境搭建过程。这项名为ESAT(无需真实环境的合成智能体轨迹生成)的技术,以预印本形式发布于学术平台,论文编号arXiv:2607.16900。其核心突破在于仅需应用接口文档,即可自动生成包含完整操作轨迹的虚拟数据,无需真实服务器、数据库或程序代码支持。

传统训练方式需构建包含真实订单系统、银行接口、通讯录等功能的数字沙盒环境,供AI助手模拟完成订餐、转账等任务。这种"练兵场"模式不仅开发成本高昂,且每新增应用组合都需重新搭建。研究团队转而利用语言模型对软件逻辑的深刻理解,让一个模型扮演"数字世界"返回虚构但合理的系统响应,另一个模型扮演AI助手执行任务,通过角色扮演完成数据生成闭环。

技术实现面临两大挑战:保持跨步骤操作的一致性,以及确保虚构数据的真实性。例如当AI助手第五步添加歌曲到播放列表后,第十步查询时该曲目必须存在;用户设定为女性时,所有返回的性别信息需保持统一。研究团队设计四层质检机制:程序化验证参数完整性、检查数据结构合规性、裁判模型审核语义合理性,最终仅保留通过多重检验的轨迹。

数据生成流程分为三个阶段:首先通过"配置桶"机制生成多样化任务,涵盖不同难度、应用组合和操作类型,并采用逆频率采样确保冷门接口获得充分训练;随后教师智能体与模拟器进行多轮对话,模拟器综合接口文档、任务上下文、虚拟用户画像等信息生成响应;最终由裁判模型筛选出真正完成目标的任务轨迹。在AppWorld测评中,系统为9个应用生成9000条轨迹,同时针对52个虚构应用设计1017个接口,产出6000条全新训练数据。

实验结果显示,使用虚构应用数据训练的模型在AppWorld测评中表现优异,270亿参数模型普通任务完成率达84.2%,挑战任务达79%,接近教师模型水平。更引人注目的是,虚构数据训练效果超越真实环境收集的634条成功轨迹,合并使用两类数据时模型性能进一步提升4.1-15.3个百分点。在OfficeBench自动化办公场景中,ESAT数据使20亿参数模型任务完成率提升60.5个百分点,显著优于同类方案Simia。

可靠性验证表明,模拟器生成的接口响应93.7%通过外部裁判审查,但在处理超2000词元的长响应时失败率升至23%。轨迹筛选环节,Gemini裁判与真实环境验证的精确率达95.2%,与人类标注者一致性系数0.90。对比实验显示,早期不考虑状态关联的合成数据集导致模型性能下降,而ESAT通过维护持久世界状态,使模型掌握跨步骤状态追踪能力。

生产效率方面,AppWorld数据集初始生成3万候选任务,最终产出9352条高质量轨迹,模拟器重试率仅6.12%;虚构应用数据集实现99.6%接口覆盖率,逆频率采样防止数据偏向热门接口。研究团队承认当前方案在精确计算任务存在局限,但强调随着语言模型能力提升,模拟复杂场景的可靠性将持续增强。这项技术已展示降低AI助手开发门槛的潜力,开发者仅需提供接口文档即可启动训练流程。

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version