阿里旗下千问大模型团队近日推出一款名为Qwen-UI-Agent的创新产品,该模型专注于图形用户界面(GUI)交互领域,旨在为数字设备打造通用型智能执行器。通过深度融合视觉理解与操作模拟能力,模型可直接解析屏幕内容并完成复杂任务,覆盖移动终端、桌面系统、网页环境及专业搜索场景。
在性能验证环节,该模型展现出显著优势:移动端测试中,MobileWorld基准得分达82.1%,真机环境MobileWorld-Real项目更取得92.2%的突破性成绩,AndroidDaily场景测试准确率高达97.5%。桌面系统方面,OSWorld Verified验证得分79.5%,浏览器环境WebArena测试达73.6%,界面元素定位专项ScreenSpot-Pro测试取得81.5%的优异表现,多项指标刷新行业纪录。
研发团队构建了超大规模的真实设备训练集群,包含100余台实体手机和150款主流应用,形成从虚拟仿真到实体落地的完整训练链路。为确保操作安全,系统内置多重防护机制:对支付交易、数据删除、权限变更等敏感操作实施强制确认流程,高风险请求将被自动拦截,构建起贯穿全流程的安全屏障。
该模型突破传统交互模式限制,创新性地支持GUI图形操作与CLI命令行的混合执行,在电脑端任务中近半数场景可调用命令行工具,显著减少操作步骤。通过支持超百步连续动作的在线强化学习,配合上万并发环境的持续迭代训练,模型搭载的AI驱动数据飞轮机制可实现任务闭环优化。
基于Harness框架的跨设备协同能力成为另一亮点,模型不仅能实现手机与电脑的任务无缝衔接,还可与深度搜索系统DeepSearch深度整合,将网络信息检索与界面操作形成联动。这种设计特别针对未开放API的传统软件,通过视觉理解技术直接完成操作,无需对原有程序进行改造,极大拓展了智能体的应用边界。










