XYZ AI Lab近日宣布推出两款新型Deep Search Agent——参数规模达350亿的XYZ-Aquila-mini与3970亿的XYZ-Aquila-pro,这两款模型在多项深度搜索基准测试中刷新了现有最高纪录。此次突破不仅展现了模型性能的飞跃,更标志着AI驱动AI研发(AI4AI)范式从理论探索迈向工程实践的关键一步。
与传统研发模式不同,XYZ团队构建了以AI为核心驱动力的闭环系统。该系统整合任务分解、模型训练、运行时优化与效果验证四大环节,通过300余个协同工作的Agent单元,在千卡级算力支持下实现研发流程的自动化迭代。研究团队特别强调,系统核心价值不在于算力规模或Agent数量,而在于将分散的实验转化为可积累、可复现的研发能力——每次实验的输入输出、中间状态与决策依据均被完整记录,形成可供后续任务调用的共享知识库。
深度搜索场景被选为首个验证场域,因其对系统综合能力提出严苛挑战。单次搜索需完成问题拆解、多源信息抓取、证据链构建、冲突消解与最终作答等复杂步骤,过程中可能遭遇网页失效、结果矛盾、关键证据淹没等突发状况。XYZ-Aquila系列需在七项基准测试中同时证明中英文处理、时效信息捕捉、跨页面推理等跨维度能力,其中XYZ-Aquila-mini在全部七项测试中均取得同规模模型最优成绩,XYZ-Aquila-pro则在三项指标上超越Claude Opus等知名闭源模型。
研发体系的设计凸显"人机协同"原则:人类团队负责制定研发目标、验收标准与风险边界,AI系统则在授权范围内自主推进任务分解、方案探索与实验执行。例如,当系统检测到证据链断裂或权限越界时,会自动暂停流程并升级至人工审查;所有代码修改需通过独立评测器验证后,才能进入下一研发阶段。这种设计既保证了探索效率,又避免了AI系统失控风险——300个Agent单元本质是执行特定任务的模块,而非独立决策主体。
该体系的突破性在于将研发焦点从单点优化转向系统级改进。在任务构造环节,系统通过构建证据图网络确保问题可检索、答案唯一且无查询捷径;训练阶段采用状态对齐监督微调技术,仅使用模型实际可见的信息进行监督;运行时通过只增不改的审计日志实现错误精准定位;强化学习模块则利用过程奖励机制优化长程决策能力。这些创新使模型在BrowseComp-ZH、LiveBrowseComp等复杂场景中,展现出更强的环境适应与证据链维护能力。
据技术报告披露,XYZ-Aquila系列的成功源于对研发全链条的重新组织。AI承担了高吞吐的探索与执行工作,人类则将精力集中于目标设定与关键决策;算力资源被转化为可验证的研发循环,而非单纯追求实验数量。这种模式为AI4AI范式提供了可复现的工程框架,其设计原则——"人类定规则、AI找路径、独立做验证、全程可追溯"——正在成为行业探索递归自我改进(RSI)的基础参考。











