在人工智能领域,一场关于模型协作的革新正悄然兴起。一家名为“Mostik”的俄罗斯初创公司,凭借其独特的模型间信息传递技术,在Kaggle平台的ARC-AGI-3竞赛中脱颖而出,一度登顶排行榜,目前稳居第二。这一成就,不仅让业界对这家此前名不见经传的团队刮目相看,更引发了关于AI未来发展方向的深入思考。
ARC-AGI-3竞赛,被誉为测试AI真正智能的试金石。与传统基准测试不同,它不提供具体的题目或规则,而是将AI智能体置于一个完全陌生的二维交互环境中。智能体需通过不断尝试,摸索环境规律,构建自己的世界模型,最终找到通关方法。这种设定,对AI的自主学习和适应能力提出了极高要求。
Mostik团队,由12位博士和一位菲尔兹奖得主组成,尽管此前鲜有露面,却在短短四个月内,打造出了这款在ARC-AGI-3竞赛中大放异彩的模型。他们究竟有何秘诀?团队成员选择保持神秘,表示比赛尚在进行中,不愿过早透露细节。然而,他们公开的一项实验,却足以让人眼前一亮。
这项实验,涉及两个不同量级的AI模型:一个是拥有7530亿参数的GLM-5.2,另一个是仅有40亿参数、可在移动设备上运行的Qwen-3.5。Mostik团队在这两个模型之间搭建了一座“桥”,让大模型在读取问题并完成初步思考后,将其内部状态直接传递给小模型,由小模型负责生成最终答案。这一设计,避免了传统多智能体系统中因文字传递而造成的信息损失,显著提高了系统效率和准确性。
实验结果显示,这套混合系统的运行成本仅为完整GLM模型的二十分之一,而表现却恰好落在两个模型之间,相当于小模型补上了与大模型之间一半的能力差距。这一成果,不仅验证了Mostik技术的有效性,也为AI模型的协作提供了新的思路。
Mostik团队指出,传统多智能体系统中,模型间的合作往往依赖于文字传递。然而,模型在生成文字时,只能将其内部状态的一小部分压缩成语言,大量有价值的信息因此丢失。他们形象地比喻说,这就像是一个在上千维空间里思考的系统,最后只能通过钥匙孔和另一个系统说话。而Mostik的“桥”技术,则让模型能够在更底层的数学空间里直接交换信息,从而避免了这种信息损失。
为了更深入地理解这一技术,Mostik团队对模型内部状态的几何结构进行了深入研究。他们发现,尽管不同模型的内部表达存在差异,但确实存在一部分可以预测的共同结构。通过找到这些对应关系,他们成功实现了不同模型内部状态之间的翻译和传递。
这座“桥”的设计也颇具匠心。它作为系统中唯一需要训练的部分,保持了两边模型的原有权重不变,无需为了配合对方而进行微调。这意味着,Mostik团队无需拆开两座已经建好的“房子”,只需在中间铺一条通道即可。这种设计不仅降低了训练成本,也提高了系统的灵活性和可扩展性。
在实验中,Mostik团队还发现,大模型越早将任务交给小模型,这种隐藏状态交接的优势就越明显。因为任务刚开始时,大模型虽然还没有写下任何内容,但内部已经形成了对问题的初步理解。而采用文字交接时,此时几乎没有东西可以传递,隐藏状态却已经装着不少信息。
除了提高系统效率和准确性外,Mostik的“桥”技术还为观察模型内部提供了新的入口。通过记录发送模型原本的状态、经过桥翻译后的状态以及接收模型最终表现出的行为,研究人员可以更深入地了解模型决策过程,甚至干预这条通道以观察模型行为的变化。这为AI的可解释性研究提供了新的思路和方法。
展望未来,Mostik团队计划将这条通道提前到训练阶段,让模型从一开始就习惯和另一个模型配合。他们设想,通过知识蒸馏和专业化等方向的研究,可以培养出更贴近教师模型的学生模型,或者让小模型在保持原有通用能力的同时更快学会某项窄领域技能。这将为大模型增加新能力时提供新的途径,无需每次都要重训整个系统。
Mostik团队还认为,这座“桥”技术可以扩展到更多模型之间,让它们在训练过程中交换各自掌握的信息,逐渐形成一套彼此交织的系统。这将为AI的发展开辟新的道路,让单个模型不必包揽所有能力,而是通过高效交换信息来实现更强大的功能。










