在人工智能领域,一场关于模型协作的革新正在悄然发生。一家名为Mostik的初创公司,凭借一项创新技术,让不同规模的AI模型实现了高效协同,在ARC-AGI 3测试中取得了令人瞩目的成绩。这一成果不仅挑战了传统模型协作方式,也为AI发展开辟了新的路径。
Mostik团队构建了一套独特的系统,让大模型和小模型能够直接传递内部状态信息,而非依赖传统的文本交流。在他们的方案中,智谱的GLM-5.2(753B参数)作为发送方,阿里的Qwen-3.5(4B参数)作为接收方。大模型仅读取问题,其隐藏状态通过一个经过训练的“桥”传递给小模型,随后停止运行。小模型则负责生成最终答案,全程不依赖大模型的文本输出。
这种设计带来了显著的成本优势。模型运行中,“解码”环节消耗算力最多,而“预填充”环节相对便宜。Mostik的方案让大模型仅执行“预填充”,将最耗资源的“解码”任务交给小模型,从而大幅降低了整体算力开销。实验结果显示,4B小模型在“桥”的加持下,性能提升了25%,与753B大模型的差距缩小了50%。在更复杂的题目子集中,提升幅度甚至达到两倍。
从算力换算角度看,若不用“桥”方案,要达到同等成绩需部署一个中等规模模型,而“桥”方案的计算成本仅为前者的五分之二。与传统文本接力方法相比,“桥”方案在所有测试的大模型算力水平上均表现更优,尤其在“交接点极早”的情况下优势明显——此时大模型尚未生成任何文字,但隐藏状态已包含关键信息。
Mostik团队强调,实验中GLM-5.2和Qwen-3.5的权重完全冻结,未进行任何微调。这表明“桥”所利用的结构是模型训练过程中自然形成的,而非通过特定调整实现。首席科学家Stanislav Smirnov指出,在两个AI模型间找到数学上的共同基础极为困难,目前尚无合适的数学语言描述这一过程。
Mostik的“桥”技术不仅提升了模型协作效率,还为知识蒸馏和专项化训练提供了新思路。在传统蒸馏中,学生模型通常仅接收教师模型的最终输出信号。若“桥”能同步教师的内部状态,监督可更早介入生成过程,从而提升学生模型的学习效果。初步实验显示,在相同训练预算下,学生模型能更接近教师模型的性能。
在专项化训练方面,小模型通过“桥”学习特定领域能力时,效率更高且能保留通用能力。这或许意味着,未来为大模型添加新技能时,无需重新训练整个系统。“桥”还为模型安全提供了新的监控维度。通过记录发送方隐藏状态、转换结果和接收方行为,可更全面地观察模型协作过程,降低异常行为绕过监控的风险。
Mostik成立于四个月前,团队规模仅15人,其中12人拥有博士学位。公司名称“Mostik”在俄语中意为“小桥”,象征其技术核心。CEO Sasha Malysheva是核心方法的开发者之一,她认为未来AI发展可能并非由单一巨型模型主导,而是前沿模型与各领域专用模型的高效配对。
目前,Mostik的技术已在ARC-AGI 3测试中验证了其潜力,但能否扩展至更多模型、任务和真实业务场景,仍需进一步探索。团队正研究如何让“桥”适应不同架构的模型,以及如何优化其在复杂任务中的表现。尽管挑战依然存在,但这一创新为AI模型协作提供了全新的视角,或许将推动行业向更高效、更灵活的方向发展。








