AI大模型领域的竞争已进入白热化阶段,技术路线选择成为行业焦点。字节跳动创始人张一鸣在近期内部会议上明确表态,公司不会采用AI蒸馏技术改进模型,认为这种做法会阻碍真正的长期技术突破。他强调,模型研发应坚持长期主义,甚至愿意为此牺牲部分短期收益,而非通过依赖他人成果换取榜单排名。
模型蒸馏技术,即知识蒸馏,是一种通过已训练好的大型模型指导小型模型训练的方法。其核心在于利用“教师模型”的输出结果训练“学生模型”,使后者在成本更低的情况下达到接近前者的性能。这种技术虽能显著节省算力并提升效率,但过度依赖可能导致模型同质化,削弱创新能力和处理复杂任务的能力。更值得关注的是,蒸馏技术可能使模型继承被蒸馏模型的价值体系,影响文化自主性和价值观独立性。
在技术路线的选择上,字节跳动选择了与多数公司不同的道路。公司CEO梁汝波在年中全员会上重申,字节跳动将坚持自研大语言模型,接受短期落后,专注优化长期能力。火山引擎总裁谭待以视频模型为例指出,只有达到SOTA水平的模型才能解锁高经济价值的商业场景,如Seedance 2.0就推动了视频生成技术从娱乐向严肃内容生产的转变。他强调,当前最重要的是打好技术基础,通过持续投入进入第一梯队。
然而,字节跳动的选择也面临巨大挑战。国内开源模型发展迅猛,仅6月至7月间就有多个大模型密集发布,在代码、全模态、超大规模MoE等方向接近全球顶级水平。OpenRouter数据显示,开源模型处理的token占比在半年内从34%跃升至65%。这种背景下,字节跳动的模型能力与海外SOTA的差距愈发明显,部分用户认为其“不蒸馏”策略是导致落后的关键原因。
内部对技术路线的争论也持续存在。有字节员工透露,Seed团队内部关于是否应转向蒸馏的讨论由来已久。梁汝波在回应外部猜测时表示,坚持自研并非因外部压力,而是希望团队保持延迟满足感,专注技术基础建设,这对实现AGI目标至关重要。但这条道路能否成功,仍取决于字节跳动能否在算力成本高昂、竞争激烈的环境下,通过自主研发支撑起长期技术追赶。









