在人工智能大模型竞争日益激烈的当下,字节跳动创始人张一鸣在内部会议上明确表达了对“模型蒸馏”的反对态度,这一决策引发了行业内的广泛关注与深度思考。模型蒸馏,作为业内普遍认可的提升效率方案,通过让小型模型学习领先模型,能在短时间内获取部分能力,降低算力成本并缩短研发周期,尤其适合资源有限的追赶者。
然而,张一鸣却认为,训练大模型是一项高难度、长周期的系统工程,模型能力的提升需建立在预训练、数据、算法和工程体系的长期积累之上。即便字节跳动的Seed团队当前与全球前沿水平存在差距,他也愿意承受阶段性落后,坚持走自主训练的道路。这一选择,不仅关乎技术路径的取舍,更体现了字节跳动对大模型研发路线的深刻洞察与长远布局。
外部模型蒸馏还面临严峻的商业与合规风险。随着美系大模型巨头不断升级产品接口监测机制,并在服务条款中限制数据采集与模型训练,利用竞品模型输出训练自家产品的行为,不仅引发研发边界的讨论,更在知识产权和服务条款合规层面带来诸多变数。今年2月,Anthropic控诉多家公司利用Claude进行“蒸馏攻击”的事件,以及7月月之暗面发布新模型后迅速被美国公司关注和指控的情况,均表明模型蒸馏已从技术问题演变为知识产权、服务条款和国际AI竞争的焦点议题。
字节跳动作为全球科技巨头,其在美国的一举一动均受到严格监管。前些年TikTok在美国经历的严酷调查,让字节跳动在合规风险上承受巨大压力。张一鸣此时对模型蒸馏表现出谨慎态度,实则是为了避免在底层版权和合规上给对手留下把柄,确保公司在全球市场竞争中的稳健发展。
张一鸣的决策,正在深刻改变Seed团队的研发方式。放弃依赖外部模型蒸馏,意味着Seed团队需承担更高不确定性,自行探索训练数据构建、模型架构调整和能力突破路径。这一过程中,组织对于长期探索的承受能力成为关键。近期,字节跳动正在推进超大规模基础模型研发,可能达到数万亿参数规模,这一计划释放出明确信号:字节跳动希望通过扩大预训练规模,寻找模型能力提升的新空间。
随着大模型竞争进入深水区,组织方式也面临调整。字节跳动长期依靠多领域赛马机制推动创新,但这一方法在基础模型研发中面临资源压力。因此,Seed团队正在提高核心模型研发的资源集中度,吸引包括DeepSeek研究人员在内的技术人才加入,强化相关方向布局。组织能力成为大模型竞争的重要变量,基础模型研发涉及算力、数据、算法、人才体系等多个环节,需要研发团队面对长周期投入和探索失败的不确定性。
对于火山引擎和豆包等商业化业务而言,底层模型能力决定未来竞争空间。Gartner预测,到2028年,约三分之一企业软件将具备AI Agent能力,超过60%的生成式AI应用将通过企业级AI平台部署。因此,字节跳动近期围绕模型、组织和研发体系的一系列动作,均指向同一目标:把决定技术突破的关键变量尽可能留在内部,形成人才密度、资源体量、组织效率和长期投入共同构成的研发机器。
中国大模型产业在追赶全球前沿的过程中,已展现出鲜明的工程效率竞争能力。斯坦福大学《2025年AI Index》显示,中美顶尖模型在多项指标上的差距持续缩小。然而,当能力差距缩小后,中国模型公司需回答下一个问题:下一代能力究竟从哪里来?不同公司给出了不同答案。DeepSeek强调技术创新提高智能生产效率,阿里希望模型成为云计算和产业生态的基础层,Kimi则集中资源寻找能力突破支点。而字节跳动,正试图通过控制模型、算力、人才和基础研究等关键生产要素,形成独特的竞争优势。











