ITBear旗下自媒体矩阵:

字节押注超5万亿参数大模型:张一鸣力挺创新,拒绝蒸馏与短期热点裹挟

   时间:2026-08-07 13:00:48 来源:快讯编辑:快讯 IP:北京 发表评论无障碍通道
 

字节跳动正酝酿一场人工智能领域的豪赌。据多方消息,这家科技巨头正在讨论训练一个参数规模超过5万亿的超大模型,远超国内现有最大模型阿里的Qwen 3.8-Max(2.4万亿参数)和月之暗面的K3(2.8万亿参数)。这一计划若付诸实施,将使字节跳动在国内大模型竞争中占据先机,但目前仍处于早期论证阶段,能否最终落地尚未可知。

新模型将由Seed Foundation负责人项亮牵头,与大语言模型预训练数据负责人沈科共同推进。为确保项目顺利实施,Seed正在进行组织架构调整,重新划分职责并调配资源。项亮和沈科均为字节跳动人工智能领域的核心人物,均出身于字节的"搜广推"体系。项亮拥有中科院自动化所博士学位,2016年加入字节后曾负责机器学习中台AML团队;沈科则是清华大学2018届毕业生,现主导LLM预训练数据工作。

自进军大模型领域以来,Seed团队一直被视为国内最具潜力的团队之一。豆包App日活突破2亿的成就,很大程度上归功于Seed的技术支撑。然而今年以来,团队面临前所未有的压力。2月中旬推出的Seed 2.0模型市场反响平平,而同期智谱开源的GLM-5被认为达到国际领先水平,月之暗面7月发布的Kimi K3更是在多项评测中接近海外闭源旗舰模型。

面对竞争压力,字节跳动创始人张一鸣两周前亲自出席Seed全员会,为团队注入强心剂。他承认训练大模型的难度,表示可接受短期落后,但要求团队以追求智能上限为目标,力争跻身世界第一梯队。张一鸣特别强调编程方向的重要性,决定整合火山引擎、飞书和豆包的资源形成合力。同时他提醒团队,编程只是当前热点,不应忽视其他潜在机会。

在技术路线选择上,张一鸣明确反对模型蒸馏策略。他认为这种做法虽能快速提升表现,但本质上是在复制已有能力,难以实现真正超越。他鼓励团队从更底层维度构建AGI壁垒,这一观点与字节高层对蒸馏路线的担忧不谋而合。尽管不采用蒸馏可能意味着短期技术落后,但字节仍坚持自主创新道路。

为弥补编程能力短板,张一鸣亲自出面邀请DeepSeek核心研究员郭达雅加盟,负责专项训练工作。字节将所有相关研发资源划归郭达雅统筹,同时阿里千问团队也加大在这方面的投入。在数据获取方面,字节计划通过推动内部业务线使用自研模型来积累真实场景反馈数据,但高层认识到这仍不足以满足需求。

字节跳动的AI战略延续了其"大力出奇迹"的传统。公司成立之初就同时推出13个应用,最终内涵段子和今日头条脱颖而出;短视频领域通过"火山""抖音""西瓜"三路并进实现突破。这种多团队并行、海量资源投入的模式,在游戏和教育业务中也得到延续。在AI领域,字节同样展现出决绝姿态——资本开支、算力储备和人才招聘均居行业前列。

面对行业共识的大模型尺寸竞赛,字节选择迎难而上。尽管视频生成模型Seedance2.0已通过极致预训练(采用MoE架构,参数达2000亿)证明这种策略的有效性,但语言模型领域面临更大挑战。更大参数不仅需要算法创新,还涉及系统工程、数据管理和跨部门协作等复杂问题。为此,字节正在内部推动资源整合,打破部门壁垒,尝试建立更高效的协作机制。

有观察人士指出,字节的文化或许不完全适合颠覆性创新,但在解决明确技术难题方面表现突出。Seedance的成功印证了这一点——通过集中资源攻克预训练难题,该模型上线后迅速成为全球性能最强的视频生成工具。现在,字节希望用同样的方法在大语言模型领域实现突破,尽管这条道路充满不确定性。

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version