近日,月之暗面Kimi创始人杨植麟在中国科学技术大学发表最新演讲,作为青年创业者代表,他围绕公司命名背后的摇滚情怀、大模型研发的硬核挑战等,分享了自己的创业思考与科技探索历程。
从摇滚乐队到AI创业:月之暗面背后的故事
演讲中,杨植麟首先讲述了公司名称“月之暗面”的由来。这个名字其实是一张摇滚专辑的名字——本科时期,他和现在的联合创始人一起玩乐队,创立公司时便觉得用专辑命名很有意思。
但除了好玩之外,这个名字更承载着他们的愿景:“月之暗面就是月亮的背面,其实你平时是看不见的,所以它比较未知。所以我们想去探索未知。”
杨植麟表示,从公司成立至今,他们最主要做的事情就是不断追求智能的上限。
坚守规模化定律,持续突破模型参数上限
谈及大模型领域的技术路径,杨植麟指出,最重要的规律是“规模化定律”,可以认为是这个领域的“第一性原理”——持续训练更大的模型,用更多的数据、更多的参数、更多的算力去训练。
他透露,月之暗面在这条路上非常激进:去年7月发布的Kimi K2是中国首个万亿参数模型;前两个月发布的Kimi K3参数规模达到2.8万亿,是目前全球开源模型中参数量最大的。
Artificial Analysis数据显示,截至2026年8月初,中国主要模型在AA智能指数上的成绩是:月之暗面Kimi K3(Max):57分,189款模型中排第四。这是开源权重模型有史以来的最高排名,超过了Claude Opus 4.8(约56分),仅次于Claude Fable 5(约60分)、GPT-5.6 Sol(约59分)和谷歌的一款旗舰。
两年磨一剑:Kimi K3的训练艰辛与Token效率革命
训练如此庞大的模型并非坦途。杨植麟以Kimi K3为例,从算力规划(需从土地、电力、数据中心、芯片层层推进)到上层算法研究,整个周期从第一天训练到最终产出结果,花了接近两年时间。
“中间哪怕一次训练失败,就要回退几个月重新再来。”他坦言,这需要极为扎实的验证体系和理论保障。
同时,团队在不断追求规模的同时,也在攻克“Token效率”难题——因为世界上的总Token量是有限的。通过两代模型的改进,他们实现了一个Token产生的智能,约等于原来五个Token产生的智能。
他用一个生动的比喻解释:“就像一个聪明的同学,看一本书等于别人看五本书,所以你能学得更多,智能上限就更高。”
年轻人是AI浪潮的主驱动力
最后,杨植麟特别提到,团队核心算法研究的同学平均年龄只有20多岁。他坚信,在未来10到20年的AI发展浪潮中,年轻人将成为最主要的驱动力。
“我们团队很多同学也是还没有毕业,然后他就可以做出一些世界前沿的模型和世界前沿的,比如说模型架构的改进。”
他认为,当前AI领域变化极快,几乎每个月都有新模型出现,需要年轻人去适应这些变化。
AI也将逐渐渗透到各行各业——帮助研发更好的抗癌药物,探索太空航行技术。“这些变化也意味着机会,”杨植麟说,“很重要的一个点是持续学习,不断摸索模型最新的边界在哪里。”










