在近期举办的WAIC大会上,中昊芯英成为焦点企业,其不仅发布了新一代自研TPU架构AI芯片,还联合合作伙伴打造了华东地区首个国产TPU千卡智算集群,标志着国产算力发展迈入新阶段。

此次发布的新一代TPU芯片名为“须臾”,其混合精度算力高达896TFLOPS,在性能大幅提升的同时,功耗较传统芯片降低了50%。这一成果源于中昊芯英对芯片架构的深度创新。与主要服务于图形渲染的GPU不同,TPU芯片专为大规模深度学习设计,其架构能够容纳更多脉动阵列,算力密度更高,且无需保留大量通用控制单元,可将资源集中用于计算、通信和存储搬运,从而在功耗上形成显著优势。在集群规模扩大时,这种功耗优势还会被指数级放大。
中昊芯英在TPU领域的探索始于2018年。当时,公司创始人团队基于对AI技术发展趋势的判断,认为基于Attention机制的Transformer架构大模型将成为未来AGI的核心载体,因此将芯片架构定位为服务大规模深度学习、海量神经网络分布式并行运算的专属场景。这一决策在当时颇具前瞻性,如今全球算力市场中,TPU架构已占据半壁江山,与GPU形成分庭抗礼之势。
除了芯片性能,国产化率也是外界关注的焦点。中昊芯英创始人透露,从算子层面看,公司芯片的国产化率达到100%,所有核心IP均为自主研发,指令集和计算平台也完全自主可控。这种全栈自研模式不仅避免了高昂的授权费用,更确保了芯片演进方向的自主性。不过,硬件自主只是第一步,国产芯片要实现从“可用”到“好用”的跨越,软件栈的成熟至关重要。据估计,行业还需两到三年时间才能让软件栈真正完善。
在软件栈尚未完全成熟的情况下,中昊芯英通过创新的商业模式实现了芯片的商业化落地。公司采用“Token Factory”模式,对外提供标准化API服务,客户只需调用API即可完成模型部署,无需关注底层算力框架。这种模式不仅降低了客户的使用门槛,还使公司能够在真实业务场景中持续收集反馈,迭代优化软件栈。目前,几乎所有主流国产大模型都能在中昊芯英的TPU上运行,公司还能在新模型发布当天实现快速适配,并通过专项调优将芯片算力利用率和模型吞吐性价比优化至最佳水平。

与芯片发布同步落地的,还有华东地区首个国产TPU千卡智算集群。该集群由中昊芯英联合杭州电信和中兴通讯共同打造,被媒体评价为“国产算力从实验室走向大规模商用的重要标志”。杭州电信相关负责人在运营实践中发现,TPU在张量运算和推理能力上具有显著优势,尤其适合当前AI算力需求特征发生转变的场景。随着Agent的规模化落地,输入Token规模远超输出Token,两者差距最高可达一万倍,这对算力基础设施提出了PD分离调度的新要求,即把模型处理输入内容的Prefill阶段和输出内容的Decode阶段拆开,分别交给最擅长的硬件执行。TPU的底层架构原生支持这种调度方式,落地门槛更低、效率更高。
然而,Token经济的爆发也带来了新的挑战。尽管单Token价格持续走低,但由于企业用量暴增,总体算力投入反而扩大,形成“越用越便宜、越用花越多”的困境。中昊芯英创始人观察到,部分企业存在Token滥用现象,大量Token被用于非生产环境或低价值任务,造成资源浪费。为此,公司内部甚至开始主动限制Token使用量。他认为,当企业开始主动“限流”时,恰恰说明一线员工已经认可了大模型的价值,但组织效率尚未匹配个体效率的提升。只有当公司运作方式适应大模型的发展节奏,大部分工作都能由模型协同完成时,Token经济才能从粗放式投入转向精细化运营,在成本与价值之间找到平衡点。










