ITBear旗下自媒体矩阵:

从“堆算力”到“算细账”:外滩大会见解论坛聚焦Agent规模化落地的核心底牌

   时间:2026-09-12 20:04:21 来源:互联网编辑:汪淼 IP:北京 发表评论无障碍通道

2025年“智能体元年”的风潮掠过之后,AI产业的聚光灯迅速从实验室的技术演示,转向了商业现实。

随着应用形态从“单轮对话”迈向“长程规划、工具调用与多智能体协作”,智能体展现出惊人能力的同时,也推倒了算力消耗的多米诺骨牌——相关数据显示,Agent单任务的Token消耗已达标准对话的5至30倍,代码类任务甚至高达1,000倍。

智能体究竟如何跨越从“能用”到“大规模落地”的鸿沟?在近日举办的 2026 Inclusion·外滩大会「Token效率:推动Agent智能提升与广泛应用的关键」见解论坛上,院士学者、一线模型团队、开源生态先锋与前沿创业者齐聚一堂,给出了行业共识的破局解法。

与会专家一致认为:算力堆叠的粗放时代已经终结,AI 时代的绿色计算,从度量每一个 Token 的效率开始。通过全栈系统工程击碎Token膨胀,不仅是Agent实现规模化商业普及的硬性边界,更是推动AI回归绿色低碳与数字普惠的唯一正轨。

宏观图景与报告发布

定义绿色智能的新度量衡

中国工程院院士郑纬民在开场报告中指出,AI已进入从“造模型”到“用模型”的阶段,Token成为驱动智能体的核心要素,且不同场景的Token价值并不均等。针对国产芯片在解码阶段显存与带宽的短板,他提出“以KV Cache为中心的分离式推理架构”,通过“PD分离、PD异构、PD异地”策略,以部分卡负责计算密集的P过程(预填充),搭配少量先进硬件负责D过程(解码),在千卡级商业实践中实现了高质量Token的高效产出,为国家级算力网络落地提供了关键技术支撑。

会上,蚂蚁集团副总裁、平台技术事业群总裁 骆骥对蚂蚁集团联合中国信息通信研究院人工智能研究所编写的《Token 效率:AI时代绿色计算的关键变量》研究报告进行了预览介绍。报告中提到,Agent单任务Token消耗可达标准对话的5至30倍,编码类甚至超1000倍,而国内智算GPU利用率不足30%,同时智算集群的电力需求正突破区域电网承载极限。这些挑战的核心矛盾在于"智能需求的持续膨胀,与算力效率、能源供给能力之间的结构性失衡"。

对此,报告指出,Token效率是化解这一矛盾的关键变量。进入AI时代,大模型引入了Token这一新的关键转化环节,绿色计算的转化链路从"碳→电力→算力→业务"的四级扩展为"碳→电力→算力→Token→业务"的五级转化,Token由此成为连接算力投入与业务产出的核心枢纽,Token效率也成为AI时代绿色计算新的优化维度和抓手。报告构建了覆盖模型层、推理层、Agent层、应用层的四层Token效率全栈技术体系框架,并面向未来提出涵盖计算效率、上下文与Token利用效率、任务效能、经济性、能碳效率五个维度的度量体系,沿"花多少→值不值→绿不绿"层层递进,使Token效率的绿色价值可量化、可披露、可追踪。


蚂蚁集团副总裁、平台技术事业群总裁 骆骥

骆骥强调,未来Token是AI新经济的"硬通货",AI竞争正经历从"规模竞赛"到"效率竞争"再到"绿色竞争"的范式演进,必须以Token效率让每一个Token承载更高的智能价值、消耗更少的能碳代价,最终推动AI走进千行百业、实现深度普惠。


重构“碳-电-算-Token-业务”五级转化链

工程与技术突围

打响全栈“Token甩水”攻坚战

单点技术无法救赎系统性消耗。在分享环节,多位嘉宾沿着Token生命周期,展示了一场贯穿模型、引擎、记忆与Infra的全链路工程解法。


蚂蚁集团百灵语言基座负责人 张志强

“国内算力受限,倒逼我们在模型架构上想办法。”蚂蚁集团百灵语言基座负责人张志强坦言。面对Agent的长上下文挑战,百灵大模型将高稀疏MoE与混合线性注意力结合,仅激活六十四分之一的参数就换来数倍容量收益;配合“先学通识再做题”的课程编排与FP8低精度训练,生产吞吐直接飙升超30%,甚至正探索极限的FP4预训练,真正实现用更低的FLOPs撬动更高阶的智能。


SGLang核心贡献者 童心源

“Agent每一次循环都带着冗长历史,如果次次重算,延迟和资源消耗根本无法承受。”SGLang核心贡献者童心源直言。SGLang首日闪电支持DeepSeek V4.1等模型,依托基数树缓存(Radix Cache)与分级存储实现上下文极致复用,避免无谓重算;配合自研投机解码与PD分离,不仅将高并发Agent吞吐拉升2.7倍,更在与蚂蚁百灵合作中跑出1120 tokens/秒的惊人速度,让复杂长程任务从10分钟压缩至2分钟内闭环。


NVIDIA 英伟达解决方案架构总监 刘川

NVIDIA 英伟达解决方案架构总监刘川从 Token 调度和 KV 缓存管理的角度,分享了在推理服务部署方面,依托NVIDIA Dynamo 如何实现高并发场景下,复杂多智能体的推理效率。


盛大集团副总裁兼EverMind CEO 邓亚峰

“整个Agent才是完整大脑,大模型更像皮层。”盛大集团副总裁兼EverMind CEO邓亚峰指出,模型参数迭代慢,但记忆与Harness层可极速演进。面对长交互带来的Token暴增,EverMind通过结构化长期记忆底座EverOS+自进化Agent框架Raven,将海量交互数据精准提炼后按需喂给模型,不仅以十分之一的数据量实现高保真交付,更跑出了“Token消耗减半、性能逆势提升”的惊人实效。


中国信通院人工智能研究所副主任 王雅晗

中国信通院人工智能研究所副主任王雅晗指出,电力已成算力扩张的核心约束,智算评价正从“比拼卡数”演进到“算清Token效能”。产业突破需实现“算法少算、系统少等、硬件少搬运”的全栈协同。信通院联合业界成立AISHPerf Token专项工作组并开源评测套件,聚焦高效能、国产化与绿色化,以硬核评测牵引国产软硬件从“可用”真正跨向“好用”。


蚂蚁集团平台技术事业群总架构师 黄挺

“编码Agent的消耗暴涨了1,200倍,行业正从粗放的‘Token Maxing’走向理性算账。”蚂蚁集团平台技术事业群总架构师黄挺指出。蚂蚁灵犀平台通过自研路由模型将任务精准分流,直接省下38.9%的成本;更结合上下文动态裁剪、JSON语义化压缩,以及将巡检海量结果外置仅留摘要等工程手段,在特定场景斩掉多达98%的无效Token,用系统工程重构智能的成本底座。

Token经济学

智能成本与算力的取舍之道

无脑追逐最强模型的狂热,正在产业落地前撞上现实的高墙。

在“硅谷101”创始人泓君主持的圆桌上,蚂蚁集团郑佳俊、EverMind邓亚峰与ACE Studio郭靖展开观点碰撞,话题一开始便切中了行业的共同焦虑:企业跑Agent,到底是在创造价值,还是在被Token账单吞噬?


“前几天我看团队报上来的业务预算,觉得太贵了,必须缩减一些。”蚂蚁集团郑佳俊直接给盲目追求最强模型的风潮泼了一盆冷水。他算了一笔账:个人用AI买生产力,一个月花几十上百美元不算贵;但一旦落地到蚂蚁这种日活亿级的具体业务,单次调用的高昂成本乘以海量并发,对于商业来说就是不可承受的数字。“大多数业务不需要最顶尖的过剩智能,拿百B级模型配上定向SFT,成本降到两三成,效果并不会变差。”

这种对“过剩算力”的警惕在垂直领域形成了共鸣。ACE Studio创始人郭靖以AI音乐创作印证了这一逻辑:“今天顶尖通用模型甚至想去解哥德巴赫猜想,但垂直场景真的需要这么高的智能吗?”他坦言,在专业任务中,基于大模型自蒸馏出几十B参数的专用模型,表现不仅不输最先进大模型,成本却能低上几个数量级。“合适比最强更重要。”

“过去行业有个误区,仿佛花掉的Token越多就代表创造的价值越大,这完全错了。”EverMind邓亚峰将视角拉回到ROI的本质。他给出了一套解题思路:通过构建本地懂偏好的轻量模型协同云端强模型的“混合调度”,或者将长记忆用几十B的小模型精炼后再喂给基座,完全可以在性能不缩水的前提下,将综合成本直降三分之一。

结语

从“参数至上”的规模军备竞赛,到精耕细作的工程落地,外滩大会见解论坛释放出一个无比笃定的信号:大模型竞赛的下半场,是单位智能产出比的较量。

告别算力奢侈品,拥抱生产力日常。只有让每一个 Token 都被有效使用——Token 效率,让 AI 在绿色的同时也更普惠。当每一次算力流转都能低碳可控,每一枚Token都能精准创造业务价值,通用智能的曙光,才算真正穿透成本的高墙,照亮千行百业。

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version