谷歌DeepMind团队近日发布了一项突破性成果——名为DiffusionGemma的语言模型,其技术报告已在arXiv平台公开,编号为arXiv:2608.00146v1。该模型通过引入扩散机制,将文字生成速度提升至传统自回归模型的7倍以上,在单张NVIDIA H100 GPU上每秒可生成约1500个词,同时保持了较强的逻辑推理能力。这一进展为实时交互式AI应用开辟了新路径。
传统语言模型采用“逐词生成”的自回归机制,每个新词的输出都依赖前文内容,如同老式打字机般逐个字母敲击。这种模式导致模型每次生成新词时都需重新加载全部参数,造成大量计算资源浪费。DeepMind团队将图像生成领域的扩散模型技术迁移至文本处理,开发出“整体规划、逐步修正”的新范式。新模型先生成包含256个词的初始草稿,再通过多轮迭代优化内容,最终输出连贯准确的回答。
技术实现层面,研究人员选择从已预训练的Gemma 4模型(252亿参数混合专家架构)出发进行改造。核心突破在于将原有的单向因果注意力机制升级为双向注意力机制,使模型能够同时参考上下文信息。通过保留原始权重并添加780万参数的自我条件化模块,模型在微调阶段仅消耗不到10%的原始预训练数据量,就成功掌握了扩散生成能力。这种改造方式显著降低了训练成本,为大规模模型改造提供了可复制路径。
训练过程分为两个关键阶段:监督微调阶段使模型掌握基础修复能力,通过随机替换文本词汇进行训练;采样器蒸馏与强化学习阶段则重点优化生成效率与质量。研究人员设计了智能采样器,根据词汇预测熵动态决定锁定或继续修改的词位,配合温度退火机制,使模型在早期探索可能性,后期收敛至确定答案。自适应停止机制进一步将平均修改轮次压缩至12轮,较初始版本减少75%。
硬件优化方面,团队通过三项改进抵消了并行处理带来的额外开销。混合专家层的专家激活数量从8个增至84个,导致该层运算时间增加4.3倍;采样计算与注意力机制分别带来5.5倍和4倍的耗时增长。但通过减少KV缓存传输次数,模型在每次修改中节省了大量内存带宽。综合计算显示,每次修改虽比传统模型慢3.2倍,但单次可生成约20个词,净效率提升6倍,最终实现每秒1456词的实测吞吐量。
性能评估覆盖数学推理、编程、科学知识等20个标准测试集。开启思考模式后,DiffusionGemma在AIME 2026数学竞赛题取得69.1分,GPQA-Diamond科学题获得73.2分,LiveCodeBench-v6编程题达到69.1分。尽管较原始Gemma 4模型有5-15个百分点的性能损耗,但其速度优势明显:同等规模开源模型LLaDA 2.1 Flash在8张B200 GPU上每秒仅生成375词,而DiffusionGemma在单张H100上即可达到1479词/秒。更关键的是,该模型保留了自回归运行能力,切换模式后性能可接近原版水平。
双向注意力机制赋予模型独特的自我修正能力。在处理数学题时,传统模型若首词预测错误,后续推导会强行自圆其说;而DiffusionGemma能在生成过程中根据后续内容修正前期错误。面对青蛙过河谜题,传统模型给出矛盾答案,新模型则通过多轮迭代发现无限循环陷阱,最终输出正确结论。这种能力在结构化输出任务中尤为突出,生成JSON数据时,模型可在两轮修改内完成全部字段填写,准确率达83%以上。
开源策略极大拓展了模型的应用场景。基于Apache 2.0许可发布的完整权重文件,允许开发者自由商用与二次开发。配套的LoRA微调工具包仅需2块A100显卡,即可在特定任务上实现高效适配。医疗团队利用该工具将模型准确率从75.6%提升至76.6%,解释性文本质量评分更是接近翻倍。目前已有企业将其应用于多语言语音识别和放射科报告生成系统,分别利用了其并行处理优势与结构化文本生成能力。
尽管取得显著进展,研究团队坦言模型仍存在改进空间。当前版本在长文本生成任务中表现较弱,强化学习导致的过度简洁问题尚未解决,极少数情况下仍会出现词汇循环。多并发场景下的吞吐量优化工作也未完成,预计通过top-k截断等技术可进一步提升性能。不过,这些局限并未掩盖其技术价值——该研究证明,通过架构改造而非重新训练,现有语言模型可实现生成范式的根本转变,为AI技术落地开辟了新维度。










