ITBear旗下自媒体矩阵:

语言模型“主动导航”:声明式注意力如何让AI高效“翻书”找答案

   时间:2026-09-14 22:37:41 来源:互联网编辑:快讯 IP:北京 发表评论无障碍通道
 

当人工智能语言模型被要求回答“男主角童年时期养的那只猫叫什么名字”时,它是否真的需要把整本百万字的小说从头到尾再读一遍?这个问题看似简单,却暴露了当前大模型处理长文本时的一个核心矛盾:虽然理论上每个生成步骤只需关注上下文中的一小部分信息,但实际操作中,模型却不得不反复读取全部内容,导致巨大的计算资源浪费。

针对这一现象,KAIST AI与Google DeepMind的研究团队提出了一种名为“声明式注意力”(Declarative Attention,简称DA)的创新方法。该方法的核心思路是让模型在生成回答的过程中,主动声明下一步需要关注的具体上下文片段,从而避免不必要的计算开销。研究团队指出,现有模型在处理长文本时,真正被重点关注的内容往往只占极小比例,但如何提前确定这些关键部分一直是个难题。

传统方法通常依赖静态启发式规则或轻量级扫描来预测重要区域,但这些方法本质上仍是“猜测”,无法精准预判未来步骤所需的具体细节。DA则另辟蹊径,直接要求模型“说出”自己需要关注的内容。具体而言,DA将生成过程分为三种模式:全局模式(global)用于定位信息区域,聚焦模式(focus)用于提取具体细节,局部模式(local)则基于已有信息完成推理。这种设计使模型能够像人类解题一样,先扫视定位,再精读细节,最后闭眼计算答案。

为确保模型能准确理解“魔法片段”的边界,研究团队将长文本切割为约2048个token的片段,并通过伪装成“工具调用记录”的方式呈现给模型。这种设计利用了模型对结构化文本的天然追踪能力,避免了自定义分隔符可能导致的混淆。在实际计算中,DA通过动态生成注意力掩码,跳过无关片段的KV缓存读取,从而显著减少内存带宽消耗。实验表明,在100万token的上下文中,单步注意力操作的理论耗时可达矩阵乘法的145倍,而DA的节省效果在长文本场景中尤为突出。

在Gemma-4-31B和Qwen-3.6-27B两个开源模型上的零样本测试中,DA分别将注意力读取量降低了52.0%和31.1%,同时准确率仅下降1.27和2.75个百分点。更值得关注的是,模型规模与DA效果呈现正相关:小模型因“语言表达能力”不足,常无法准确声明聚焦片段,而大模型(如31B的Gemma)的focus成功率可达99%,准确率保留比例接近原始水平。上下文越长,DA的节省效果越显著——在64K至256K的文本中,节省的token数量可达2100万,远超短文本场景。

尽管DA在多数任务中表现优异,但研究团队也指出其局限性。例如,在需要全局统计或跨片段表格的任务中,分段处理会破坏答案所需的完整信息,导致准确率大幅下降。输出长度与文档规模强绑定的任务(如逐段摘要)可能因解码步数激增,抵消单步节省的开销。针对这些问题,研究团队提出未来可引入“可逆式上下文压缩”,通过动态调整KV缓存的存储层级,进一步优化超长文本的处理效率。

DA的另一个潜在优势在于其与思维链提示的兼容性。现有方法通常将推理过程隐藏在模型内部,而DA通过显式声明关注区域,使计算过程变得可读、可控。这种“系统2式”的稀疏注意力机制,为未来通过强化学习优化选择逻辑提供了可能。例如,模型可学习根据任务类型动态调整三种模式的使用比例,或在导航阶段参考压缩摘要而非原始内容,从而进一步提升效率。

目前,DA已集成至开源推理框架vLLM中,并通过块对齐的掩码设计兼容FlashAttention算子,确保工程实现的稳定性。研究团队强调,DA的收益将随行业上下文窗口的扩大而自然增长,无需额外适配。然而,如何让模型在思考模式下稳定遵守DA协议,仍是当前方法面临的主要挑战。若能突破这一限制,DA或将成为长文本处理领域的标准解决方案。

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version