在解决复杂数学和科学问题时,大语言模型常采用并行推理策略,即同时生成多条独立思路,最终通过投票选出最可靠的答案。这一方法虽能提升正确率,却面临算力与时间成本随思路数量线性增长的困境。更棘手的是,传统方案要求所有思路同步运行至终点,导致部分已收敛的思路被迫“陪跑”,而仍在摇摆的思路则持续消耗资源。针对这一痛点,上海交通大学与宾夕法尼亚大学的研究团队提出了一种名为ParaTempo的创新框架,通过动态资源调度机制优化并行推理效率。
研究团队首先对现有判断思路收敛性的信号进行了系统性评估。第一类信号基于token级别的不确定性,如平均token熵和困惑度,但实验显示其与最终答案稳定性的相关性极弱,相关系数仅0.12至0.13,几乎无法预测答案走向。第二类信号为瞬时答案置信度,即强制中断模型思考并获取当前答案的概率分布。尽管其相关性提升至0.41,但易受推理波动干扰,标准化波动率高达0.26,可能导致误判。例如,模型可能因临时困惑给出错误答案,但数秒后自行修正。若依赖此类信号决策,可能提前终止本可收敛的正确思路,或保留已陷入震荡的错误思路。
基于上述分析,团队提出“时间置信度”作为核心控制信号。该方法通过周期性插入引导语(如“最终答案是:”),强制模型输出当前候选答案的概率分布,并记录最近多次探测结果。随后,对滑动窗口内的答案分布进行平均聚合,以负熵指数衡量集中程度。若时间置信度接近1,表明思路已高度收敛;若值较低,则说明答案仍分散。这一设计类似于观察朋友是否真正决定辞职:单次情绪化表态可信度低,但连续两周表达相同态度则更具说服力。实验表明,时间置信度的波动率显著低于旧信号,且与未来答案稳定性的相关性接近单调递增,有效结合了前两类信号的优点。
ParaTempo框架围绕时间置信度构建了完整的资源调度机制,为每条推理分支分配四种状态:活跃、退休、修剪和分叉。在热身校准阶段,系统通过前15次探测收集置信度数据,以中位数作为动态修剪阈值,避免“一刀切”失效。正式运行后,若分支置信度低于阈值,则被修剪以释放算力;若连续9次探测置信度超0.90,则提前退休并保留答案权重用于投票。修剪后的算力并非闲置,而是从高置信度分支中复制推理前缀,以新随机种子继续探索,形成“资源再利用”的分叉机制。最终,系统通过加权投票判断全局共识:若某答案权重超50%,则提前终止推理;否则运行至预算耗尽。
该框架的异步控制特性是其关键优势。每条分支独立决策,无需等待其他分支同步,大幅缩短了整体延迟。以马拉松比赛为例,同步控制要求选手每5公里停表核对名次,快者被迫等待慢者;而异步控制允许选手根据体感随时调整策略,总耗时显著降低。实验数据显示,在AIME 2026、HMMT等高难度测试集上,ParaTempo在Qwen3.5-35B-A3B模型上的正确率达71.1%,仅比标准方法低1.1个百分点,但延迟降低21.8%,总token数减少30.3%。与同类动态控制方法相比,其正确率与效率优势更为明显,例如在AIME26测试中,延迟较Parallel-Probe缩短24.7秒,正确率高出6.6个百分点。
消融实验进一步验证了各模块的价值。移除退休机制后,正确率骤降6.6个百分点至66.7%,表明保留已收敛答案对投票至关重要;移除修剪机制虽对正确率影响较小,但延迟显著上升,证明其效率优化作用;移除分叉机制虽降低计算成本,却导致正确率下滑3.3个百分点,说明算力再投入能挖掘更多潜在正确路径。研究还指出,退休与修剪阈值的不对称设计源于错误代价的差异:错误修剪可能永久丢失正确分支,而错误退休仅保留当前判断,风险更低。
尽管ParaTempo在封闭答案任务中表现优异,但其对开放式生成任务(如写作)的适用性仍需探索。当前实验均基于明确标准答案的数学和科学问题,未来研究可进一步检验其在模糊答案场景中的有效性。团队强调,诊断现有方法缺陷的扎实论证是ParaTempo成功的关键。相比直接提出新方案,系统分析旧信号的局限性为创新提供了坚实基础,这种研究范式值得其他领域借鉴。










