ITBear旗下自媒体矩阵:

阿里通义实验室智能计算团队推出新算法FIPO

   时间:2026-04-07 23:14:01 来源:格隆汇编辑:快讯 IP:北京 发表评论无障碍通道
 
格隆汇4月7日|阿里通义实验室智能计算团队宣布推出新算法FIPO(Future-KL Influenced Policy Optimization),引入Future-KL机制,奖励关键Token,解决纯强化学习(Pure RL)训练中“推理长度停滞”难题。据该团队介绍,在32B规模的纯RL设定下,率先实现对o1-mini与同规模DeepSeek-Zero-MATH的性能反超。
 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version