首页 国内 国际 社会 军事 科技 财经 体育 娱乐
首页 采集科技文章 返回首页

阿里通义实验室智能计算团队推出新算法FIPO|fipo

4月7日,阿里通义实验室智能计算团队宣布推出新算法FIPO(Future-KL Influenced Policy Optimization),引入Future-KL机制,奖励关键Token,解决纯强化学习(Pure RL)训练中“推理长度停滞”难题。据该团队介绍,在32B规模的纯RL设定下,率先实现对o1-mini与同规模DeepSeek-Zero-MATH的性能反超。

📚 相关阅读

• 小米汽车工厂卡丁车体验中心6月1日起调价
• Meta首个“超级智能”模型亮相 闭源路线大转弯|智能体|大模型|meta|spark
• 长征火箭再立新功!我国成功发射卫星互联网试验卫星,航天产业进入密集催化期|低轨|卫星通信|卫星发射|高精度温室气体
• 小鹏回应澳大利亚独家经销商合作破裂|澳洲|运营
• 国家航天局发布2026年中国航天重点任务 商业航天将迎密集催化|卫星|火箭|航天工程|载人飞船|东风商业航天
• 深城交牵头低空重点实验室揭牌|研究院|智能交通