首页 国内 国际 社会 军事 科技 财经 体育 娱乐
首页 采集科技文章 返回首页

阿里通义实验室智能计算团队推出新算法FIPO|fipo

4月7日,阿里通义实验室智能计算团队宣布推出新算法FIPO(Future-KL Influenced Policy Optimization),引入Future-KL机制,奖励关键Token,解决纯强化学习(Pure RL)训练中“推理长度停滞”难题。据该团队介绍,在32B规模的纯RL设定下,率先实现对o1-mini与同规模DeepSeek-Zero-MATH的性能反超。

📚 相关阅读

• 应美国政府要求,“星球实验室”无限期暂停发布伊朗战事卫星影像
• 巴黎奥运会系列报道|商汤日日新大模型亮相|乒乓球
• 我国钠离子电池取得重大突破 彻底阻断热失控|电解液|电解质|锂离子电池
• 安徽:加快布局形成一批商业航天标志性产品,发展大推力可回收复用火箭|卫星|星座|智能制造|上海商业航天大会
• 5G网络建设加速数字经济基础设施完善
• 吉林大学在氢基超导研究取得重要突破|实验|高温|氢化物|美国化学会志