摩尔线程大模型对齐研究获国际顶级学术会议认可:URPO 框架入选 AAAI 2026
【导语】11 月 13 日消息,摩尔线程提出的新一代大语言模型对齐框架 URPO 统一奖励与策略优化,相关论文被 AAAI 2026 收录。该框架融合两大角色并同步优化,从三方面攻克技术难题,实验显示多项指标超越传统基线,且已在自研计算卡上稳定运行,还完成主流强化学习框架适配 。

11 月 13 日消息,摩尔线程提出的新一代大语言模型对齐框架 —— URPO 统一奖励与策略优化,相关研究论文近日被人工智能领域的国际顶级学术会议 AAAI 2026 收录,为简化大模型训练流程、突破模型性能上限提供了全新的技术路径。
据介绍,在题为《URPO:A Unified Reward & Policy Optimization Framework for Large Language Models》的论文中,摩尔线程 AI 研究团队提出了 URPO 统一奖励与策略优化框架,将“指令遵循”(选手)和“奖励评判”(裁判)两大角色融合于单一模型中,并在统一训练阶段实现同步优化。URPO 从以(yǐ)下(xià)三(sān)方(fāng)面(miàn)攻(gōng)克技术挑战:
数据格式统一:将异构的偏好数据、可验证(zhèng)推(tuī)理(lǐ)数(shù)据(jù)和开放式指令数据,统一重构为适用于 GRPO 训练的信号格式。
自我奖励循环:针对开放式指令,模型生成多个候选回答后,自主调用其“裁判”角色进行评分,并将结果作为 GRPO 训练的奖励信号,形成一(yī)个(gè)高(gāo)效的自我改进循环。
协(xié)同(tóng)进(jìn)化(huà)机(jī)制(zhì):通(tōng)过(guò)在(zài)同(tóng)一(yī)批(pī)次(cì)中混合处理三类数据,模(mó)型(xíng)的(de)生(shēng)成(chéng)能(néng)力(lì)与(yǔ)评(píng)判(pàn)能(néng)力得以协同进化。生成能力提升带动评判更精准,而精准评判进一步引导生成质量跃升,从而突破静态奖励模型的性能瓶颈。
实验结果显示,基于 Qwen2.5-7B 模型,URPO 框架超越依赖独立奖(jiǎng)励(lì)模(mó)型(xíng)的传统基线:在 AlpacaEval 指令跟随(suí)榜(bǎng)单(dān)上(shàng),得分从 42.24 提升至 44.84;在综合推理能力测试中,平均分从 32.66 提升至 35.66。作为训练的“副产品”,该模型内部自然涌现出的评判能力在 RewardBench 奖励模型评测中取得 85.15 的高分,表现优于其替代的专(zhuān)用(yòng)奖(jiǎng)励(lì)模(mó)型(xíng)(83.55 分)。
从摩尔线程官方获悉,目前(qián),URPO 已(yǐ)在(zài)摩尔线程自研计算卡上实现稳定高效运行。同时,摩尔线程已完成 VERL 等主流强化学习框架的深度适配。
热门新闻
- 1续约谈崩!皇马巨星成阿森纳猎物,世纪转会能否成真?
- 2后防告急,利物浦盯上米兰铁卫,美因茨:钱到位就放人!
- 3卫星互联网组网提速 业界期待加快商业闭环
- 4物联网应用技术:重构工业与城市的数据神经网络
- 5(文化中国行)粉彩瓷绘:方寸瓷器物 匠心续古香
- 6物联网工程:连接物理与数字的神经脉络
- 7【好评中国】东湖评论丨老兵旧物件,读懂中国军魂
- 8神州控股旗下科捷物流亮相第九届服装物流行业年会
- 9破解文物保护与城市建设矛盾
- 10物联网技术:实现万物互联的智能底座
- 11IoT物联网:从边缘计算到工业级协议栈的深度解析
- 12做强数字金融 以数字赋能 推动保险服务效率全面提质
- 13汇川物联网申请边坡滑体识别相关专利,实现边坡潜在滑体的自动识别与风险评估
- 14物联网工程专业就业方向:从技术栈到产业生态的深度解析
- 15全面收紧 8月1日起将不能再通过第三方互联网平台办电话卡
