《電子技術應用》
您所在的位置:首頁 > 人工智能 > 业界动态 > 摩尔线程大模型对齐研究获国际顶级学术会议认可

摩尔线程大模型对齐研究获国际顶级学术会议认可

URPO框架入选AAAI 2026
2025-11-14
來源:IT之家

11 月 13 日消息,摩爾線程提出的新一代大語言模型對齊框架 —— URPO 統一獎勵與策略優化,相關研究論文近日被人工智能領域的國際頂級學術會議 AAAI 2026 收錄,為簡化大模型訓練流程、突破模型性能上限提供了全新的技術路徑。

format,f_avif.avif.jpg

▲ 圖源:摩爾線程官方公眾號 | URPO 統一獎勵與策略優化框架

據介紹,在題為《URPO:A Unified Reward & Policy Optimization Framework for Large Language Models》的論文中,摩爾線程 AI 研究團隊提出了 URPO 統一獎勵與策略優化框架,將“指令遵循”(選手)和“獎勵評判”(裁判)兩大角色融合于單一模型中,并在統一訓練階段實現同步優化。URPO 從以下三方面攻克技術挑戰:

數據格式統一:將異構的偏好數據、可驗證推理數據和開放式指令數據,統一重構為適用于 GRPO 訓練的信號格式。

自我獎勵循環:針對開放式指令,模型生成多個候選回答后,自主調用其“裁判”角色進行評分,并將結果作為 GRPO 訓練的獎勵信號,形成一個高效的自我改進循環。

協同進化機制:通過在同一批次中混合處理三類數據,模型的生成能力與評判能力得以協同進化。生成能力提升帶動評判更精準,而精準評判進一步引導生成質量躍升,從而突破靜態獎勵模型的性能瓶頸。

實驗結果顯示,基于 Qwen2.5-7B 模型,URPO 框架超越依賴獨立獎勵模型的傳統基線:在 AlpacaEval 指令跟隨榜單上,得分從 42.24 提升至 44.84;在綜合推理能力測試中,平均分從 32.66 提升至 35.66。作為訓練的“副產品”,該模型內部自然涌現出的評判能力在 RewardBench 獎勵模型評測中取得 85.15 的高分,表現優于其替代的專用獎勵模型(83.55 分)。

從摩爾線程官方獲悉,目前,URPO 已在摩爾線程自研計算卡上實現穩定高效運行。同時,摩爾線程已完成 VERL 等主流強化學習框架的深度適配


subscribe.jpg

本站內容除特別聲明的原創文章之外,轉載內容只為傳遞更多信息,并不代表本網站贊同其觀點。轉載的所有的文章、圖片、音/視頻文件等資料的版權歸版權所有權人所有。本站采用的非本站原創文章及圖片等內容無法一一聯系確認版權者。如涉及作品內容、版權和其它問題,請及時通過電子郵件或電話通知我們,以便迅速采取適當措施,避免給雙方造成不必要的經濟損失。聯系電話:010-82306118;郵箱:aet@chinaaet.com。
主站蜘蛛池模板: 国产欧美日韩中文字幕| 国内揄拍国内精品| 久久精品国产成人| 国产精品免费观看高清| 欧美亚洲色图视频| 91精品久久久久久久久久| 久久综合久久网| 色综合久综合久久综合久鬼88| 欧美激情一级精品国产| 91精品视频在线| 国产精品视频999| 免费看又黄又无码的网站| 午夜精品一区二区三区在线观看| 国语自产精品视频在线看| 日韩精品福利视频| 不卡伊人av在线播放| 国产人妻互换一区二区| 国语自产精品视频在免费| 久久激情五月丁香伊人| 欧美日韩无遮挡| 日韩精品极品视频在线观看免费| 一区二区不卡视频| 亚洲综合在线做性V| 高清不卡日本v二区在线| 国产精品一区二区在线观看| 久久av喷吹av高潮av| 久久亚洲国产精品成人av秋霞| 日韩精品福利片午夜免费观看| 亚洲欧美日韩在线综合| 97精品视频在线播放| 国产精品一区二区你懂得| 久久波多野结衣| 精品国模在线视频| 国产在线精品成人一区二区三区| 久久不射电影网| 国产一区二区精品在线| 国产日韩一区欧美| 国产精品中文字幕久久久| 精品国产一区二区三区久久久狼 | 久久久久久草| 久久精品久久久久|