近日,中国科学院合肥物质科学研究院等在大语言模型强化学习与推理可靠性方面取得两项成果,从因果信息论角度严格证明过程奖励模型(PRM)相比于结果奖励模型(ORM)的优势,并提出大模型强化评测基准体系——棱镜基准OPG-D3。两项成果从类脑信息处理与认知控制的角度,为理解模型推理行为的可靠性提供了新的理论框架和评测范式。
在基于结果奖励的强化学习下,模型会天然地偏好学习训练数据中的表面统计相关性,而非真正的因果推理链。这一现象与人类认知中的“启发式捷径”相似——大脑在面对复杂问题时,也倾向于调用低能耗的联想记忆而非费力的逻辑推演。受此启发,团队将过程奖励模型类比为前额叶皮层对推理步骤的在线监控机制。通过逐步骤的稀疏奖励信号,过程奖励模型能够像认知控制一样,对每一步推理施加约束,抑制“走捷径”倾向,引导模型逐步构建更稳健的因果链条。研究证实,单纯扩大同质数据规模无法从根本上消除这一脆弱性,唯有对推理过程施加结构化监督,才能实现从“答案匹配”到“因果掌握”的质变。
团队剖析了当前强化学习评测基准的固有局限,提出了OPG指标——衡量模型在训练集上训练与直接在测试集上训练的性能差异。实验显示,在主流基准上,强化学习模型的OPG近乎为零,表明当前训练—测试划分可能低估了模型的泛化失败风险。以难度测试、泛化测试和反事实扰动测试为核心的基准框架OPG-D3,能够针对性衡量当前模型在跨分布、规则突变等场景下性能表现、陌生情境下的泛化能力。该成果为构建面向真实世界“认知压力”的下一代世界模型评测基准,提供了可操作的设计原则和诊断工具。
两项研究共同构成了大模型训练推理和评测创新体系——模型推理的可靠性不仅取决于数据量和参数规模,更依赖于学习目标与认知控制结构的匹配程度。团队将强化学习中的结果—过程矛盾上升为计算理论层面的一般性问题,并提出因果信息论边界的棱镜基准OPG-D3,为后续世界模型评测提供了可验证、可比较的理论参照系。
相关成果被国际自然语言处理领域顶级会议ACL 2026接收发表。
论文链接:1、2
结果奖励诱导捷径与过程监督纠正机制示意图
当前大语言模型强化学习评测基准局限性示意图
复旦大学基础医学院、脑科学研究院、脑功能与脑疾病全国重点实验室教授刘星、马兰合作,发现小鼠脑内基底外侧杏仁核(BLA)神 约翰·霍普克罗夫特 ■约翰·霍普克罗夫特 编者按 作为中国高等教育界的老朋友,早在2011年,图灵奖得主约 新华社利马/西安11月13日电 “天涯若比邻”——这句唐朝诗人王勃的千古名句,既是8年前秘鲁国家考古人类学历史博物馆“华夏瑰宝展”的主题,也是多年来中国和秘鲁传统友好、民心相亲的生动写照 中国教育报-中国教育新闻网讯(记者 任朝霞)11月12日,上海科技馆自然藏品进校园暨科创校长空间站“一平米博物馆”特别活动在松江四中初级中学举行,正式开启上海科技馆与地方合作共谋发展新篇章,进 中国教育报-中国教育新闻网讯(记者 方梦宇)近日,由教育部学校规划建设发展中心主办,合肥工业大学承办的2024国际产学研用合作会议新能源与智能网联汽车研讨会在合肥召开。来自国内外知名高校、企 中国教育报-中国教育新闻网讯(记者 周仕敏 通讯员 张聪 李星亚)“作品中憨态可掬的熊猫形象,生动展现了中华饮食文化的独特魅力。”2024中国—东盟职业院校学生烹饪技能大赛,来自香港特别行政区 。本文链接:大语言模型强化学习与推理可靠性研究获进展http://www.sushuapos.com/show-12-4455-0.html
声明:本网站为非营利性网站,本网页内容由互联网博主自发贡献,不代表本站观点,本站不承担任何法律责任。天上不会到馅饼,请大家谨防诈骗!若有侵权等问题请及时与本网联系,我们将在第一时间删除处理。
上一篇: 研究人员提出面向多模态推荐的解耦与蒸馏动态集成框架
下一篇: 超低阈值二维半导体激光器研究取得进展