设置
  • 日夜间
    随系统
    浅色
    深色
  • 主题色

仅需格式转换提升9%数学推理能力,上交开源新对齐方法ReAlign

发布时间: 2024-03-17 20:22:16 来源: 量子位

代码数据集都开源9P6速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

大模型对齐新方法,让数学推理能力直接提升9%。9P6速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

上海交通大学生成式人工智能实验室(GAIR Lab)新成果ReAlign,现已开源。9P6速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

仅需格式转换提升9%数学推理能力,上交开源新对齐方法ReAlign

随着以ChatGPT为代表的语言大模型的快速发展,研究人员意识到训练数据的质量才是大模型对齐的关键。9P6速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

然而,目前主流的提示数据质量的方法不是需要大量人工成本(人工构造高质量数据)就是容易遭受大模型幻觉的影响(从蒸馏数据中选择高质量样本)。9P6速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

ReAlign能以较小的人工成本提升现有数据集的质量,进而提升模型整体对齐能力,包含数学推理能力、回答问题的事实性、回答的可读性。9P6速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

目前,该项目开源了大量资源:9P6速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

  • ReAlign代码(使用方法和步骤均在Github中给出)
  • ReAlign后的数据集,Github仓库中给出,同时包含huggingface版本。
  • 46个不同任务场景对应的任务描述以及人工构造的回答格式。
  • 用于对指令数据任务分类的分类器以及该分类器的训练数据。
  • 用于事实性(Factuality)评估的NQ数据集及其ground truth。
  • 用于可读性(Readability)和事实性(Factuality)评估的prompt。

该方法有如下优势:9P6速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

可以显著提升数学推理能力:LLaMA-2-13B在GSM8K上的数学推理能力从46.77%提升到了56.63%9P6速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

同时具备显著的OOD泛化能力:在MATH上训练,LLaMA-2-13B在GSM8K上从14.48%提升到了25.17%9P6速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

仅需格式转换提升9%数学推理能力,上交开源新对齐方法ReAlign

该方法与其他对齐技术(如SFT、DPO、指令数据构造方法等)垂直,即可以在现有技术的基础上去进一步提升大模型性能。9P6速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

该方法所得到的模型在回答问题时具备更易读、组织格式更优良、原因解释更细致等优点,可以显著提升可读性与数学推理能力。9P6速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

该方法在针对知识密集型任务时采用了检索增强技术,可以有效提升模型的事实性,减少了幻觉带来的影响。9P6速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

该文章也指出ReAlign的底层逻辑是重新协调人类与大模型在对齐过程中的角色,利用他们之间互补的优势,让人类去明确指定自己的偏好,而大模型采用自己强大的生成能力去按照人类指定偏好重构回答,并不会蒸馏大模型本身的知识(避免幻觉问题)。9P6速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

示例

下图示例1展示了ReAlign用于一个数学任务训练数据后的效果,可以看出ReAlign后的回答格式更加清晰易读。9P6速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

仅需格式转换提升9%数学推理能力,上交开源新对齐方法ReAlign

下图示例2展示了采用原始数据集训练后的模型与采用ReAlign的数据集训练后的模型在回答问题上的差异,红色字体高亮了原始回答较弱的部分,绿色字体高亮了ReAlign后的模型回答较强的部分。9P6速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

仅需格式转换提升9%数学推理能力,上交开源新对齐方法ReAlign

方法

该方法流程示意图如下:9P6速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

仅需格式转换提升9%数学推理能力,上交开源新对齐方法ReAlign

该方法分为3个模块:准则定义、检索增强、和格式重构。9P6速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

1、准则定义

该预定义准则包含任务和相应的格式。9P6速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

任务9P6速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

该文章作者人工定义了46个任务,可以归为10个大类,具体分类情况如下表所示:9P6速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

仅需格式转换提升9%数学推理能力,上交开源新对齐方法ReAlign

同时,作者针对这46个任务训练了一个任务分类器。9P6速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

格式9P6速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

由于不同任务对于格式的需求是不一样的,因此作者针对这46种任务精心设计了46个回答格式,包含组织结构、章节内容要求和输出形态。这样特定的格式相比通用格式更清晰易读,下表示例为邮件生成任务的格式:9P6速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

仅需格式转换提升9%数学推理能力,上交开源新对齐方法ReAlign

2、检索增强

知识密集型任务如开放域问答和事实验证任务,需要大量外部知识作为证据来确保回答的事实性。9P6速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

因此作者选择了5个知识密集型任务,针对这些任务的问题,先去调用谷歌搜索的API得到对应证据,用于后续改写。以下是一个检索增强的示例,可以看出有了检索增强后的ReAlign可以给出具备事实性的详细解释:9P6速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

仅需格式转换提升9%数学推理能力,上交开源新对齐方法ReAlign

3、格式重构

重写9P6速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

作者利用大模型(比如ChatGPT)基于之前定义的准则和检索到的证据(对于知识密集型任务)来重新改写原数据集中的回答。具体来说,是通过提示将问题、原始回答、格式要求和证据(对于知识密集型任务)进行组织,然后询问大模型得到重写后的回答。此外,由于一些问题有特定的格式要求,因此作者采用了自适应改写,即先让大模型判断该问题与给定的格式是否匹配,若匹配则改写,否则保留原始回答。9P6速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

此外,作者认为一些特定任务不应有特定格式要求,例如故事生成、诗歌生成等,因此作者对这类任务并没有采用格式重构(具体可看论文)。9P6速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

后处理9P6速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

长度过滤:作者发现大模型在改写回答的时候偶尔会只输出做了改变的句子,这种情况下长度会锐减。因此,作者将改写后长度小于原始回答一半的数据保留其原始回答不改变。9P6速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

基于任务的过滤:作者发现任务分类器有时候会导致错误传播,因此针对以下3个任务设计了特定过滤规则:9P6速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

  • 代码相关任务:通过关键词匹配确定改写前后的回答是否均包含代码,如果其中一方不包含代码则认为改写失败,进而保留原始回答。
  • 考题任务:匹配改写前后的答案是否一致,若不一致则认为改写失败,保留原始回答。
  • 计划任务:如果问题中不包含计划相关的关键词,则不采纳改写的回答,保留原始回答。

实验与结果

作者在5个数据集(Open-Platypus、No Robots、Alpaca、GSM8K、MATH)和2个模型(LLaMA-2-13B和Mistral-7B)上做了实验。9P6速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

作者首先在AlpacaEval、MT-Bench、Vicuna-Bench上测试了通用对齐能力,结果如下表所示,发现除了部分MT-Bench的第二轮对话性能下降,其他均有提升,证明了对回答格式重构可以有效提升对齐能力。9P6速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

仅需格式转换提升9%数学推理能力,上交开源新对齐方法ReAlign

随后,作者测试该方法对数学推理能力的影响,其在GSM8K和MATH两个常用数学数据集上进行测试。结果如下表所示,可以看到该方法可以显著提升数学推理能力,甚至可以得到9-10个点的提升。9P6速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

此外,还具有显著的OOD泛化能力,例如LLaMA-2-13B在MATH上训练,在GSM8K上测试可以提升10个点以上。作者认为这样的提升可能是因为格式重构后带来了更多以及更清晰的中间步骤和解释,进而提升了模型的数学推理能力。9P6速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

仅需格式转换提升9%数学推理能力,上交开源新对齐方法ReAlign

接下来,作者构造了一个评测标准去测试模型的事实性(Factuality),他们从带有正确答案的NQ数据集中随机筛选了100条数据。9P6速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

随后用训练好的模型去回答这100个问题,得到模型的回答,接下来采用一个提示模版将问题、答案和模型的回答组织起来,让GPT-4为该回答与正确答案的符合程度进行打分作为事实性分数。9P6速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

测评结果如下图所示,可以看到在这三个数据集上事实性均有提升,作者认为是检索增强带来的效果。9P6速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

仅需格式转换提升9%数学推理能力,上交开源新对齐方法ReAlign

此外,作者还测试了模型的可读性(Readability),他们针对Vicuna-Bench的回答,采用GPT-4和人工评估对用ReAlign前后的回答进行一对一可读性比较。9P6速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

结果如下图所示,可以看到无论是GPT-4还是人工,ReAlign后的数据集相比原始数据集均有显著提升。9P6速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

仅需格式转换提升9%数学推理能力,上交开源新对齐方法ReAlign

作者还进行了对齐税(Alignment Tax)分析,在知识型评测基准BBH和AGIEval上进行测试,发现采用ReAlign后的模型并不会损失其原有的知识,并且在个别情况还会有提升。9P6速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

仅需格式转换提升9%数学推理能力,上交开源新对齐方法ReAlign

最后,作者分析了ReAlign的扩展定律(Scaling Law),即只ReAlign一部分数据,对训练后的模型的影响情况。9P6速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

结果如下图所示,可以看出只ReAlign 5%的数据即可为通用对齐能力带来全部ReAlign的67%提升,并且随着ReAlign的比例提升性能也呈上升趋势。9P6速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

仅需格式转换提升9%数学推理能力,上交开源新对齐方法ReAlign

总结

总的来说,GAIR研究组提出了一个新的对齐方法ReAlign,其可以自动化提升现有指令数据集的回答质量,并且最小化了人工成本和幻觉影响。9P6速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

他们ReAlign得到了了5个新的高质量数据集Open-Platypus、No Robots、Alpaca、GSM8K和MATH。实验证明,ReAlign可以显著提升通用对齐能力、数学推理能力、事实性和可读性,并且不会损害知识能力。9P6速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

此外,也公开了数据集、人工精心撰写的46种任务描述及格式、任务分类器及其训练数据、事实性评估数据集。9P6速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

论文地址:https://arxiv.org/pdf/2402.12219.pdf9P6速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
项目地址:https://gair-nlp.github.io/ReAlign/9P6速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
代码与数据地址:https://github.com/GAIR-NLP/ReAlign9P6速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

再打一局游戏就睡,再刷几个视频就睡,终于放下手机,关灯睡觉了……结果翻来覆去睡不着,半夜醒来再也睡不着,为什么明明睡着了,睡眠质量却不高?3月21日是世界睡眠日,最新发布的《2024中国 3月19日,记者从中国科学院海洋研究所了解到,该所研究团队在国际上首次发布了银鲳的高质量染色体水平参考基因组。相关研究论文近日在线发表于《自然》子刊《科学数据》。银鲳广泛分布于西北太 21世纪经济报道记者雷晨 北京报道近日,国内AI领域的明星产品——Kimi智能助手,因流量激增遭遇了短暂的服务中断。月之暗面随后发布公告,对此次服务中断事件进行了说明,并采取了一系列紧   “AI热潮”有人欢喜又有人忧:新兴市场遭资金外流!  财联社3月20日讯(编辑 黄君芝)巴西亿万富翁、巴西金融公司Banco BTG Pactual SA创始人Andre Esteves表示,人工智能(AI)股票持续上涨导致发展中国家资本市场资金 3月22日,中国互联网络信息中心(CNNIC)发布第53次《中国互联网络发展状况统计报告》(以下简称《报告》)。《报告》显示,截至2023年12月,我国网民规模达10.92亿人,较2022年12月新增网民2480万人,互联网 今天(23日)是第64个世界气象日,今年世界气象日的主题是“气候行动最前线”。地球是人类赖以生存和发展的家园,气候变化给人类造成的影响广泛而深远,关乎当下,更关乎未来。世界气象组织确认2023年全 。

本文链接:仅需格式转换提升9%数学推理能力,上交开源新对齐方法ReAlignhttp://www.sushuapos.com/show-2-3874-0.html

声明:本网站为非营利性网站,本网页内容由互联网博主自发贡献,不代表本站观点,本站不承担任何法律责任。天上不会到馅饼,请大家谨防诈骗!若有侵权等问题请及时与本网联系,我们将在第一时间删除处理。

上一篇: OpenAI大模型上身机器人,原速演示炸场!

下一篇: 用AI重构PC,荣耀笔记本AI PC技术正式发布

热门资讯

  • 全国首个煤炭行业能源智算中心在山西建成

    3月18日,记者从山西省人民政府获悉,“山西煤炭工业互联网智算平台”日前在山西联通大数据中心建设完成。该平台由中国联通与山西晋云互联科技有限公

  • 我国首个适应高寒气候肉羊品种通过鉴定

    记者19日从兰州大学获悉,天华肉羊通过国家畜禽遗传资源委员会审定鉴定,成为我国首个适应高寒气候的肉羊品种。该品种由兰州大学草地农业科技学院李发

  • Sora将如何影响科学与社会

    英国《自然》周刊网站3月12日刊登题为《OpenAI的文生视频工具Sora会如何改变科学——以及社会》的文章,作者为乔纳森·奥卡拉汉,内

  • 自主研制!哈工大“天都二号”探月卫星成功发射

    科技日报从哈尔滨工业大学获悉,北京时间2024年3月20日8时31分28秒,“天都一号”“天都二号”通导技术试验星伴随探月工程四期鹊桥二号中继星任务搭乘

  • 每12个恒星或有一个吞过行星

    据《自然》20日消息称,天文学家对91对恒星所作的光谱分析显示,大约每12个恒星中就有一个可能吞噬了一个行星。在吞噬一个行星后,恒星的化学构成可能发

  • 太空培育类器官或带来疾病新疗法

    自2019年以来,科学家已经在国际空间站上培育出了包括人类大脑、心脏和乳房在内的多个类器官模型。这些类器官通常利用人类干细胞培育而成,在一系列化

  • 培生2023年财报业绩超出预期,持续加码数字产品

    21世纪经济报道记者王峰北京报道 近日,全球教育集团培生(NYSE:PSO)公布2023财年财报。2023财年,培生的销售额为36.74亿英镑(下同),同比下降4%,但基

  • 达摩院AI加速农业新品种培育 全球23家科研机构“尝鲜”

    记者3月21日获悉,全球植物科学期刊《分子植物》刊载了中国科学家的最新研究,中国农业科学院作物科学研究所、国家南繁研究院与阿里达摩院(湖畔实验室)

  • “AI钢铁侠”黄仁勋,又进化了英伟达

      “AI钢铁侠”黄仁勋,又进化了英伟达  作 者丨倪雨晴  2024年,英伟达一年一度的GTC大会已然成为AI界春晚,现场座无虚席,全球AI爱好者翘首以待黄仁勋的独家SOLO。  北京

  • 聚焦AI框架技术创新 加速大模型规模化落地

    “人工智能作为数字新基建重点建设方向,前景广阔,大有作为。今年的政府工作报告更首次提出开展‘人工智能+’行动,无疑将为人工智能技术在

  • 北京市青少年科学教育基地揭牌

    为构建有效联动、密切配合的青少年科学教育协同机制,提升科学教育实施效能,3月23日,北京市关心下一代工作委员会(以下简称“北京市关工委”)、北京市科

  • 吸烟会增加腹部脂肪

    科学杂志《成瘾》3月21日发表的一项新研究显示,刚开始吸烟和终生吸烟都可能增加腹部脂肪,特别是内脏脂肪。内脏脂肪与心脏病、糖尿病、中风和痴呆症

推荐资讯

  • 日榜
  • 周榜
  • 月榜