用AI生成数据训练AI或导致模型崩溃，原始内容9次迭代后成了“胡言乱语”

发布时间: 2024-07-26 16:20:02 来源：中国科技网

观看：295

《自然》24日正式发表的一篇研究论文指出了一个人工智能（AI）严重问题：用AI生成的数据集训练未来几代机器学习模型，可能会严重“污染”它们的输出，这被称为“模型崩溃”。研究显示，原始内容会在9次迭代以后，变成不相关的“胡言乱语”（演示中一个建筑文本最终变成了野兔的名字），这凸显出使用可靠数据训练AI模型的重要性。

生成式AI工具越来越受欢迎，如大语言模型等，这类工具主要用人类生成的输入进行训练。不过，随着这些AI模型在互联网不断壮大，计算机生成内容可能会以递归循环的形式被用于训练其他AI模型或其自身。

包括英国牛津大学在内的联合团队一直在进行相关研究，并在去年论文预印本中提出这一概念。在正式发表的论文中，他们用数学模型演示了AI可能会出现的“模型崩溃”。他们证明了一个AI会忽略训练数据中的某些输出（如不太常见的文本），导致其只用一部分数据集来自我训练。

团队分析了AI模型会如何处理主要由AI生成的数据集。他们发现，给模型输入AI生成的数据，会减弱今后几代模型的学习能力，最终导致了“模型崩溃”。他们测试的几乎所有递归训练语言模型，都容易出现问题。比如，一个用中世纪建筑文本作为原始输入的测试，到第9代的输出已经是一串野兔的名字。

团队指出，用前几代生成的数据集去训练AI，崩溃是一个不可避免的结局。他们认为，必须对数据进行严格过滤。与此同时，这也意味着依赖人类生成内容的AI模型，或许能训练出更高效的AI模型。

总编辑圈点：

对AI来说，“模型崩溃”就像癌症一样，甚至分早期与晚期。在早期时，被“喂”了生成数据的AI会开始失去一些原始正确数据；但在晚期，被“喂”了生成数据的AI会“口吐狂言”——给出完全不符合现实，也和底层数据一点不相关的结果，就像本文中的例子一样。更可怕的是，“模型崩溃”的AI极其固执，错误几乎难以矫正。它会持续强化，最终把错误结果认为是正确的。这一问题值得所有关注生成式AI的人们警惕，因为它等于是在“毒化”AI对真实世界的认知。

《自然》24日正式发表的一篇研究论文指出了一个人工智能（AI）严重问题：用AI生成的数据集训练未来几代机器学习模型，可能会严重“污染”它们的输出，这被称为“模型崩溃”。研究显示，原始内容会在9次迭代以后，变成不相关的“胡言乱语”（演示中一个建筑文本最终变成了野兔的名字），这凸显出使用可靠数据训练AI模型的重要性。

生成式AI工具越来越受欢迎，如大语言模型等，这类工具主要用人类生成的输入进行训练。不过，随着这些AI模型在互联网不断壮大，计算机生成内容可能会以递归循环的形式被用于训练其他AI模型或其自身。

包括英国牛津大学在内的联合团队一直在进行相关研究，并在去年论文预印本中提出这一概念。在正式发表的论文中，他们用数学模型演示了AI可能会出现的“模型崩溃”。他们证明了一个AI会忽略训练数据中的某些输出（如不太常见的文本），导致其只用一部分数据集来自我训练。

团队分析了AI模型会如何处理主要由AI生成的数据集。他们发现，给模型输入AI生成的数据，会减弱今后几代模型的学习能力，最终导致了“模型崩溃”。他们测试的几乎所有递归训练语言模型，都容易出现问题。比如，一个用中世纪建筑文本作为原始输入的测试，到第9代的输出已经是一串野兔的名字。

团队指出，用前几代生成的数据集去训练AI，崩溃是一个不可避免的结局。他们认为，必须对数据进行严格过滤。与此同时，这也意味着依赖人类生成内容的AI模型，或许能训练出更高效的AI模型。

总编辑圈点：

对AI来说，“模型崩溃”就像癌症一样，甚至分早期与晚期。在早期时，被“喂”了生成数据的AI会开始失去一些原始正确数据；但在晚期，被“喂”了生成数据的AI会“口吐狂言”——给出完全不符合现实，也和底层数据一点不相关的结果，就像本文中的例子一样。更可怕的是，“模型崩溃”的AI极其固执，错误几乎难以矫正。它会持续强化，最终把错误结果认为是正确的。这一问题值得所有关注生成式AI的人们警惕，因为它等于是在“毒化”AI对真实世界的认知。

3月18日，荣耀在国内市场发布全新AI使能的全场景战略，推出平台级AI赋能、以人为中心的跨操作系统体验，以及与全球产业链共振创新的一系列智能设备。荣耀CEO赵明表示，人工智能大模型时代，他们的AI战 3月18日，在2024年黑龙江农机产品展示交易会上，一部可智能播种，又可助力增产的电驱气吸播种机引发众人关注。这台高端智能电驱气吸播种机的价格与机械播种机价格相当，据悉，研发团队通过自主研发和 3月20日8时31分，探月工程四期鹊桥二号中继星由长征八号遥三运载火箭在中国文昌航天发射场成功发射升空。火箭飞行24分钟后，星箭分离，将鹊桥二号中继星直接送入近地点高度200公里、远地点高度42 3月21日上午，全球首列氢能源市域列车在中车长客股份公司（以下简称“中车长客”）试验线上进行了时速160公里满载运行试验。当日试验过程中，车以160公里/小时速度运行的列车，每公里实际运行平均能耗 3月25日消息，按照惯例，iPhone会在6月份的WWDC上发布iOS 18、watchOS 11、visionOS 2等全新系统。其中iOS 18比较受关注，被许多爆料者称为iOS史上最大升级。据名记Mark Gurman最新消息， iOS 18将支持随着无人驾驶技术的快速发展，无人车在城市配送、环卫清扫、安防巡逻等应用场景中已得到较好示范应用。3月22日，南京溧水经济开发区管委会与南京易咖智车科技有限公司联合举办“金陵智地易启未。

本文链接：用AI生成数据训练AI或导致模型崩溃，原始内容9次迭代后成了“胡言乱语”http://www.sushuapos.com/show-2-7711-0.html

声明：本网站为非营利性网站，本网页内容由互联网博主自发贡献，不代表本站观点，本站不承担任何法律责任。天上不会到馅饼，请大家谨防诈骗！若有侵权等问题请及时与本网联系，我们将在第一时间删除处理。

上一篇：新研究证实禽流感会在哺乳动物间传播

下一篇：极干旱沙漠10年来首开鲜花

用AI生成数据训练AI或导致模型崩溃，原始内容9次迭代后成了“胡言乱语”

热门资讯

推荐资讯

科技最热文章