消费级GPU即可微调JmR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
“只需”10万美元,训练Llama-2级别的大模型。JmR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
尺寸更小但性能不减的MoE模型来了:JmR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
它叫JetMoE,来自MIT、普林斯顿等研究机构。JmR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
性能妥妥超过同等规模的Llama-2。JmR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
JmR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM△贾扬清转发JmR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
要知道,后者可是数十亿美元级别的投入成本。JmR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

JetMoE发布即完全开源,且学术界友好:仅使用公开数据集和开源代码,用消费级GPU就能进行微调。JmR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
不得说,大模型的打造成本,真的比人们想的要便宜更多了。JmR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
Ps. Stable Diffusion前老板Emad也点了赞:JmR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

10万美刀实现Llama-2性能
JetMoE启发于ModuleFormer的稀疏激活架构。JmR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
(ModuleFormer,一种基于稀疏专家混合(SMoE)的模块化架构,可提高大模型效率和灵活性,去年6月提出)JmR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
它的注意力层中仍然使用了MoE:JmR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
80亿参数的JetMoE一共有24个区块,每块包含2个MoE层,分别是注意力头混合 (MoA) 和MLP专家混合 (MoE)。JmR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
每个MoA和MoE层又有8个专家,每次输入token激活2个。JmR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

JetMoE-8B使用公开数据集中的1.25T token进行训练,学习率5.0 x 10-4,全局batch size为4M token。JmR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
具体训练方案遵循MiniCPM(来自面壁智能,2B模型就能赶超Mistral-7B)的思路,共包含两阶段:JmR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
第一阶段使用线性预热的恒定学习率,用来自大规模开源预训练数据集的1万亿个token进行训练,这些数据集包括RefinedWeb、Pile、Github data等等。JmR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

第二阶段则使用指数学习率衰减,用2500亿个token训练来自第一阶段数据集和超高质量开源数据集的token。JmR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

最终,团队使用96×H100的GPU集群,花费2周时间、约8万美元搞定JetMoE-8B。JmR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
更多技术细节将在不久后发布的技术报告上揭露。JmR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
而在推理过程中,由于JetMoE-8B仅具有22亿个激活参数,因此计算成本大大降低——JmR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
同时,它还收获了不错的性能表现。JmR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
如下图所示:JmR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
JetMoE-8B在8个评测基准上获得了5个sota(包括大模型竞技场Open LLM Leaderboard),超过LLaMA-13B、LLaMA2-7B和DeepseekMoE-16B。JmR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

在MT-Bench基准上得分6.681,也超过了130亿参数的LLaMA2、Vicuna等模型。JmR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

作者介绍
JetMoE一共4位作者,分别是:JmR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
MIT-IBM Watson Lab研究员,研究方向NLP。JmR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
本硕毕业于北航,博士经历于Yoshua Bengio创办的Mila研究机构。JmR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
MIT博士在读, 研究方向为3D成像的数据高效机器学习。JmR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
UC伯克利本科毕业,去年夏天作为学生研究员加入MIT-IBM Watson Lab,导师为Yikang Shen等人。JmR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
普林斯顿博士在读生,本科毕业于北大应用数学和计算机科学,目前也是Together.ai 的兼职研究员,与Tri Dao合作。JmR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
MIT博士在读,同时在创业,MyShell的AI研发主管。JmR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
这家公司刚刚融资了1100万美元,投资者包括Transformer的作者。JmR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

传送门:
https://github.com/myshell-ai/JetMoEJmR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
参考链接:
https://twitter.com/jiayq/status/1775935845205463292JmR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
3月18日,伴随着搬运车的轰鸣声,全国首个大规模清洁能源特高压直流输电工程的送端±800千伏特高压祁连换流站迎来了一位“新成员”——1号调相机转子,该换流站第7次年度检修工作
记者3月20日从中国科学技术大学获悉,该校郭光灿院士团队在量子态分辨研究中取得重要进展。研究组在最小资源消耗的量子态分辨问题中首次提出了全局最优自适应策略,并发展了自适应集体测量实验
3月21日上午,全球首列氢能源市域列车在中车长客股份公司(以下简称“中车长客”)试验线上进行了时速160公里满载运行试验。当日试验过程中,车以160公里/小时速度运行的列车,每公里实际运行平均能耗
作为月之暗面的创始人,杨植麟常把他的AGI梦想形容为“登月计划”,长文本就是这个伟大计划的第一步。但现在,随着Kimi的爆火出圈,赛道瞬间变得拥挤,24小时内,阿里、360、百度紧急“出手”,纷
3月21日,人工智能大模型赋能企业科技创新研讨会在广州召开。中国知网在会议期间发布了专利大数据智能应用产品“AI Pat+”。据中国知网相关负责人介绍,中国知网在人工智能大模型领域的深入研发
记者从中国气象局了解到,3月24日、25日和26日三天,将可能出现地磁活动,其中3月25日可能发生中等以上地磁暴甚至大地磁暴,预计地磁活动将持续到26日。在此影响之下,空间站可能因大气拖拽造成轨道高
。
本文链接:10万美元训出Llama-2级大模型!全华人打造新型MoE,贾扬清SD前CEO围观http://www.sushuapos.com/show-2-4591-0.html
声明:本网站为非营利性网站,本网页内容由互联网博主自发贡献,不代表本站观点,本站不承担任何法律责任。天上不会到馅饼,请大家谨防诈骗!若有侵权等问题请及时与本网联系,我们将在第一时间删除处理。
上一篇: 超巧 全智贤 宋慧乔在机场撞型,她眼睛都会笑(超巧全智贤宋慧乔在机场撞型)
下一篇: 最懂AI的诺奖经济学得主去世,大模型关键技术受他研究启发