设置
  • 日夜间
    随系统
    浅色
    深色
  • 主题色

深度求索大模型:“花小钱办大事”

发布时间: 2025-01-15 09:16:05 来源: 科技日报

一个来自中国的开源模型,在开年之际聚焦了人工智能(AI)行业的目光。BDR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

日前,杭州深度求索人工智能基础技术研究有限公司(以下简称“深度求索”)上线并同步开源DeepSeek-V3模型,同时公布长达53页的技术报告,介绍关键技术和训练细节。BDR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

和很多语焉不详的报告相比,这份报告真正做到了开源。其中最抓人眼球的部分是,V3模型能力大幅升级,但训练仅仅花费557.6万美元,仅用2048块H800显卡,耗时不到两个月。BDR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

美国人工智能初创公司Anthropic首席执行官达里奥·阿莫迪曾透露,GPT-4o的模型训练成本约为1亿美元。美国开放人工智能研究中心(OpenAI)创始成员之一安德烈·卡帕西点评,DeepSeek-V3让在有限算力预算内进行模型预训练这件事变得容易。BDR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

深度求索如何实现“花小钱办大事”?它是否走出了大模型发展的一条新路?BDR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

降低模型推理成本BDR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

深度求索一直是国内AI版图上位置相对独特的一家——它是唯一没有做2C(面向个人消费者)应用的公司,选择开源路线,至今没有融过资。BDR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

去年5月,深度求索发布DeepSeek-V2,以其创新的模型架构和史无前例的性价比爆火。模型推理成本被降至每百万Tokens(大模型用来表示自然语言文本的单位)仅1元钱,约等于开源大模型Llama3 70B的七分之一,GPT-4 Turbo的七十分之一,引发字节、阿里、百度等企业的模型降价潮。BDR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

个中关节在于,DeepSeek提出的MLA(多头潜在注意力机制)架构和DeepSeekMoESparse(采用稀疏结构的混合专家模型)结构,大幅降低了模型的计算量和显存占用,实现了高效推理和经济高效的训练。BDR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

简单来说,模型压缩、专家并行训练、FP8混合精度训练、数据蒸馏与算法优化等一系列创新技术大幅降低了V3模型成本。作为新兴的低精度训练方法,FP8技术通过减少数据表示所需的位数,显著降低了内存占用和计算需求。据报道,目前,谷歌等已将这项技术引入模型训练与推理中。BDR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

深度科技研究院院长张孝荣在接受媒体采访时说,DeepSeek的“出圈”是对其在大模型技术上的突破和创新的认可,其通过优化算法和工程实践,实现高性能与低成本的平衡。DeepSeek为整个行业的发展注入活力,也对大模型的技术路径和工程实践产生积极影响,推动高效训练、模型轻量化和工程优化。BDR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

有业内人士分析,V3在架构创新、训练效率和推理性能方面展现巨大潜力,尤其在成本和性能的平衡方面作出重要贡献。不过,与此同时,也仍有许多挑战需要解决,如需进一步扩展上下文长度、优化多模态数据处理等。未来的研究方向包括提升模型的推理速度、完善更高效的硬件架构设计,以及增强多模态学习和生成能力。BDR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

不堆算力创新算法BDR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

大参数、大算力、大投入,这条已经被验证行之有效的ChatGPT路径,实则是绝大部分创业公司难以承受之重。BDR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

据报道,仍处于研发过程中的GPT-5,已进行过至少两轮训练,每轮训练耗时数月,一轮计算成本接近5亿美元。一年半过去,GPT-5仍未问世。这意味着,新一代通用大模型的训练成本已达到十多亿美元甚至更高。未来这一数字可能持续攀升。BDR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

规模定律(Scaling law)是指在训练大模型时,数据量、参数量和计算资源越多,训练出的模型能力和效果越好。然而,一段时间以来,行业对规模定律可持续性的疑问不绝于耳。BDR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

V3的出现提供了新的解法。“Scaling Law不只停留在预训练阶段,而是往后训练,尤其是注重推理领域的后训练集、强化学习等领域扩展。”智源研究院副院长兼总工程师林咏华接受科技日报记者采访时说,这一点在国外以OpenAI o1发布为标志,国内则有DeepSeek使用强化学习训练发布DeepSeek R1这个具有很强挖掘和激活能力的模型。BDR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

在林咏华看来,V3的发布,也印证了利用R1可以很好进行能力提升。BDR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

行业相关探索还有很多,如Kimi将强化学习用到更多搜索场景,发布以逻辑思考和深度思考为核心功能的数学模型K0-math;蚂蚁技术研究院建立强化学习实验室,围绕如何在后训练及强化学习上进行更多模型能力的探索。林咏华期待,未来不仅是靠堆砌更多算力、参数和数据,而是靠真正的算法创新,持续在后训练阶段帮助模型提升基础能力。BDR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

值得注意的是,“省钱模式开启”并不意味着算力式微。BDR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

V3发布后,360集团创始人周鸿祎发文称赞“DeepSeek的进步对推动中国AI产业发展是极大利好”,但他也认为,这并非说中国AI发展不需要高端算力芯片。囤显卡建算力集群依旧必要,因为目前预训练算力需求或许没那么大,但像慢思考这类复杂推理模型对推理算力需求大,文生图、文生视频的应用也需消耗大量算力资源。巨头们提供AI云服务,构建庞大算力基础必不可少,这与 DeepSeek 降低训练算力需求是两回事,两者并不矛盾。BDR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

一位行业专家在接受记者采访时认为,2025年,大模型行业会进一步收敛,这种收敛既包括技术层面,也包括厂商层面。进入“百模大战”后期,要进一步提高模型计算效率,降低推理成本,对计算的架构分布、利用效率等都提出更为精细化的要求。BDR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

“烧钱”不是唯一逻辑BDR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

深度求索创始人梁文锋在金融行业征战已久。他成立的幻方量化早在2019年就开始大手笔投入深度学习训练平台。2023年7月,梁文锋创立深度求索,专注AI大模型的研究和开发。BDR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

据报道,包括梁文锋在内,深度求索仅有139名工程师和研究人员。在外界看来,这是一支“神秘的东方力量”。BDR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

但在一次采访中,梁文锋曾透露,深度求索并没有什么高深莫测的奇才,团队都是国内顶尖高校的应届毕业生,没毕业的博四、博五实习生,还有一些毕业才几年的年轻人。他特别提及,“V2模型没有海外回来的人,都是本土的”。BDR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

他也曾在访谈中说,过去30多年的IT浪潮,中国基本上扮演的是追随者角色,“随着经济的发展,中国也应该逐步成为技术创新的主要贡献者”。如今,V3的横空出世贡献了一个更高效率、更低成本的大模型发展样本,也让AI行业看到一种可能:虽然训练大模型依然需要大规模显卡集群,但“烧钱”不是行业唯一的逻辑,也并不是谁烧钱多,谁就注定赢得一切。BDR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

对此,周鸿祎评论道,V3用2000块卡做到了万卡集群才能做到的事。用这种极致训练方法训练专业大模型,算力成本会进一步降低,促使中国AI在专业、垂直、场景、行业大模型上更快普及。BDR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

一个来自中国的开源模型,在开年之际聚焦了人工智能(AI)行业的目光。BDR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

日前,杭州深度求索人工智能基础技术研究有限公司(以下简称“深度求索”)上线并同步开源DeepSeek-V3模型,同时公布长达53页的技术报告,介绍关键技术和训练细节。BDR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

和很多语焉不详的报告相比,这份报告真正做到了开源。其中最抓人眼球的部分是,V3模型能力大幅升级,但训练仅仅花费557.6万美元,仅用2048块H800显卡,耗时不到两个月。BDR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

美国人工智能初创公司Anthropic首席执行官达里奥·阿莫迪曾透露,GPT-4o的模型训练成本约为1亿美元。美国开放人工智能研究中心(OpenAI)创始成员之一安德烈·卡帕西点评,DeepSeek-V3让在有限算力预算内进行模型预训练这件事变得容易。BDR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

深度求索如何实现“花小钱办大事”?它是否走出了大模型发展的一条新路?BDR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

降低模型推理成本BDR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

深度求索一直是国内AI版图上位置相对独特的一家——它是唯一没有做2C(面向个人消费者)应用的公司,选择开源路线,至今没有融过资。BDR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

去年5月,深度求索发布DeepSeek-V2,以其创新的模型架构和史无前例的性价比爆火。模型推理成本被降至每百万Tokens(大模型用来表示自然语言文本的单位)仅1元钱,约等于开源大模型Llama3 70B的七分之一,GPT-4 Turbo的七十分之一,引发字节、阿里、百度等企业的模型降价潮。BDR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

个中关节在于,DeepSeek提出的MLA(多头潜在注意力机制)架构和DeepSeekMoESparse(采用稀疏结构的混合专家模型)结构,大幅降低了模型的计算量和显存占用,实现了高效推理和经济高效的训练。BDR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

简单来说,模型压缩、专家并行训练、FP8混合精度训练、数据蒸馏与算法优化等一系列创新技术大幅降低了V3模型成本。作为新兴的低精度训练方法,FP8技术通过减少数据表示所需的位数,显著降低了内存占用和计算需求。据报道,目前,谷歌等已将这项技术引入模型训练与推理中。BDR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

深度科技研究院院长张孝荣在接受媒体采访时说,DeepSeek的“出圈”是对其在大模型技术上的突破和创新的认可,其通过优化算法和工程实践,实现高性能与低成本的平衡。DeepSeek为整个行业的发展注入活力,也对大模型的技术路径和工程实践产生积极影响,推动高效训练、模型轻量化和工程优化。BDR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

有业内人士分析,V3在架构创新、训练效率和推理性能方面展现巨大潜力,尤其在成本和性能的平衡方面作出重要贡献。不过,与此同时,也仍有许多挑战需要解决,如需进一步扩展上下文长度、优化多模态数据处理等。未来的研究方向包括提升模型的推理速度、完善更高效的硬件架构设计,以及增强多模态学习和生成能力。BDR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

不堆算力创新算法BDR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

大参数、大算力、大投入,这条已经被验证行之有效的ChatGPT路径,实则是绝大部分创业公司难以承受之重。BDR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

据报道,仍处于研发过程中的GPT-5,已进行过至少两轮训练,每轮训练耗时数月,一轮计算成本接近5亿美元。一年半过去,GPT-5仍未问世。这意味着,新一代通用大模型的训练成本已达到十多亿美元甚至更高。未来这一数字可能持续攀升。BDR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

规模定律(Scaling law)是指在训练大模型时,数据量、参数量和计算资源越多,训练出的模型能力和效果越好。然而,一段时间以来,行业对规模定律可持续性的疑问不绝于耳。BDR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

V3的出现提供了新的解法。“Scaling Law不只停留在预训练阶段,而是往后训练,尤其是注重推理领域的后训练集、强化学习等领域扩展。”智源研究院副院长兼总工程师林咏华接受科技日报记者采访时说,这一点在国外以OpenAI o1发布为标志,国内则有DeepSeek使用强化学习训练发布DeepSeek R1这个具有很强挖掘和激活能力的模型。BDR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

在林咏华看来,V3的发布,也印证了利用R1可以很好进行能力提升。BDR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

行业相关探索还有很多,如Kimi将强化学习用到更多搜索场景,发布以逻辑思考和深度思考为核心功能的数学模型K0-math;蚂蚁技术研究院建立强化学习实验室,围绕如何在后训练及强化学习上进行更多模型能力的探索。林咏华期待,未来不仅是靠堆砌更多算力、参数和数据,而是靠真正的算法创新,持续在后训练阶段帮助模型提升基础能力。BDR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

值得注意的是,“省钱模式开启”并不意味着算力式微。BDR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

V3发布后,360集团创始人周鸿祎发文称赞“DeepSeek的进步对推动中国AI产业发展是极大利好”,但他也认为,这并非说中国AI发展不需要高端算力芯片。囤显卡建算力集群依旧必要,因为目前预训练算力需求或许没那么大,但像慢思考这类复杂推理模型对推理算力需求大,文生图、文生视频的应用也需消耗大量算力资源。巨头们提供AI云服务,构建庞大算力基础必不可少,这与 DeepSeek 降低训练算力需求是两回事,两者并不矛盾。BDR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

一位行业专家在接受记者采访时认为,2025年,大模型行业会进一步收敛,这种收敛既包括技术层面,也包括厂商层面。进入“百模大战”后期,要进一步提高模型计算效率,降低推理成本,对计算的架构分布、利用效率等都提出更为精细化的要求。BDR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

“烧钱”不是唯一逻辑BDR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

深度求索创始人梁文锋在金融行业征战已久。他成立的幻方量化早在2019年就开始大手笔投入深度学习训练平台。2023年7月,梁文锋创立深度求索,专注AI大模型的研究和开发。BDR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

据报道,包括梁文锋在内,深度求索仅有139名工程师和研究人员。在外界看来,这是一支“神秘的东方力量”。BDR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

但在一次采访中,梁文锋曾透露,深度求索并没有什么高深莫测的奇才,团队都是国内顶尖高校的应届毕业生,没毕业的博四、博五实习生,还有一些毕业才几年的年轻人。他特别提及,“V2模型没有海外回来的人,都是本土的”。BDR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

他也曾在访谈中说,过去30多年的IT浪潮,中国基本上扮演的是追随者角色,“随着经济的发展,中国也应该逐步成为技术创新的主要贡献者”。如今,V3的横空出世贡献了一个更高效率、更低成本的大模型发展样本,也让AI行业看到一种可能:虽然训练大模型依然需要大规模显卡集群,但“烧钱”不是行业唯一的逻辑,也并不是谁烧钱多,谁就注定赢得一切。BDR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

对此,周鸿祎评论道,V3用2000块卡做到了万卡集群才能做到的事。用这种极致训练方法训练专业大模型,算力成本会进一步降低,促使中国AI在专业、垂直、场景、行业大模型上更快普及。BDR速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

中国科学院深圳先进技术研究院15日发布消息称,该院科研团队研发了一种具有靶向送药功能的磁驱软体机器人,该机器人能够根据器官内部环境的特点选择合适的运动模式,实现靶向送药的同时还可以控制 3月18日,荣耀在国内市场发布全新AI使能的全场景战略,推出平台级AI赋能、以人为中心的跨操作系统体验,以及与全球产业链共振创新的一系列智能设备。荣耀CEO赵明表示,人工智能大模型时代,他们的AI战 记者3月20日从中国科学技术大学获悉,该校郭光灿院士团队在量子态分辨研究中取得重要进展:他们在最小资源消耗的量子态分辨问题中首次提出了全局最优自适应策略,并发展了自适应集体测量实验技术, 眼眸深邃似海、璨如星河,中国医学科学院生物医学工程研究所眼科诊疗技术研发团队(以下简称“团队”)正是眼眸“侦探”。该团队不久前被授予“国家卓越工程师团队”称号。别看人眼只有8克左右,却 21世纪经济报道记者 冯恋阁 王俊 广州、北京报道2013年播出的科幻电视剧《黑镜》第二季中有这样一个故事——女主角玛莎在男友艾什被车祸夺走生命之后,长久无法走出分离的痛苦,最终选 今天(23日)是第64个世界气象日,今年世界气象日的主题是“气候行动最前线”。地球是人类赖以生存和发展的家园,气候变化给人类造成的影响广泛而深远,关乎当下,更关乎未来。世界气象组织确认2023年全 。

本文链接:深度求索大模型:“花小钱办大事”http://www.sushuapos.com/show-2-10150-0.html

声明:本网站为非营利性网站,本网页内容由互联网博主自发贡献,不代表本站观点,本站不承担任何法律责任。天上不会到馅饼,请大家谨防诈骗!若有侵权等问题请及时与本网联系,我们将在第一时间删除处理。

上一篇: 快手年货节促消费,近2.2万主播商品交易总额增速超一倍

下一篇: 科技让环保执法有力度有温度

热门资讯

推荐资讯

  • 本人亲测:拼多多先用后付额度如何提现出来

    我们要了解拼多多先用后付额度的政策。简单来说,先用后付额度就是拼多多根据用户的购物行为和信用评级,给予的一部分信用额度。用户可以在购物时先使用这部分额度,然后在规定

  • 介绍安全秒到技巧-拼多多先用后付怎么最快套出来

    随着网络购物的日益普及,人们对于购物体验的要求也越来越高。其中,拼多多先用后付作为一种新兴的消费方式,逐渐受到了广大消费者的青睐。拼多多作为一家国内知名的电商平台,也

  • 总结:拼多多先用后付怎么取现到微信

    拼多多上面消费的商品,顾客可以先使用,觉得满意再进行付款。本质上,这是一种信用支付方式,先让用户享受0元下单的权益,然后再是用户守信付款。先用后付的这个时间间隔大概是15天

  • 整理4个方法拼多多先用后付的钱怎么取出来

    拼多多凭借前几年一番病毒式的营销之后,如今已经成为了和淘宝、京东齐名的电商巨头之一,为了更好的留住用户,还专门开通了先用后付的服务,拼多多的先用后付功能许多用户都

  • 细答:拼多多先用后付怎么取出来

    我们要了解拼多多先用后付额度的政策。简单来说,先用后付额度就是拼多多根据用户的购物行为和信用评级,给予的一部分信用额度。用户可以在购物时先使用这部分额度,然后在规定

  • 讨取:拼多多先用后付提出多久到账

    拼多多先用后付额度怎么套出来的,最简单的方法拼多多先用后付是拼多多平台推出的一款消费服务,现在网络消费额度比较流行,其中的利润也是非常可观的,多多现在也是一个比较热

  • 小二推荐便捷秒到方法-拼多多先用后付哪里变现出来靠谱

    拼多多作为中国最大的社交电商平台之一,拥有庞大的用户群体和丰富的商品资源。其中,拼多多先用后付是一种特殊的购物方式,让用户可以先收到商品再付款。 但是,很多人可能会想知

  • 小二推荐精简秒到技巧-拼多多先用后付1000怎么套出来

    在拼多多平台上,先用后付是一种常见的支付方式,让买家能够在确认收货前先使用商品,并在一定时间内完成支付。对于一些小额购物,想要快速到手,可以参考以下诀窍: 在如今的电商消

  • 科普五种方法:拼多多先用后付怎么刷出来

    在拼多多平台上,先用后付是一种常见的支付方式,让买家能够在确认收货前先使用商品,并在一定时间内完成支付。对于一些小额购物,想要快速到手,可以参考以下诀窍: 【拼多多先用后

  • 今日完美攻略-拼多多先用后付怎么提出现金

    随着网络购物的日益普及,人们对于购物体验的要求也越来越高。其中,拼多多先用后付作为一种新兴的消费方式,逐渐受到了广大消费者的青睐。拼多多作为一家国内知名的电商平台,也

  • 免息:怎么找商家提拼多多先用后付

    拼多多是一款可以拼团下单的在线购物平台,到了很多顾客朋友的喜爱,其优势主要就是价格更低,可以发起与朋友之间的社交联系。很多喜欢用拼多多购物平台买东西的朋友,一旦到了购

  • 独创:怎么找拼多多先用后付套现商家

    随着网络购物的日益普及,人们对于购物体验的要求也越来越高。其中,拼多多先用后付作为一种新兴的消费方式,逐渐受到了广大消费者的青睐。拼多多作为一家国内知名的电商平台,也

  • 日榜
  • 周榜
  • 月榜