设置
  • 日夜间
    随系统
    浅色
    深色
  • 主题色

大模型背景下,智能计算发展有哪些新态势?

发布时间: 2024-04-29 11:09:03 来源: 新华网

当前,智能算力需求倍增,千卡计算集群成为大模型训练标配,巨量参数、海量数据是人工智能大模型研发的必经之路。以ChatGPT为代表的多模态AI大模型成为人工智能迈向通用智能的里程碑技术,2018年—2024年OpenAI公司先后发布GPT-3.5、GPT-4、Sora等大模型,参数规模突破万亿,模型训练数据量达TB级别,应用场景覆盖文生文、文生图、文生视频等多模态计算任务。参数规模在百亿到千亿区间、训练数据TB级别以上,已成为研发具备涌现能力大模型的必备条件。cYP速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

2003年—2023年20年间智能算力需求增长百亿倍,远超摩尔定律提升速度。以ChatGPT为代表的人工智能大模型突破性进展激发全球智能计算发展热潮,大模型算力需求远超半导体增长速度,算力需求增长与芯片性能增长之间逐渐不匹配。根据公开数据测算,以AlexNet为代表的传统卷积神经网络模型训练计算量以5~7个月翻倍增长,当前基于Transformer的大模型计算量以4~5个月翻倍增长;然而芯片侧,CPU依旧延续摩尔定律以两年性能翻倍的速度发展,GPU芯片通过架构创新持续强化并行计算能力,实现十年千倍增长速度(int8算力)。现阶段,业界通过算力堆叠以及芯片、软件、互联等协同技术系统性能提升以满足大模型智能算力激增要求,千卡算力芯片构建的集群成为千亿参数大模型训练的标配。cYP速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

 芯片、软件、互联等技术创新是算力提升关键cYP速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

多维度架构创新实现芯片性能倍增。与通用计算芯片不同,智能计算芯片微架构创新对其算力提升影响超过工艺制程。英伟达重视GPU微架构创新,2010年以来已累计实现9次架构升级,结合工艺升级实现了十年千倍的性能提升。最新Blackwell GPU架构内置第二代Transformer引擎和专用RAS安全引擎,全面提升计算效率和部署稳定性。第二代Transformer引擎支持微张量缩放和动态范围管理算法,扩展支持新型FP6、FP4精度计算,实现自动调整精度以达到芯片最优算力性能;RAS引擎基于人工智能的预防性维护技术完成芯片运行状态的诊断,最大化延长系统运行时间和降低运营成本。cYP速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

深度学习框架和软件栈间接口高效适配成为芯片好用的关键。深度学习框架在支撑应用开发的同时,需要完成与底层芯片软件栈的高效适配。开发框架方面,提供分布式调度、访存优化、模型并行、数据并行等开发能力,支持分布式大模型高性能训练与推理已成为框架高效应用的关键。PyTorch采用类Python语法降低使用门槛,动态计算图设计思路便于灵活调试,加快模型的训练和优化过程,是当前算法应用开发的主力产品。软件栈方面,重点强化大模型加速库能力建设,通过向用户提供易用、高效的芯片编程接口,提高开发人员的工作效率,目前已推出针对深度学习计算、优化模型推理和加速科学计算、图形计算的专用加速库,满足多样化智能计算需求。cYP速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

高速互联是大规模算力集群构建的基础。芯片间、服务器间、集群间的高速互联、无损网络能力建设,是支撑千卡、万卡智能算力集群计算需求的必备条件,英伟达新一代NVLink 5高带宽互联技术支持GPU间、GPU与Grace CPU直连,带宽从H100的900Gb/s提升到1800Gb/s,与NVLink交换机联合使用可最高支持576个GPU高速通信,是H100芯片最大直连数量的2倍,为支持万亿参数大模型训练提供基础。cYP速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

  巨头蜂拥智能计算赛道cYP速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

  寡头垄断与多体系并存cYP速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

计算核心企业加快智能计算产品端到端体系化布局,抢占产业生态主导权。英伟达巩固GPU芯片性能优势的同时,向CPU、服务器架构、云平台等下游渗透,借助B200、H100芯片和DGX SuperPOD计算集群主导地位开辟云服务DGX Cloud,使企业能够立即访问生成式AI应用和训练模型所需的基础设施与软件。AMD强化“CPU+GPU”双芯片战略布局,CPU方面,通过改进分支预测、增加浮点支持指令等持续迭代升级芯片性能,GPU方面,发布基于CDNA 3架构的人工智能芯片MI300A和MI300X以抢占大模型算力市场份额。英特尔围绕高性能计算优势领域,逐步向GPU、ASIC等面向人工智能技术路线的产品体系布局,推出Habana Gaudi 2、Xe GPU等产品。但从全球智能计算芯片市场的规模来看,英伟达主导地位明显,市场占有率超80%,短期内领先的市场格局不会改变。cYP速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

云平台及AI企业向底层芯片领域渗透,但仅少量自研芯片实际部署应用。谷歌、微软、亚马逊等云厂商依托云计算优势向底层芯片领域渗透。谷歌自研张量处理器芯片TPU历经五代迭代创新,于2023年8月发布新一代定制TPU v5e用于大模型训练和推理,目前已批量应用于自研LLaMA大模型训练推理任务中。微软于2023年11月发布Maia 100和Cobalt 100芯片,Maia 100专为Azure云生成式AI业务设计,提供自然语言处理、计算机视觉、推荐系统等计算服务,已在Bing和Office AI产品上完成测试;Cobalt 100是基于ARM架构的通用计算芯片,当前已为Microsoft Teams等应用提供支持;然而上述两款芯片至今仅支持微软自家云服务,尚未向合作伙伴和客户开放芯片产品供应。微软自研推理芯片Inferentia和训练芯片Trainium,2023年4月更新的Inferentia 2芯片进一步提升计算性能,通过多卡高速互联可完成千亿参数大模型推理任务。但从实际应用来看,国内外云厂商仅在有限的特定算法场景中使用自研芯片,对外提供的稳定、可靠的高性能智能算力服务均基于英伟达加速卡产品实现。cYP速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

  智能计算生态软硬深度绑定发展cYP速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

计算企业均构建了与自研芯片相对应的端到端软件栈。目前国内企业均构建了与自研芯片相对应的端到端软件栈(含驱动层、编译器、加速库、工具链等),存在兼容英伟达CUDA生态和自研软件栈等技术路线。一方面,英特尔、AMD等企业在工具链API接口协议等方面与CUDA对应一致,便于把CUDA程序快速迁移到自研GPU硬件平台,降低芯片应用门槛,满足不同应用开发及调试需求。另一方面,谷歌自研TPU芯片应用时,自研软件栈编译器等工具,针对特定算法应用进行优化,实现处理效率和性能的提升。cYP速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

国内软件生态竖井及碎片化发展,应用跨平台迁移难度大、成本高。“框架+工具链+硬件”紧密耦合的长链条,端到端紧耦合、接口互不兼容,致使上层应用与特定系统锁定,是形成繁多竖井生态的根本性因素。对于应用开发者而言,应用开发人员在使用多芯片异构算力进行AI算法实现过程中,不同厂家开发的框架应用程序接口、编程库和操作系统尚不统一,DSA架构专用芯片编程范式和软件栈互不兼容,需在OpenCL、OpenACC、OpenMP等多种模型范式间切换。开发框架、软件栈竖井式的开发生态增加了应用开发人员的开发成本,应用企业为开发出能够适配多种异构AI芯片算力的算法程序,需建立多支开发团队、维护多个程序版本,成为业界运用异构算力的主要瓶颈。cYP速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

当前,智能算力需求倍增,千卡计算集群成为大模型训练标配,巨量参数、海量数据是人工智能大模型研发的必经之路。以ChatGPT为代表的多模态AI大模型成为人工智能迈向通用智能的里程碑技术,2018年—2024年OpenAI公司先后发布GPT-3.5、GPT-4、Sora等大模型,参数规模突破万亿,模型训练数据量达TB级别,应用场景覆盖文生文、文生图、文生视频等多模态计算任务。参数规模在百亿到千亿区间、训练数据TB级别以上,已成为研发具备涌现能力大模型的必备条件。cYP速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

2003年—2023年20年间智能算力需求增长百亿倍,远超摩尔定律提升速度。以ChatGPT为代表的人工智能大模型突破性进展激发全球智能计算发展热潮,大模型算力需求远超半导体增长速度,算力需求增长与芯片性能增长之间逐渐不匹配。根据公开数据测算,以AlexNet为代表的传统卷积神经网络模型训练计算量以5~7个月翻倍增长,当前基于Transformer的大模型计算量以4~5个月翻倍增长;然而芯片侧,CPU依旧延续摩尔定律以两年性能翻倍的速度发展,GPU芯片通过架构创新持续强化并行计算能力,实现十年千倍增长速度(int8算力)。现阶段,业界通过算力堆叠以及芯片、软件、互联等协同技术系统性能提升以满足大模型智能算力激增要求,千卡算力芯片构建的集群成为千亿参数大模型训练的标配。cYP速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

 芯片、软件、互联等技术创新是算力提升关键cYP速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

多维度架构创新实现芯片性能倍增。与通用计算芯片不同,智能计算芯片微架构创新对其算力提升影响超过工艺制程。英伟达重视GPU微架构创新,2010年以来已累计实现9次架构升级,结合工艺升级实现了十年千倍的性能提升。最新Blackwell GPU架构内置第二代Transformer引擎和专用RAS安全引擎,全面提升计算效率和部署稳定性。第二代Transformer引擎支持微张量缩放和动态范围管理算法,扩展支持新型FP6、FP4精度计算,实现自动调整精度以达到芯片最优算力性能;RAS引擎基于人工智能的预防性维护技术完成芯片运行状态的诊断,最大化延长系统运行时间和降低运营成本。cYP速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

深度学习框架和软件栈间接口高效适配成为芯片好用的关键。深度学习框架在支撑应用开发的同时,需要完成与底层芯片软件栈的高效适配。开发框架方面,提供分布式调度、访存优化、模型并行、数据并行等开发能力,支持分布式大模型高性能训练与推理已成为框架高效应用的关键。PyTorch采用类Python语法降低使用门槛,动态计算图设计思路便于灵活调试,加快模型的训练和优化过程,是当前算法应用开发的主力产品。软件栈方面,重点强化大模型加速库能力建设,通过向用户提供易用、高效的芯片编程接口,提高开发人员的工作效率,目前已推出针对深度学习计算、优化模型推理和加速科学计算、图形计算的专用加速库,满足多样化智能计算需求。cYP速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

高速互联是大规模算力集群构建的基础。芯片间、服务器间、集群间的高速互联、无损网络能力建设,是支撑千卡、万卡智能算力集群计算需求的必备条件,英伟达新一代NVLink 5高带宽互联技术支持GPU间、GPU与Grace CPU直连,带宽从H100的900Gb/s提升到1800Gb/s,与NVLink交换机联合使用可最高支持576个GPU高速通信,是H100芯片最大直连数量的2倍,为支持万亿参数大模型训练提供基础。cYP速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

  巨头蜂拥智能计算赛道cYP速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

  寡头垄断与多体系并存cYP速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

计算核心企业加快智能计算产品端到端体系化布局,抢占产业生态主导权。英伟达巩固GPU芯片性能优势的同时,向CPU、服务器架构、云平台等下游渗透,借助B200、H100芯片和DGX SuperPOD计算集群主导地位开辟云服务DGX Cloud,使企业能够立即访问生成式AI应用和训练模型所需的基础设施与软件。AMD强化“CPU+GPU”双芯片战略布局,CPU方面,通过改进分支预测、增加浮点支持指令等持续迭代升级芯片性能,GPU方面,发布基于CDNA 3架构的人工智能芯片MI300A和MI300X以抢占大模型算力市场份额。英特尔围绕高性能计算优势领域,逐步向GPU、ASIC等面向人工智能技术路线的产品体系布局,推出Habana Gaudi 2、Xe GPU等产品。但从全球智能计算芯片市场的规模来看,英伟达主导地位明显,市场占有率超80%,短期内领先的市场格局不会改变。cYP速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

云平台及AI企业向底层芯片领域渗透,但仅少量自研芯片实际部署应用。谷歌、微软、亚马逊等云厂商依托云计算优势向底层芯片领域渗透。谷歌自研张量处理器芯片TPU历经五代迭代创新,于2023年8月发布新一代定制TPU v5e用于大模型训练和推理,目前已批量应用于自研LLaMA大模型训练推理任务中。微软于2023年11月发布Maia 100和Cobalt 100芯片,Maia 100专为Azure云生成式AI业务设计,提供自然语言处理、计算机视觉、推荐系统等计算服务,已在Bing和Office AI产品上完成测试;Cobalt 100是基于ARM架构的通用计算芯片,当前已为Microsoft Teams等应用提供支持;然而上述两款芯片至今仅支持微软自家云服务,尚未向合作伙伴和客户开放芯片产品供应。微软自研推理芯片Inferentia和训练芯片Trainium,2023年4月更新的Inferentia 2芯片进一步提升计算性能,通过多卡高速互联可完成千亿参数大模型推理任务。但从实际应用来看,国内外云厂商仅在有限的特定算法场景中使用自研芯片,对外提供的稳定、可靠的高性能智能算力服务均基于英伟达加速卡产品实现。cYP速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

  智能计算生态软硬深度绑定发展cYP速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

计算企业均构建了与自研芯片相对应的端到端软件栈。目前国内企业均构建了与自研芯片相对应的端到端软件栈(含驱动层、编译器、加速库、工具链等),存在兼容英伟达CUDA生态和自研软件栈等技术路线。一方面,英特尔、AMD等企业在工具链API接口协议等方面与CUDA对应一致,便于把CUDA程序快速迁移到自研GPU硬件平台,降低芯片应用门槛,满足不同应用开发及调试需求。另一方面,谷歌自研TPU芯片应用时,自研软件栈编译器等工具,针对特定算法应用进行优化,实现处理效率和性能的提升。cYP速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

国内软件生态竖井及碎片化发展,应用跨平台迁移难度大、成本高。“框架+工具链+硬件”紧密耦合的长链条,端到端紧耦合、接口互不兼容,致使上层应用与特定系统锁定,是形成繁多竖井生态的根本性因素。对于应用开发者而言,应用开发人员在使用多芯片异构算力进行AI算法实现过程中,不同厂家开发的框架应用程序接口、编程库和操作系统尚不统一,DSA架构专用芯片编程范式和软件栈互不兼容,需在OpenCL、OpenACC、OpenMP等多种模型范式间切换。开发框架、软件栈竖井式的开发生态增加了应用开发人员的开发成本,应用企业为开发出能够适配多种异构AI芯片算力的算法程序,需建立多支开发团队、维护多个程序版本,成为业界运用异构算力的主要瓶颈。cYP速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

旅行推销员问题是一个经典的数学问题,也是一个组合优化问题。德国柏林弗雷大学和亥姆霍兹柏林能源与材料研究中心(HZB)科学家开展的一项新研究证明,量子计算机在解决旅行推销员问题上,相较于传统 记者3月20日从中国科学院地质与地球物理研究所获悉,该所科研人员在东北黑土区开展了大范围的野外调查和样品采集工作,通过分析采集的黑土样品发现,黑土物质最初都是由风力搬运而来。相关研究成 2024年2月,OpenAI公司推出了文生视频人工智能(AI)模型Sora。OpenAI展示了Sora利用少量简短文字提示即可创建逼真视频的能力,并提供了包括一位女士在闪烁着霓虹灯的东京街道漫步,以及一只狗在两个 21世纪经济报道记者王峰北京报道 近日,成人职业在线教育企业尚德机构(NYSE:STG)公布了其2023年第四季度及全年未经审计的财务报告。2023年第四季度,尚德机构净收入为5.42亿元(人民币,下 3月22日,中国互联网络信息中心(CNNIC)发布第53次《中国互联网络发展状况统计报告》(以下简称《报告》)。《报告》显示,截至2023年12月,我国网民规模达10.92亿人,较2022年12月新增网民2480万人,互联网 记者3月22日获悉,中山大学、深圳华大生命科学研究院与复旦大学的研究团队合作,揭示了多种蚊虫在不同生境下病毒的多样性、传播分布的影响因素及地理谱系特征,在多维尺度上为研究蚊虫病毒组提供 。

本文链接:大模型背景下,智能计算发展有哪些新态势?http://www.sushuapos.com/show-2-5497-0.html

声明:本网站为非营利性网站,本网页内容由互联网博主自发贡献,不代表本站观点,本站不承担任何法律责任。天上不会到馅饼,请大家谨防诈骗!若有侵权等问题请及时与本网联系,我们将在第一时间删除处理。

上一篇: 发射成功!看神舟十八号载人飞船的技术“绝活”

下一篇: 科技与自然情景交融

热门资讯

  • 打造平台级AI 引领行业创新

    3月18日,荣耀在国内市场发布全新AI使能的全场景战略,推出平台级AI赋能、以人为中心的跨操作系统体验,以及与全球产业链共振创新的一系列智能设备。荣

  • AI领域,重磅消息传来!

    AI领域,一则重磅消息传来!最新消息,全球最知名的AI公司——OpenAI将在几个月内发布新版大型语言模型GPT-5,性能将有大幅跃升。目前,ChatGPT使用

  • 英伟达发布AI“超级芯片” 自称“非常、非常强大”

    据法新社3月18日报道,周一,美国半导体巨头英伟达公司发布了其最新型号的电子芯片,这些芯片旨在支持人工智能(AI)革命,英伟达正努力巩固其作为人工智能领

  • 海龟深潜时一分钟心跳只有两次

    据《日本经济新闻》3月19日报道,东京大学副教授坂本健太郎等人研究发现,海龟下潜时心率将急剧下降。海龟与鲸等哺乳类动物同样,心率随下潜深度加深而

  • 我国科学家揭示东北黑土成因

    记者3月20日从中国科学院地质与地球物理研究所获悉,该所科研人员在东北黑土区开展了大范围的野外调查和样品采集工作,通过分析采集的黑土样品发现,黑

  • 新型催化剂为国内柴油发动机尾气氮氧化物处理补短板

    记者3月19日从天津大学获悉,该校环境学院刘庆岭教授团队与吉林大学于吉红院士团队以及天津工业大学梅东海教授团队合作,证明了无有机模板剂合成的具

  • 甘肃首座特高压换流站迎来“新成员”

    3月18日,伴随着搬运车的轰鸣声,全国首个大规模清洁能源特高压直流输电工程的送端±800千伏特高压祁连换流站迎来了一位“新成员”—&mdas

  • 新研究揭示 光合作用进化“缺失的一环”

    一个国际团队近日在英国《自然》杂志上发表论文说,他们利用湖水样本培养出一种奇特的光合细菌,它属于绿弯菌门一种此前未知的目,代表了光合作用生物进

  • 单个颗粒无标记光学显微成像实现

    记者3月21日从中国科学技术大学获悉,该校物理学院张斗国教授课题组,提出并实现了一种基于矢量光场调控原理的动量空间偏振滤波器件。该滤波器件安装

  • 2999元!卢伟冰:xiaomiCivi 4 Pro可能是2024年最轻薄的电话

    3月22日消息,xiaomi集团的卢伟冰在微博上表示,xiaomiCivi 4 Pro有可能是2024年最轻薄的电话。这款电话的厚度仅为7.45mm,重量为179.3g。尽管拥有超轻薄的

  • 聚焦AI框架技术创新 加速大模型规模化落地

    “人工智能作为数字新基建重点建设方向,前景广阔,大有作为。今年的政府工作报告更首次提出开展‘人工智能+’行动,无疑将为人工智能技术在

  • 第三颗“厦门造”卫星出征

    3月23日,“天卫科技03星”暨“华祥苑壹号”卫星在厦门举行出征仪式,这是由厦门本土企业天卫科技制造研发的第三颗服务当地建设的商业卫星,标志着厦门

推荐资讯

  • 日榜
  • 周榜
  • 月榜