12月3日,腾讯混元大模型公布最新进展,正式上线视频生成能力。与此同时,腾讯开源该视频生成大模型,参数量130亿,是当前最大的视频开源模型。据介绍,这是腾讯混元继文生文、文生图、3D生成之后的又一新里程碑。
“用户只需要输入一段描述,即可生成视频,”腾讯混元相关负责人透露,目前的生成视频支持中英文双语输入、多种视频尺寸以及多种视频清晰度。目前该模型已上线腾讯元宝APP,用户可在AI应用中的“AI视频”板块申请试用。企业客户通过腾讯云提供服务接入,目前API同步开放内测申请。
腾讯混元生成的视频截图。
在与国内外多个模型的评测对比显示,混元视频生成模型在文本视频一致性、运动质量和画面质量多个维度效果领先,在人物、人造场所等场景下表现尤为出色。
在现场演示中,腾讯混元生成视频大模型可以实现超写实画质、生成高度符合提示词的视频画面,画面流畅不易变形。比如,在冲浪、跳舞等大幅度运动画面的生成中,腾讯混元可以生成非常流畅、合理的运动镜头,物体不易出现变形;光影反射基本符合物理规律,在镜面或者照镜子场景中,可以做到镜面内外动作一致。同时,模型还可以实现在画面主角保持不变的情况下自动切镜头。
据介绍,混元视频生成能力基于与Sora类似的DiT架构,并在架构设计上进行多多处升级。混元视频生成模型适配了新一代文本编码器提升语义遵循,其具备强大的语义跟随能力,更好地应对多个主体描绘,实现更加细致的指令和画面呈现;采用统一的全注意力机制,使得每帧视频的衔接更为流畅,并能实现主体一致的多视角镜头切换;通过先进的图像视频混合VAE(3D 变分编码器),让模型在细节表现有明显提升,特别是小人脸、高速镜头等场景。
目前,腾讯宣布开源该视频生成大模型已在Hugging Face 平台及 Github 上发布,包含模型权重、推理代码、模型算法等完整模型,可供企业与个人开发者免费使用和开发生态插件。基于腾讯混元的开源模型,开发者及企业无需从头训练,即可直接用于推理,并可基于腾讯混元系列打造专属应用及服务,能够节约大量人力及算力,加速行业创新步伐。
据悉,腾讯混元系列模型的开源速度不断加快。此前,腾讯混元已经开源了旗下文生文、文生图和3D生成大模型。至此,腾讯混元系列大模型已实现全面开源。
中新网北京12月19日电 (记者 孙自法)施普林格·自然旗下专业学术期刊《自然-医学》最新发表一篇论文称,研究人 今天上午,中国首家公办本科职业学校——南京工业职业技术大学与柬埔寨柬华理事总会合作共建的柬华应用科技大学成立揭牌 图为在上海科技创新成果展上拍摄的科学刊物展台。新华社记者 方喆摄 一直以来,学者们向学术期刊投稿面临着激烈竞 中新网12月20日电 据台湾中天新闻网报道,新党桃园市“立委”参选人游智彬19日揭露,台南“立委”陈亭妃博士论文涉嫌抄 12月18日,2023年度国家自然科学基金管理工作会议在北京召开。会议深入学习贯彻党的二十大精神和习近平总书记在中共中央 省教育厅关于下达2024年普通高校“专转本”计划的通知 苏教学函〔2023〕22号 各有关高校: 根据《省教育厅关于做好2024年 。本文链接:腾讯大模型上线视频生成能力,并宣布开源http://www.sushuapos.com/show-11-14879-0.html
声明:本网站为非营利性网站,本网页内容由互联网博主自发贡献,不代表本站观点,本站不承担任何法律责任。天上不会到馅饼,请大家谨防诈骗!若有侵权等问题请及时与本网联系,我们将在第一时间删除处理。