MiniMax H3正式发布:视频编辑登顶全球第一,定价0.8元/秒,8月3日开源

AI工具快讯1个月前发布 众享AI
168 00

2026年7月31日,MiniMax正式发布通用全模态生成模型MiniMax H3。这款模型首次实现了对文本、图像、视频、声音的统一理解与生成,可输出原生双声道音视频,最高支持15秒2K分辨率视频直出。

H3是MiniMax推出的首款开源多模态生成模型。早在WAIC期间,MiniMax便表示H3是其从“特化任务模型”迈向“通用多模态智能”的新范式探索。此前两代模型(Hailuo 01、02)分别在系统构建与架构效率上完成迭代,H3则进一步实现了任务与模态的统一。


MiniMax H3 全模态生成与视频编辑演示

▲ MiniMax H3 支持多模态统一理解与生成,视频编辑能力登顶全球第一

一组关键数字:视频编辑能力在Artificial Analysis榜单中排名全球第一(1130 Elo);2K视频生成定价0.8元/秒,仅为行业旗舰模型的三分之一;最高支持15秒2K分辨率原生双声道音视频;将于8月3日正式开源。

视频编辑能力登顶全球第一

在Artificial Analysis视频模型榜单中,MiniMax H3在视频编辑能力项排名全球第一,以1130 Elo领先于Google Gemini Omni、字节Seedance 2.0等模型。在有声文生视频榜单中,H3以1242分位列第二,仅比第一名Gemini Omni Flash低4分。

H3的核心能力集中体现在三个方面:指令遵循、文字与品牌信息呈现、V2V Motion Transfer(视频到视频动作迁移)。V2V Motion Transfer是指将源视频的动作特征精准迁移至目标视频,有助于实现可控的多模态内容编辑。

在内容生成层面,H3将文本、图片、音频、视频纳入同一个多模态上下文,由模型统一理解创作意图。从脚本理解、分镜生成、角色与场景保持、动作迁移、音画同步,到字幕、品牌文字、转场包装和局部编辑,全部端到端集成在模型之中。用户输入一段文本,模型直接输出接近商业成片的视频内容。

核心技术方面,H3搭载了Contextual Omni Representation、H3-VAE、H3-Omni Transformer等自研架构。通过理解与生成异构训练架构,训练吞吐量提升了近30%。在2K视频输出上,H3没有使用常规超分模块,而是让基础模型对低分辨率结果进行in-context重新生成,最大程度复用基模的生成能力。

0.8元/秒:价格砍到行业三分之一

H3的2K视频生成定价为0.8元/秒,仅为业内同类旗舰视频模型的三分之一。768P分辨率下价格不到主流模型720P的一半。

这一价格优势源于系统级的技术创新。MiniMax通过高压缩Tokenizer降低视频生成所需的Token数量,同时在异构训练、负载均衡和GPU利用效率等方面进行了针对性优化,在保障模型效果的同时大幅压降了训练与推理成本。有分析指出,H3价格下探的底层逻辑并非亏本补贴,而是基于技术创新的结构性降本。

受H3发布消息提振,MiniMax股价单日一度大涨超14%。

8月3日正式开源

MiniMax宣布,H3将于北京时间8月3日0点正式开源,开放模型权重。硬件兼容性从H3设计的最早阶段就被纳入考量。MiniMax表示,开源旨在支持社区发展、加速与更广泛AI硬件的兼容,并让用户更容易构建定制版本。

H3广泛适用于广告、品牌、电商、产品设计、UI/UX、游戏等商业场景。MiniMax方面表示,H3具备商用级的多场景内容生成能力,定位于降低企业和开发者进行高质量视频内容创作的门槛。

谁在用?用在哪?

广告与品牌营销团队。 H3在指令遵循、文字与品牌信息呈现方面表现出色,适合快速生成品牌宣传片、产品演示视频和多语言广告素材。

电商与产品设计团队。 支持2K分辨率直出和精准可控的多模态编辑,可用于产品展示视频、详情页动态素材和UI/UX原型可视化。

游戏与影视创作者。 V2V动作迁移能力可将参考视频的动作特征迁移至新场景,适合游戏角色动画、分镜预演和影视后期特效制作。

AI应用开发者。 H3支持文本、图片、音频、视频多种输入形式,并提供API接口,即将开源进一步降低集成门槛。

常见问题解答

H3和之前的Hailuo系列有什么区别?
Hailuo 01和02分别解决了系统构建和架构效率问题,H3则进一步实现了任务与模态的统一——不再是图片、视频、声音各有一套独立模型,而是全部集成在一个通用全模态模型中。

H3支持多长的视频?
单次生成最高支持15秒,输出为2K分辨率、原生双声道音视频。输出时长支持4到15秒的整数值。

H3的价格是多少?
2K分辨率视频生成0.8元/秒,仅为行业旗舰模型的三分之一。

什么时候开源?在哪里下载?
H3将于北京时间8月3日0点正式开源模型权重。届时可通过MiniMax官方渠道或Hugging Face获取。

H3支持哪些输入形式?
支持文本、图片、音频、视频四种输入形式。参考输入最多支持9张图片、3段视频、3段音频,总计不超过12个文件。

多模态视频生成,正在告别“专用专家”时代

MiniMax H3的发布,标志着多模态生成模型正在从“专用专家”向“通用助手”迈出关键一步。在此之前,图像生成、视频生成、音频生成各自被拆分成数十个独立任务——T2I、编辑、主体参考、动作参考、风格参考各有一套模型。H3打破了这些边界,把文本、图像、视频、声音放进同一个上下文,由模型统一理解和生成。

更值得关注的是H3的定价策略。0.8元/秒的价格将高质量视频生成的门槛拉低到了前所未有的位置。当视频编辑能力全球第一的模型以行业三分之一的价格出现,并承诺开源时,AI视频生成的门槛正在被重新定义。

MiniMax表示,后续版本将推动与M系列模型能力的融合,并持续提升画面精细度。

一句话总结:MiniMax H3是2026年7月31日发布的通用全模态生成模型,视频编辑能力在Artificial Analysis榜单排名全球第一,2K视频生成定价0.8元/秒(行业三分之一),将于8月3日开源。适合 广告与品牌团队、电商与产品设计、游戏与影视创作者、AI应用开发者 重点关注。

了解更多:访问 MiniMax官网MiniMax API文档

© 版权声明

相关文章

暂无评论

none
暂无评论...