MiniMax 发布全模态生成模型 H3
MiniMax 于 2026 年 7 月 31 日正式发布全模态生成模型 MiniMax H3,目前已通过 API 提供服务。H3 支持对文本、图像、视频和音频组成的多模态上下文进行统一理解,可输出带原生双声道音频的视频,官方称其在指令遵循、文字与品牌信息呈现、视频到视频动作迁移等方面表现突出。
H3 可生成 4 至 15 秒视频,参考生成模式最多输入 9 张图片、3 段视频和 3 段音频,提示词上限为 7000 字符。2K 视频基础价格为每秒 0.13 美元,768P 为每秒 0.09 美元。官方宣称 2K 分辨率下每秒价格不到主流模型的三分之一。
技术方面,MiniMax 披露称 H3-VAE 带来约 4 倍序列长度收益,异构训练架构将训练吞吐提升近 30%,「计划在未来几天内,在符合相关法律法规的前提下开放模型权重」。
(MiniMax)
MiniMax 于 2026 年 7 月 31 日正式发布全模态生成模型 MiniMax H3,目前已通过 API 提供服务。H3 支持对文本、图像、视频和音频组成的多模态上下文进行统一理解,可输出带原生双声道音频的视频,官方称其在指令遵循、文字与品牌信息呈现、视频到视频动作迁移等方面表现突出。
H3 可生成 4 至 15 秒视频,参考生成模式最多输入 9 张图片、3 段视频和 3 段音频,提示词上限为 7000 字符。2K 视频基础价格为每秒 0.13 美元,768P 为每秒 0.09 美元。官方宣称 2K 分辨率下每秒价格不到主流模型的三分之一。
技术方面,MiniMax 披露称 H3-VAE 带来约 4 倍序列长度收益,异构训练架构将训练吞吐提升近 30%,「计划在未来几天内,在符合相关法律法规的前提下开放模型权重」。
(MiniMax)