
AI视频模型正在从“输入一句话、生成一段画面”变成统一的内容制作底座。MiniMax于7月31日发布H3,把文本、图像、视频和音频放入同一上下文理解,最高可输出15秒、2K分辨率的原生双声道音视频。更关键的变化不是清晰度数字,而是参考、编辑、动作迁移、声音与多镜头不再被拆成彼此隔离的专用任务。
输入从单一提示扩展为多模态上下文。用户可以同时给出文字、图片、视频和音频,并用自然语言描述素材之间的关系,而不是逐个切换动作、风格、音色或编辑工具。
输出把画面与声音一起生成。H3最高支持15秒2K视频,音频采用原生双声道,并覆盖文生图、文生视频、多镜头、文生音频及跨模态参考和编辑。
开放计划仍在路上。MiniMax表示将在未来几天开放模型权重,并从设计初期考虑多款国产芯片适配;截至发布时,权重、许可与完整本地部署要求尚未落地。
过去的视频生成链路通常被切成文生视频、图生视频、首尾帧、主体参考、动作参考、音色参考和视频编辑;声音还会继续拆成人声、音效与音乐。创作者必须理解每个入口的边界,再把多个结果带回剪辑软件拼接。H3的思路是尽早混合不同数据和任务,用语言描述“参考什么、保留什么、改变什么”,由模型统一解释关系。
这套预训练范式同时覆盖图像、视频和音频生成,也包括图片到图片、图片到视频、音频到音频,以及音视频到音视频的参考和编辑。它不等于取消专业软件,而是把素材理解和第一次生成集中到同一入口。广告、电商、游戏UI、动态海报和片头制作因此有机会减少中间转换,先得到带声音、镜头和视觉元素的完整草案,再由人工精修。
统一任务的难点在于,模型不仅要看懂每份素材,还要理解它们之间的约束。H3为此强化了Contextual Omni Representation:大量原始素材需要约10万token的推理分析,再被提炼成平均约4000 token的描述。这个过程试图把人物、动作、镜头、音色和目标画面之间的关系压进语言表示,成为后续指令遵循的基础。
第一处变化是H3-VAE。MiniMax重新设计视频tokenizer,提高重建质量和可学习性,同时依靠更高压缩率带来4倍有效序列长度收益。这让更长视频或更高分辨率不必按原始像素规模线性扩大计算,也是默认提供2K输出的关键。这里的“4倍”描述的是有效序列长度,不应直接等同于生成速度提升4倍。
第二处是H3-Omni Transformer。多模态上下文让序列长度方差扩大3倍,理解与生成又具有不同计算形态。H3把两类工作负载分开调度,分别优化硬件利用率,再处理样本内部计算差异和样本之间的负载均衡,端到端训练吞吐提升近30%。这项数据来自模型开发环节,不能直接推导为用户侧延迟降低30%。
第三处是In-context Regeneration。H3生成2K结果时没有另接专用超分模块,而是让基模结合原始多模态上下文,重新生成自身的低分辨率结果。传统超分主要根据现有像素补细节,遇到小字和细粒度元素容易“猜”;上下文重生成则可以再次调用参考图、文字要求和声音关系,理论上更有机会恢复目标信息。
MiniMax称,H3在2K分辨率下的每秒价格不到主流模型三分之一,768p价格不到主流模型720p的一半。这个对比展示了高压缩架构的商业目标,但发布材料没有列出对照模型、统一时长、并发条件和完整计费表,因此目前更适合作为官方定价定位,而不是横跨所有平台的成本结论。
可用边界同样需要写清。官方展示聚焦前期邀测和若干商业创作案例,尚未给出统一第三方评测、失败率、生成延迟、模型参数量、显存需求或不同硬件的实测结果;完整技术报告也要后续发布。团队还承认模型规模限制了部分能力,某些场景的画面精细度仍需提升。15秒上限适合片段创作,但距离稳定生成长叙事内容仍有距离。
开放权重会是决定H3影响力的下一步。如果权重、许可证、推理代码和国产芯片适配如期落地,开发者可以围绕品牌素材、行业工作流和私有数据定制视频模型,生成生态也可能从少数网页产品扩展到本地和企业部署。但在文件真正可下载之前,不能把“计划开放”写成已经开源,更不能忽略视频生成涉及的版权、人物授权和内容安全审核。
ATYUN编辑判断:H3最值得关注的不是又把分辨率推高一级,而是视频模型开始争夺“多模态创作操作系统”的位置:用户描述意图,模型理解多种素材并生成带声音的结果,专业工具负责最后修订。若统一任务带来的稳定性、价格和开放部署都能兑现,视频生成会从单点效果竞争转向完整工作流竞争;眼下真正需要观察的,是权重是否按期发布,以及第三方在真实项目里能否复现质量与成本优势。
