这两天,视频生成模型的“开放程度”出现了一个很有代表性的对照:Flux.3 已经官宣,但截至发稿仍没有可供开发者下载的公开源码或权重;MiniMax H3 则直接把模型权重、推理格式和部署路径交给了社区。
MiniMax 官方在 H3 介绍文章 中将它定义为通用的全模态生成模型;Hugging Face 模型仓库 已公开权重和完整的部署说明。H3 最值得关注的不是“又一个文生视频模型”,而是它把文本、图像、视频和音频放进同一个生成系统:单段视频最长 15 秒,视频和原生立体声音频可以在一次生成中同步产出。
这使 H3 与 Flux.3 形成了很清晰的工程对比:前者今天已经可以下载、部署和改造,后者目前仍主要停留在产品/模型路线的官宣层面。对开发者来说,真正的分水岭不只是模型能力,而是权重、许可证、推理代码和可复现实验是否已经到位。
Flux.3 官宣了,但“官宣”还不是“开源”
Flux.3 的消息首先意味着 Black Forest Labs 已经把下一代图像生成模型路线摆到台前。但截至本文发布时,公开信息中仍缺少一个可以让开发者直接执行的完整开源交付:没有可下载的 Flux.3 权重、没有对应的官方源码仓库,也没有像 H3 那样明确列出 Diffusers 或 SGLang 的本地部署入口。
这一区别需要被说清楚:
- 官宣:模型名称、能力方向或产品计划已经对外公布;
- 开放权重:开发者可以下载模型参数,在许可范围内本地运行;
- 源码可用:模型定义、预处理、推理和必要的运行时逻辑可以检查、修改和复现;
- 生态支持:主流框架已经接入,能够把模型放进真实服务或工作流。
Flux.3 目前至少还没有跨过后面几道门。因此,不能把“Flux.3 已官宣”写成“Flux.3 已开源”,也不能拿一个尚未公开的模型和 H3 的本地可部署能力做直接 benchmark 对比。
MiniMax H3:全模态上下文与音视频联合生成
H3 的设计目标是让模型同时理解文本、图像、视频和音频,并根据这些上下文生成音视频结果。官方给出的能力边界包括:
- 输出时长为 4–15 秒;
- 最高支持 2K 输出;
- 输出音频为 32 kHz 立体声;
- 支持文本、图像、视频、音频之间的组合输入;
- 视频和音频由同一个生成系统联合建模,而不是先生成无声视频再外挂音轨。
这里的“15 秒”指单段输出的最大时长,不是模型在 15 秒内完成推理。实际生成时间仍然取决于分辨率、输入模态、GPU 数量、并行配置和服务框架。
音频不是后处理,而是生成目标的一部分
H3 的 Omni Transformer 联合预测视频和音频 latent,再分别由 Visual VAE 与 Audio VAE 解码。官方示例中,模型可以同时利用视频、图像和音频参考,生成带环境声、音乐或对白的目标视频;也支持把参考视频中的画面和声音关系作为条件。
这带来一个实际变化:视频生成服务的输出不再只是 mp4 画面帧,还要同时考虑音频采样率、左右声道、音画同步和多模态输入的时间对齐。对推理框架而言,显存、序列长度和 I/O 都比单纯的 T2V 更复杂。
33B dense Transformer,但推理加载量不等于总参数量
H3-Omni Transformer 是约 33B 参数的 dense、single-stream Transformer。官方说明其中约 13B 参数位于 AdaLN 相关分支,这部分调制输出可以预计算并缓存,因此推理部署不必把所有 AdaLN 参数都作为实时计算路径加载。
这不是把 33B 模型变成了 20B 模型,而是说明参数统计和推理时的活跃计算、显存驻留之间需要分开理解。H3 仍然是高门槛模型,社区需要继续验证不同 GPU 数量、并行方式和精度下的真实显存与吞吐。
真正开源了什么,哪些部分仍然没有公开
H3 的开放程度很高,但并不是“整套 MiniMax 视频产品的每一个模块都已开源”。Hugging Face 仓库把模型分成两个任务专用 checkpoint:
- MiniMax-H3 Base FL2VA:文本到音视频、首帧/尾帧到音视频;
- MiniMax-H3 Base Ref2VA:基于图像、视频和音频参考的音视频生成。
仓库同时提供原始 checkpoint 和 Diffusers 格式,包含 processor、tokenizer、text encoder、transformer、Visual VAE 和 Audio VAE 等组件。
但有两个边界必须标出来:
- H3-Context-IR 没有随本地权重完整开源。 这是负责复杂多模态上下文理解、关系解析和提示增强的多阶段模块,官方提供 API 以复现完整工作流;
- H3-Regenerate-2K 也没有完整开源。 本地 H3-Base 主要用于 768p 生成,完整 2K 流程需要结合官方 API;初始开源版本还只提供 full attention,稀疏 attention 实现计划后续发布。
所以更准确的说法是:H3 Base 已开源并可本地部署;完整的 2K 产品工作流仍是“本地模型 + 官方 API”的组合。
Diffusers 和 SGLang 已经接上部署路径
H3 仓库直接列出了 Diffusers pipeline 文档 和 SGLang cookbook。这不是“社区里有人试着加载”的模糊支持,而是模型仓库已经把对应的 serving 路径写进官方 README。
Diffusers:按需拉取组件
Diffusers 用户可以直接从模型仓库加载 ModularPipeline:
from diffusers import ModularPipeline
pipe = ModularPipeline.from_pretrained("MiniMaxAI/MiniMax-H3")
仓库说明,Diffusers 会按 pipeline 需要拉取组件,不必手动下载原始 checkpoint。具体任务、输入格式和显存配置应以 H3 pipeline 文档 为准。
SGLang:原始 checkpoint 与多卡 serving
如果使用 SGLang 或 vLLM 的原始 checkpoint,可以按任务范围下载:
# 两类任务都下载
hf download MiniMaxAI/MiniMax-H3 \
--include "FL2VA/*" "Ref2VA/*" \
--local-dir MiniMax-H3
# 只下载 FL2VA
hf download MiniMaxAI/MiniMax-H3 \
--include "FL2VA/*" \
--local-dir MiniMax-H3
SGLang README 给出的多卡启动示例是:
sglang serve \
--model-path MiniMaxAI/MiniMax-H3 \
--num-gpus 4 \
--ulysses-degree 4 \
--performance-mode speed \
--host 0.0.0.0 \
--port 30010 \
--model-variant fl2va
Ref2VA 使用 --model-variant ref2va 和另一个端口。这里的 4 卡配置只是官方示例,不代表所有机器都必须使用 4 卡;实际部署还要根据 checkpoint、分辨率、输入模态和 GPU 显存重新测量。
H3 与 Flux.3:开发者现在真正能拿到什么
把两者放在一起,差异不在宣传语,而在工程交付阶段:
| 项目 | Flux.3 | MiniMax H3 |
|---|---|---|
| 对外状态 | 已官宣 | 权重已公开 |
| 本地权重 | 截至发稿未见公开下载 | Hugging Face 可下载 |
| 官方源码/推理路径 | 截至发稿未见对应公开仓库 | Diffusers、SGLang 等路径已列出 |
| 音视频联合生成 | 当前公开信息不足以确认 | 原生立体声,视频与音频联合生成 |
| 单段输出 | 等待更多公开规格 | 4–15 秒,最高 2K |
| 完整产品链路 | 等待后续开放 | 2K 的 Context-IR/Regenerate-2K 仍依赖官方 API |
这张表也说明了为什么“开源”必须拆成多个维度。H3 并不是所有产品组件都公开,但它已经让开发者可以下载 Base 权重、阅读模型说明、接入推理框架并开始做真实实验;Flux.3 目前最重要的事实仍然是“已经官宣,但还没有进入同一条可复现工程链路”。
对 AIGC 工程团队意味着什么
第一,模型发布的竞争单位正在从 checkpoint 变成“checkpoint + runtime + workflow”。H3 同时给出原始权重、Diffusers 格式、SGLang 示例和 768p/2K 的边界,社区可以更快开始定位显存、VAE、音频同步和多卡通信瓶颈。
第二,音视频联合生成会把 benchmark 从单一画质扩展到多目标评测。至少要记录视频质量、音频质量、音画同步、生成时延、峰值显存和不同输入模态下的失败率。只报告一张视频截图,无法说明 H3 的全模态能力是否真正可用。
第三,H3 的“开放”并不意味着完整 2K 产品能力已经可以离线复现。Context-IR 与 Regenerate-2K 仍依赖 API,稀疏 attention 也还没有随首个 release 一起提供。部署文档必须把本地能力和远程能力分开写,避免把 API 结果误标成纯本地结果。
第四,Flux.3 的后续价值要等到权重、许可证和代码真正落地后再判断。届时需要比较的不是官宣参数,而是相同硬件、相同分辨率、相同输出时长和相同音视频目标下的端到端成本。
结论:H3 把“发布”推进到了可运行阶段
Flux.3 的官宣说明新一代生成模型竞争已经开始,但它目前仍是一个等待更多技术交付的信号。MiniMax H3 则把模型竞争推进到了开发者可以实际操作的阶段:权重已公开,15 秒级音视频联合生成已经有明确规格,Diffusers 和 SGLang 已有入口,原始 checkpoint 与框架格式也已经准备好。
对今天想做视频生成、音频生成或多模态推理的团队,H3 的价值首先是可验证:可以下载、部署、测量,再决定是否值得优化。对 Flux.3,当前更稳妥的判断是:值得关注,但在源码和权重公开之前,不能把官宣当成可部署能力。
来源与证据边界
- MiniMax H3 官方介绍:模型定位、全模态能力、15 秒与 2K 规格、设计理念;
- MiniMaxAI/MiniMax-H3:公开权重、许可证、checkpoint 结构、Diffusers/SGLang 部署说明;
- Diffusers MiniMax H3 文档:pipeline 加载路径;
- SGLang MiniMax H3 cookbook:多卡 serving 示例。
本文发布于 2026 年 8 月 3 日。Flux.3 部分只陈述“已官宣、截至发稿未见公开源码和权重”的公开状态,不对尚未公开的模型规格、性能或许可证作推测;H3 的参数、时长、分辨率和框架支持均以官方页面与模型仓库说明为准,未声称 AIGCage 已独立复现其性能。