8 月 11 日到 17 日,AIGC 开源栈的主线从“把模型接进来”进一步转向“把模型稳定地跑起来”:vLLM 继续推进 DSpark speculative decoding,FlashInfer 把 MoE Expert Parallel、FP4、MLA decode 和 Ulysses sequence parallel 放进同一个 serving 组件,Transformer Engine 2.18 则同时处理 FP8/NVFP4、CUDA Graph、融合 attention 和构建兼容性。
另一条线索来自版本密度:ComfyUI 在本周从 v0.32.0 连续推进到 v0.33.2,变化集中在 PyTorch 版本门槛、嵌套张量、MiniMax-H3、LTX 2.5、显存和工作流 API。底层项目并没有只追求一个 benchmark 数字,而是在修复动态 shape、异步同步、量化 scale、缓存布局和首请求路径上的工程缝隙。
本文统计窗口为 2026 年 8 月 11 日 00:00 至 8 月 17 日 23:59(UTC),以各项目 GitHub Release 的公开时间为准。稳定版、RC、beta 和连续发布的小版本会明确区分;文中的性能、硬件覆盖范围和“production-ready”表述均为项目方公开说明,不代表 AIGCage 独立复测。
一、本周结论
- Serving 的竞争点正在集中到状态编排:专家权重、KV layout、CUDA Graph workspace、量化 scale 和序列并行通信需要同时被运行时管理。
- MoE 支持开始跨过“能跑”阶段:FlashInfer v0.6.17 把 Expert Parallel、故障 rank mask、预量化权重和 persistent knob cache 组合成更接近服务引擎的路径。
- 硬件特化仍然是公开栈的主战场:SM12x/Blackwell 的 FP4、MLA、small-batch decode、SM100 block-sparse 和 cuDNN fused attention 都在本周的 release notes 中占据核心位置。
- 稳定版与实验版的边界必须保留:vLLM v0.27.1 是 patch release,v0.27.2rc0 是 RC,FlashAttention 4 beta26 是 pre-release,不能把它们当成同等生产承诺。
- 多模态工作流的升级已经成为连续维护问题:ComfyUI 一周内连续发布 v0.32.0、v0.33.0、v0.33.1 和 v0.33.2,说明视频、VAE、嵌套张量和显存路径需要快速迭代。
二、Serving:vLLM 与 FlashInfer 正在把“模型支持”拆成一组可复用后端
vLLM v0.27.1:小版本也在补 speculative decode 的入口
vLLM v0.27.1 于 8 月 11 日发布,官方将其定义为 v0.27.0 之上的 patch release,核心变更只有一项:支持量化 DSpark Markov heads。
这类 patch 值得关注的地方不在改动数量,而在模型支持的边界:当 speculative decoding 依赖量化的 Markov head 时,权重格式、验证路径和 serving runner 必须一起识别。对于已经运行 v0.27.0 的环境,升级前应对量化 checkpoint、draft/verify 一致性和首 token 延迟做回归,而不是只确认主模型仍能加载。
v0.27.2rc0:从支持 DSpark head 继续推进 confidence-scheduled verification
v0.27.2rc0 于 8 月 12 日发布,是本周的 RC,不是稳定版。其 release 标题直接指向 DSpark confidence-scheduled verification:验证窗口不再只是一个固定的 speculative 长度,而是让置信度参与决定验证行为。
这和本周论文中“动态预算”的方向相互呼应,但工程上仍要保守处理:RC 的收益需要在 draft 接受率、验证开销、退化样本、batch 形态和不同硬件上重新测量。建议把 RC 放到 shadow 或 canary 环境,保留 v0.27.1 的稳定回退路径。
三、FlashInfer:MoE、FP4、MLA 和长序列通信进入同一个发布面
v0.6.17:Expert Parallel 开始具备服务引擎需要的配套能力
FlashInfer v0.6.17 于 8 月 11 日发布。官方 highlights 将本版概括为四组能力:MoE Expert Parallel、Blackwell SM12x fused-MoE 的 FP4 accuracy fix、统一 MoE API 对 MXFP4 W4A8/W4A16 和 shared experts 的扩展,以及 vLLM 下 Kimi K3 MLA 和 MiniMax-M3 sparse attention 的 decode 支持。
其中最接近生产服务的部分是 MegaMoE 路径:包含 CUDA Graph capture/replay、fused quantize-and-stage、prequantized weight pack、跨层复用 workspace 和 persistent knob cache。NCCL-EP 与 NIXL-EP 还加入 opt-in fault-tolerance rank mask,在 peer timeout 时屏蔽并跳过失效 rank。它们共同解决的是“专家并行的正常路径、调优路径和异常路径”不能分离的问题。
Blackwell 方向则修复了 NVFP4 量化 bug,并加入 input_global_scale,让集成方可以直接传入 checkpoint 的 weight scale;W4A16 路径加入 cooperative persistent launch、small-batch tensor-core decode 和 shape-stable route packing。MLA 部分覆盖 Kimi K3 的非 2 的幂 head count、variable-Q decode、context parallelism,以及 MiniMax-M3 的 packed paged KV layout。
同一版本还把 Ulysses sequence parallel 的 head-scatter/sequence-gather all-to-all 作为公开 API,并加入 NVLink P2P layout permutation kernel,无法 P2P 时回退 NCCL。对视频扩散和长上下文 attention 来说,这说明“算子优化”和“跨 GPU 数据布局”已经是同一个接口的两端。
四、Kernel 与训练基础设施:动态 shape、同步和量化 scale 继续成为故障高发区
FlashAttention 4 beta26:修复的是 scheduler、dynamic shape 和 deadlock 边界
FlashAttention 4 beta26 于 8 月 12 日发布,明确标记为 pre-release。本版包括:block-sparse backward 等待 bwd_preprocess、SM90/100/110 backward 的 learnable sink、scheduler reconstruction 中保留 first-tile flag、SM100 varlen + block-sparse + SplitKV forward deadlock 修复,以及 dynamic-shape correctness 和 forward compile-key churn 修复。
这些改动没有一个看起来像“新增大功能”,但它们直接决定 Kernel 是否能在真实的变长、稀疏和 split-KV 组合下稳定工作。升级 beta 时应保留固定 shape、动态 shape、block-sparse、SplitKV、反向数值和编译缓存命中率测试;尤其不要把“能 import”当成 FA4 已经可用于生产。
Transformer Engine v2.18:FP8/NVFP4、CUDA Graph 和 cuDNN attention 同时推进
Transformer Engine v2.18 于 8 月 14 日发布。Common 层新增 scaled SwiGLU、ClampedSwiGLU 和 SReLU 的融合 BF16 forward/backward Kernel,并把 fused softmax、LayerNorm 和 RMSNorm 迁移到 NVRTC,以减少 binary size 和 build time;变长 cuDNN fused attention forward 也直接传递 sequence-length metadata。
量化与并行路径包括 FP8 current-scaling grouped quantization、CUDA Graph 兼容的 GroupedLinear、Blackwell compute capability 10.x 上 head dimension 256 的 cuDNN attention backward、FP8 block scaling、zero-copy Expert Parallel,以及 NVFP4 cached weight 的 scale-factor swizzling 优化。TE 还新增环境变量来分别控制 FlashAttention v2/v3/v4。
本版 release notes 同时列出一个重要 known issue:FlashAttention v4、CuTeDSL 和 cuDNN Frontend pip 包存在兼容性组合,可能触发 block_copy ImportError,官方给出了稳定组合。也就是说,TE 2.18 的验证对象不是单个 wheel,而是 CUDA、cuDNN、CuTeDSL、FlashAttention 和编译/运行时路径的版本矩阵。
五、ComfyUI:一周四个版本,视频工作流进入快速兼容维护
v0.32.0:PyTorch 门槛、嵌套张量和 H3 路径一起变化
ComfyUI v0.32.0 于 8 月 11 日发布,官方说明最低正式支持的 PyTorch 版本改为 2.7。本版还加入嵌套张量调试改进、MiniMax-H3 VAE 优化、非动态 VRAM 低显存下的 upscale 修复、H3 VAE decode crash 修复,以及 comfy kitchen attention、LTX 2.5 和相关工作流模板更新。
这不是一次只改节点的版本升级:PyTorch 门槛、NestedTensor、VAE、低显存 offload 和 attention backend 会共同改变视频工作流的显存峰值与失败方式。已有环境需要同时检查 Python 依赖、模型权重、VAE decode 和 low-VRAM fallback。
v0.33.0 → v0.33.1 → v0.33.2:连续小版本说明兼容性仍在快速收敛
v0.33.0 于 8 月 13 日发布,v0.33.1 同日跟进,v0.33.2 于 8 月 17 日发布。公开 release 页面显示,这一串版本在短时间内连续推进;对使用视频、Partner Node、NestedTensor 和最新模型的用户来说,升级节奏本身就是一个信号:工作流兼容不应等一个“大版本”再统一处理。
建议把 ComfyUI 的版本 manifest 与工作流一起保存,至少记录 PyTorch/CUDA、模型、VAE、custom nodes、attention backend 和输出编码器。对于本周连续版本,可以先在复制的工作流上验证 H3、LTX 2.5、嵌套 latent、低显存和长视频,再决定是否替换稳定环境。
六、从版本变化看下一阶段的工程接口
1. “支持某模型”已经变成一张后端依赖图
Kimi K3 和 MiniMax-M3 的支持同时触及 MLA geometry、paged KV、FP4、route packing、context parallelism 和 decode runner。模型类只是入口,真正的可用性取决于 Kernel、量化、cache layout、通信和 fallback 是否对齐。
2. 动态 shape 与动态预算会成为默认测试维度
FlashAttention 4 beta26 修复 dynamic shape 和 compile-key 问题,vLLM RC 把 confidence 放进验证调度,FlashInfer 用 shape-stable route packing 降低重新编译。未来 benchmark 应同时记录 shape 分布、编译缓存命中、首请求成本、验证接受率和端到端尾延迟。
3. 量化的生产边界在 scale、checkpoint 和异常路径
FlashInfer 的 input_global_scale、Transformer Engine 的 FP8/NVFP4 scale 与 CUDA Graph、vLLM 的量化 DSpark head,说明量化不是一个 dtype 开关。升级验证要覆盖 checkpoint load、scale 语义、数值误差、graph capture 和回退路径。
4. 开源发布的真正交付物是可回归的版本组合
这周的多个项目都在修复跨组件边界:FlashAttention 与 CuTeDSL/cuDNN 的兼容性、ComfyUI 与 PyTorch 的门槛、FlashInfer 与 vLLM 的模型后端、Transformer Engine 与 CUDA Graph。工程团队应该维护“模型—runtime—Kernel—硬件—精度—cache—启动参数”的组合清单,而不是只锁一个 Python 包版本。
本期开源变更
- vLLM v0.27.1
- vLLM v0.27.2rc0
- FlashInfer v0.6.17
- FlashAttention 4 beta26
- Transformer Engine v2.18
- ComfyUI v0.32.0
- ComfyUI v0.33.0
- ComfyUI v0.33.1
- ComfyUI v0.33.2
整理说明:本文依据项目官方 GitHub Release 与公开文档整理。版本状态、硬件验证范围和性能数字均为项目方报告,不代表 AIGCage 独立复测;稳定版、RC、beta、nightly 与 Partner Node 不应视为同等生产承诺。