7 月 24 日到 30 日,开源 AIGC 栈出现了一个很清楚的变化:模型、推理框架和底层内核不再各自演进,而是开始围绕同一批超大 MoE、多模态和混合注意力模型同步交付。Kimi K3 把开放权重模型推到 2.8T 参数和 100 万 token 上下文;vLLM 与 SGLang 随即把新模型、分层 KV 存储、混合注意力和推测解码接进服务路径;FlashAttention、ComfyUI 和 TRL 则继续处理那些决定系统能否稳定运行的细节。

本周结论

  • Kimi K3 开放权重:2.8T 总参数、原生多模态、100 万 token 上下文,Stable LatentMoE 每个 token 激活 896 个专家中的 16 个。开放的是前沿模型权重,但部署门槛并没有因此降低。
  • vLLM v0.26.0:新增完整 Inkling 支持,继续优化 DeepSeek-V4,并把不同 KV Cache group 的 attention backend、分层 KV offload、对象存储和 Rust 多模态前端向生产路径推进。
  • SGLang v0.5.16:加入 DSpark 推测解码和 Inkling 支持,UnifiedRadixTree 成为 SWA、Mamba 与 DSA 模型的默认缓存结构,同时继续压缩长上下文和推测解码的状态内存。
  • FlashAttention 4 beta24、ComfyUI v0.29.0 与 TRL v1.9.1/1.9.2:一边修正 FP8、CUDA Graph 和变长反向传播,一边补齐视频转码、模型节点、vLLM 通信初始化和异步训练指标。

Kimi K3:开放权重模型进入 3T 级别

Moonshot AI 在本周公开了 Kimi K3。官方将它定义为开放权重、原生多模态的 Agent 模型,总参数量 2.8T,支持文本、图像和视频,并提供 100 万 token 上下文。

K3 不是简单扩大 K2 的宽度。它引入 Kimi Delta Attention(KDA)和 Attention Residuals(AttnRes),同时使用 Stable LatentMoE 扩大稀疏度:一共有 896 个专家,每个 token 激活 16 个。Moonshot 给出的说法是,相比 Kimi K2,这套结构带来了约 2.5 倍的整体 scaling efficiency。

这次发布还把“Agentic”落到了更具体的任务上。官方列出的目标包括长时间代码工程、超大仓库理解、终端工具编排、GPU Kernel 和编译器开发,以及带视觉反馈的游戏、CAD 和芯片设计。它不只是给模型增加图片输入,而是要求模型在长任务中持续读取视觉状态并修改外部对象。

但开放权重不等于低成本部署。2.8T 总参数、16 个活跃专家和 100 万 token 上下文,会同时放大权重存储、专家并行、通信、KV Cache 和多模态预处理压力。团队在采用前仍然需要回答几个问题:

  1. 推理框架是否完整支持 KDA、AttnRes 和对应的 MoE 路由;
  2. 量化版本是否保留长任务与视觉能力;
  3. 单机、机内多卡和多机部署分别采用什么专家并行策略;
  4. Kimi K3 License 是否满足具体产品的分发和商用要求。

因此,K3 的主要意义不是“下载后即可替代闭源 API”,而是让社区第一次可以围绕 3T 级原生多模态 Agent 模型研究运行时、量化和系统瓶颈。

vLLM v0.26.0:从模型适配继续走向分层存储

vLLM v0.26.0 包含 411 个 commit,来自 212 位贡献者,其中 61 位是新贡献者。本次更新最显眼的是新模型支持,但更值得关注的是 KV Cache 和异构 attention backend 的变化。

新模型支持不再只是一份 modeling 文件

vLLM 为 Inkling 模型族补齐了基础建模、piecewise CUDA Graph、Hopper 上的 FlashAttention 4 relative attention、MTP=1 推测解码、LoRA 和 ModelOpt NVFP4 量化。对于混合 attention、多模态和 MoE 模型,所谓“支持”已经变成一组跨越模型层、调度器、Kernel、CUDA Graph 和量化路径的改动。

DeepSeek-V4 也继续获得专项优化,包括专用 routing kernel、fused_topk_bias、减少重复 copy,以及 AMD 和 XPU 上的稀疏 prefill/decode 与推测解码路径。官方 release note 给出的部分改动已能在端到端 TPOT 上看到个位数百分比收益;这类优化是否能迁移到其他 MoE,仍取决于路由结构、batch 和硬件。

Attention backend 可以按 KV Cache group 选择

v0.26.0 允许不同 KV Cache group 选择不同 attention backend,并把 sliding window support 明确为 backend capability。这个变化直接面向混合模型:同一个模型里可能同时存在全注意力、滑动窗口、线性注意力或状态空间层,强迫它们共享单一 backend 会限制性能,也容易制造兼容性分支。

更细粒度的 backend 选择意味着运行时需要同时管理不同的缓存形态、Kernel 能力和图捕获边界。它提高了适配混合架构的上限,但也要求 benchmark 明确记录实际命中的 backend,不能只写“使用 vLLM”。

KV offload 开始具备分层存储形态

本次更新继续补齐 KV offloading 指标、事件处理、DP replica 感知的 tiering,并加入对象存储作为 secondary tier,以及 encoder cache 的 CPU offload connector。KV Cache 不再只有“留在 GPU”或“挪到 CPU”两个选项,而是在向 GPU、CPU、本地存储和对象存储组成的分层系统发展。

这条路线首先服务于长上下文、低复用长尾请求和多模态 encoder cache。它可以扩大可服务容量,但对象存储的时延、带宽抖动和请求放大也可能反过来拖慢 TTFT。上线前需要分别测量 cache hit、miss、promotion 和 eviction,而不是只看稳态吞吐。

此外,Rust frontend 新增视频、音频输入、Seed-OSS tool parser 和原生 vllm-bench;Olmo、Olmo2、MistralLarge3 与 HunyuanVL 等模型继续迁移到 Transformers modeling backend。

SGLang v0.5.16:把推测解码、混合缓存和状态内存放到一起优化

SGLang v0.5.16 汇集 169 位贡献者的 574 个 PR。它和 vLLM 的共同点是快速接入新模型,但这一版更集中地处理了推测解码与混合状态缓存。

DSpark 根据置信度决定验证窗口

DSpark 是本版新增的推测解码算法。它先按 block 做半自回归 draft,再根据 draft 自身置信度动态决定 verify window,而不是始终使用固定 draft 长度。官方在 DeepSeek-V4-Pro、B300、TP8、batch size 1 上给出的结果是 383.7 tok/s,平均接受长度约 5。

这个数字不能直接搬到其他模型和并发上,但算法思路值得关注:推测解码正在从固定参数变成运行时自适应。真正上线时需要同时观察 acceptance length、验证成本、batch 扰动和尾延迟。

Inkling 与混合 attention 支持

SGLang 为 975B 参数的 Inkling 多模态 MoE 补齐 NVFP4 MoE、可选视觉/音频 tower、MTP,以及 sliding window、full attention 和 Mamba2 linear attention 的混合路径。官方验证范围覆盖 Blackwell、H200 和 AMD MI350X/MI355X。

UnifiedRadixTree 在这一版成为 SWA、Mamba 和 DSA 模型的默认缓存结构。它的意义不是换一个容器名字,而是让不同 attention/state 类型共享统一的前缀复用、回放和状态重置语义,减少每种架构维护独立缓存实现的分叉。

两项具体的显存缩减

GLM-5.2 的 DSA cache layer split 在 prefill context parallel 下把 KV 和 indexer cache layer 分到不同 CP rank。SGLang 给出的例子是:GLM-5.2-FP8、78 层、8192 token、cp_size=4 时,每个 rank 的 KV 内存从 0.77 GB 降到 0.20 GB,约减少 74%。

ReplaySSM Ring Spec-Verify 则避免为每次 draft 保存完整 SSM snapshot。在 Qwen3.5-35B-A3B、TP1 的官方测试中,推测解码 scratch 从每卡 11.5 GB 降到 1.8 GB,缩小 6.4 倍,同时保持准确率和吞吐基本一致。这项能力默认关闭,而且只支持特定 GDN 与线性 draft chain,不能理解成所有推测解码都自动获得同样收益。

三个小版本:稳定性改动同样影响生产结果

FlashAttention 4 beta24

FlashAttention 4 beta24 继续处理四类问题:

  • CuTe/Flex 路径允许变长 backward 使用 score modification;
  • 关闭 dropout 时不再引入不需要的 header;
  • combine kernel 增加 linearize scheduling,以配合完整 CUDA Graph;
  • 调整 FP8 数值路径。

它仍然是 beta 版本。对 FP8 和 CUDA Graph 的修改可能影响性能与数值结果,升级时应保留固定输入下的正确性对比,不能只记录 Kernel 时间。

ComfyUI v0.29.0

ComfyUI v0.29.0 将视频转码从“把所有帧缓存在内存”改为流式处理,降低长视频工作流的主机内存峰值;同时加入 JoyImageEdit 原生模型支持、OpenAI GPT-5.6 Partner Node、Job ID 请求头,以及若干 Comfy Kitchen 与 Anima 优化。

生成工作流越来越像一套异构任务调度系统。模型执行速度之外,视频编解码、帧缓存、远程节点追踪和失败恢复都会决定长任务能不能稳定完成。

TRL v1.9.1 / v1.9.2

TRL v1.9.1 修复了 vLLM server mode communicator 初始化,并修正 AsyncGRPOTrainer 的 queue wait time 指标;v1.9.2 随后恢复 NemotronH 的 GRPO/RLOO 测试,并适配 bitsandbytes 0.50.0。

这些不是新的训练算法,但会直接影响 rollout 通信是否正确、等待时间是否可信,以及量化训练组合能否通过测试。对于 RL 系统,指标口径和通信初始化错误往往比单个算子慢几微秒更危险。

本周判断

  1. 模型发布正在带着运行时一起发布。 Kimi K3 和 Inkling 这类模型要求 attention、MoE、视觉 tower、量化、CUDA Graph 和推测解码同时到位。只完成模型加载已经不能叫“支持”。
  2. 显存优化正在从压缩单个 tensor 转向管理状态生命周期。 KV tiering、DSA layer split 和 ReplaySSM 都在回答状态放在哪里、什么时候保留、由谁拥有,而不是单纯减少 dtype 位宽。
  3. 混合架构会迫使 benchmark 公开更多细节。 同一模型可能按 KV group 选择不同 backend,实际性能取决于命中路径。框架版本、attention backend、cache policy 和图捕获配置都应进入测试记录。
  4. 开放权重扩大了研究空间,也扩大了基础设施差距。 3T 级模型让社区能检查架构与权重,但真正复现其能力仍需要高带宽互联、量化、专家并行和成熟 serving stack。
  5. 小版本不能只按“修 bug”处理。 FP8 数值调整、vLLM communicator 初始化、视频转码方式和队列等待指标都会改变最终 benchmark 或生产稳定性,升级后必须重新验证。

本文统计 2026 年 7 月 24 日至 7 月 30 日(北京时间)由项目官方仓库公开的 release、模型说明与技术报告。性能数字均为项目发布方给出的特定配置结果,不代表 AIGCage 独立复测。