7 月 24 日到 30 日,开源 AIGC 栈出现了一个很清楚的变化:模型、推理框架和底层内核不再各自演进,而是开始围绕同一批超大 MoE、多模态和混合注意力模型同步交付。Kimi K3 把开放权重模型推到 2.8T 参数和 100 万 token 上下文;vLLM 与 SGLang 随即把新模型、分层 KV 存储、混合注意力和推测解码接进服务路径;FlashAttention、ComfyUI 和 TRL 则继续处理那些决定系统能否稳定运行的细节。
本周结论
- Kimi K3 开放权重:2.8T 总参数、原生多模态、100 万 token 上下文,Stable LatentMoE 每个 token 激活 896 个专家中的 16 个。开放的是前沿模型权重,但部署门槛并没有因此降低。
- vLLM v0.26.0:新增完整 Inkling 支持,继续优化 DeepSeek-V4,并把不同 KV Cache group 的 attention backend、分层 KV offload、对象存储和 Rust 多模态前端向生产路径推进。
- SGLang v0.5.16:加入 DSpark 推测解码和 Inkling 支持,UnifiedRadixTree 成为 SWA、Mamba 与 DSA 模型的默认缓存结构,同时继续压缩长上下文和推测解码的状态内存。
- FlashAttention 4 beta24、ComfyUI v0.29.0 与 TRL v1.9.1/1.9.2:一边修正 FP8、CUDA Graph 和变长反向传播,一边补齐视频转码、模型节点、vLLM 通信初始化和异步训练指标。
Kimi K3:开放权重模型进入 3T 级别
Moonshot AI 在本周公开了 Kimi K3。官方将它定义为开放权重、原生多模态的 Agent 模型,总参数量 2.8T,支持文本、图像和视频,并提供 100 万 token 上下文。
K3 不是简单扩大 K2 的宽度。它引入 Kimi Delta Attention(KDA)和 Attention Residuals(AttnRes),同时使用 Stable LatentMoE 扩大稀疏度:一共有 896 个专家,每个 token 激活 16 个。Moonshot 给出的说法是,相比 Kimi K2,这套结构带来了约 2.5 倍的整体 scaling efficiency。
这次发布还把“Agentic”落到了更具体的任务上。官方列出的目标包括长时间代码工程、超大仓库理解、终端工具编排、GPU Kernel 和编译器开发,以及带视觉反馈的游戏、CAD 和芯片设计。它不只是给模型增加图片输入,而是要求模型在长任务中持续读取视觉状态并修改外部对象。
但开放权重不等于低成本部署。2.8T 总参数、16 个活跃专家和 100 万 token 上下文,会同时放大权重存储、专家并行、通信、KV Cache 和多模态预处理压力。团队在采用前仍然需要回答几个问题:
- 推理框架是否完整支持 KDA、AttnRes 和对应的 MoE 路由;
- 量化版本是否保留长任务与视觉能力;
- 单机、机内多卡和多机部署分别采用什么专家并行策略;
- Kimi K3 License 是否满足具体产品的分发和商用要求。
因此,K3 的主要意义不是“下载后即可替代闭源 API”,而是让社区第一次可以围绕 3T 级原生多模态 Agent 模型研究运行时、量化和系统瓶颈。
vLLM v0.26.0:从模型适配继续走向分层存储
vLLM v0.26.0 包含 411 个 commit,来自 212 位贡献者,其中 61 位是新贡献者。本次更新最显眼的是新模型支持,但更值得关注的是 KV Cache 和异构 attention backend 的变化。
新模型支持不再只是一份 modeling 文件
vLLM 为 Inkling 模型族补齐了基础建模、piecewise CUDA Graph、Hopper 上的 FlashAttention 4 relative attention、MTP=1 推测解码、LoRA 和 ModelOpt NVFP4 量化。对于混合 attention、多模态和 MoE 模型,所谓“支持”已经变成一组跨越模型层、调度器、Kernel、CUDA Graph 和量化路径的改动。
DeepSeek-V4 也继续获得专项优化,包括专用 routing kernel、fused_topk_bias、减少重复 copy,以及 AMD 和 XPU 上的稀疏 prefill/decode 与推测解码路径。官方 release note 给出的部分改动已能在端到端 TPOT 上看到个位数百分比收益;这类优化是否能迁移到其他 MoE,仍取决于路由结构、batch 和硬件。
Attention backend 可以按 KV Cache group 选择
v0.26.0 允许不同 KV Cache group 选择不同 attention backend,并把 sliding window support 明确为 backend capability。这个变化直接面向混合模型:同一个模型里可能同时存在全注意力、滑动窗口、线性注意力或状态空间层,强迫它们共享单一 backend 会限制性能,也容易制造兼容性分支。
更细粒度的 backend 选择意味着运行时需要同时管理不同的缓存形态、Kernel 能力和图捕获边界。它提高了适配混合架构的上限,但也要求 benchmark 明确记录实际命中的 backend,不能只写“使用 vLLM”。
KV offload 开始具备分层存储形态
本次更新继续补齐 KV offloading 指标、事件处理、DP replica 感知的 tiering,并加入对象存储作为 secondary tier,以及 encoder cache 的 CPU offload connector。KV Cache 不再只有“留在 GPU”或“挪到 CPU”两个选项,而是在向 GPU、CPU、本地存储和对象存储组成的分层系统发展。
这条路线首先服务于长上下文、低复用长尾请求和多模态 encoder cache。它可以扩大可服务容量,但对象存储的时延、带宽抖动和请求放大也可能反过来拖慢 TTFT。上线前需要分别测量 cache hit、miss、promotion 和 eviction,而不是只看稳态吞吐。
此外,Rust frontend 新增视频、音频输入、Seed-OSS tool parser 和原生 vllm-bench;Olmo、Olmo2、MistralLarge3 与 HunyuanVL 等模型继续迁移到 Transformers modeling backend。
SGLang v0.5.16:把推测解码、混合缓存和状态内存放到一起优化
SGLang v0.5.16 汇集 169 位贡献者的 574 个 PR。它和 vLLM 的共同点是快速接入新模型,但这一版更集中地处理了推测解码与混合状态缓存。
DSpark 根据置信度决定验证窗口
DSpark 是本版新增的推测解码算法。它先按 block 做半自回归 draft,再根据 draft 自身置信度动态决定 verify window,而不是始终使用固定 draft 长度。官方在 DeepSeek-V4-Pro、B300、TP8、batch size 1 上给出的结果是 383.7 tok/s,平均接受长度约 5。
这个数字不能直接搬到其他模型和并发上,但算法思路值得关注:推测解码正在从固定参数变成运行时自适应。真正上线时需要同时观察 acceptance length、验证成本、batch 扰动和尾延迟。
Inkling 与混合 attention 支持
SGLang 为 975B 参数的 Inkling 多模态 MoE 补齐 NVFP4 MoE、可选视觉/音频 tower、MTP,以及 sliding window、full attention 和 Mamba2 linear attention 的混合路径。官方验证范围覆盖 Blackwell、H200 和 AMD MI350X/MI355X。
UnifiedRadixTree 在这一版成为 SWA、Mamba 和 DSA 模型的默认缓存结构。它的意义不是换一个容器名字,而是让不同 attention/state 类型共享统一的前缀复用、回放和状态重置语义,减少每种架构维护独立缓存实现的分叉。
两项具体的显存缩减
GLM-5.2 的 DSA cache layer split 在 prefill context parallel 下把 KV 和 indexer cache layer 分到不同 CP rank。SGLang 给出的例子是:GLM-5.2-FP8、78 层、8192 token、cp_size=4 时,每个 rank 的 KV 内存从 0.77 GB 降到 0.20 GB,约减少 74%。
ReplaySSM Ring Spec-Verify 则避免为每次 draft 保存完整 SSM snapshot。在 Qwen3.5-35B-A3B、TP1 的官方测试中,推测解码 scratch 从每卡 11.5 GB 降到 1.8 GB,缩小 6.4 倍,同时保持准确率和吞吐基本一致。这项能力默认关闭,而且只支持特定 GDN 与线性 draft chain,不能理解成所有推测解码都自动获得同样收益。
三个小版本:稳定性改动同样影响生产结果
FlashAttention 4 beta24
FlashAttention 4 beta24 继续处理四类问题:
- CuTe/Flex 路径允许变长 backward 使用 score modification;
- 关闭 dropout 时不再引入不需要的 header;
- combine kernel 增加 linearize scheduling,以配合完整 CUDA Graph;
- 调整 FP8 数值路径。
它仍然是 beta 版本。对 FP8 和 CUDA Graph 的修改可能影响性能与数值结果,升级时应保留固定输入下的正确性对比,不能只记录 Kernel 时间。
ComfyUI v0.29.0
ComfyUI v0.29.0 将视频转码从“把所有帧缓存在内存”改为流式处理,降低长视频工作流的主机内存峰值;同时加入 JoyImageEdit 原生模型支持、OpenAI GPT-5.6 Partner Node、Job ID 请求头,以及若干 Comfy Kitchen 与 Anima 优化。
生成工作流越来越像一套异构任务调度系统。模型执行速度之外,视频编解码、帧缓存、远程节点追踪和失败恢复都会决定长任务能不能稳定完成。
TRL v1.9.1 / v1.9.2
TRL v1.9.1 修复了 vLLM server mode communicator 初始化,并修正 AsyncGRPOTrainer 的 queue wait time 指标;v1.9.2 随后恢复 NemotronH 的 GRPO/RLOO 测试,并适配 bitsandbytes 0.50.0。
这些不是新的训练算法,但会直接影响 rollout 通信是否正确、等待时间是否可信,以及量化训练组合能否通过测试。对于 RL 系统,指标口径和通信初始化错误往往比单个算子慢几微秒更危险。
本周判断
- 模型发布正在带着运行时一起发布。 Kimi K3 和 Inkling 这类模型要求 attention、MoE、视觉 tower、量化、CUDA Graph 和推测解码同时到位。只完成模型加载已经不能叫“支持”。
- 显存优化正在从压缩单个 tensor 转向管理状态生命周期。 KV tiering、DSA layer split 和 ReplaySSM 都在回答状态放在哪里、什么时候保留、由谁拥有,而不是单纯减少 dtype 位宽。
- 混合架构会迫使 benchmark 公开更多细节。 同一模型可能按 KV group 选择不同 backend,实际性能取决于命中路径。框架版本、attention backend、cache policy 和图捕获配置都应进入测试记录。
- 开放权重扩大了研究空间,也扩大了基础设施差距。 3T 级模型让社区能检查架构与权重,但真正复现其能力仍需要高带宽互联、量化、专家并行和成熟 serving stack。
- 小版本不能只按“修 bug”处理。 FP8 数值调整、vLLM communicator 初始化、视频转码方式和队列等待指标都会改变最终 benchmark 或生产稳定性,升级后必须重新验证。
本文统计 2026 年 7 月 24 日至 7 月 30 日(北京时间)由项目官方仓库公开的 release、模型说明与技术报告。性能数字均为项目发布方给出的特定配置结果,不代表 AIGCage 独立复测。