本期覆盖 2026/9/23—9/29,按 arXiv 首次提交的 UTC 日期收录,共 16 篇。配套的版本与代码更新见本期开源一周。

MiniMax-H3 的优化仍然很密集:Sol-H3 调整生成流程,PDMD 修改蒸馏更新方向,PulseQuant 处理量化误差,DraftAttention2 则把稀疏度和计算精度放在一起选择。这几条路线改动的位置不同,适合放在一起读,却不能把加速倍数直接相乘。

长上下文侧,本周更有意思的是调度细节:卸载到 CPU 的 KV 怎样取回来,流水线里的各张卡是否真的都命中了同一个前缀,以及长短序列混训时,按 token 数分配工作为什么仍然会失衡。

一、视频生成:H3 的速度还能从哪里找

1. Sol-H3:低分辨率起稿,再把 latent 交给高分辨率阶段

9 月 28 日。 Sol-H3 将算法与运行时优化分开组织。一条路径让 H3 在较低分辨率完成早期生成,再经上采样和训练得到的 latent adapter,交给 LTX 做高分辨率细化。两套模型的潜空间不同,adapter 的作用就是跨过这道接口,省掉完整的视频 VAE 解码、再编码。

前段少处理视觉 token,后段负责细节修复,显存却要容纳两个生成阶段、文本编码器和 VAE。论文在 DGX Spark 上将两阶段配置从 142.4 GiB 压到 116.9 GiB,才能放进约 119.68 GiB 的统一内存池。

速度需要按配置读。在单张 RTX 5090 上,5 秒、1344×768 的请求耗时 39.80 秒,对照同卡全分辨率 49 步基线的 1045.40 秒,约为 26.3 倍。这里同时改变了生成步骤和流程,不能当成单个 kernel 的收益。而 8 张 GB200、1.434 秒生成 5 秒视频来自另一组单阶段、四步 LoRA 配置,不能和两阶段结果拼成同一条性能曲线。

更值得部署者注意的是 5090 的耗时构成:文本编码部分占 34.1%,其中绝大部分用于每次请求重新加载、释放编码器。DiT 足够快以后,模型驻留方式会接过瓶颈。

来源:论文与完整实验、Sol-H3 代码分支。

2. PDMD:修正 DMD 的更新方向,减少少步模型的过饱和

9 月 28 日。 DMD 依赖 teacher 和在线 critic 提供分布差异的估计。critic 自身不准确时,蒸馏更新可能沿着不合适的方向积累,表现为过饱和和伪影。PDMD 将 DMD 更新中平行于 student–critic endpoint residual 的分量投影掉,保留其余方向。

它不新增网络、训练数据或额外前向;论文将实现概括为很小的更新规则改动。这个简洁性值得关注,但论文中的残差无偏性论证有固定 noisy query 等前提,不能理解成任意 critic 误差都会自动消失。

在 Wan2.1-T2V-1.3B、4 次网络求值(NFE)的对照中,VBench 为 83.73,比匹配的 DMD 基线高 1.03 分;MiniMax-H3-33B 的四步蒸馏实验也同时评估画面和音频。对已经在训练 DMD 的团队,最直接的验证是固定 teacher、初始化和训练预算,只替换更新规则,看收益是否仍在。

来源:PDMD。

3. PulseQuant:同样是 4 bit,不同位置的误差不该同等处理

9 月 27 日。 视频 DiT 量化后,单层重建误差很小,也可能在后续 block 和去噪步骤中被放大。PulseQuant 在离线校准时对 block–step 位置做干预,估计误差的传播风险,再据此分配逐行校准范围。

第二步在响应子空间中修正残差:优先调整会影响主要激活方向的量化编码,并在相邻编码中搜索。最终仍使用原本的 4-bit 权重表示,不靠额外高精度残差矩阵来换质量。评估涉及 Wan、Self Forcing 和 MiniMax-H3。

它主要改善相同低比特表示下的质量。复现时可以固定量化格式、推理 kernel 与采样步数,检查运动连续性和细节;单看 weight relL2,很难发现误差在后续去噪中放大的问题。

来源:PulseQuant、项目代码。

4. DraftAttention2:先估计哪些块重要,再决定跳过还是低精度计算

9 月 26 日。 DraftAttention2 用较低分辨率的 Q/K 表示估计 Attention 分布。平均池化保留区域总体关系,最大池化补充容易被平均掉的强响应;得到的重要性信息既用于选择稀疏块,也用于分配块的计算精度。

这解决了两个独立使用时容易遇到的问题:稀疏 Attention 跳过一个块,会完全丢掉它的贡献;统一低比特计算则可能伤到少数关键块。联合决策可以让重要部分获得更高精度,次要部分使用低精度,贡献很弱的块再被省略。

实现上还需要避免多种精度变成多套中间张量。论文融合准备过程,并让不同精度阶段共享数据搬运、softmax 和输出处理。对四步、八步这类采样预算较小的视频模型,这尤其值得测试:后续步骤少,前面引入的近似误差更难被修正。

来源:DraftAttention2。

5. WaveAlign:稀疏 mask 不变,重新排列执行顺序

9 月 28 日。 稀疏 Attention 已经少算了很多块,但相邻执行的 query 行可能访问完全不同的 K/V,L2 仍然反复失效。WaveAlign 对 mask 的访问模式做低秩表示,将访问相似 K/V 的行排在一起,再在一个执行 wave 内按工作量调整次序。

它保留原来的稀疏选择,因此这项优化能与不同稀疏算法组合。另一处实用设计是自适应跳过:序列太短、预计收益不足时,不付出重新排序的成本。

作者在 H100 与 A40 上评估了 Wan 和 LTX2.3。H100 实验中,Attention kernel 的最高加速约 1.25 倍,生成全流程最高约 1.17 倍。比倍数更有解释力的是缓存行为:固定稀疏模式后,减少重复 HBM 读取仍然能换来收益。复现时应把生成排序的时间一起计算。

来源:WaveAlign。

6. AV-GRPO:音频、画面和同步性,怎样分别得到训练信号

9 月 24 日。 音视频联合生成的奖励归因并不简单。一段视频得分低,可能因为声音不对、画面差,也可能各自都不错但不同步。把这些混成一个标量,会使训练难以知道该调整哪个分支。

AV-GRPO 引入 modality-anchored rollout:评估某个模态的改动时,固定另一个模态的轨迹,减少两边同时变化带来的混淆,再组合模态质量与同步奖励。论文还构建了五维音视频评估数据,并在 LTX2.3 的 LoRA 和全参数训练设置上实验。

这提供了一种检查联合奖励的方法:音频分数提高以后,视频运动有没有退化?同步奖励是否只偏爱某类容易匹配的场景?这些分项比最终总分更能解释训练发生了什么。

来源:AV-GRPO、代码与数据入口。

7. ViRDM:后训练阶段只保留生成器

9 月 24 日。 ViRDM 尝试用预计算的目标表示分布替代在线 teacher–critic 组合。训练生成器,使生成视频在表示空间接近目标分布。难点在于,多步、因果视频 rollout 的梯度链很长,而且表示相近未必意味着运动自然。

它通过随机截断的 clean-exit 监督、轻量 VAE decoder 和分阶段向量–雅可比积控制显存,再加入轻量动态正则化补足时间维度的约束。这些设计共同使 generator-only 后训练可行。

论文报告,从已有初始化出发,20 次生成器更新、16 A100 GPU-hours 达到 VBench 84.87。这个预算指后训练阶段,不包含基础模型预训练与目标分布准备。对于显存难以同时容纳三套网络的实验环境,这条路线值得优先看实现细节。

来源:ViRDM。

二、低比特与 kernel:省下乘法之后,还剩多少转换开销

8. MpFA:QK 用 NVFP4,PV 保留 FP8

9 月 27 日。 MpFA 针对数据中心 Blackwell 的 Attention。QK 和 PV 都压到 FP4,看上去计算量最省,但 softmax 输出转 FP4 还需要生成 scale,并在 shared memory、tensor memory 之间搬运。转换工作压在本来就忙的 softmax 路径上,可能吃掉低比特 MMA 的优势。

因此它选择 QK4/PV8,并把 rank-one 平滑补偿放进额外的 Tensor Core MMA 中执行。配合 TMEM 复用和针对 prefill、decode 的划分,尽量让误差补偿不阻塞关键路径。

在 B200、Llama-3.1-8B 与 Qwen3-14B、16K—128K 上下文的评估中,论文报告相对 BF16 FA4 的端到端输出吞吐几何平均提升 2.81 倍。补偿平均恢复了 62.5% 的量化准确率损失,约增加 2% kernel 开销;仍有损失未恢复。这些结论绑定 B200 的实现和测试模型,不宜直接外推到 RTX 5090。

来源:MpFA。

9. QuantForge:让搜索过程保留失败解释,而不只记住最高分

9 月 28 日。 QuantForge 研究用 agent 搜索量化算法,但把格式约束固定为 MXFP4 W4A4。搜索过程中保留相互竞争的解释,安排能区分它们的实验,并检查后续代码是否真的实现了提出的假设。

其找到的 HiRes 方法在固定量化器坐标下,调整合法编码与路径残差。论文将“如何提出并验证改法”也作为实验对象:相同 240 次调用预算、8 次重复实验中,QuantForge 有 6 次达到保留任务的目标,几个对照策略分别达到 3、3、1 次。

这个结果衡量的是搜索可靠性,不是把模型准确率提高了六成。对于准备自动搜索量化方案的团队,可借鉴的是保留可证伪假设、严格执行格式约束和单独设置保留任务,避免搜索只适应同一套校准样本。

来源:QuantForge。

10. KernelOPT:优化编译后的子 kernel,再拼回模型验证

9 月 24 日。 KernelOPT 从编译器已经生成的结构入手:保留 cuBLAS、cuDNN 调用,主要替换 Inductor 生成的 Triton 子 kernel。这样既能利用 profiler 找瓶颈,也保留了编译器已有的算子分派决定。

候选实现要经过静态检查、多 seed 正确性、模型级数值验证和性能门槛,重新组装后的模型还要再测。候选都不合格时,回到原始编译结果。相比单个算子跑得快,这种“替换后整段模型仍正确”的验证更接近实际维护需求。

单张 H200 上,250 个 KernelBench 问题的 Level 1/2/3 相对 torch.compile 几何平均加速为 1.40/1.15/1.07 倍。这里统计了全部问题,未通过验证的候选回退到编译器基线。相比只汇报成功案例,这个口径更适合估计自动搜索能带来的整体收益。

来源:KernelOPT。

三、长上下文:训练负载、KV 和请求调度一起看

11. QwenGyre:长 rollout 没结束,GPU 也能重新分工

9 月 27 日。 Agent 的长任务执行时间差异很大:有的很快完成,有的还在工具调用与分支探索中。若 rollout 和训练固定分区,或者每轮等待所有执行结束,都容易留下空闲 GPU。

QwenGyre 在不中断正在执行的任务的前提下,弹性调整 rollout 与训练的 GPU 份额。轨迹处理器还要重建分支历史、为部分进展评分、删除重复路径,控制训练样本的规模。

报告中,Qwen3.8 2.4T 使用每次 rollout 700K token 的设置,48 步后 NL2RepoBench 从 52.5% 升至 58.5%,提高 6 个百分点。这是整套长任务强化学习训练的结果,不能单独归因于 GPU 调度。对基础设施而言,重点是运行中任务的状态怎样跨越资源重新分配而不丢失。

来源:QwenGyre。

12. HyDra:同样的 token 数,并不意味着同样的训练时间

9 月 28 日。 混合长度训练里,显存用量大体随长度线性增长,Attention 计算却有二次项。只按能否装进显存选择 context parallel 度,再按 token 数平衡各 rank,会留下很大的计算偏斜。

HyDra 用估计计算负载决定分配,并用 lazy heap 降低大量序列排布的调度成本。通信侧采用内部 Ulysses、外部浅层 ring 的组合,使更高 CP 度不至于单纯增加通信负担。

论文最初的生产诊断来自超过 11K GPU 的训练;优化后的主要生产评估则是 2048 GPU,两者不能混写。在后者中,pipeline bubble 从 36% 降到 14%,相对 Mcore DCP 的平均吞吐提升为 1.25 倍。这说明长上下文训练里,“显存均衡”之后还需要检查每个 rank 的时间线。

来源:HyDra。

13. PulseInfer:KV 卸载的收益,要和每 token 延迟一起交代

9 月 28 日。 PulseInfer 在 SGLang 上研究 CPU KV 卸载。它把需要取回 KV 的请求与常驻 GPU 的请求分组,在层边界切换执行,用后一组的计算覆盖前一组的 I/O;准入控制决定能同时容纳多少卸载请求。

传输也做了重新组织:CPU 先把零散 KV 块收集到连续 pinned buffer,再进行大块 DMA,GPU 最后 scatter 回目标位置。多两次内存拷贝,换取更高的 PCIe 有效带宽,是否划算取决于块的数量和大小。

测试使用 RTX PRO 6000 96GB、PCIe 5.0×16 和 1TB 主存:Qwen3-14B、Qwen3-30B-A3B 用单 GPU,MiniMax-M2.5 用四卡 TP。论文报告 decode 吞吐相对常驻 KV 的 SGLang 为 1.5—4.7 倍,相对其他卸载方案为 1.1—2.6 倍。

这里有一个必须保留的取舍:相对全 GPU 常驻基线,平均 TPOT 增至约 2.2 倍;相对卸载基线才是延迟下降。评估还跳过了 prefill,模拟 PD 分离中的 decode 实例。它适合缓解容量限制、增加并发,不能写成整段请求延迟也同步降低。

来源:PulseInfer。

14. WavePP:前缀复用要得到整条流水线的确认

9 月 28 日。 PP 的各 stage 可以独立保留或驱逐缓存。第一张卡命中前缀,并不代表后面几张卡还保留着它;逐级确认、预留空间又会拖慢新请求进入流水线。

WavePP 在前面的请求运行时,异步找出所有 stage 都能复用的前缀,保护这些缓存,并为剩余输入预留容量。随后动态规划 chunk 大小,让准备工作与模型计算重叠,减少流水线断粮。

在 4 张 B300、NVFP4、PP4 的同拓扑对照中,GLM5.2 与 MiniMax-M2.7 共 40 组设置有 37 组 prefill 吞吐提高;128 并发、长前缀高复用且只需计算短后缀时,分别达到原 TensorRT-LLM 的 2.91 和 2.02 倍。输入吞吐包含缓存复用,不能当作等量新 token 的计算能力。论文另有 Kimi K3 的跨框架实验,读者可先复现同框架对照,归因更清楚。

来源:WavePP。

15. SlimWise:prefill 保留完整专家池,decode 再裁剪

9 月 28 日。 MoE 单 token 只激活少数专家,但 batch 增大后,一步 decode 可能访问大部分专家权重。专家裁剪能减少这部分流量,却也可能损害 prefill;而计算密集的 prefill 并不总能从同样的裁剪里获得明显收益。

SlimWise 让完整模型负责 prefill,裁剪后的模型直接接收其 KV cache,继续 decode。随后用低成本蒸馏,让 decoder 适应完整模型产生的上下文状态,只更新部分参数。

在 Qwen3.6-35B-A3B、两张 A100-80GB、1K 输入与 8K 输出的服务实验中,作者沿不同 batch 和用户生成速度约束比较吞吐。50% 专家裁剪下,PD 分离最高达到 1.81 倍 decode 收益;PD 共置为最高 1.72 倍,而且共置仍要为 prefill 保留完整专家权重,不能同时获得同样的权重显存节省。

论文还专门检查生成长度:准确率接近时,输出可能变长或变短;不控制这点,吞吐与任务完成成本容易被误读。

来源:SlimWise。

16. Cartridges++:压缩文档之后,还会不会回答文档以外的问题

9 月 28 日。 将一篇长文档离线压缩成可学习的 KV 表示,能降低重复问答成本。现有评估通常只问文档相关的问题,Cartridges++ 则检查另一面:用户临时换了话题时,压缩记忆会不会继续把回答拉回原文档。

作者观察到,学习型压缩可以在文档问答上更强,却损害常识、指令遵循与无关问题的回答。两个改法都很直接:推理时由 router 决定是否接入这份记忆;训练时混入少量文档以外的问答,让压缩状态学会不过度干预。

这给知识库部署补上了一组必要测试:除了“有没有记住”,还要问“什么时候不该用”。对于经常跨文档、跨任务切换的助手,仅凭文档内问答分数选择 KV 压缩方法还不够。

来源:Cartridges++。

本周值得动手验证的三件事

  • 做 H3 推理:先分别记录文本编码、去噪、VAE 和每次请求的加载时间。Sol-H3 的 5090 结果说明,压缩 DiT 时间后,反复加载文本编码器可能成为更大的开销。
  • 做长上下文服务:把吞吐、TPOT、缓存命中率和实际新算 token 数放在同一份报告里。PulseInfer 与 WavePP 的收益来自不同资源约束,不能只按最高倍数选方案。
  • 做低比特或自动 kernel 搜索:固定格式与基线,保留整段模型的正确性验证。单层误差、微基准和最终任务质量分别回答不同问题。

本文以论文首次提交日期确定收录范围;后续修订、主分支实现与正式发布版本可能存在差异。具体代码状态见本期开源一周。