本期覆盖 2026/9/16—9/22,按 arXiv 首次提交的 UTC 日期收录,共 16 篇。9 月 16 日与上期重叠,已介绍的论文不再重复。

DeepSeek-V4.1 把全局 KV 与滑动窗口状态分开管理;分阶段量化让 prefill 和 decode 使用不同的计算格式,甚至不同的权重;Video DeltaNet 则把 H3 的局部细节与远距离联系交给两条注意力分支。本周几项主要工作都在追问:过去统一处理的部分,是否值得拆开设计?

几项视频生成工作给出了很大的加速倍数。数字确实醒目,但其中往往同时包含了少步蒸馏、稀疏化、低精度和内核优化。下面会把这些收益拆开,避免将整套新模型的速度当成某个算子的提升。

一、热门模型:缓存省在哪里,多模态能力又落在哪里

1. DeepSeek-V4.1-Flash:全局 KV 跨层复用,局部状态按需重算

DeepSeek-V4.1-Flash 技术报告于 9 月 17 日提交。模型采用 Causal Encoder-Decoder 架构,backbone 参数量为 552B,prefill 与 decode 每 token 激活参数分别为 8B、16B。它原生接收多模态输入,支持百万 token 上下文。

缓存变化主要来自 CSA2。层被静态分成 Full、Reindex、Reuse 三类:Full 生成全局 KV 并选择索引;Reindex 复用前层 KV,用自己的 Query 重新选 Top-K;Reuse 连 Top-K 索引一起复用。各层仍保留自己的全局 Query 和局部滑动窗口状态。这样减少的是重复存储,不是简单地把所有层共用一套 Attention 输出。

配合 FP4 全局 KV,报告给出的常驻 HBM 全局缓存为 890 bytes/token,约为 DeepSeek-V4-Flash 的四分之一。另一个数字——持久化缓存降至约八分之一——来自 SWA Bounded Replay:恢复会话时,只重放有限的近期 token,近似恢复局部状态,少存一部分本来需要落盘或放在主机内存中的 KV。

两种比例对应不同存储层,不能相乘,也不代表整机显存缩小八倍。Bounded Replay 还引入了近似恢复;作者明确保留了极端长上下文检索和缓存恢复边界上的可靠性问题。部署时应把“首次计算”和“恢复旧会话”分别测一遍。

来源:技术报告、官方模型卡与权重。

2. Qwen3.8-Omni:从看懂音视频,走向完成一段工作

9 月 22 日的 Qwen3.8-Omni 报告介绍 Qwen3.8-Omni-Flash。它继承 Qwen3.8-Next 的稀疏 MoE,扩展到百万 token 上下文,通过原生多模态联合训练,将文本中的工具使用与任务执行能力迁移到音频、视频场景。

报告关注的不只有识别、问答,还包括长音视频翻译、剪辑、视频笔记和依据音乐制作视频等持续任务。这类任务需要反复读取素材、调用工具、保存中间结果;一次多模态回答得分较高,并不足以证明整条工作流可靠。

相应地,作者同时给出 Qwen-MM-Plugins 和 Qwen-Live-Harness。前者为代理补充多模态工具,后者负责实时交互、记忆和后台任务委派。研究上的可观察变化,是模型评测开始与外部执行系统一起出现。

目前可确认的开放内容是两个工具框架的源码,Live Harness 通过云端 API 调用模型。本期未将 Qwen3.8-Omni-Flash 列为开放权重模型。

来源:论文、Qwen-MM-Plugins、Qwen-Live-Harness。

二、视频与图像:先改变计算,再检查画面失去了什么

3. Video DeltaNet:H3 保留局部 Softmax,远处信息放进线性记忆

Video DeltaNet(9 月 17 日)在 MiniMax-H3 上使用混合注意力:局部 Softmax 保留细粒度交互,双向线性记忆承担较远的时空联系。线性分支按帧更新,一次共同处理该帧的空间 token;两条分支各有输出投影,再通过可学习的 gate 合并。

改动主要作用于视频与视频之间的注意力,涉及文本、音频的交互仍保留 Softmax。模型不是直接把现成 H3 的 Attention 换个 kernel:它先逐层对齐,再联合校正混合分支,随后加入 LoRA,最后做少步蒸馏。

速度可以分成两层看。对同一段约 14.3 秒、768p 视频,单次完整 backbone 前向在单张 B200 上从 16.0 秒降至 6.2 秒,约 2.6 倍;再叠加八步蒸馏与八卡推理,论文的 DiT 去噪耗时为 6.70 秒,相对同卡数的 50 步 dense H3 为 14.5 倍。

项目 README 的部署口径另列约 6.9 秒去噪、9.0 秒端到端,完整请求仍包含其他阶段。质量评估使用固定的 103 组提示词,八步模型在所报指标上接近 50 步 dense H3;复杂动作、参考图等自己的常用条件,仍值得保留单独的对照样例。

来源:论文、训练与推理代码、权重。

4. SparkDiffusion:极高稀疏率下,训练损失下降未必换来好视频

SparkDiffusion(9 月 19 日)研究一个容易误判的现象:Attention 已经非常稀疏时,单个去噪步骤的训练损失还在下降,最终生成质量却可能不再改善。作者把主要问题定位到高噪声阶段的结构误差,以及逐步训练目标与最终视频分布之间的不一致。

方法先做短暂的稀疏结构适配,再通过混合轨迹的少步蒸馏修正终端分布,部署端叠加 FP8 和融合内核。论文覆盖 Wan2.1、Wan2.2 的文生视频和图生视频,在部分长序列 720p 配置上使用 97% Attention 稀疏率。

标题中的 265 倍来自单张 RTX 5090 上 Wan2.1-T2V-14B-720P 的端到端对比:新方案是三步、无 CFG;基线为 BF16、50 步、带 CFG,每步两次模型调用,共 100 次。少步、稀疏和 FP8 的收益叠加在一起,相同步数下的 Attention 加速要另看消融。摘要里另一个 1.3 秒去噪结果属于 1.3B、480p 的配置,也不能与前者拼成同一组成绩。

这篇论文更值得借鉴的是训练顺序。若高稀疏模型一直“loss 很好、画面一般”,延长原来的逐步训练可能只是继续优化不合适的目标。

来源:SparkDiffusion。

5. QuantWM:2-bit KV 的误差,要看它把注意力引向了哪里

QuantWM(9 月 22 日)从视频闪烁入手。作者发现,低比特 KV 在 VBench 等汇总指标上可以看起来接近原模型,实际视频却有明显的时序抖动;Key 的重建误差有时小于 Value,造成的画面损伤反而更大。

原因在于 Key 误差会改变 QK 的结果,使 Query 选择不同的时空位置。方法因此不只最小化缓存张量的重建误差:QSAC 利用历史 Query 的敏感方向和残差范围选择量化中心;PSAC 则在主要 Query 子空间中,用低秩项补偿剩余 Key 误差对 Attention logits 的影响。

这是无需训练、严格因果的缓存量化方案。测试覆盖 Causal-Forcing、LingBot-World-v2、HY-World 1.5、Matrix-Game-2 和 LongCat-Video,论文报告最高 6.20 倍 KV 缓存压缩。这个比例对应缓存,不是模型权重或全流水线峰值显存;补偿所需的状态与计算也必须计入实现成本。

据此设计自己的量化测试时,可以增加固定镜头、缓慢运动、主体遮挡后重现等连续性样例。这是本文的测试建议:仅检查单帧观感或综合分数,容易漏掉“每帧都还行,连起来却在跳”的问题。

来源:QuantWM。

6. PixelDiT2:不用 VAE,也要给像素扩散一个表示先验

PixelDiT2(9 月 21 日)继续做像素空间扩散。它没有引入用于压缩、重建图像的 autoencoder,而是用冻结的视觉基础模型提供逐 patch 的表示指导,让生成网络少承担一部分“从 RGB 中同时学表示和学去噪”的负担。

这里的区别很细:不用 latent bottleneck,不意味着不借助预训练表示。PixelDiT2 把表示学习的指导与实际像素生成分开,保留端到端像素输出。

作者在 ImageNet 上报告:256×256、600 epochs 的 FID 为 1.46;512×512、680 epochs 为 1.48。这组结果说明表示指导能改善指定设置下的像素生成。开放域文生图、图像编辑和推理延迟,则需要另外的对照,当前证据还不足以决定是否替换一条现有的 latent diffusion 流水线。

来源:PixelDiT2。

7. The Weight Is Over:先缩小文本编码器,再谈桌面端实时出图

这篇 9 月 18 日的工作围绕 FLUX.2-klein,组合了小文本编码器、embedding translator、量化与权重流式加载。translator 将 0.6B 编码器的表示映射到原 4B 编码器的空间,减少常驻权重;随后再按显存预算决定多少 denoiser 权重留在设备上。

论文的桌面编辑器使用 ONNX Runtime 的 TensorRT-RTX provider。RTX PRO 6000 Blackwell Workstation Edition 上,1024×1024、四步、NVFP4 配置报告约 0.27 秒完整生成、102 毫秒首图、5.7GB 峰值显存。首图指编码加一次去噪和 VAE decode,不是四步全部结束。

换到 12GB RTX 4070 Ti,0.6B 编码器加 translator、半驻留权重的例子约需三秒。更小的显存下,避开分页比追求全部权重驻留更划算;显存足够时则相反,流式加载可能只增加等待。两种硬件恰好说明了优化顺序为何不同。

来源:论文、NVIDIA DIN Deploy 示例。

三、低比特推理:prefill、decode 与各个 head 不必一刀切

8. Disaggregated Quantization:保留低比特 decoder,单独训练 prefiller

9 月 22 日的 Disaggregated Quantization 将阶段差异放到量化设计的中心。prefill 处理大量 prompt token,适合直接使用低精度矩阵运算;低并发 decode 更受权重带宽影响,紧凑的 weight-only 格式可能更合适。两阶段未必需要同一种激活精度,更不必始终使用同一份量化权重。

作者进一步冻结现成的 GGUF decoder,单独训练 NVFP4 prefiller,修复低比特 prompt processing 给后续生成留下的误差。在 Qwen3.8-27B 的 IQ1_S 配置上,相对论文对应的 weight-only 基线,MMLU-Pro、MMMU-Pro 分别提升 32.5、35.3 个百分点。这不是未经训练的格式替换,也不是所有量化位宽都有如此大的提升。

额外的 prefiller 权重需要存放。ODP 将它们留在 SSD,逐层加载,并借用 prefill 期间暂时不用的 decode 权重缓冲区。DGX Spark 上的定制 llama.cpp 路径,在 8K prompt 下报告 1.78 倍 TTFT 加速;较长输入提供了更多计算时间来覆盖读取,短输入则可能在等 SSD。

因此,“不增加设备上的权重驻留”与“不增加任何开销”不同:仍需额外磁盘 checkpoint、加载流量、校准或训练,以及经过修改的运行时。它适合拿来研究阶段专用精度,不宜理解为给任意 GGUF 文件加一个开关就能复现。

来源:论文、训练与评测代码、llama.cpp 实验分支。

9. KV-COBRA:同样的缓存预算,head 之间怎样分更划算

KV-COBRA(9 月 21 日)把低秩截断和标量量化放在同一个分配问题里。不同 Attention head 的信息结构不同:有的值得保留更多维度、接受较低精度;有的适合少留几个方向、给保留下来的值更多 bit。统一 rank、统一 bit-width 会浪费这部分差异。

方法先估计每个 head 内截断与量化的失真,再跨 head 分配预算;结合 Hadamard 旋转平衡通道方差,并用 Attention KL 的重要性重排 SVD 基,使分配考虑 Query 的影响。它也支持 K、V 联合分配。

论文比较 0.5—4 bits per dimension 的困惑度、零样本与长上下文表现。这里的 bpd 是压缩后的平均预算,不表示硬件能直接执行“0.5-bit Attention”。作者所说没有逐 token 分配开销,也不意味着整个缓存读写、投影和解压路径零成本。要判断服务价值,仍需看压缩布局如何接入真实 Attention kernel。

来源:KV-COBRA。

10. SpecQuant:用同一模型的多种精度做起草与路由

SpecQuant(9 月 18 日)从同一个基础模型派生 INT4、FP8、FP16 版本,按问题复杂度选择路径,并结合推测解码。它希望避免另训一个架构不同的 draft model,也让简单问题不必总走最昂贵的路径。

报告基于 Qwen2.5 系列,在 MMLU、AlpacaEval、GSM8K 上给出 35%—43% 的加速,并允许小幅准确率变化。阅读时要特别分开两件事:经过目标模型严格验证的推测采样,以及直接把请求交给较低精度模型的自适应路由。后者会改变回答来源,不能因为两者出现在同一框架里,就把整体方法称为“无损推测解码”。

复现时还需要补齐多份权重的实际存储、切换开销、路由错误和目标模型调用比例。对显存紧张的本地设备,这几项可能比平均加速更早决定方案是否可用。

来源:SpecQuant。

四、系统与训练:路由结果、序列长度和机器拓扑都在变化

11. Weave:MoE 的通信 SM 数量,可以等路由完成后再定

Weave(9 月 18 日)针对 EP 推理的 dispatch、专家计算和 combine。固定留一组 SM 做通信的方案有个问题:不同层、不同 GPU 实际接到的 token 数不同,同一个 SM 划分未必同时适合它们。

路由结束后,本层通信量与计算量已经可估。Weave 将轻量成本模型放入 persistent megakernel,按层、按 GPU 决定通信和计算的 SM 比例;时间调度器再组织分块流水,减少数据依赖造成的空闲。

在 4×H100 SXM、单机 NVLink、EP=4 的范围内,论文对六种 MoE 模型与五种基线给出几何平均 2.89 倍 MoE 层加速、1.33 倍端到端加速。两者差距说明非 MoE 部分仍占用大量时间。

作者明确把更多 GPU 和跨节点扩展留作后续工作。不能把这里的 NVLink 带宽、同步成本和动态划分结果原样搬到多机 RDMA;但“等 routing 结果出来再分 SM”值得与固定配额做同形状对照。

来源:Weave。

12. NSP:长序列多分卡,短序列少通信,GPU 组还可以嵌套

NSP(9 月 19 日)讨论长尾长度数据上的 sequence parallelism。统一使用较大的 SP degree,会让数量众多的短样本承担不必要的通信;统一使用较小的 degree,又容易让少数长样本拖慢整个迭代。

不同于把 GPU 切成互不重叠的组,NSP 在同一迭代内嵌套不同大小的 SP group。树状规划器在显存约束下安排序列,执行端沿层级组织计算流和重计算,将负载均衡目标从“每组差不多”细化到每张 GPU。

摘要报告在最长 384K 的 Qwen3-MoE 长尾工作负载上,相对 Static SP 最高提升 1.48 倍,相对 FlexSP 最高提升 1.16 倍。这里保留摘要的比较范围,不补猜未核实的集群配置。对工程测试,先确认真实数据的长度分布比直接追最高倍数更重要;整齐定长 batch 未必有同样收益。

来源:NSP 论文与摘要。

13. HyperParallel-FSDP:分片语义放在哪一层,会影响训练成本

HyperParallel-FSDP(9 月 18 日)面向 Ascend SuperPoD,尝试把分布式张量的布局解析放在 autograd 之上的 API 边界。生产模式减少稳态逐算子分派,验证模式则保留元数据传播、快速失败检查和梯度等价测试。

它还针对超节点内外链路差异调整 FSDP 通信,并从张量布局推导 Muon 的通信组,避免重复做整矩阵正交化。系统设计围绕实际拓扑展开,不能只归结为“另一个 FSDP 实现”。

报告在 Atlas 900 A3 上扩展至 384 cards、768 ranks;505B MoE 的所报吞吐为 421k tokens/s。论文还给出相对 FSDP2、Megatron DDP 的平均步时下降,但比较绑定其模型、软件栈与硬件。这里不把昇腾上的结果换算成 H100、B300 的预期收益。

迁移这套方法之前,值得先读它的分项实验:布局解析、通信流水与 Muon 处理的是不同成本,最终 tokens/s 会把它们混在一起。

来源:HyperParallel-FSDP。

14. DSec:Agent 训练的 GPU 之外,还有成千上万的有状态环境

DeepSeek Elastic Compute 报告于 9 月 19 日提交。它将 FnCall、容器、microVM、完整虚拟机接入统一 SDK,处理大批沙箱的创建、放置、镜像读取和资源回收。

Agent rollout 会修改文件、安装依赖、执行命令,这些状态不能随着 GPU 训练被抢占就随意丢掉。DSec 因而把有状态的执行环境与可抢占的训练计算解耦,结合 3FS 按需读取镜像,并与 RL 框架协调环境生命周期。

报告列出约 160 节点的生产单元、每日约 300 万沙箱等运行规模。这些是作者生产系统的经验数据,不是下载一个单机程序就能得到的性能。论文链接中的 3FS 等公开组件,也不能据此视为整个 DSec 已经完整开源。

对正在搭 Agent 训练平台的人,这篇提醒了几个经常漏算的成本:环境启动尾延迟、低复用率镜像的分发、闲置沙箱的内存,以及保留 rollout 状态时的资源回收策略。

来源:DSec。

五、线性注意力:保留效率,尝试不同的表达能力

15. Complex KDA:通过 gate 与更新范围,增加状态旋转能力

Complex KDA(9 月 21 日)研究 Kimi Delta Attention 的表达能力。作者允许通道 gate 取负值,将范围扩到 [-1, 1],同时允许 delta-rule 系数 β 取 [0, 2];两项扩展配合,使单次更新可以表达二维旋转。

更新仍保持 diagonal-plus-rank-one 结构,不需要通过增加一次完整 delta transition 来获得相同类型的旋转。论文给出了稳定性与状态追踪能力的理论分析,并测试有限群状态追踪、周期音频延续和语言建模。

状态追踪和长度外推是论文较鲜明的收益;语言建模结果则与 KDA 基线接近。代码来自独立研究项目,并非 Kimi K3 的官方架构更新。

来源:论文、代码。

16. dQwen3.5:带循环层的混合骨干,也可以适配扩散语言模型

dQwen3.5(9 月 17 日)将 Qwen3.5 的 0.8B、2B、4B、9B 变体适配为 diffusion language model。难点不只是改变 Attention mask:混合架构中的循环层本来带有因果方向,双向建模需要单独处理。

论文发现,相对其 full-attention 对照,混合骨干达到同一训练 loss 所需 token 约减半,并表现出任意顺序解码和并行解码能力。这首先是适配效率和模型行为的结果,不能直接读作每秒生成速度翻倍。

如果手头已有混合架构预训练模型,这项工作提供了一条不必先退回全 Attention 骨干的研究路线。实际延迟仍要把采样迭代数、并行接受策略、缓存复用和 batch 大小放在一起测试。

来源:dQwen3.5。

本周可以优先复现什么

手头的问题 优先读哪篇 第一组对照应固定什么
H3 生成太慢 Video DeltaNet 分辨率、时长、步数与 GPU 数,先比较 backbone 再比较整请求
视频量化后闪烁 QuantWM prompt、随机种子、缓存长度,额外看连续帧而不只看总分
低比特模型读长 prompt 很慢 Disaggregated Quantization 同一 decoder,单测 TTFT、SSD 读取与短输入退化
MoE 通信与计算互相等待 Weave token 分布、EP degree、通信拓扑与各基线 SM 配额
长短样本混训利用率差 NSP 真实长度分布、显存预算与有效训练 token 数

做复现记录时,建议在每个数字旁边加一列计量对象:全局 KV 还是整机显存、DiT 去噪还是完整请求、单层 kernel 还是端到端吞吐。下次换模型或硬件,才有能对得上的基线。

配套阅读:AIGC 开源一周:9/16—9/22。