本期覆盖 2026/9/16—9/22,按 arXiv 首次提交的 UTC 日期收录,共 16 篇。9 月 16 日与上期重叠,已介绍的论文不再重复。
DeepSeek-V4.1 把全局 KV 与滑动窗口状态分开管理;分阶段量化让 prefill 和 decode 使用不同的计算格式,甚至不同的权重;Video DeltaNet 则把 H3 的局部细节与远距离联系交给两条注意力分支。本周几项主要工作都在追问:过去统一处理的部分,是否值得拆开设计?
几项视频生成工作给出了很大的加速倍数。数字确实醒目,但其中往往同时包含了少步蒸馏、稀疏化、低精度和内核优化。下面会把这些收益拆开,避免将整套新模型的速度当成某个算子的提升。
一、热门模型:缓存省在哪里,多模态能力又落在哪里
1. DeepSeek-V4.1-Flash:全局 KV 跨层复用,局部状态按需重算
DeepSeek-V4.1-Flash 技术报告于 9 月 17 日提交。模型采用 Causal Encoder-Decoder 架构,backbone 参数量为 552B,prefill 与 decode 每 token 激活参数分别为 8B、16B。它原生接收多模态输入,支持百万 token 上下文。
缓存变化主要来自 CSA2。层被静态分成 Full、Reindex、Reuse 三类:Full 生成全局 KV 并选择索引;Reindex 复用前层 KV,用自己的 Query 重新选 Top-K;Reuse 连 Top-K 索引一起复用。各层仍保留自己的全局 Query 和局部滑动窗口状态。这样减少的是重复存储,不是简单地把所有层共用一套 Attention 输出。
配合 FP4 全局 KV,报告给出的常驻 HBM 全局缓存为 890 bytes/token,约为 DeepSeek-V4-Flash 的四分之一。另一个数字——持久化缓存降至约八分之一——来自 SWA Bounded Replay:恢复会话时,只重放有限的近期 token,近似恢复局部状态,少存一部分本来需要落盘或放在主机内存中的 KV。
两种比例对应不同存储层,不能相乘,也不代表整机显存缩小八倍。Bounded Replay 还引入了近似恢复;作者明确保留了极端长上下文检索和缓存恢复边界上的可靠性问题。部署时应把“首次计算”和“恢复旧会话”分别测一遍。
2. Qwen3.8-Omni:从看懂音视频,走向完成一段工作
9 月 22 日的 Qwen3.8-Omni 报告介绍 Qwen3.8-Omni-Flash。它继承 Qwen3.8-Next 的稀疏 MoE,扩展到百万 token 上下文,通过原生多模态联合训练,将文本中的工具使用与任务执行能力迁移到音频、视频场景。
报告关注的不只有识别、问答,还包括长音视频翻译、剪辑、视频笔记和依据音乐制作视频等持续任务。这类任务需要反复读取素材、调用工具、保存中间结果;一次多模态回答得分较高,并不足以证明整条工作流可靠。
相应地,作者同时给出 Qwen-MM-Plugins 和 Qwen-Live-Harness。前者为代理补充多模态工具,后者负责实时交互、记忆和后台任务委派。研究上的可观察变化,是模型评测开始与外部执行系统一起出现。
目前可确认的开放内容是两个工具框架的源码,Live Harness 通过云端 API 调用模型。本期未将 Qwen3.8-Omni-Flash 列为开放权重模型。
来源:论文、Qwen-MM-Plugins、Qwen-Live-Harness。
二、视频与图像:先改变计算,再检查画面失去了什么
3. Video DeltaNet:H3 保留局部 Softmax,远处信息放进线性记忆
Video DeltaNet(9 月 17 日)在 MiniMax-H3 上使用混合注意力:局部 Softmax 保留细粒度交互,双向线性记忆承担较远的时空联系。线性分支按帧更新,一次共同处理该帧的空间 token;两条分支各有输出投影,再通过可学习的 gate 合并。
改动主要作用于视频与视频之间的注意力,涉及文本、音频的交互仍保留 Softmax。模型不是直接把现成 H3 的 Attention 换个 kernel:它先逐层对齐,再联合校正混合分支,随后加入 LoRA,最后做少步蒸馏。
速度可以分成两层看。对同一段约 14.3 秒、768p 视频,单次完整 backbone 前向在单张 B200 上从 16.0 秒降至 6.2 秒,约 2.6 倍;再叠加八步蒸馏与八卡推理,论文的 DiT 去噪耗时为 6.70 秒,相对同卡数的 50 步 dense H3 为 14.5 倍。
项目 README 的部署口径另列约 6.9 秒去噪、9.0 秒端到端,完整请求仍包含其他阶段。质量评估使用固定的 103 组提示词,八步模型在所报指标上接近 50 步 dense H3;复杂动作、参考图等自己的常用条件,仍值得保留单独的对照样例。
4. SparkDiffusion:极高稀疏率下,训练损失下降未必换来好视频
SparkDiffusion(9 月 19 日)研究一个容易误判的现象:Attention 已经非常稀疏时,单个去噪步骤的训练损失还在下降,最终生成质量却可能不再改善。作者把主要问题定位到高噪声阶段的结构误差,以及逐步训练目标与最终视频分布之间的不一致。
方法先做短暂的稀疏结构适配,再通过混合轨迹的少步蒸馏修正终端分布,部署端叠加 FP8 和融合内核。论文覆盖 Wan2.1、Wan2.2 的文生视频和图生视频,在部分长序列 720p 配置上使用 97% Attention 稀疏率。
标题中的 265 倍来自单张 RTX 5090 上 Wan2.1-T2V-14B-720P 的端到端对比:新方案是三步、无 CFG;基线为 BF16、50 步、带 CFG,每步两次模型调用,共 100 次。少步、稀疏和 FP8 的收益叠加在一起,相同步数下的 Attention 加速要另看消融。摘要里另一个 1.3 秒去噪结果属于 1.3B、480p 的配置,也不能与前者拼成同一组成绩。
这篇论文更值得借鉴的是训练顺序。若高稀疏模型一直“loss 很好、画面一般”,延长原来的逐步训练可能只是继续优化不合适的目标。
来源:SparkDiffusion。
5. QuantWM:2-bit KV 的误差,要看它把注意力引向了哪里
QuantWM(9 月 22 日)从视频闪烁入手。作者发现,低比特 KV 在 VBench 等汇总指标上可以看起来接近原模型,实际视频却有明显的时序抖动;Key 的重建误差有时小于 Value,造成的画面损伤反而更大。
原因在于 Key 误差会改变 QK 的结果,使 Query 选择不同的时空位置。方法因此不只最小化缓存张量的重建误差:QSAC 利用历史 Query 的敏感方向和残差范围选择量化中心;PSAC 则在主要 Query 子空间中,用低秩项补偿剩余 Key 误差对 Attention logits 的影响。
这是无需训练、严格因果的缓存量化方案。测试覆盖 Causal-Forcing、LingBot-World-v2、HY-World 1.5、Matrix-Game-2 和 LongCat-Video,论文报告最高 6.20 倍 KV 缓存压缩。这个比例对应缓存,不是模型权重或全流水线峰值显存;补偿所需的状态与计算也必须计入实现成本。
据此设计自己的量化测试时,可以增加固定镜头、缓慢运动、主体遮挡后重现等连续性样例。这是本文的测试建议:仅检查单帧观感或综合分数,容易漏掉“每帧都还行,连起来却在跳”的问题。
来源:QuantWM。
6. PixelDiT2:不用 VAE,也要给像素扩散一个表示先验
PixelDiT2(9 月 21 日)继续做像素空间扩散。它没有引入用于压缩、重建图像的 autoencoder,而是用冻结的视觉基础模型提供逐 patch 的表示指导,让生成网络少承担一部分“从 RGB 中同时学表示和学去噪”的负担。
这里的区别很细:不用 latent bottleneck,不意味着不借助预训练表示。PixelDiT2 把表示学习的指导与实际像素生成分开,保留端到端像素输出。
作者在 ImageNet 上报告:256×256、600 epochs 的 FID 为 1.46;512×512、680 epochs 为 1.48。这组结果说明表示指导能改善指定设置下的像素生成。开放域文生图、图像编辑和推理延迟,则需要另外的对照,当前证据还不足以决定是否替换一条现有的 latent diffusion 流水线。
来源:PixelDiT2。
7. The Weight Is Over:先缩小文本编码器,再谈桌面端实时出图
这篇 9 月 18 日的工作围绕 FLUX.2-klein,组合了小文本编码器、embedding translator、量化与权重流式加载。translator 将 0.6B 编码器的表示映射到原 4B 编码器的空间,减少常驻权重;随后再按显存预算决定多少 denoiser 权重留在设备上。
论文的桌面编辑器使用 ONNX Runtime 的 TensorRT-RTX provider。RTX PRO 6000 Blackwell Workstation Edition 上,1024×1024、四步、NVFP4 配置报告约 0.27 秒完整生成、102 毫秒首图、5.7GB 峰值显存。首图指编码加一次去噪和 VAE decode,不是四步全部结束。
换到 12GB RTX 4070 Ti,0.6B 编码器加 translator、半驻留权重的例子约需三秒。更小的显存下,避开分页比追求全部权重驻留更划算;显存足够时则相反,流式加载可能只增加等待。两种硬件恰好说明了优化顺序为何不同。
三、低比特推理:prefill、decode 与各个 head 不必一刀切
8. Disaggregated Quantization:保留低比特 decoder,单独训练 prefiller
9 月 22 日的 Disaggregated Quantization 将阶段差异放到量化设计的中心。prefill 处理大量 prompt token,适合直接使用低精度矩阵运算;低并发 decode 更受权重带宽影响,紧凑的 weight-only 格式可能更合适。两阶段未必需要同一种激活精度,更不必始终使用同一份量化权重。
作者进一步冻结现成的 GGUF decoder,单独训练 NVFP4 prefiller,修复低比特 prompt processing 给后续生成留下的误差。在 Qwen3.8-27B 的 IQ1_S 配置上,相对论文对应的 weight-only 基线,MMLU-Pro、MMMU-Pro 分别提升 32.5、35.3 个百分点。这不是未经训练的格式替换,也不是所有量化位宽都有如此大的提升。
额外的 prefiller 权重需要存放。ODP 将它们留在 SSD,逐层加载,并借用 prefill 期间暂时不用的 decode 权重缓冲区。DGX Spark 上的定制 llama.cpp 路径,在 8K prompt 下报告 1.78 倍 TTFT 加速;较长输入提供了更多计算时间来覆盖读取,短输入则可能在等 SSD。
因此,“不增加设备上的权重驻留”与“不增加任何开销”不同:仍需额外磁盘 checkpoint、加载流量、校准或训练,以及经过修改的运行时。它适合拿来研究阶段专用精度,不宜理解为给任意 GGUF 文件加一个开关就能复现。
来源:论文、训练与评测代码、llama.cpp 实验分支。
9. KV-COBRA:同样的缓存预算,head 之间怎样分更划算
KV-COBRA(9 月 21 日)把低秩截断和标量量化放在同一个分配问题里。不同 Attention head 的信息结构不同:有的值得保留更多维度、接受较低精度;有的适合少留几个方向、给保留下来的值更多 bit。统一 rank、统一 bit-width 会浪费这部分差异。
方法先估计每个 head 内截断与量化的失真,再跨 head 分配预算;结合 Hadamard 旋转平衡通道方差,并用 Attention KL 的重要性重排 SVD 基,使分配考虑 Query 的影响。它也支持 K、V 联合分配。
论文比较 0.5—4 bits per dimension 的困惑度、零样本与长上下文表现。这里的 bpd 是压缩后的平均预算,不表示硬件能直接执行“0.5-bit Attention”。作者所说没有逐 token 分配开销,也不意味着整个缓存读写、投影和解压路径零成本。要判断服务价值,仍需看压缩布局如何接入真实 Attention kernel。
来源:KV-COBRA。
10. SpecQuant:用同一模型的多种精度做起草与路由
SpecQuant(9 月 18 日)从同一个基础模型派生 INT4、FP8、FP16 版本,按问题复杂度选择路径,并结合推测解码。它希望避免另训一个架构不同的 draft model,也让简单问题不必总走最昂贵的路径。
报告基于 Qwen2.5 系列,在 MMLU、AlpacaEval、GSM8K 上给出 35%—43% 的加速,并允许小幅准确率变化。阅读时要特别分开两件事:经过目标模型严格验证的推测采样,以及直接把请求交给较低精度模型的自适应路由。后者会改变回答来源,不能因为两者出现在同一框架里,就把整体方法称为“无损推测解码”。
复现时还需要补齐多份权重的实际存储、切换开销、路由错误和目标模型调用比例。对显存紧张的本地设备,这几项可能比平均加速更早决定方案是否可用。
来源:SpecQuant。
四、系统与训练:路由结果、序列长度和机器拓扑都在变化
11. Weave:MoE 的通信 SM 数量,可以等路由完成后再定
Weave(9 月 18 日)针对 EP 推理的 dispatch、专家计算和 combine。固定留一组 SM 做通信的方案有个问题:不同层、不同 GPU 实际接到的 token 数不同,同一个 SM 划分未必同时适合它们。
路由结束后,本层通信量与计算量已经可估。Weave 将轻量成本模型放入 persistent megakernel,按层、按 GPU 决定通信和计算的 SM 比例;时间调度器再组织分块流水,减少数据依赖造成的空闲。
在 4×H100 SXM、单机 NVLink、EP=4 的范围内,论文对六种 MoE 模型与五种基线给出几何平均 2.89 倍 MoE 层加速、1.33 倍端到端加速。两者差距说明非 MoE 部分仍占用大量时间。
作者明确把更多 GPU 和跨节点扩展留作后续工作。不能把这里的 NVLink 带宽、同步成本和动态划分结果原样搬到多机 RDMA;但“等 routing 结果出来再分 SM”值得与固定配额做同形状对照。
来源:Weave。
12. NSP:长序列多分卡,短序列少通信,GPU 组还可以嵌套
NSP(9 月 19 日)讨论长尾长度数据上的 sequence parallelism。统一使用较大的 SP degree,会让数量众多的短样本承担不必要的通信;统一使用较小的 degree,又容易让少数长样本拖慢整个迭代。
不同于把 GPU 切成互不重叠的组,NSP 在同一迭代内嵌套不同大小的 SP group。树状规划器在显存约束下安排序列,执行端沿层级组织计算流和重计算,将负载均衡目标从“每组差不多”细化到每张 GPU。
摘要报告在最长 384K 的 Qwen3-MoE 长尾工作负载上,相对 Static SP 最高提升 1.48 倍,相对 FlexSP 最高提升 1.16 倍。这里保留摘要的比较范围,不补猜未核实的集群配置。对工程测试,先确认真实数据的长度分布比直接追最高倍数更重要;整齐定长 batch 未必有同样收益。
来源:NSP 论文与摘要。
13. HyperParallel-FSDP:分片语义放在哪一层,会影响训练成本
HyperParallel-FSDP(9 月 18 日)面向 Ascend SuperPoD,尝试把分布式张量的布局解析放在 autograd 之上的 API 边界。生产模式减少稳态逐算子分派,验证模式则保留元数据传播、快速失败检查和梯度等价测试。
它还针对超节点内外链路差异调整 FSDP 通信,并从张量布局推导 Muon 的通信组,避免重复做整矩阵正交化。系统设计围绕实际拓扑展开,不能只归结为“另一个 FSDP 实现”。
报告在 Atlas 900 A3 上扩展至 384 cards、768 ranks;505B MoE 的所报吞吐为 421k tokens/s。论文还给出相对 FSDP2、Megatron DDP 的平均步时下降,但比较绑定其模型、软件栈与硬件。这里不把昇腾上的结果换算成 H100、B300 的预期收益。
迁移这套方法之前,值得先读它的分项实验:布局解析、通信流水与 Muon 处理的是不同成本,最终 tokens/s 会把它们混在一起。
14. DSec:Agent 训练的 GPU 之外,还有成千上万的有状态环境
DeepSeek Elastic Compute 报告于 9 月 19 日提交。它将 FnCall、容器、microVM、完整虚拟机接入统一 SDK,处理大批沙箱的创建、放置、镜像读取和资源回收。
Agent rollout 会修改文件、安装依赖、执行命令,这些状态不能随着 GPU 训练被抢占就随意丢掉。DSec 因而把有状态的执行环境与可抢占的训练计算解耦,结合 3FS 按需读取镜像,并与 RL 框架协调环境生命周期。
报告列出约 160 节点的生产单元、每日约 300 万沙箱等运行规模。这些是作者生产系统的经验数据,不是下载一个单机程序就能得到的性能。论文链接中的 3FS 等公开组件,也不能据此视为整个 DSec 已经完整开源。
对正在搭 Agent 训练平台的人,这篇提醒了几个经常漏算的成本:环境启动尾延迟、低复用率镜像的分发、闲置沙箱的内存,以及保留 rollout 状态时的资源回收策略。
来源:DSec。
五、线性注意力:保留效率,尝试不同的表达能力
15. Complex KDA:通过 gate 与更新范围,增加状态旋转能力
Complex KDA(9 月 21 日)研究 Kimi Delta Attention 的表达能力。作者允许通道 gate 取负值,将范围扩到 [-1, 1],同时允许 delta-rule 系数 β 取 [0, 2];两项扩展配合,使单次更新可以表达二维旋转。
更新仍保持 diagonal-plus-rank-one 结构,不需要通过增加一次完整 delta transition 来获得相同类型的旋转。论文给出了稳定性与状态追踪能力的理论分析,并测试有限群状态追踪、周期音频延续和语言建模。
状态追踪和长度外推是论文较鲜明的收益;语言建模结果则与 KDA 基线接近。代码来自独立研究项目,并非 Kimi K3 的官方架构更新。
16. dQwen3.5:带循环层的混合骨干,也可以适配扩散语言模型
dQwen3.5(9 月 17 日)将 Qwen3.5 的 0.8B、2B、4B、9B 变体适配为 diffusion language model。难点不只是改变 Attention mask:混合架构中的循环层本来带有因果方向,双向建模需要单独处理。
论文发现,相对其 full-attention 对照,混合骨干达到同一训练 loss 所需 token 约减半,并表现出任意顺序解码和并行解码能力。这首先是适配效率和模型行为的结果,不能直接读作每秒生成速度翻倍。
如果手头已有混合架构预训练模型,这项工作提供了一条不必先退回全 Attention 骨干的研究路线。实际延迟仍要把采样迭代数、并行接受策略、缓存复用和 batch 大小放在一起测试。
来源:dQwen3.5。
本周可以优先复现什么
| 手头的问题 | 优先读哪篇 | 第一组对照应固定什么 |
|---|---|---|
| H3 生成太慢 | Video DeltaNet | 分辨率、时长、步数与 GPU 数,先比较 backbone 再比较整请求 |
| 视频量化后闪烁 | QuantWM | prompt、随机种子、缓存长度,额外看连续帧而不只看总分 |
| 低比特模型读长 prompt 很慢 | Disaggregated Quantization | 同一 decoder,单测 TTFT、SSD 读取与短输入退化 |
| MoE 通信与计算互相等待 | Weave | token 分布、EP degree、通信拓扑与各基线 SM 配额 |
| 长短样本混训利用率差 | NSP | 真实长度分布、显存预算与有效训练 token 数 |
做复现记录时,建议在每个数字旁边加一列计量对象:全局 KV 还是整机显存、DiT 去噪还是完整请求、单层 kernel 还是端到端吞吐。下次换模型或硬件,才有能对得上的基线。
配套阅读:AIGC 开源一周:9/16—9/22。