本期窗口:2026/9/3—9/9;资料截止北京时间 9 月 9 日 10:20。 论文按 arXiv 首次提交日期核对,使用 UTC 日期归档;因此不包含截止时间之后公开的资料,也不把 9 月列表中的 8 月论文当成本周新作。
本周最值得细读的几项工作,都在追问一个具体问题:我们以为可以省掉的计算、精度和状态,究竟承担了什么功能?
FP4 Attention 已经给出很好的局部吞吐,但训练中的概率矩阵未必能一起降到 4 bit;MoE 少激活一半专家后,输出变差的一部分原因竟来自归一化;视频量化损失的细节,也可能在去噪后半程被 CFG 继续放大。这些细节比一个总的加速倍数更有参考价值。
本期选了 16 篇论文。前半部分讲 Attention、MoE 和缓存,后半部分讲训练系统、图像与视频生成。涉及开源状态的地方另查了项目仓库,论文中的发布承诺不等同于代码已经齐备。
一、FP4 与 MoE:先弄清省掉的是什么
1. FP4 FlashAttention-4:前向快了,训练还要分开看
《Hardware-Aware FP4 FlashAttention-4》(9 月 3 日)研究的是 Blackwell 上的 Attention 执行路径。矩阵乘法使用 FP4 Tensor Core 后,softmax 的转换和片上依赖会占据更大比例,不能只把两次 GEMM 换成低精度就期待线性提速。
作者的 Direct-P 路径直接把分数转换为 FP4 概率,用于非因果推理;在 GB200 上,报告最高达到 BF16 前向吞吐的 2.13 倍。因果训练则保存量化后的 Q、K,在反向重建概率,并使用 FP8 梯度操作数;完整单卡 8B 模型更新的最高加速是 1.14 倍。一个是 Attention 前向吞吐,一个是模型更新,不能放进同一张不加说明的速度排行榜。
更重要的是失败结果:匹配的分布式训练保留了 FP8 概率与 V;作者测试的 MXFP4 概率/V 训练轨迹均出现发散。投影层可以接受的精度,到了 softmax 后未必仍然合适。这个负面结果限定了当前方案的使用范围,也比笼统讨论“FP4 能否训练”更具体。
如果准备研究实现,值得沿着 QK → softmax/量化 → PV → backward 看精度在哪一步改变,再看保存了哪些中间量。把所有这些统称为“FP4 Attention”,会漏掉论文最关键的取舍。
来源:论文与全文。
2. Qwen 专家减半:Top-k 改动还会改变专家分支的幅度
《Training-Free Halving of Activated Experts in Fine-Grained Mixture-of-Experts Models》(9 月 4 日)给出了一个很小、但值得试验的改动:选择哪些专家参与计算,与用哪些路由概率做归一化,分开决定。
普通做法是选出 top-k,再把这 k 个专家的概率归一化。推理时缩小 k,既删除了一部分专家,又改变了保留专家的输出权重。论文用 k1 决定实际执行的专家数,用 top-k2 的概率总和作为归一化参考;增加的是一个整数设置,不需要新增可训练参数。
在 Qwen3.6-35B-A3B 上,从 8 个激活专家减到 4 个,常规归一化的 MMLU 下降 4.65 个点,使用 k2=16 后下降 0.35 个点。Qwen3.5-397B-A17B 从 10 个减到 5 个,也报告了选择适当参考集合后仅下降 0.55 个点的结果。
这里减半的是 routed-expert 计算,不是整个模型延迟。Attention、共享专家、通信与调度仍然存在。论文还发现,困惑度与下游准确率偏好的 k2 不一致:仅凭一段无标签文本选配置,可能得到一个 perplexity 看起来不错、实际任务却退步的设置。
来源:论文。
3. ACE:不只看 router 给了多少分,还估计专家能输出什么
同为 9 月 4 日的 ACE 也做专家跳过,但选择依据不同。Router 概率只能表示路由偏好,不能直接代表专家变换对结果的贡献。ACE 为每个专家预先计算两类统计:一类结合 gate、up、down 投影与 RMSNorm 缩放,估计整体变换能力;另一类从中心化的 router 权重提取方向原型,估计路由偏好方向上的响应。
推理时把这些统计与当前 token 的路由权重组合,只有两种估计都认为贡献较小时才跳过,并始终保留 top-1 专家。在线路径主要是查表和标量运算,不要求校准数据、再训练或改写 checkpoint。
作者在三个 MoE 模型、八个基准上评估。以 Qwen3.6-35B-A3B 的 50% 跳过率为例,相比其最强对照方法,WikiText-2 困惑度降低 7.96%,平均下游准确率提高 4.15 个百分点。这个比较对象是其他压缩方法,不是未压缩原模型。
ACE 与上一项可以一起读:前者改“哪些专家可以省”,后者改“省掉以后如何加权”。两项实验各自成立,并不表示把它们叠起来就能保留各自全部收益。
来源:ACE 论文。
4. Cache-Aware Router:把专家权重搬运算进优化目标
《Cache-Aware Joint Router Adaptation for Memory-Efficient MoE Inference》(9 月 4 日)针对权重无法全部放进显存的部署。此时 token 虽只调用少量专家,decode 却可能反复等待专家权重从主机搬到 GPU。
Temporal Router 预测同一层专家后续会不会复用,据此保留缓存,不主动加载;Spatio-Temporal Router 再利用因果前驱的隐藏状态,在访问目标层之前调整缓存。模型原有的 Top-K 专家选择规则仍保留,辅助路由器负责帮助管理驻留。
在 Qwen3 的三个任务上,完整方法相对作者评估的最强预取基线,专家权重流量减少 4.6%—53.3%;GPT-OSS 的结果则随任务变化。它需要联合后训练,不属于前两篇那种拿到 checkpoint 就可直接试的免训练压缩。
评估这类工作时,缓存命中率之外还应看主动预取多搬了多少无用数据。高命中不必然意味着低流量,低流量也不必然变成同等比例的端到端提速。
来源:论文。
二、缓存与混合架构:留下什么,决定模型还能做什么
5. BeaconKV:长推理会回头看,最近的 Query 未必能预测它
BeaconKV(9 月 4 日)针对长思维链中的一种常见动作:推理走了很远之后,重新查看早先的计划或条件。只使用最近几个 Query 判断 KV 重要性,容易提前清掉这些暂时不热、随后却会用到的内容。
论文发现,触发回看的 Query 能聚成少量相似组,于是用代表性的 beacon queries 保留这种访问偏好。它们是压缩后的查询代表,不是保存全部 Query 历史。方法无需训练,目标是让驱逐决策少依赖眼前的一小段注意力。
作者测试了 DeepSeek-R1 蒸馏模型和 Qwen3 等四个推理模型,报告最高 5.8 倍内存缩减、超过 4.3 倍吞吐提升。但与其他压缩方法同预算比较时,主要优势更接近“保住质量”:附录中 Qwen3-4B、1K KV 预算、batch 320 的实验,BeaconKV 的吞吐约 1346 token/s,略低于 SnapKV 的约 1381 token/s,LiveCodeBench 准确率却从 30.9% 提高到 42.2%。
同预算下多花一点时间,换回明显更好的任务准确率,才是这组对照最直接的意义。部署长推理服务时,应先确定能接受的质量损失,再选择缓存预算。
来源:论文及附录 Table 5。
6. VestigeKV:缩小参与 Attention 的集合,不等于释放同样多的显存
VestigeKV(9 月 3 日)在 Kimi Linear 的 NoPE-MLA 中寻找不依赖未来 Query 的驱逐信号。作者发现,缓存里一条 64 维的解耦分支可以充当显著性线索,只读取每行约 11% 的内容就能排序。
被选中的行留在参与 Attention 的层级,其余行移入精确保留的归档,满足触发条件时再召回。论文报告了较强的 needle retrieval 结果,但其默认归档仍在 GPU 上。所谓 attended tier 缩小 32 倍,不能直接写成总 KV 显存缩小 32 倍;真正回收这部分显存,需要另看 host-offload 变体。
适用结构也很窄。同一算子放到带 RoPE 的 MLA 上效果明显恶化。论文提到 Kimi K3 的潜在适配可能,但没有提供该模型上的实测,不能替换成“已经支持 Kimi K3”。
这项工作适合看 NoPE 训练如何重新利用已有分支,也提醒我们在读 cache 压缩结果时,把“参与计算的工作集”“完整存储量”“传输量”分别列出来。
来源:论文。
7. Qwen3.5 与 Falcon-H1:Attention 负责找回内容,递归状态影响回答方式
《What Attention Recalls and Recurrence Controls in Hybrid Language Models》(9 月 3 日)没有提出新内核,而是做了两个直接的干预实验。Split-prefill 在读完上下文后,只保留 KV 或只保留 recurrent state;state-swap 则把上下文 A 的 KV 与上下文 B 的递归状态组合起来。
实验模型是 Qwen3.5-4B 与 Falcon-H1-3B-Instruct。作者观察到,精确检索主要依赖 Attention;输出语言和 persona 的保留则更依赖递归状态。交换实验中,回答值跟随 KV 一侧,语言跟随递归状态一侧。
这些结果支持两种状态存在功能分工,但仍是特定模型和任务的干预证据,不是所有混合模型都遵循的硬规则。对 serving 的启发很实际:缓存恢复测试不能只检查 needle retrieval,还要测试语言、指令和角色约束是否保持。数值上“差一点”的 state,可能改变的不是记住了哪个词,而是整段回答的行为。
8. Prefix Cache 与量化:固定 seed 仍不足以复现 Agent 轨迹
《Same Request, Different Answer》(9 月 4 日)把请求顺序、模型、解码参数和 seed 固定,串行执行 batch=1 的多轮工具调用任务,再比较缓存开关。80 个 episode 的实验中,开启缓存后,16-bit 配置有 36.2% 的轨迹变化,4-bit 配置达到 75.0%。
论文进一步恢复缓存状态,发现 cached 路径和 recompute 路径可以各自复现,却仍彼此不同。换句话说,缓存状态也是执行条件的一部分,仅保存用户请求并不足以完整描述一次运行。
这里必须补上版本:实验使用 llama.cpp b10434 和 vLLM 0.11.0 等冻结环境,并不是对本周最新版 vLLM、SGLang 的统一测试;SGLang 未进入最终采集。轨迹变化率也不是任务失败率,论文的单轮实验没有观察到整体准确率随之改变。
如果正在排查量化 Agent 的偶发差异,建议在复现记录中增加缓存清空方式、命中情况、请求顺序和服务版本,再讨论采样随机性。仅把 temperature 设为 0,通常还不够描述问题。
三、训练系统:减少重复计算和重复传输
9. LeanGRPO:扩散 RL 的 rollout,能否直接用于反向?
LeanGRPO(9 月 3 日)注意到,FlowGRPO、DanceGRPO 一类流程先生成轨迹,再对选中的时间步重新前向以建立梯度。在 rollout 与 update 使用相同后端、参数尚未更新的 on-policy 单次更新条件下,这部分重算存在冗余。
它提供两种调度。Retain 在 rollout 时保留计算图和激活,update 直接反向,省计算但占显存;Reweight 对选中的步先用临时 advantage 反向,并延后梯度同步,轨迹结束获得真实 advantage 后再修正梯度,以减少激活长期驻留。
论文在 FLUX.1-dev、SD3.5、Wan 以及不同扩散 RL 流程中评估,最高端到端加速为 1.83 倍。这个最高值不是每个 Wan 配置都能达到,Retain 与 Reweight 的显存—时间取舍也不同。
移植前需要核对参数版本、log-prob 定义、裁剪项与同步时机。若 rollout 和 update 已经异步解耦,或者一批轨迹要反复做多轮更新,不能直接套用“无需重算”的推导。
来源:论文与训练调度推导。
10. CIERA:权重的指数没变,就不必每轮重传
CIERA(9 月 4 日)优化分片 MoE 训练中的权重 AllGather。作者观察到,训练 warmup 后,许多权重的浮点指数跨迭代保持不变。接收端缓存指数,指数未变化时只传符号和尾数,变化时补足重建信息,从而精确恢复原权重。
不过编码本身也花时间。CIERA 按参数块判断压缩是否划算,再把压缩、通信与计算重叠。它报告的收益包含这些系统安排,不应全部归因于少传几个 bit。
作者在 OLMoE-1B-7B、两节点共 16 张 A100-80GB 上报告,相对 ZeRO-3 的加速为 3.70 倍;节点间使用 200 Gbps HDR InfiniBand。128 GPU 的数字来自 trace-driven 模拟,正文将超过 16 卡的结果标为外推,并说明方法在 dense LLM 上的收益会显著收窄。
“无损”在这里指权重重建逐 bit 一致。它不自动保证改变执行调度后,整个训练过程每一步都逐 bit 相同。要复现其加速,需保留模型规模、分片策略和 gather/release 调度等条件。
来源:论文,尤其实验设置与局限性。
11. Einsummable:从张量分解推导多卡执行计划
《Every Kernel Is a Join》(9 月 3 日)尝试绕开“先挑 TP、DP 或某种预设策略”的入口。它把算子表述为张量关系上的 join 与 aggregation,让每个算子暴露可用分解,再跨整个计算选择通信代价较低的组合。
编译器随后生成拓扑感知的 exchange 程序,通信与聚合由计划推导,而不是直接调用一组预制 collective。这是一个自动并行原型:用户提交类似 PyTorch 的计算描述,无需手写设备分配和分片注解。
作者在 8 张 A100 上测试 LLaMA Transformer blocks,报告几何平均运行时间 8.97 ms,手调 PyTorch 与 vLLM 对照分别为 13.80 ms、15.90 ms。这里是 block 计算基准,不能推导成完整在线服务也领先相同比例;请求调度、KV 管理与动态形状是另一组问题。
值得借鉴的是优化视角:当既有并行模板限制了搜索空间,可以从算子的分解与数据交换重新推导方案。但生产系统需要的功能覆盖和调试能力,仍要与局部执行性能一起评估。
来源:论文。
四、图像与视频:低比特、少步数之外的细节
12. LLaDA-Image:先学习视觉先验,再接上生成与编辑
LLaDA-Image 论文于 9 月 3 日提交。它把从头训练的 6B DiT 与基于 LLaDA2.0-Mini 的冻结视觉语言理解模块结合,并没有一开始就依赖大量图文配对训练。
训练先使用纯图像建立视觉先验,之后逐步引入语言监督、分辨率提升与编辑任务。论文所述生成训练累计样本约 2.2 亿,其中 98% 为真实图像,超过 90% 用于纯图像训练;这不是宣布发布了一个 2.2 亿张可下载的数据集。DiT 使用无可训练参数的 RMSNorm,并配合 Muon 优化。
模型报告了中文、英文图像生成与编辑能力,Turbo 路径把采样降到 2—4 步。实际仓库推荐 Base 50 步、Turbo 4 步,并提供各自的 BF16、FP8 权重入口。
需要注意论文与仓库的差别:截至本期截稿,官方已经发布推理代码和权重,但训练代码仍标为 coming soon。“训练方案公开”与“完整训练基础设施可复现”还不是同一件事。开源一周会继续展开安装和社区适配状态。
13. DSAQuant:Wan 量化后丢掉的纹理,要沿去噪阶段找原因
DSAQuant(9 月 3 日)研究视频量化中一个很直观的症状:大体构图、运动和文本语义还在,纹理、锐度却明显变差。作者把原因定位到不同去噪阶段承担的任务并不一致。
方法同时改训练和推理。训练前期保留 teacher 蒸馏来稳定结构规划,中后期逐渐转向目标驱动的细节恢复;推理末段关闭 CFG,避免 guidance 放大量化误差形成的高频伪影。它属于量化感知训练,而不是任意 checkpoint 的免训练转换工具。
实验覆盖 Wan2.1、Wan2.2、CogVideoX 的多个规模,在 W4A4 与 W3A3 下比较质量。相对 QVGen,激进 W3A3 设置的 VBench 平均分最高改善 6.60。这个数字是质量分数差,不是视频生成提速 6.6 倍。
官方部署仓库则聚焦 Wan 的 packed W4A4 推理,包含动态 A4、W4 权重、融合 QKV 和 CUDA 内核;论文的 W3A3 实验范围比当前部署入口更宽。读者若准备上手,先分清正在复现论文质量实验,还是在跑仓库给出的 W4A4 快速路径。
14. SVDtrunc:步数已经很少,还能不能把 DiT 本身缩小?
《Importance-Aware Low-Rank Distillation of Diffusion Transformers》(9 月 4 日)研究 FLUX 的低秩压缩。作者发现,DiT 对截断 SVD 的退化相对平滑,冗余分散在网络各处的投影矩阵中,不只是少数可删除的 block。
SVDtrunc 先按全局参数预算分配各 block 的 rank,对较不重要部分进行截断,再以模块化知识蒸馏和 rectified-flow 目标微调整个网络。与简单统一 rank 相比,它把有限的参数预算留给更敏感的位置。
作者在 GenEval、HPSv2、DPG 上报告,保留原参数量的 68% 时仍接近完整模型表现,57% 时仍具竞争力。注意是“保留 68%”,不是“压缩掉 68%”。少参数也未必按比例省时间,低秩矩阵的实际尺寸与内核效率会影响收益。
它与少步蒸馏压缩的是两个不同维度:一个减少每次前向的工作量,一个减少前向次数。论文展示了二者的结合潜力,但部署时仍需分别记录质量与延迟,不能仅把两个压缩比例相乘。
15. FlashRender:先稳定相机控制,再减少采样步数
FlashRender(9 月 3 日)做的是给已有视频换一条相机轨迹的生成式重渲染。它发现,少步采样的问题不只在画质:同一相机控制在不同步数下会产生不一致结果。
方法先用 RETA,把源视频内部表示与冻结几何模型提供的目标视频特征对齐,让几何变换进入源视频流;随后在更平直的去噪轨迹上做 MeanFlow 微调,最后通过 on-policy flow map distillation 修正固定少步采样时的自生成误差。
作者报告,在保持视频质量和几何一致性的同时,采样成本降低 25 倍,并改善相机控制。这个口径是 sampling cost,不等于上传视频到下载成片的端到端延迟也缩短 25 倍。
对视频蒸馏来说,这篇的顺序值得关注:若条件控制本身随着步数变化,直接压缩采样过程可能把控制误差一并放大。先解决几何一致性,再压缩轨迹,是与单纯追求更少 NFE 不同的切入点。
来源:论文。
16. DM-Align:把视频偏好对齐和蒸馏放进同一次优化
《Joint Alignment and Distillation for Video Generation via Sample-Guided Distribution Matching》(9 月 3 日)关注视频后训练流程中的先后顺序。先做 RL 再蒸馏成本高,先蒸馏再做 RL 又可能破坏少步模型。
DM-Align 在 distribution matching 梯度之外,构造朝向人类偏好样本的梯度方向。偏好信号可以来自样本对,也可以来自组内探索;两种方向在同一阶段协同优化,减少传统流程中多步奖励评估和 ODE/SDE 转换带来的负担。
论文报告其统一方案优于独立步骤或顺序拼接的对照,但这不意味着任意奖励函数都能直接替换进去。落地时仍需检查偏好数据来源、teacher 的质量上限,以及少步生成是否牺牲运动连贯性。
它与 LeanGRPO 处理的是不同问题:LeanGRPO 尽量不改变既定目标,重排执行以省重算;DM-Align 则重新组织对齐与蒸馏目标。前者更接近训练系统优化,后者需要重新评估模型行为。
来源:论文。
五、把本周的数字放回各自的实验里
| 工作 | 数字对应什么 | 不应扩写成什么 |
|---|---|---|
| FP4 FlashAttention | GB200 非因果前向最高 2.13×;完整单卡更新最高 1.14× | 全模型训练提速 2.13× |
| Qwen 专家减半 | routed-expert 计算减半,保留适当归一化参考 | 服务延迟直接减半 |
| VestigeKV | attended tier 缩小,默认另保留 GPU archive | 总 KV 显存同步缩小 |
| CIERA | 16 卡测量;32—128 卡为模拟外推 | 128 卡真实集群训练验证 |
| DSAQuant | 特定 W3A3 对照下 VBench 平均分提高 6.60 | 6.6× 推理加速或完整 W3A3 部署发布 |
| FlashRender | 采样成本降低 25× | 完整请求端到端快 25× |
如果只选几篇精读,做 GPU 内核可以从 FP4 FlashAttention 开始;做 MoE serving,可以把专家减半、ACE 和 Cache-Aware Router 对照阅读;做视频系统,则优先看 LeanGRPO 与 DSAQuant,分别检查训练重算和量化后半程的误差。
本周与这些论文相邻的实际进展,包括 FastH3 的 VSA 适配、GLM-5.3 的 Hybrid HiSparse、SGLang 0.5.19 和 LLaDA-Image 的权重发布,见同期开源一周。这些进展的发布状态不同,不能仅凭论文标题或模型名字判断是否已能直接部署。