本期收录 2026/9/30—10/6(UTC)首次提交的 16 篇论文。框架版本与代码进展见本期开源一周。
DiT 压缩这周有两个值得一起看的问题:量化前只做旋转,为什么仍然留下很大的异常方向;小模型分别学好了有条件、无条件分支,为什么合成 CFG 后反而失真。CentriQ、分支空间量化和 GFD-OPD 分别给出了不同层面的解释。
视频侧,H3 的稀疏 Attention、Wan 的少步蒸馏与长视频记忆继续推进。系统侧则分成三类工作:搬运专家权重、调度专家通信,以及让训练并行配置适应异构硬件。
图像与视频模型的量化和蒸馏
1 CentriQ 在旋转前移走每个 token 的均值
10 月 5 日。 DiT 的 adaptive layer norm 会给激活加入随条件变化的偏移。直接套用 Hadamard 旋转时,这个均值分量可能集中到一个或少数坐标,继续决定整组数值的量化范围;旋转了,并不意味着异常方向已经消失。
CentriQ 先减去每个 token 的均值,只量化中心化后的残差,再通过线性层输出中的 rank-one 高精度项补回均值贡献。权重侧使用稳健的拟合目标,降低长尾对编码范围的影响。两条路径都不依赖提示词校准集。
论文在 PixArt-Σ、FLUX.1-schnell 和 SANA-1.6B 上评估 W4A4,比较 FID、ImageReward,以及相对高精度输出的 LPIPS、PSNR。这里“精确补回”的是被移走的均值项,残差和权重仍然有量化误差。它提供了一个很具体的排查方向:如果 DiT 旋转量化仍不稳定,先检查条件调制后的 token 均值,而不只是继续增大旋转块。
来源:CentriQ。
2 GCBT 将 CFG 两个分支一起编码
10 月 1 日。 通常的激活量化分别处理 conditional 和 unconditional 分支,但 CFG 最终会对两者做线性组合。两个分支相关性很强,各自的误差小,组合后的误差却未必小,尤其在较大的 guidance scale 下。
这篇工作把匹配的两路激活看作二维信号,先在分支空间做一个 2×2 正交变换,再进行量化。GCBT 根据 guidance 方向与跨分支二阶统计量选择编码基,在论文的等码率噪声近似下可以逐层闭式求解,不需要搜索旋转角或做梯度优化。
它与通道内旋转处理的是不同维度,也依赖成对 CFG 激活的结构。使用 guidance-distilled 单分支模型时,不能直接套用同一解释。复现时应把 guidance scale 作为独立变量,比较最终 guided 输出的误差,而不只测两个分支各自的重建损失。
来源:Joint Branch-Space Transform Coding。
3 GFD-OPD 让小模型直接学习 teacher 的 guided 输出
9 月 30 日。 GFD-OPD 研究 SD3.5、FLUX.2 等扩散模型的大模型到小模型蒸馏。小模型容量有限,两个分支的误差往往无法像同规模模型那样相互抵消;CFG 再放大分支差异,画面就可能偏离 teacher。
它将 teacher 已完成 CFG 合成的速度场作为目标,让 student 的条件分支直接学习这一结果。训练样本仍来自 student 自己生成的轨迹,因此保留了 on-policy 的状态分布;“folding”折叠的是 guidance 组合,不是自动把全部采样步骤压成一步。
论文还提出 Fixed-State KL:在固定的 teacher 轨迹状态和由真实图像加噪得到的状态上比较模型,避免各自在不同轨迹上测出的 KL 难以对齐。对实验设计,这一点和训练方法同样有用。只看 student 自己访问的状态,可能低估它已经偏离 teacher 的程度。
4 MC-Sparse 缓存稀疏选择和丢失的 Attention 贡献
10 月 5 日。 高稀疏率下的误差来自多个环节:token 分组限制了能选择的关系,重要性估计可能选错,被丢弃的关系本身也有贡献。MC-Sparse 将相似 Query 组织成适合 GPU tile 的组,但在 K/V 侧保留逐 token 选择。
它在 anchor 步用精确 Attention 概率产生选择结果,并缓存 Query 分组、K/V 索引和 dense–sparse 输出残差,在后续去噪步复用。这样既减少重复选块,也补偿一部分被舍弃的注意力贡献;代价是额外的元数据和残差缓存。
H3-Base 的 768p 实验使用 8 张 Hopper GPU,其中 7 张以 Ulysses 执行 denoiser,另 1 张负责条件编码和 VAE。在 15% Attention density 下,论文报告相对 FA3 dense 基线 1.80 倍 DiT 去噪加速。计时包含 dense warm-up,不含条件编码与 VAE,不能据此认为完整视频请求也快了 1.80 倍。
来源:MC-Sparse。
5 VDOT++ 放松 teacher 与 student 的逐位置匹配
10 月 2 日。 同一句提示词可以对应多段合理视频,teacher 和 student 的物体位置不必一一相同。若最优传输蒸馏要求所有空间 token 都完整配对,可能把这种合理差异也当作错误。
VDOT++ 使用非对称的 unbalanced optimal transport:不可靠的 student token 可以携带更少匹配质量,同时维持对 teacher token 的覆盖。另一个改动把底层距离换成 L1,使聚合更接近加权中位数,降低遥远匹配目标的牵引。
方法还结合分布匹配与对抗细化,通过顺序反向传播控制训练过程,并探索大 score network 指导小 generator。论文分别在 T2V、I2V 和条件生成上训练四步模型;“统一”指共享训练配方,不是一个 checkpoint 已经包办所有任务。
来源:VDOT++。
6 DuoMatching 用图像 teacher 补充视频的单帧质量
10 月 2 日。 视频 DMD 匹配多帧联合分布,能约束时间关系,但不一定充分利用图像模型的纹理与语义能力。DuoMatching 在原有视频联合匹配上,再加入来自图像 teacher 的帧级边缘分布监督。
两种模型可能使用不同 VAE,不能直接比较 latent。LatentBridge 负责跨潜空间转换;Latent Variation Sampling 将监督分散到不同时间段,避免总在相似帧上重复训练。实验以 Wan 系列为基础,并比较 SDXL、FLUX.2-4B、Qwen-Image 等图像 teacher。
这与简单逐帧美化的区别在训练目标:视频 teacher 继续管跨帧关系,图像 teacher 补足视觉与语义先验。实际评估应把单帧质量和运动指标并列看,不能用更好看的截图替代时间一致性检查。
来源:DuoMatching、项目页。
7 PixelDense 将语义对齐与几何对齐分开
9 月 30 日。 REPA 常用 DINOv2、CLIP 等语义表示加速 DiT 训练。PixelDense 在像素扩散中比较了分割、深度和几何 teacher,发现把所有监督简单相加,并没有胜过最好的单个几何 teacher。
它将 DINOv2、SAM2 放入语义投影支路,将 Depth Anything v2、Metric3D v2 放入几何支路,并用权重空间正交约束减少两类监督争用同一表示子空间。四个 teacher 在训练时冻结,推理时全部移除。
在 PixelGen-XXL 上,GenEval Overall 从 0.7927 升至 0.8093。这里改善的是训练出的模型,而非增加推理时的多模型协作。对于已有表示对齐训练,值得先检查不同 teacher 的梯度是否互相竞争,再决定是否继续堆更多监督源。
来源:PixelDense。
8 Keepsake 根据可替代性管理长视频记忆
10 月 5 日。 相机控制的长视频需要保留过去看见的场景,但保存全部历史会让存储和检索持续增长。只在一帧生成时决定留不留,也忽略了它之后可能被更好的观测替代。
Keepsake 在已有与新生成的观测之间建立 pose–appearance 图,同时看相机姿态和视觉相似度。若一帧有很多近似替代品,保留价值就降低;某个独特视角即使很旧,也可能继续留在固定容量的记忆里。
它只改变持久记忆的更新,不修改生成器、去噪日程和检索规则。在 MemCam 的 180 秒轨迹实验中,记忆预算只有 32 帧,生成历史则达到 5397 帧。这里压缩的是可检索的历史观测,并非把模型内部所有 KV 都压成 32 个 token。
来源:Keepsake。
低比特训练与 MoE 系统
9 QATFactory 将训练时的量化模拟对齐到部署格式
9 月 30 日。 QATFactory 支持 NVFP4、MXFP4 和 llama.cpp 的 Q4_K,覆盖 dense、MoE、全参数与 LoRA 训练。训练阶段模拟目标格式的量化误差,但矩阵乘法仍用 BF16,因此可在 H100 上适配 NVFP4;这不意味着 H100 获得了原生 FP4 Tensor Core。
它把导出后的模型放进 vLLM、llama.cpp 评估,减少训练指标与部署指标之间的脱节。在论文所用评测集合上,Qwen3.5-9B 的 NVFP4 QAD 平均准确率为 68.9%,对应最佳 PTQ 为 65.4%;MXFP4 分别为 66.0% 与 56.4%。
一个值得留意的实验结论是,两种 FP4 格式未必适合相同训练配方:NVFP4 在所测配置中通常更适合只模拟权重量化,MXFP4 则从同时模拟权重与激活量化中获益。目标格式的 scale 和编码方式不同,不能只用“都是四位”决定训练策略。
来源:QATFactory 论文。截至 10 月 8 日,论文所列 QATFactory/QATFactory 仓库返回 404,代码能否公开获取仍待确认。
10 MegaFlux 在计算过程中复制热点专家
9 月 30 日。 MoE megakernel 已经将通信与计算融合,但路由偏斜仍会使少数 GPU 成为拖尾。复制热点专家可以分担负载,却新增了权重传输;训练时还要把副本产生的权重梯度归约回 owner。
MegaFlux 在设备端共同决定副本位置和 tile 对齐的 token 分配,不改变 router 的选择。副本不必等完整权重传完才开始计算,backward 也让副本梯度归约与其他专家计算重叠。
8 张 B200、每个方向 147 组配置中,相对固定专家放置的同类 megakernel,forward 与 backward 几何平均加速分别为 1.45、1.28 倍。接入 vLLM 的 DeepSeek-V4-Pro prefill 后,端到端中位加速为 1.13—1.26 倍。两组数字的分母不同,也说明层级收益传到整段模型后会收窄。
来源:MegaFlux。
11 RailWave 调整流量走哪条链路和什么时候发送
10 月 2 日。 即使专家放置与路由都不变,All-to-All 仍可能因为网络 rail 负载不均、许多 sender 同时涌向同一 receiver 而变慢。RailWave 在 DeepEP 之上处理这层通信问题。
RailBalance 使用源端信息,将流量分摊到可用 rail;基于拓扑生成的可复用排列日程控制每轮并发发送者数量。轻量选择器再根据当前通信阶段与离线测量,选用合适路径,避免每次重新构造全局需求相关日程。
实验来自 GLM-4.5-Air 106B 的训练通信负载,在各含 32 GPU 的 H800、H20 集群上,相对 Native 路径最高达到 5.84、4.36 倍。它们是通信阶段的加速,不是完整训练吞吐。与 MegaFlux 相比,这里不移动专家,而是调整固定专家布局下的流量组织。
12 MoE-CORE 区分 prefill 的逐层搬运与 decode 的专家缓存
10 月 1 日。 在权重放不进设备内存的 MoE 服务中,prefill 和 decode 对专家的访问方式差别很大。MoE-CORE 在 prefill 用交替 buffer 暂存完整专家层;decode 则结合不同层的容量分配、路由历史替换和跨层预取。
常规路径执行 router 实际选中的专家。另有可选近似路径,对符合条件的低分 miss 做专家替换;这个路径会改变计算语义,不能与精确 offload 混为一谈。
论文在 Ascend NPU 环境评估 DeepSeek-V4-Flash-W4A8 和 GLM-5.2-W4A8C8。其主要对照中,MoE-CORE 与 vLLM Prefetch 的输出上限分别为 1K、128 token,因而不宜把表里的 TPOT 直接相除,当作统一负载下的普遍优势。更有迁移价值的是 prefill/decode 分别设计驻留策略,以及在自己的输出长度、内存预算下重测。
来源:MoE-CORE。
13 HAPMoE 为异构集群选择并行方案
9 月 30 日。 混合不同 GPU、显存和网络配置以后,同一份 DP/TP/PP 方案很难让所有设备均衡。MoE 又增加了专家并行及 dispatch/combine 成本,单用 dense 模型的估算会遗漏重要开销。
HAPMoE 先用少量 warm-up 测量计算 kernel 与 collective,再建立成本模型,搜索 DP、PP、TP、CP、EP、TPE 六维空间。输出包括并行度、非均匀 stage 划分、设备映射和重计算策略,可以交给 Megatron-LM 执行。
非均匀划分的价值在于,不再强迫算力、显存不同的设备承担相同层数。部署这类 planner 时,应把机型、链路、batch 与序列长度一同纳入 profiling;换了通信拓扑后,之前得到的最优计划未必还成立。
来源:HAPMoE。
可复用缓存与 GPU 代码验证
14 KV² 只重建一部分上下文来决定保留哪些 KV
10 月 2 日。 一份长上下文要服务许多不同问题时,压缩策略不能只依赖某一个 query。完整重建上下文能得到更准确的淘汰分数,却需要再处理全部输入;只用便宜代理分数又容易删错。
KV² 先用轻量 scorer 选出有信息量的上下文 token,再只重处理这一子集,得到最终 KV 淘汰分数。第一轮挑选的是用于评分的输入,不应直接理解为最终只保留这一批 KV。
实验主要使用 Llama-3.1-8B-Instruct 与 Qwen3-8B,在 RULER、LongBench 等任务测试低保留率。在 2% 这类紧预算下,选择性重建比廉价打分更有价值,同时避免完整重建的时间和峰值显存。对于重复文档问答,还需将一次压缩成本摊到实际查询次数上,再判断是否划算。
来源:KV²。
15 D2K-Bench 区分知道优化方法和真正写出实现
10 月 2 日。 D2K-Bench 给 agent 同一批任务,分别提供或不提供专家指导,观察算法思路、数据流设计和低层技巧能否转化成可运行代码。它包含 26 项任务、85 种 workload;成对实验共享工具、硬件和 350 轮预算。
在 B200 上,五个模型合计 130 个模型–任务组合的正确率从 93.1% 升到 98.5%。对两种设置下都完成全部任务的三个模型,相对 Fable-5 无指导时首次正确实现的几何平均加速,从 1.69 倍提高到 2.49 倍。这个分母既不是 PyTorch,也不是专家最优实现;统计范围也只限上述三个模型。
它适合用来检查 agent 的失败发生在哪一步:没有提出合理数据流,还是已经写出正确解释,却没有在代码里落实。对工程团队,能复用的专家提示最好包含依赖条件、数据布局和验证方法,而不只是一句“使用共享内存优化”。
16 RESOLVE 将随机测试与形式化分析串起来
10 月 5 日。 GPU kernel 在几组随机输入上通过容差检查,并不能排除 race,也可能让错误藏在较宽松的数值阈值内。RESOLVE 首先通过二进制插桩扰动执行时序,增加并发问题暴露的机会。
接着,agent 把候选与参考 kernel 改写成并发程度较低的版本,并测试它们是否与原实现逐位一致;最后在 F*/Pulse 中证明简化版本的实数计算等价。论文跨 CUTLASS、Triton、Gluon 检查 fused GEMM,也分析了 megakernel。
这里的证明边界很重要:形式化分析针对简化后的程序与实数语义,原 GPU 实现到简化版本之间仍有测试环节。它比单一容差检查提供更多证据,但不能缩写成“整个原始 GPU 程序已经得到完整浮点正确性证明”。
来源:RESOLVE。
本周的工程观察
这几篇视频压缩工作把质量损失拆到了更具体的位置:token 均值、CFG 的误差合成,以及稀疏 Attention 丢失的残差。找到误差从哪里进入,比反复调整采样步数更接近问题本身。
系统优化也越来越依赖阶段区分:专家权重复制、网络流量整形和异构并行规划解决的不是同一处瓶颈。先把等待发生在哪一层、哪个阶段画出来,再选择相应方法,通常比先比较论文里的最高倍数更有效。