AIGC 论文一周:混合注意力、KV Cache 和视频推理的几条新路线
统计窗口:2026/8/24—2026/9/2(UTC)
本期关键词:Qwen3.8-Next、MiniMax-H3、LTX-2.5、Wan2.2、DeepSeek、Kimi、GLM、KV cache、扩散加速、推测解码、MoE serving
8 月 24 日至 9 月 2 日,论文里的一个共同变化是:模型结构和推理系统开始一起设计。Qwen3.8-Next 把混合线性注意力、稀疏注意力、门控残差和主机侧 n-gram 记忆放在同一套架构里;MiniMax-H3 的相关工作则把视频、音频、VAE 压缩和世界模型训练连了起来。KV Cache 也不再只讨论统一量化,而是开始区分页面年龄、注意力贡献和跨模型复用。
本文挑出几条和模型落地关系较大的路线,尽量把论文里的数字、假设和工程限制一起写清楚。
1. 模型结构:从单一 attention 走向混合执行
1.1 Qwen3.8-Next:混合线性注意力带来的系统问题
论文《On the Design of Qwen3.8-Next Architecture: Evaluation, Efficiency, and Training Stability》系统讨论了 Qwen3.8-Next 的设计取舍。论文给出的 Qwen3.8-Flash-Next 配置是 125B 总参数、每 token 约 6B active parameters,另外约 51B 的 n-gram 表不常驻加速器,而是放在主机内存侧。
这里并不是简单把 Transformer attention 换成 GDN,而是几条路径同时变化:
- 大多数层使用 Gated DeltaNet(GDN)这类混合线性注意力,周期性保留全注意力层。
- 继续预训练阶段,把部分全注意力进一步替换成 Qwen Sparse Attention(QSA),用微块压缩索引器选择相关 token block。
- Gated Residual 把残差路径拆成四个分支,让不同状态更新路径拥有不同的门控。
- n-gram 预取表走主机侧内存,目标是让更大的记忆容量不直接挤占 GPU 显存。
- 训练稳定性上使用 Muon,并上调学习率和 batch size,同时取消 batch warmup。
论文报告,在 14 个预训练 benchmark 中,Qwen3.8-Flash-Next 在 8 个任务上超过前代 397B-A17B;虽然并非每个任务都领先,但使用约三分之一 active parameters、三分之一训练 token 和约九分之一训练 FLOPs 达到接近的能力区间。
对 serving 来说,难点也随之变化。长上下文模型的瓶颈不只是单次 attention FLOPs,还包括状态驻留在哪里、以什么格式保存,以及 GPU 和主机之间如何搬运。如果框架仍把每一层当成同一种 attention,混合架构的收益很容易被调度和状态管理抵消。
论文:https://arxiv.org/abs/2608.30320
1.2 DASC:为 Kimi-Linear 与 Qwen GDN 设计的状态压缩
《DASC: Decay-Aware State Compression for Hybrid Linear-Attention Serving》把问题推进了一步:对于 KDA 和 GDN,不能只讨论传统 KV cache,因为它们还存在随时间衰减的 recurrent state。
DASC 的重点有四个:
- 根据每个 head/channel 的 retention horizon 估计哪些状态仍有价值。
- 将状态压缩成 ragged checkpoint layout,减少无效的固定长度存储。
- 在 tensor parallel 下重新均衡 state shard,避免某些 rank 因为状态分布不均而拖慢全局。
- 对请求切分出的 suffix 做 zero-fill 和 refresh,修复压缩后重新接续计算时的状态误差。
论文报告:KDA state compression 可达到 2.63×;在固定内存条件下,TTFT 降低 42.6%,输入吞吐提升 68.4%。这里值得注意的是,收益来自“衰减感知 + 布局 + 恢复”,不是把 state 统一地转成更低 bit。
这对 Qwen3.8-Next、Kimi K3 以及后续 hybrid attention 模型都很关键:线性注意力的 state 不是传统 page table 的附属物,而应当进入 cache manager 的一等公民设计。
论文:https://arxiv.org/abs/2608.30386
1.3 MiniMax-H3:从视频生成走向世界模型
MiniMax-H3 相关论文和开源实现值得单独看。H3-World 把 MiniMax-H3 用作可交互世界模型的底座,SolarWM 则把 Wan2.2、LTX-2.5 和 MiniMax-H3 放进同一套长时视频世界模型训练框架。
H3-World 的方法重点不是再训练一个普通视频生成器,而是让模型理解结构化动作和相机控制:
- 将角色动作、镜头动作与视频 latent 的时间位置对齐。
- 用 temporal attention routing 降低角色动作和相机动作之间的互相泄漏。
- 采用 8,000 条 gameplay 样本和 10,000 个 LoRA steps。
- 只训练约 0.199% 的参数,尽量保留 H3 原有的视频质量和泛化能力。
SolarWM 更偏系统工程:它整理了 143 万条 canonical clips,统一视觉帧、度量相机、caption、质量、筛选和 provenance 字段;同时训练基于 Wan2.2、LTX-2.5 和 MiniMax-H3 的 5B—33B 模型。论文采用三阶段训练:双向适配、teacher-forced 自回归初始化和蒸馏。论文的判断是,因果世界模型即使只用 5 秒片段训练,也可以把 rollout 延长到分钟甚至小时级;决定效果的因素不只是上下文长度,数据契约和训练目标同样重要。
论文:https://arxiv.org/abs/2609.01560、https://arxiv.org/abs/2609.02886
1.4 LTX-2.5:联合视频音频生成的推理优化
TurboT2VA 针对 19B 的 LTX-2 联合视频音频模型,目标是把视频和音频的联合轨迹保留下来,同时把采样步数和单步计算压下去。
论文中的优化组合包括:
- modality-specific normalization,分别处理视频和音频的数值尺度。
- progressive consistency curriculum,把模型逐步适配到少步数生成。
- guarded W8A8 和 fused operators,避免只做量化却被 kernel launch 和 memory movement 抵消。
- padded text compaction,减少文本条件输入中的无效 token。
- modality-aware sparse attention,让视频、音频和跨模态 token 使用不同的稀疏模式。
论文报告,在 512×768 设置下,50.52 秒降到 2.51 秒,约 20.1×;在单张 H20、1024×1792 高分辨率设置下,generator-only 从 318.74 秒降到 5.83 秒,约 54.67×。这些是论文工作负载下的结果,不能直接当作产品端到端延迟。它至少说明了一点:联合模态模型的加速不能只改采样步数,还要同时处理 kernel、量化和输入整理。
论文:https://arxiv.org/abs/2608.24674
1.5 Wan2.2:从 off-manifold refinement 找回视频物理一致性
《Off-Manifold Refinement》以 Wan2.2-T2V-A14B 为对象,引入冻结的 V-JEPA2.1 作为 surprise energy 评估器,在 ODE 中段通过小 adapter 注入 refinement gradient。
它试图解决一个常见问题:扩散模型生成的视频看起来清晰,但物体运动、接触、相机和物理关系不一定可信。论文在固定的 400-prompt VideoPhy 子集上报告,指标从 47.0% 提升到 52.0%,相对提升约 10.6%。代价是基础运行时约 1.71×,但比单纯扩大搜索或重复采样更可控。
对 Wan2.2、LTX-2.5 和 MiniMax-H3 来说,这类方法提供了另一种后处理思路:不重新训练完整模型,而是在中间 ODE 步骤引入外部时空表征模型,把质量修正做成独立的推理阶段。
论文:https://arxiv.org/abs/2608.29904
1.6 GLM-5.3-Flash 与 Step-3.7-Flash:稀疏 MoE + 混合注意力继续下沉到开源工具链
Transformer v5.16.0/5.16.1 的模型支持变化也值得看:
- Step-3.7-Flash 是 198B sparse MoE VLM,其中约 196B 是语言部分、1.8B 是视觉部分,使用 288 个 routed experts,每 token top-8,并支持 MTP speculative decoding。
- GLM-5.3-Flash 的 release note 标注为 320B 总参数、18B active parameters,采用 sparse + linear attention 混合结构和 mHC。模型方称它在部分 benchmark/workload 上超过 GLM-5.2,并以约十分之一成本运行;这些属于项目方报告,需结合独立测评理解。
- Qwen4-Exp 引入 GatedResidual、Qwen Sparse Attention 和 Per-Layer Embedding,将 GDN 与稀疏注意力结合到长上下文架构中。
模型进入 Transformers 这样的基础库后,工作重点就会转到 cache、TP/EP、量化和 generation loop。能加载只是起点;实际 batch、长上下文和多卡条件下能否稳定运行,才决定它是否真正可用。
论文/实现入口:https://github.com/huggingface/transformers/releases/tag/v5.16.0、https://github.com/huggingface/transformers/releases/tag/v5.16.1
2. KV cache:从统一低比特走向按价值分配
2.1 Minima-KV:Qwen3.6-27B 的页面级混合精度
Minima-KV 在单张 96GB RTX PRO 6000 Blackwell 上研究 Qwen3.6-27B 的 KV 管理。它让最近或受保护的 anchor pages 使用 FP8,较旧页面使用 TQ3;所有 live request pages 仍然可寻址,并使用 online softmax merge,不维护一份 dense shadow cache。
论文报告:
- 约 18.3 KiB/token。
- 相比 BF16 压缩 3.50×,相比 FP8 压缩 1.75×。
- 16K RULER needle 与 dense 结果匹配。
- LongBench v2 在 16K/32K/64K 的差异分别约为 -0.80/-0.60/-0.40 个百分点。
- canary workload 达到 3.625× active-KV compression,吞吐约为 control 的 0.9821×。
Minima-KV 给出的直接启发是,压缩策略应和页面生命周期绑定。刚产生的 token、注意力贡献高的 token,以及长时间没有被访问的 token,不应使用同一种格式。
论文:https://arxiv.org/abs/2608.23834
2.2 SemKV:质量 cliff 比“平均 bit 数”更重要
SemKV 在 Llama 3.1 8B-Instruct 上研究 affine KV quantization,发现模型质量从 FP16 降到 2.322 bits/value 时仍可能没有统计显著差异,但到 2.0 bits/value 后出现明显质量崩塌,并且现象能迁移到 Mistral-7B。
SemKV 的结论不是“越低 bit 越好”,而是先找到模型和任务的 quality cliff,再进行 mixed precision。论文报告在不出现可检测质量损失的情况下,存储可降低约 6.0×;使用 TurboQuant-MSE 后,这个安全点可提升到约 7.9×。
这对 DeepSeek、Qwen、Kimi 这类长上下文模型尤其有用:KV quantization 的验证集不应只有 perplexity,还要覆盖 needle retrieval、长文问答、tool call 和多轮对话。
论文:https://arxiv.org/abs/2608.28911
2.3 TwinKV:关注“因果贡献”,而不是只看 attention magnitude
TwinKV 观察到 attention magnitude 和 token 的 causal contribution 几乎无关,论文给出的 Spearman 相关系数约为 -0.004。因此它不依赖训练,也不单纯按 attention score 淘汰 token,而是寻找重复或冗余的 key,把被淘汰的孤立 token 替换成仍然保留的 donor token。
在 LongBench、LooGLE、RULER 和 MMLU-Pro 的不同压缩比例下,TwinKV 对 Qwen3-4B 的多数策略有提升,但并非所有 few-shot classification 都受益。这个边界很重要:token eviction 的目标应是减少真正无用的状态,而不是让所有任务共享同一套“重要性”定义。
论文:https://arxiv.org/abs/2608.27128
2.4 CacheBridge:让一个模型的 KV 迁移给另一个模型
CacheBridge 研究跨模型 KV transfer。它通过 architecture-indexed 的 source/target head matching、attention-aligned calibration 和 fused GPU statistics,把一个模型已经计算过的上下文状态迁移给另一个模型。
论文报告:
- Qwen3 的平均 target retention 达到 99.83%。
- Qwen3 14B→32B 时,mapper 存储减少 8×。
- 应用过程最高约 3× 加速。
- calibration data 减少到原来的约十分之一。
- 500 条序列的 calibration 从 92.63 秒降到 8.63 秒,约 10.7×。
对于同时提供 Qwen、Kimi、DeepSeek 或 GLM 大小模型路由的产品,跨模型复用 cache 可能比单独再压缩每个模型的 KV 更有价值。
论文:https://arxiv.org/abs/2609.00891
3. 推测解码与扩散推理:瓶颈从模型变成执行器
3.1 Strong Drafts Need Compact Memories
这篇工作研究 8B/70B Llama 3.1 目标模型的 speculative decoding。它指出 draft model 通常更小,但 draft-side KV memory 仍可能成为瓶颈;压缩 draft KV 后,内存可减少 70% 以上,相对 AR 的加速最高达到 2.08×/3.33×。
这里的工程结论很直接:speculative decoding 不能只看 draft model 的 FLOPs,还要把 draft 的上下文内存、验证 batch 以及 target 和 draft 的同步开销算进去。
论文:https://arxiv.org/abs/2608.30252
3.2 DBloom:把 block draft 的“接受率天花板”显式化
DBloom 研究 DFlash/DFlare 这类 block diffusion drafter,提出 acceptance histogram ceiling:当某些位置几乎总被拒绝时,继续扩大 draft block 只会制造 stranded speedup。
在 Qwen3-8B/4B 上把 block 从 16 扩到 24,论文报告中位数额外接受约 0.8 token,最高约 1.1;在 Gemma4-12B-IT 上,7 个 benchmark 的中位提升约 0.41 token,额外收益约 0.29—0.98。这个方向提醒我们:draft 长度不应该写死,应该按 prompt、模型和位置动态决定。
论文:https://arxiv.org/abs/2608.30427
3.3 FOVEA:VLM 推测解码不必把视觉 token 全部塞进上下文
FOVEA 针对多模态 speculative decoding,把视觉证据按需检索进 cache-friendly memory,再用 gated residual 修正 LM head,而不是把所有视觉 token 直接插入语言上下文。
论文报告在多个 VLM backbone 上最高达到 2.13× 端到端加速。它与 Qwen3-VL、GLM、Step-3.7-Flash 等视觉语言模型的共同问题相吻合:视觉上下文并不总是每一步都需要完整重算,关键是设计一个可检索、可校正、不会破坏 target distribution 的证据缓存。
论文:https://arxiv.org/abs/2608.22883
3.4 Serving Masked Diffusion LLMs:LLaDA 的服务瓶颈在 CPU 调度
这篇工作以 LLaDA-8B-Instruct 和 D2F LoRA 为例,指出 masked diffusion LLM 的请求会落在有限的去噪步数层级上。单请求下,GPU 只占 wall time 的约 24%,剩余时间大量消耗在 CPU dispatch;batch size 16 时,把同一步骤的请求合并成共享 forward,可达到约 16× 相对逐请求 dispatch 的吞吐提升。
这类模型的 serving scheduler 不宜直接照搬自回归 decode scheduler。更合适的调度单位可能是“去噪 step bucket + 共享 forward + 请求完成顺序”,而不是逐 token iteration。
论文:https://arxiv.org/abs/2608.23807
4. MoE 与稀疏执行:减少 active experts 但不牺牲路由稳定性
4.1 MetaNet:按任务动态减少 DeepSeek-MoE 的 active experts
MetaNet 以 DeepSeek-MoE-16B-Chat 为对象,训练 task-conditioned layerwise expert retention controller。
- 固定 top-k=6 时,平均 active experts 可降到 3.61,减少约 40%,MMLU 从 0.474 提升到 0.489。
- 更激进地降到约 2.28 个 active experts 时,active experts 减少约 62%,但准确率下降约 3.7 个百分点。
- 跨到 C-Eval 时,无需重新训练,平均约 2.90 个 active experts,减少约 52%,准确率约 0.386。
MetaNet 的结果表明,expert sparsity 存在明显的任务相关区间。对 DeepSeek、Qwen MoE、GLM 和 Step 这类模型,retention controller 可以结合 batch、任务类型和上下文长度,而不是全局固定 top-k。
论文:https://arxiv.org/abs/2608.26650
4.2 Qwen3-4B 三值化:压缩、精度和速度仍然是三件事
《Post-Training Ternarization of Qwen3-4B》使用 KOTMS rotation、E2M-ATQ 和 GPTQ/TWLA,报告约 1.641 effective bits/weight,覆盖约 81.62% 参数;packed model 从 8.29 GiB 降到 3.96 GiB。
但论文同时报告 10 个 comparison accuracy 从 64.5 降到 54.7,Wikitext perplexity 从 13.639 升到 18.748;一个初步 Triton GEMV 还比同形状 FP16 cuBLAS 慢 4.6×。这是一条必须保留的工程结论:更小的权重文件不自动等于更快的模型,最终收益取决于解包、向量化、kernel occupancy、batch 和 memory hierarchy。
论文:https://arxiv.org/abs/2609.01962
5. 训练与算子工程:把经验变成可复用的工具
5.1 KOPE:让 GLM-5.2 的 kernel 优化经验形成图记忆
KOPE 面向 GLM-5.2 的硬件 kernel 优化,使用 experience graph memory 和 active context injection。
论文报告:
- 相比 CANNBot,几何平均加速约 1.54×。
- 53 个 operator 的 pass rate 从 60.0% 提升到 84.6%。
- graph memory 版本的完整 suite pass rate 从 55.2% 提升到 84.6%,几何平均加速约 1.43×。
- tokens 从 15.9B 降到约 1.113B。
KOPE 暴露出的瓶颈并不是“不会写 CUDA”,而是反复犯相似的 layout、同步和边界错误。编译反馈、失败样例、硬件约束和成功 patch 如果能结构化保存,往往比单纯增加上下文更有用。
论文:https://arxiv.org/abs/2608.25570
5.2 FLINT:面向 LLM 权重的 burst buffer
FLINT 提出 HBF flash tier、workload-driven burst buffer、phantom-plane refresh 和 read-only FTL,目标是降低大模型权重从存储到 GPU 的读放大与抖动。
虽然论文摘要没有给出足够的统一端到端数字,但它对应一个现实问题:当 Qwen、DeepSeek、Kimi、GLM 的 checkpoint 规模不断增大时,冷启动、实例迁移、权重换入和多租户共享会成为 serving 成本的一部分。下一阶段的“模型优化”很可能包括文件系统和 flash layout。
论文:https://arxiv.org/abs/2608.25062
5.3 BaryCache:DiT 采样中的低成本历史状态外推
BaryCache 针对 DiT 图像和视频生成,通过 training-free barycentric extrapolation 利用历史采样状态,论文报告最高约 3.30× 端到端采样加速,并在显存与质量之间取得更好的折中。
它可以和 Wan2.2、LTX-2.5、MiniMax-H3 的少步采样、Cache-DiT 和蒸馏放在同一条优化链路上评估。每一种加速都单独做近似时,误差可能叠加;只有把采样步数、cache、量化和质量监控放在一起,才能分辨收益和代价分别来自哪里。
论文:https://arxiv.org/abs/2608.28670
6. 一张模型—优化对照表
| 模型/路线 | 主要瓶颈 | 本期代表方法 | 工程落点 |
|---|---|---|---|
| Qwen3.8-Next | 长上下文状态与 attention FLOPs | GDN/QSA/Gated Residual/n-gram host memory | hybrid cache、稀疏索引、主机侧状态 |
| MiniMax-H3 | 视频音频联合生成成本 | VAE 压缩、少步 LoRA、Cache-DiT、FP8/INT8 | 4 卡并行、消费级 offload、音视频一致性 |
| LTX-2/LTX-2.5 | 视频音频联合采样 | progressive consistency、W8A8、fused op | 少步采样、模态感知 sparse attention |
| Wan2.2 | 物理与时空一致性 | V-JEPA surprise energy refinement | 中间 ODE 步骤质量修正 |
| DeepSeek/Kimi | MoE 与新型 attention | expert parallel、KDA/GDN state compression | EP、paged state、低比特 MoE |
| GLM/Step | 大规模稀疏 MoE/VLM | hybrid attention、MTP、动态 expert retention | TP/EP、speculative decoding |
| Llama/Mistral | KV 与 draft memory | SemKV、TwinKV、CacheBridge | mixed precision、跨模型 cache |
| LLaDA | masked diffusion 调度 | denoising step bucket | shared forward、CPU dispatch 合并 |
7. 本期结论:能加载,离能用还差几步
这批论文最后汇成三条比较清楚的线索:
- 模型优化已经从单个 kernel 延伸到完整执行路径。 MiniMax-H3 的性能差异不只取决于 attention backend,还取决于 VAE、音频 token、prompt embedding、layerwise offload、Ulysses/Ring 和 quality mode。
- 缓存开始按时间、语义和模型关系管理。 Qwen3.8-Next 的 recurrent state、Minima-KV 的页面年龄、SemKV 的 quality cliff、CacheBridge 的跨模型迁移,实际上都在回答同一个问题:哪些状态值得留下。
- 压缩必须回到真实 kernel 上验证。 Qwen3 三值化同时出现文件变小和 Triton GEMV 变慢,说明 storage saving、memory saving 和 latency saving 并不是一回事。
如果要把这些论文转成工程任务,可以先建立“模型—backend—cache—量化”矩阵,再分别对 MiniMax-H3、LTX 和 Wan 做视频音频端到端 profile,最后把质量、显存峰值、kernel time、CPU dispatch 和首帧时间放进同一张回归表。