8 月 11 日到 17 日,AIGC 论文里最值得关注的变化,是“推理优化”的对象正在从单个算子扩展成一整套运行时状态:权重如何驻留、矩阵乘法算多少、KV Cache 保留多少、被拒绝的 Agent 分支是否真的回滚,以及视频扩散中的特征缓存何时刷新。

这条线索把看似分散的工作串到了一起。低比特量化和 MoE slot cache 处理的是模型权重,输入自适应矩阵约简和小批量 MoE 处理的是每一步算力,AATC、GraniKV、KV-Rescue 和 Pallas 处理的是 KV 的误差、粒度、迁移与恢复,最后还有工作提醒我们:缓存本身已经是 Agent 的语义状态,而不只是一个性能对象。

本文依据 arXiv 在 2026 年 8 月 11 日 00:00 至 8 月 17 日 23:59(UTC) 首次提交的论文整理。我们从计算机视觉、机器学习、自然语言处理和人工智能类别中筛选与推理优化、量化、MoE、缓存、Kernel、视频生成和 Serving 相关的工作。性能、准确率、压缩比例和复杂度均为论文作者报告,不代表 AIGCage 独立复现。

一、本周主线:推理系统开始管理“状态”,而不只是减少 FLOPs

传统优化通常把问题拆成单点:把权重改成 4 bit、把 KV 改成低精度、把 attention 换成线性近似,或者把某个 Kernel 融合起来。但长上下文、MoE、Agent 和视频生成的共同约束是:状态会在请求生命周期中变化,而且不同部分的价值并不相同。

因此,本周论文反复出现几种新接口:

  • 预算接口:由输入、路由、任务难度和质量约束决定算多少;
  • 状态接口:保留、量化、删除、恢复、重算和迁移不再是互斥的黑盒动作;
  • 生命周期接口:逻辑上的提交、拒绝、handover 必须和模型实际关注的 KV 状态同步;
  • 端到端接口:论文开始同时报告模型质量、GPU 显存、数据移动、解码速度和请求中断时间。

二、权重与计算:从“模型压缩”走向小批量和输入自适应

ReRound:校准无关量化也可以利用结构先验

ReRound: Reconstructive Rounding to Resolve Midpoint Ambiguity in Calibration-Free LLM Quantization 关注 RTN 量化中一个容易被忽略的问题:权重落在量化区间中点附近时,向上还是向下舍入并没有明确答案。论文用条件扩散模型生成低比特权重的连续重建信号,再用容差区域判断哪些权重需要重建引导,最后通过比较原模型和候选量化矩阵的主奇异值来选择舍入方案。

作者报告,ReRound 在多个较小语言模型的 3 bit 和 4 bit 校准无关量化中持续优于标准 RTN,并可与需要校准数据的方法竞争;它只在离线阶段增加处理,不改变低比特推理阶段的额外开销。工程上值得注意的是,它把“量化误差”从逐元素距离问题,转成了权重矩阵结构是否被保留的问题。

RealisticTritonBench:Kernel 生成要在真实框架里验收

RealisticTritonBench: A Benchmark for Triton-Kernel Generation in Real-World AI Frameworks 把 LLM 生成 Triton Kernel 的评测从“PyTorch 算子翻译”推进到真实开源框架的工程任务。论文从流行 AI 框架中修改 Triton Kernel 的 pull request 提取任务,要求模型根据自然语言需求完成实现,并把生成 Kernel 放回原框架做端到端测试。

它还指出现有 benchmark 的两个问题:只测单 Kernel 性能,无法反映端到端收益;手写评测脚本可能被模型利用,导致 correctness 分数虚高。作者对当前 LLM 的评估显示,它们在真实 Triton 任务上仍然困难。对 Kernel 工程和代码 Agent 来说,真正值得追踪的指标应包含正确性、编译时间、框架集成、回归测试和端到端收益,而不只是某个 microbenchmark 的 tokens/s。

DeaMoE:小批量解码首先是权重加载问题

DeaMoE: Efficient MoE Structure for Fast Small-Batch Decoding 针对实时交互场景中的 MoE 解码。小 batch 下,计算量并不是主要瓶颈,真正拖慢每个 token 的是专家权重加载。DeaMoE 把专家组织成共享大部分参数的“部门”,每个专家再保留少量私有参数,并设计两阶段路由来减少重复加载。

论文报告,在预训练 7B 模型上每步加载权重最多减少 50.9%,A40 上端到端 TPOT 最高提升 1.33 倍;在 DeepSeek-V3 的微基准中,A40 和 H100 分别报告最高 2.00 倍1.97 倍峰值加速。这个结果说明 MoE 的稀疏性不能只看 FLOPs:如果被激活的专家仍然需要从慢速层级搬运,路由稀疏并不会自动变成低延迟。

Every Expert Counts:完整专家可用性与显存预算并不矛盾

Every Expert Counts: ExactMoE for Memory-Efficient W4A16 Inference 选择了另一条路线:不删专家、不改 top-k 路由,而是把路由专家做对称 group-128 4 bit 量化,采用 Kernel-native MARLIN 格式存放在 pinned host memory,再通过 GPU slot cache 和 fused grouped MoE Kernel 执行。

在 OLMoE-1B-7B-0924-Instruct、单张 NVIDIA L4 的作者实验中,16-slot 配置把峰值 reserved GPU memory 从 14.168 GiB 降至 1.836 GiB,同时保留 BF16 解码吞吐的 81.85%;64-slot 全驻留配置达到 31.923 tokens/s,高于 BF16 的 21.662 tokens/s。12,450 道 zero-shot 选择题上的归一化准确率为 BF16 的 99.23%。这里的“Exact”是专家完整可用和路由不变,不表示与 BF16 数值完全相同。

Reduced Matrix Multiplication:让模型自己决定哪些乘法可以少算

Reduced Matrix Multiplication: Input-Adaptive Matrix-Product Reduction for LLM Inference 是一种无需训练的输入自适应推理方法:沿矩阵乘法的 contraction dimension 选择更有信息量的 slice,以 retention ratio 控制准确率—效率折中,同时不修改模型权重。

论文覆盖 1B 到 70B 模型,并将方法扩展到视觉语言模型。作者的机制分析显示,Transformer 内部 attention 侧的计算通常比 MLP 更容易约简;在 NVIDIA A100 的自定义 Kernel 实测中,较长序列更容易把理论计算节省转化成实际运行时间收益。对实现者来说,重要的不是再增加一个固定剪枝比例,而是把保留率变成可以按模型、层、输入和序列长度调节的运行时参数。

三、KV Cache:压缩、分页、恢复和迁移正在合并成一层系统

AATC:KV 的 bit 应该按“对 attention 的影响”分配

KV Cache Compression Through the Lens of Transform Coding 认为,直接最小化 KV 重建误差并不等价于最小化 attention 输出误差。论文在白噪声量化模型下推导 attention-aware distortion 的分解,再借用 transform coding 和 reverse water-filling,把 bit 分配给对注意力更敏感的 token 和 channel,形成 Attention-Aware Transform Coding(AATC)。

在 Llama-3.1-8B-Instruct 和 Qwen2.5-7B-Instruct 的 LongBench、RULER、GSM8K、MMLU-Pro 与 MATH-500 实验中,作者报告约 5.8 倍压缩仍接近无损准确率,而基线在部分设置下出现退化。它给 Kernel 和 page layout 的启示是:KV 量化不能只看 dtype,scale、变换、访问模式和恢复路径需要一起设计。

GraniKV:共享前缀和请求后缀不应使用同一种分页粒度

GraniKV: Asymmetric Granularity KV-Cache Paging for Multi-Agent Systems with Long Shared Prefix 观察到,多 Agent 服务的两个 KV 区域需求相反:长共享前缀需要连续存储,逐请求后缀则更适合 token 级细粒度分配。GraniKV 因此把前缀放进 contiguous HOT pool,把后缀放进 token-level COLD pool,再由 per-step dispatcher 在不同后端之间选择。

当共享前缀为 16K token 时,作者报告相对生产基线,在 Llama-3.1-8B/TP=1、Qwen2.5-14B/TP=2、Qwen2.5-32B/TP=4 上分别达到 2.16 倍、1.98 倍和 1.57 倍输出 token 吞吐;在不同长度、不同提示词的异构多 Agent 场景,报告 1.95 倍吞吐。论文还特别拆分了 cascade attention 与存储层的贡献:存储层增益不一定最大,但它让批量 GEMM 前缀后端成为可能。

KV-Rescue:被驱逐的上下文可以由轻量 full-context helper 追回

KV-Rescue: Recovering Reasoning Language Model KV Eviction Loss via Stepwise Interleaving 处理长推理轨迹中的激进 KV eviction。论文将退化拆成“能力不足”和“信息缺口”,观察到被驱逐的 7B 模型与完整上下文的 1.5B 模型会犯互补的错误,于是让轻量 full-context helper 与被压缩的 base model 交错生成共享推理轨迹。

在线 detector 使用 entropy 和 compressibility 及时终止重复、失控的候选。作者在 Qwen2.5-Math 7B/72B 和五个数学 benchmark 上报告,在 eviction budget B=64 时平均追回被驱逐带来的准确率损失的 87%,并因阻止 runaway degeneration 使 base-model token generation 平均减少 43%。这是一种“先压缩、再按风险恢复”的状态机,而不是把 eviction 当作一次性删除。

Aborted but Not Forgotten:逻辑回滚必须回滚模型真正看到的状态

Aborted but Not Forgotten: KV-Cache Retention Breaks Rollback Consistency in Language Agents 把 KV Cache 从性能结构提升为 Agent 的安全边界。应用层可以从 transcript 中删除一个被拒绝的分支,但如果 serving session 仍保留旧 KV,模型下一步仍可能 attend 到应用认为已经撤销的内容。

论文提出 rollback consistency,并用 same-token/different-cache audit 固定决策步 token,只改变 cache 是否由 committed state 重建。在七个开源模型家族、3.8B 到 36B 的 63 个审计单元中,作者报告保留旧 KV 会在 25 个单元中改变受保护效果;重建 cache 则关闭全部单元的通道。这里的工程结论比某一个模型的安全分数更重要:事务回滚、时间旅行、拒绝采样和 speculative branch 必须拥有明确的 cache commit/abort 语义。

Pallas:移动中的请求也需要提前迁移 KV

Pallas: A Proactive KV Cache Migration Framework for LLM Inference in AI-RAN 将 KV 迁移放进移动网络 handover 场景。用户切换到目标基站时,源端仍在生成 token,目标端可以提前把稳定历史前缀做本地 prefill,同时由源端流式发送仍在变化的 suffix KV;handover 发生时,两部分被拼成可继续解码的状态。

论文原型基于 vLLM,在三个 LLM、100—500 Mbps 的 inter-gNB 链路上,作者报告平均服务中断时间相对 target-side recovery 降低 2.28—89.68 倍,相对 source-side forwarding 的平均 ITL 降低 16.0%—50.0%。它把“KV cache 是内存对象”进一步改写为“KV cache 是可迁移的执行状态”,而迁移窗口需要由移动性预测和运行时 telemetry 联合决定。

四、视频生成:子二次 attention 与动作感知缓存同时出现

SQuad:用蒸馏把视频 attention 推到 O(n√n)

SQuad: Sub-Quadratic Attention Distillation for Efficient Video Generation 针对 Video DiT 中随 latent token 数平方增长的 self-attention。它不是直接用线性 attention 替换 softmax,而是将预训练的 full-attention DiT 蒸馏成复杂度为 O(n√n) 的 SQuad-Attention,先做 flow-matching supervised fine-tuning,再做改进的 DMD2 蒸馏。

在 Wan 2.2 5B 文生视频上,作者报告 VBench 83.20 对 83.08,单步单 block attention FLOPs 约减少 67 倍、attention latency 约减少 11 倍,端到端 DiT latency 降低 2 倍,并将采样 NFE 从默认 100降到 6。这些数字属于特定教师模型、蒸馏模型和视频设置,不能直接外推到所有 DiT;但它说明“近似 attention”需要和采样步数、质量蒸馏一起看。

五、本周判断

  1. 权重、算力、KV 和网络状态正在使用同一种语言。 它们都需要预算、驻留位置、迁移成本、质量损失和恢复策略,而不是单一的压缩率。
  2. KV Cache 的关键指标不再只有命中率。 还应该记录量化误差、未来误删、恢复率、重算 token、page 粒度、迁移窗口、ITL 和服务中断时间。
  3. Agent 把缓存一致性提升为正确性问题。 transcript 回滚但 KV 不回滚,可能产生跨层语义残留;cache lifecycle 必须进入事务和安全设计。
  4. MoE 的稀疏性要用数据移动验证。 DeaMoE 减少重复加载,ExactMoE 用 host slot cache 保留完整专家,两者都在说明“激活少”不等于“搬运少”。
  5. 视频生成的加速会同时发生在模型结构和运行时缓存。 SQuad 减少 attention 复杂度,DriveCache 则根据规划动作分配特征复用;下一步会是二者与显存、质量预算的联合调度。

对工程团队来说,本周论文留下的实践清单是:先把请求状态画成可观测状态机,再把保留、量化、删除、恢复、重算、迁移和 commit/abort 设计成显式动作。只有这样,论文中的压缩和加速方法才有机会进入长上下文、MoE、Agent 与视频服务的真实执行路径。


本期论文

整理说明:本文依据 arXiv 公开版本与论文摘要整理;性能、准确率、压缩比例、复杂度和服务指标均为论文作者自报,不代表 AIGCage 独立复现。不同模型、硬件、数据集、任务和基线之间不能直接横向比较。