8 月 3 日到 10 日,AIGC 论文里最值得关注的变化,不是又出现了多少个“更大的模型”,而是研究者开始把计算预算分配当成一个需要动态决策的问题:视觉 token 不必平均保留,音频驱动的视频不必每个时间片都更新,KV Cache 也不必在“完整保留”和“永久删除”之间二选一。
这条线索贯穿了本周的几组工作:有的根据输入内容决定留下多少 token,有的根据音频能量决定视频缓存何时刷新,有的根据未来注意力变化保留可恢复的 KV,有的则把调度、缓存迁移和 SLO 放进同一个请求级预算。AIGC 推理正在从“把一个算子做快”走向“只为真正影响结果的部分付出计算和内存”。
本文依据 arXiv 在 2026 年 8 月 3 日 00:00 至 8 月 10 日 23:59(UTC) 首次提交的论文整理。我们从计算机视觉、机器学习、自然语言处理和人工智能类别中筛选与生成模型、多模态、推理优化、缓存、Agent 和高效服务相关的工作。性能、准确率和压缩比例均为论文作者报告,不代表 AIGCage 独立复现。
一、本周主线:固定压缩率正在让位于动态预算
长上下文、多模态输入和扩散式生成有一个共同问题:真正有用的信息并不是均匀分布的。如果系统预先规定“每张图保留 10% token”“每层都用 2-bit”“每个请求使用同样的推测长度”,就会在简单输入上浪费资源,在困难输入上过早丢失信息。
本周的论文给出了几个相互补充的答案:先估计哪些内容会改变最终结果,再决定保留多少;对被压缩的状态保留回退路径;把恢复、重算、预取和排队放进同一个请求级决策里。
二、多模态生成:缓存和 token 都要看内容
EchoCache:音频能量决定视频缓存什么时候更新
EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation 研究音频驱动视频生成中的一个具体浪费:扩散模型需要多轮去噪,但视频特征的时间冗余并不均匀,音频中的节奏、能量和变化会直接影响画面应该在哪些时刻更新。
EchoCache 用音频的时频能量作为显著性信号,指导 latent 级别的缓存刷新,并引入按时间步和 latent 动态管理的缓存,同时对缓存做量化。它解决的不是“所有帧都少算一点”,而是让跨模态信号参与决定哪些缓存仍然可信。
作者在多个音频驱动视频模型上报告了更好的延迟—质量折中;在 Wan2.2-S2V 的 EMTD 测试上,报告最高 2.46 倍加速,并保持视频质量和音画一致性。这里的数字来自论文特定配置,不能直接当作所有视频模型的通用加速比。
RUTA:每个图像—问题对应该拿到不同的视觉 token 预算
RUTA: Principled Visual Token Allocation via Rate-Utility Optimization 把视觉 token 压缩写成一个 rate-utility 优化问题。模型不是先设定统一保留率,再让一个重要性预测器去适配;它会针对每个图像—查询对共同决定“保留哪些 token”和“应该保留多少”。
被保留的 token 还会按照语义相似度和空间邻近关系聚合未保留区域的信息,避免简单删 token 带来的局部空洞。论文在五个 benchmark 上报告:相对完整 token 的基线,LLaVA-NeXT-7B 只使用 2.0% 的视觉 token,保留 88.2% 的任务表现;Qwen3-VL-8B 使用 4.2% token,保留 94.4% 的任务表现。
工程启示很直接:视觉 token reducer 的接口不应只有一个 compression_ratio,还应该能够接收查询、预算和质量约束。否则同一套比例很难同时适合文档 OCR、细粒度定位和普通图像问答。
OPTD:扩散语言模型的步数压缩要沿着自己的轨迹训练
OPTD: On-Policy Transition Distillation with Consistency-Guided Adaptive Compression for Few-Step Diffusion Language Models 处理扩散语言模型的 few-step 蒸馏。问题在于,学生模型在推理时会提前做出并行决策,它实际访问的状态可能已经偏离了离线 teacher 轨迹;压缩越激进,这种偏移越明显。
OPTD 从学生自己的少步轨迹采样部分状态,再让冻结的 teacher 找出与最终结果一致的未来候选,并按照当前状态的置信度选择最长的安全前缀。它不使用 gold response 构造目标,而是试图让“压缩多少步”成为一个受当前状态约束的决定。
这项工作的价值不只在于扩散语言模型。凡是把多步计算压成少数大步的系统,都需要问:压缩后的执行轨迹是否仍然覆盖了训练时监督过的状态空间。
LibraSpec:推测长度应由边际收益决定
LibraSpec: Dynamic Diffusion-Based Speculative Decoding via Marginal-Gain-Driven Optimization 观察到,扩散式 drafter 可以并行生成候选块,因此动态推测的关键不再是“还能生成多少 token”,而是“多验证一个 token 是否值得付出额外验证成本”。
LibraSpec 用 drafter 置信度估计每次扩展的接受收益,只有当边际收益超过验证成本时才继续扩大 speculative length。它是无需训练、可插拔的策略,并给出了向最优推测长度单调收敛的理论分析。作者在六个目标模型、三种扩散式 speculative decoding 方法和数学、代码、对话任务上报告了相对基线 0.5—1.5 倍的进一步改进,最高达到相对自回归解码 8.49 倍加速。
这里最值得借鉴的是决策形式:推测解码不应只暴露一个静态 num_speculative_tokens,而要让接受率、验证成本和当前并发共同影响窗口大小。
三、KV Cache:从永久删除走向可恢复、可学习和分层管理
QEvict:不重要不等于永远不重要
QEvict: Recoverable Quantized KV Eviction for Attention-Drift-Robust Long-Context Decoding 指出,传统 eviction 策略通常做出不可逆决定:某个窗口当前 attention 分数低,就直接删掉。但生成过程中的 query 会变化,历史上不重要的区域可能在后续重新获得大量注意力。
QEvict 用三层状态替代二元保留/删除:高置信窗口保留全精度,中间窗口进入可恢复的量化层,只有最低置信窗口才删除。当量化窗口重新变得重要时,系统将其反量化并提升回全精度。论文还提出 Future Missed Mass 和 Global LIR 两个诊断量,用来测量被删状态未来可能承载的注意力以及历史低活跃区域的重新激活。
这比单纯追求更高 eviction ratio 更接近生产问题:缓存策略不仅要报告当前命中率,也要记录误删、恢复和重算的成本。
DistillCache:用输出分布而不是静态注意力训练 eviction 策略
DistillCache: KL-Guided Adaptive KV-Cache Eviction for Memory-Efficient LLM Inference 将 KV eviction 建模为序列决策问题。它用 attention 统计、value norm、熵和位置信息作为策略输入,用每一步相对完整 cache 输出分布的 KL 散度作为奖励,通过 REINFORCE 学习轻量策略网络。
在 Mistral-7B-Instruct-v0.3 的 LongBench 设置中,作者报告在 25% cache 预算下保留完整 cache 的 94.2%准确率,相比 H2O 和 SnapKV 最高提升 2.7 个百分点;在保持竞争力的同时,报告最高 2.1 倍完整 cache 吞吐。由于这是论文作者在特定模型和复现实验下的结果,部署前仍需检查策略网络本身的开销、训练迁移性和不同 batch 形态下的稳定性。
SPECTRA:先旋转状态,再把 bit 花在真正重要的通道上
SPECTRA: Pushing the KV Cache Beyond the 2-Bit Cliff via Spectral Transform Coding 关注 KV 量化的“2-bit cliff”。当原始 cache 的通道高度相关时,平均分配 bit 会让少数 outlier 占据有限的量化级别,其他通道则被噪声淹没。
SPECTRA 从 cache 自身统计量计算旋转坐标系,先去除通道相关性,再把更多 bit 分配给携带主要信号的通道。它是无需训练的 drop-in codec。作者在 Llama-3.1-8B 和 Qwen2.5-7B 的长上下文 benchmark 上报告:4 倍压缩接近无损,8 倍压缩时仍优于均匀量化,在部分设置下最高达到 12 倍压缩。
它提示量化实现可以从“给所有元素选择同一个 dtype”转向“根据变换后的统计结构分配误差预算”。这也意味着 kernel、layout、scale 管理和 cache page 组织会一起成为性能问题。
Cascade:同一个请求预算同时决定排队和 KV 迁移
Cascade: Exploiting SLO-Aware latency budget for fair and high goodput LLM inference serving 将请求的 SLO 与预计剩余执行时间相减,得到每个请求的 latency budget。预算多的请求可以承受更多排队、预取或重算,预算少的请求则应优先获得调度和数据移动资源。
Cascade 用同一个预算协调请求调度和 KV Cache 层级管理:决定某段不在 HBM 的 KV 是恢复、预取、继续保留,还是直接重算。作者在三个模型的生产 trace 上报告,goodput 最高提升 2.4 倍,SLO 违约下降 40%,相对默认的 vLLM FIFO 调度器。
这是本周最接近系统落地的一条线:缓存不是独立的内存优化模块,它和队列、SLO、带宽以及重算路径共同构成请求级调度问题。
VLZip:视觉和文本都需要压缩,不能只剪图像 token
VLZip: Unified Visual and Textual Compression for Interleaved Long-Context Modeling 针对交错图文超长上下文。已有方案往往只压缩视觉 token,或者改用效率更高但表达能力有限的架构;但在长文档、视频叙事和多轮图文任务里,文本部分同样会把 self-attention 推向平方复杂度。
VLZip 将视觉和文本片段分层蒸馏成按层变化的 soft prefix,并注入每个 decoder layer 的 hidden state,从而缩短实际 attention 序列。作者还提出 LongVLBench,并报告训练上下文可以从 20K 左右扩展到 120K,推理超过 280K,在特定设置下展示到 2M token的内存扩展能力。
它的工程边界也很清楚:soft prefix 能否在已有 serving runtime 中高效执行,取决于模型层接口、KV layout、编译图和跨层缓存生命周期,不是只加一个 tokenizer 压缩步骤就能完成。
四、本周判断
- 压缩的基本单位正在变化。 以前常见的是固定比例、固定 bit、固定步数;现在更常见的是图像—查询对、时间片、KV 窗口、请求和 SLO 预算。
- 删除需要回退路径。 QEvict 的可恢复量化、Cascade 的重算/预取选择,都说明“删掉”应该是状态机中的一个可解释状态,而不是终点。
- 多模态系统要同时管理内容和执行。 EchoCache 让音频决定视频更新,VLZip 同时压缩视觉和文本,RUTA 则把视觉 token 预算交给具体问题。
- 推测解码正在从参数调优变成在线优化。 LibraSpec 和 OPTD 都在回答“当前状态下压缩到哪一步仍然安全”,这比离线选择一个全局窗口更适合异构请求。
- 真正的生产指标会从平均吞吐扩展到预算利用率。 下一步值得在 benchmark 中记录 cache 恢复率、重算比例、SLO 违约、token 预算、接受长度、视觉 token 数和端到端质量,而不是只报一个平均速度。
对工程团队来说,本周论文留下的实践清单是:先把“保留、量化、删除、恢复、重算、预取”定义为可观测状态,再让调度器根据请求内容和剩余预算选择动作。这样,论文里的压缩方法才有机会进入真实的长上下文、多模态和 Agent 服务。
本期论文
整理说明:本文依据 arXiv 公开版本与论文摘要整理;性能、准确率、压缩比例和加速结果均为论文作者自报,不代表 AIGCage 独立复现。不同模型、硬件、数据集、任务和基线之间不能直接横向比较。