7 月 26 日到 8 月 2 日的论文里,一个很明显的变化是:平均指标开始不够用了。

KV Cache 量化不能只看一组离线 Benchmark 的平均准确率,因为真正部署时,系统不知道当前请求是否正在被压缩误差伤害;视频生成不能只看最终画面,因为模型还可能在物理过程、运动多样性和实际推理时间上失效;Agent 也不能只看一个任务成功率,因为错误的评测器、被掩盖的过程故障和来不及执行的正确动作,都可能藏在同一个分数下面。

本周值得关注的论文,正在把这些隐藏问题重新放回系统视野:为每个请求建立风险证书,为每次缓存传输设计回退路径,为每条 Agent 轨迹保留可诊断的失败原因,并把“正确答案何时产生”纳入关键路径。

本文依据 arXiv 在 2026 年 7 月 26 日 00:00 至 8 月 2 日 23:59(UTC) 首次提交的论文整理。我们从 AIGCage 当前关注的计算机科学类别中获取 2340 篇候选,再按 Agent、推理优化、LLM 理论、多模态生成、生成模型、蒸馏和生成式强化学习等主题交叉筛选。主题之间允许重复,因此文中的主题数量不能相加得到论文总数。所有性能与准确率数字均来自论文作者报告,不代表 AIGCage 独立复现。

一、本周最值得关注的变化:从“平均表现”转向“请求级可观察性”

传统评测习惯先固定模型、数据集和压缩配置,再报告一个平均准确率、吞吐或成功率。这种方法适合比较整体趋势,却回答不了三个部署问题:

  1. 当前这个请求是否已经进入高风险区域;
  2. 如果近似计算失效,系统能否定位并回退;
  3. 最终分数没变时,内部失败过程是否已经恶化。

本周几篇工作分别从 KV Cache、视频生成和 Agent 评测给出了相似答案:系统需要的不只是一个更好的平均数,而是能够定位到 layer、head、step、轨迹阶段和执行时刻的观测信号。优化开始和风险控制绑定在一起。

二、KV Cache:从压缩对象变成可观测、可组合、可分层传输的系统状态

WitCert:给 KV Cache 量化加一个运行时风险仪表

WitCert: Sound Runtime Risk Observability and Gating for KV-Cache Quantization 处理的是 KV Cache 量化长期存在的盲区:离线 Benchmark 可以告诉我们某种 INT8 或 FP8 方案平均损失不大,却不能判断正在服务的这个请求是否已经被压缩误差破坏。

WitCert 为每个 layer、head 和 decoding step 计算精确 attention 与压缩 attention 之间总变差距离的上界。它提供两层证书:第一层是面向任意 cache-preserving 黑盒量化器的确定性界,不要求查询独立;第二层针对受控的 subtractively-dithered INT8 量化器,在明确的请求级失败预算下给出更紧的概率证书。论文还用 Lean 4 对核心定理进行了机器检查。

工程上更重要的是,这个风险仪表并没有停在分析脚本里。作者把它通过环境开关接入 SGLang,并允许把量化方案注册成一个 tensor function 后直接在真实服务路径中测量。当风险过高时,系统可以按 meter 结果触发 gating 或 repair。

作者报告,在困难 RULER 任务上,未经保护的 raw-cast FP8 得分为 22.8,meter 驱动的修复把它恢复到 79.7;与未压缩结果的配对差异被控制在 [+0.0, +0.8]。在其测试设置中,带证书的 INT8 Cache 在相同显存下可服务 1.88 倍 KV Token。这些结果来自论文给定模型、任务和 SGLang 补丁,不能直接外推到所有量化器。

这篇工作的价值在于改变了量化的部署接口:量化不再只是启动参数,而应同时暴露当前风险、失败预算和回退动作。

SemPIC:位置无关 Cache 不只是移除位置编码,还要改变文档表示

SemPIC: Learning Semantic Position-Independent KV Caches 面向 RAG 和 Agent 场景中的重复文档。相同文档会在不同指令、历史和排列顺序下反复出现;传统 Prefix Cache 只有当前缀完全一致时才能命中,而直接独立编译每段文档的 KV,又会因为缺少未来上下文而产生明显偏差。

SemPIC 把系统拆成 Writer 和 Reader:Writer 通过 LoRA 和行为蒸馏,离线把文档编译为原生的逐层 KV;Reader 保持预训练解码器不变,继续使用标准 KV 接口和原有 cache-hit 路径。也就是说,适配成本主要发生在离线缓存构建阶段,而不是每次在线解码时。

论文还提出 KV Gradient Checkpointing,在不切断缓存梯度的前提下降低训练峰值显存。作者在三个模型和四类任务上报告,SemPIC 将相对 KV Packet 的平均 micro-F1 从 0.53 提高到 0.60,接近完整重算的 0.62。

它说明位置无关 Cache 的难点并不是把 RoPE 或位置索引处理干净,而是让独立生成的文档状态在未知未来上下文里仍保持可用。缓存开始更像一种经过训练的语义资产,而不是普通中间张量。

SmartGen:Prefill 与 Decode 解耦后,不必一次搬完整 KV

SmartGen: Seamless Disaggregated LLM Inference with Selective KV Cache Transfer 关注自建云环境中的 Prefill/Decode 解耦。专用集群可以依赖高速互联搬运 KV Cache,但普通租用云实例的跨节点带宽很容易被完整 KV 传输占满。

SmartGen 将传输拆成三条路径:

  1. 主动路径:根据 Profile 在 Prefill 阶段识别并推送关键 KV;
  2. 按需路径:Decode 时并行获取本地与远端缺失项;
  3. 推测路径:在后台继续传输其余 KV,最终让 Decode 节点获得完整状态。

这套设计不是简单地永久丢弃“不重要”的 KV,而是用不同优先级和时间点逐步补齐。作者报告,相比一次传输完整 KV,SmartGen 的 time-to-second-token 最高降低 4.3 倍,后续 Decode 性能和准确率保持相当。

把这三篇放在一起看,KV Cache 正在出现清晰分层:SemPIC 负责缓存怎样成为可复用语义状态,SmartGen 负责状态怎样跨节点逐步到达,WitCert 则负责压缩和近似是否仍处于可接受风险内。

三、视频生成:速度、运动多样性和物理过程开始一起进入设计目标

Sol-Attn:稀疏 Attention 不能只决定“保留谁”,还要补偿被跳过的贡献

Sol-Attn: Accelerating Video Generation Inference via On-the-Fly Attention Sparsification 针对视频 Diffusion Transformer 的长序列 Attention。现有动态稀疏方法通常先计算代理分数,再选择固定比例或累计概率达到阈值的 KV Block;前者预算僵硬,后者容易负载不均,而且两者都需要额外生成和保存代理分数图。

Sol-Attn 把动态路由、稀疏计算和近似修正放进同一轮 online softmax:Block 在计算过程中直接与阈值比较,不再物化完整代理图;未被选择的 Block 也不是完全丢弃,而是复用代理分数近似它们对 Attention 的贡献。

作者在图像和视频任务上报告,在保持视觉质量的情况下,视频生成和视频编辑分别获得 2.1 倍与 2.3 倍端到端加速。这里值得注意的是“端到端”:论文不是只报告稀疏 Attention Kernel 的局部倍数,而是把路由成本和最终生成时间一起计算。

PDD:一次网络调用并行预测多段去噪轨迹

Parallel Decoding Distillation for Fast Image and Video Generation 试图绕开 Few-step 蒸馏中常见的 VSD 与对抗训练。虽然这些方法能把 Diffusion 压缩到少量步骤,但训练不稳定、Mode Collapse 和运动多样性下降仍然是视频任务中的突出问题。

PDD 采用轨迹式蒸馏,让一次网络计算并行预测多个去噪步骤,相当于每次函数求值沿轨迹向前跨越更大的距离。方法不需要用 JVP 或有限差分显式回归速度场导数,并允许推理时选择不同的 NFE。

论文在 LTX-2.3 文生视频/音频、Wan 14B 文生视频和 Qwen-Image 文生图上测试,在 4–8 NFE 下报告了有竞争力的质量,同时强调相较已有 Few-step 方法改善视频多样性。它的工程吸引力是兼容现有预训练模型,但真实部署还需要继续核对不同 NFE 下的显存、单步 Kernel 效率以及并发吞吐。

VIPER:物理条件用视频演示,比用文字枚举更自然

VIPER: Visual In-Context Physics Reasoning for Physically Plausible Video Generation 关注视频生成的物理控制。材料响应、接触、形变和运动轨迹是连续且互相关联的,用文本很难完整描述,但可以通过一段参考视频自然展示。

VIPER 将参考视频视为物理过程示例,而不是外观模板。它先用多模态大模型提取参考视频中的物理线索,再通过分层训练引导已有 Image-to-Video 模型,在保留基础生成先验的同时迁移物理行为。作者还构建了带材料、轨迹和物理影响标注的 VIPER-19K 数据集。

论文在未见验证集上报告,相比代表性视频生成和 video-as-prompt 基线,VIPER 获得更高的参考物理相似度与人工偏好,同时保持有竞争力的通用视频质量。它并没有证明模型获得了通用物理定律,更准确的理解是:参考视频扩展了条件带宽,让模型能模仿文本难以表达的连续行为。

本周视频方向的共同变化是,速度优化不再只追逐更少步数,质量优化也不再只看静态画面。Attention 路由、轨迹蒸馏、运动多样性和物理条件正在被放进同一个端到端问题里。

四、Agent:任务成功率正在被拆成评测可靠性、过程错误和决策时延

How Benchmarks Mis-Score:失败样本中,有一部分其实是评测器错了

How Benchmarks Mis-Score Computer-Use Agents 审视 Computer-Use Agent 的评测流水线:任务可能过期,轨迹可能缺少关键视觉证据,脚本评测器可能拒绝合法替代路径,最终聚合分数又会把具体原因压平。

作者审计了五个 Web、企业工作流和桌面控制 Benchmark 中 150 条公开标记为失败的轨迹,发现 15.3% 的 FAIL 判定有误:10.7% 是评测器假阴性,4.7% 是任务本身损坏。对剩余真实失败进一步分类后,验证/反馈与规划问题比执行/定位错误更突出。

这意味着成功率的误差不只来自 Agent,也来自任务、观测、判分和报告四层流水线。Benchmark 如果不保留这些层级,就无法判断一次模型升级究竟改善了规划,还是只碰巧适配了某个脚本 Oracle。

Flat Score, Amplified Failures:4-bit 看似不掉分,过程故障却被放大

Flat Score, Amplified Failures: How the Error Budget Masks Damage in Quantized LLM Agents 检查“4-bit 量化几乎无损”这条常见结论在多轮工具 Agent 上是否成立。

论文覆盖两个开放模型家族的 Dense 与 MoE 版本、两个业务域,共八个实验单元;每个单元包含 456 个 Episode,并比较 16-bit、8-bit 和 4-bit 权重。按标准任务指标看,没有一个单元的分数差异通过多重比较校正,量化似乎确实免费。

但过程日志显示,量化会把全精度模型已经存在的故障放大:电信任务中的工具名幻觉,以及零售任务中的实体错误,最多增加到原来的 2.5 倍,每个任务增加 17.6 个百分点。不同精度的失败集合高度相似,排名相关系数至少为 0.94,新故障只占 0.18%。

总分没有下降,是因为 Benchmark 允许最多十次错误,额外故障被 Error Budget 吸收;把预算缩小到两次后,受损单元重新暴露出 17 分差距。论文提出的启示很实用:Agent 量化评测不能只报告任务奖励,还应同时报告错误通道分布以及不同 Error Budget 下的成功率。

AAPT:答案正确并不代表动作来得及执行

Why Are GUI Agents Correct but Late? Decode on the Decision-Time Critical Path, Tested with Pre-Compiled Policy Trees 关注转瞬即逝的 GUI 事件。Agent 可能最终生成正确动作,但等 Autoregressive Decode 完成时,按钮、弹窗或交互窗口已经消失。

论文提出 Adaptive Anticipatory Policy Trees:在屏幕空闲期,冻结的多模态模型提前构建一个有界条件策略树,包含可观察 Guard、预授权动作和分支 Deadline;事件发生后,轻量 Observer 只负责将变化帧匹配到已有分支并立即执行,不再临场生成长文本。

在配对试验中,AAPT 将受限决策窗口内的成功率从 0.50 提高到 0.79,且没有产生错误动作;仍需在执行阶段 Decode 的 Open-loop 和 Predict-and-replan 基线成功率均为零。作者也明确给出适用边界:候选动作可以提前枚举时,预编译策略树最有效;开放世界、动作无法预知时,响应式执行仍然更强。

这三篇论文从不同方向指向同一个问题:Agent 的单一成功率已经不足以描述系统。评测器是否可靠、错误过程是否恶化、正确动作是否在 Deadline 前产生,都必须被单独记录。

五、本周判断

本周最值得持续跟进的,不是某个模型在排行榜上又增加了几点,而是 AIGC 系统开始为近似计算和长链路执行建立细粒度证据

  1. 推理优化开始自带风险接口。 KV Cache 的压缩、复用和跨节点传输不再只报告平均速度,而是暴露请求级风险、命中边界与回退路径。
  2. 生成加速开始回到端到端。 Sol-Attn 把路由成本算进最终时间,PDD 同时检查步数和多样性,VIPER 则把物理过程加入条件设计。
  3. Agent 评测开始拆解责任。 错误可能来自 Agent、任务、轨迹记录或评测器;同一个总分也可能掩盖过程故障和关键路径延迟。
  4. “可部署”越来越接近“可观测、可诊断、可回退”。 仅仅在平均值上更快已经不够,系统还要知道自己什么时候不可靠。

对工程团队来说,下一步最值得补的指标也很明确:KV Cache 方案应记录逐请求风险与回退比例;视频加速应同时记录端到端延迟、运动多样性和质量退化;Agent Benchmark 则应保留评测器置信度、错误类别、动作生成时间和 Deadline 命中率。只有这些指标进入日常回归,论文里的优化方法才有机会变成稳定的生产能力。


本期论文

整理说明:本文依据 arXiv 公开版本与论文摘要整理;性能、准确率和人工偏好结果均为论文作者自报,不代表 AIGCage 独立复现。不同模型、硬件、数据集、任务和基线之间不能直接横向比较。