这一周,我们的论文库在 7 月 10 日至 17 日区间收录了 570 篇新论文。数量最多的仍然是 Agent,但真正值得工程团队关注的变化,不是又多了几个“会调用工具”的 Demo,而是研究重点开始向更具体的问题下沉:KV Cache 怎样成为可复用的系统状态,Agent 怎样学习正确行动甚至拒绝行动,视频生成怎样从“生成一段视频”走向精确编辑和长时间稳定,以及蒸馏怎样真正换来可用的端到端速度。
下面是本周最值得关注的四条线索。
一、KV Cache 不再只是显存优化,而是系统设计的一部分
过去谈 KV Cache 优化,通常只有两个关键词:量化和淘汰。这一周的论文把问题向前推进了一步——研究者开始同时追问“缓存内部有什么结构”“缓存何时可复用”以及“不同请求、不同 Agent 之间怎样传递缓存”。
JoLT:把 KV Cache 当成三阶张量
A JoLT for the KV Cache 不再把 KV Cache 简化成二维矩阵,而是直接利用 head、token 和 feature 三个轴上的冗余差异。它用部分 Tucker 分解压缩 token 和 feature 维度,再用低比特 JL residual 补回截断损失。
论文报告,在 Mistral-7B-v0.3 和 LLaMA-2-13B 上可实现接近无损的 2–3 倍压缩;2 倍压缩时,K/V 的相对 Frobenius 重建误差分别约为 0.009 和 0.006。随机化 SVD 版本 FlashJoLT 还能把压缩过程加速 5–13 倍。
这里真正重要的不是又出现一种低秩方法,而是资源分配方式发生了变化:Tucker rank 和 residual bit-width 在统一字节预算下联合决定,而且 K、V 可以分别配置。这比“一刀切地把所有缓存量化成 4 bit”更接近实际系统需要。
MemDecay:Agent 已经知道上下文的语义区域,缓存策略应该利用它
MemDecay 针对 Agent 上下文提出了一个很现实的问题:system prompt、计划、检索文档、工具输出和 scratchpad 的生命周期完全不同,为什么要用同一种淘汰规则?
实验发现,不同区域的 attention lifetime 可以相差一个数量级。system token 的半衰期约为 148–189 个 decoding step,而 scratchpad 只有 14–16 步。MemDecay 允许为不同语义区域设置基础优先级和衰减速度,并把关键区域固定在缓存中。
这意味着 KV Cache 管理不应只待在推理引擎内部。Agent harness 掌握着 prompt 的结构信息,未来更合理的接口可能是由上层把“这段状态是否可丢弃”传给 serving runtime。
AAFLOW+:Agent 之间不只传文本,也可以传模型状态
AAFLOW+ 更进一步,把 KV Cache 提升为分布式系统中的一等对象,提供 materialize、transfer、fork、composition 和 eviction 等操作。论文基于实测硬件微基准构建的成本模型显示,在 16-Agent 场景中,传递和复用 KV 状态可将 TTFT 最多降低 50.2 倍、计算成本降低 7.63 倍,并将吞吐提升超过 7.74 倍。
这些数字还需要真实端到端部署继续验证,但方向很明确:多 Agent 系统如果仍然通过文本反复传递相同长上下文,就会不断重复 prefill。模型状态能否跨进程、跨机器复用,正在成为 Agent 基础设施的新问题。
一个重要的评测提醒:看见 Query,会改变压缩方法的排名
How Query Visibility Changes KV-Cache Compression Rankings 对六种压缩方法做了 matched-budget audit。它指出,很多论文在压缩上下文时已经看到了 Query;但真实的缓存复用场景往往是先压缩文档,未来问题尚未出现。
当评测从 query-aware 改成 query-agnostic 后,方法排名明显变化。在共享 attention backend 的五种方法中,只有 KeyDiff 能稳定超过简单基线;SnapKV 平均甚至输给“保留开头和最近窗口”。这提醒我们:压缩率相同不代表测试条件相同,Query 是否可见必须成为 KV Cache Benchmark 的显式字段。
二、推理优化开始同时看性能、能耗和正确性
Attention to Detail 对 vLLM 的 attention kernel、prefix caching 和 chunked prefill 进行了 9000 次受控运行,覆盖 5 个开源模型和 5 类任务。
结果没有给出一个“最佳配置模板”。attention 类型和 prefix caching 对能耗与性能影响明显,chunked prefill 在默认 serving 配置和被测负载下影响有限;更值得注意的是,同一选项的收益高度依赖模型与任务,推理配置甚至可能影响输出准确率。
这和我们做性能榜单时坚持公开硬件、框架版本、并发和负载的原因一致。vLLM 版本、attention backend、prefix cache 是否开启,都不能藏在备注里。模型选择决定全局 Pareto frontier,框架配置更多是在局部继续优化。
扩散模型 serving 也出现了类似的“工作量不必均匀”思路。FlashDiff 根据早期 attention 信号把 latent 划分成语义区域,只继续计算仍需细化的区域,并把释放出来的算力重新分配给并发请求。论文在图像、视频和音频任务上报告端到端延迟降低 30%–97%,吞吐提升 1.2–2.2 倍。
三、Agent 的重点从“会做事”转向“知道该做什么”
本周 Agent 方向收录量最大,但最值得看的是训练目标和安全边界开始变得更清楚。
Agentic-DPO:把专家轨迹从模仿数据变成动作偏好
Agentic-DPO 认为,SFT 只是让 Agent 模仿完整专家轨迹,却没有教它在每个状态下区分正确动作和看似合理的错误动作。它从当前策略采样一步负例,把专家动作和错误动作组成 state-conditioned preference,再使用 DPO 式目标训练。
这个方法不需要在线环境 rollout 或单独 reward model。在 tau-bench retail 上,9B 模型准确率从 SFT 的 21.7% 提升到 41.4%,达到同 backbone 在线 GRPO 的水平。对难以大规模部署交互环境的团队来说,这是一条很有吸引力的离线 Agent 优化路径。
AgentAbstain:Agent 不行动,也是一种能力
AgentAbstain 关注一个经常被成功率掩盖的问题:面对歧义、冲突约束和工具故障,Agent 能否在不可逆操作之前停下来?
它构造了 263 对 act / abstain 任务,覆盖 42 个可执行沙箱和 8 类拒绝场景。在 17 个前沿模型、4 种 Agent harness 的测试中,最佳系统在一对任务上同时做对“应该执行”和“应该拒绝”的比例也只有 59.5%。论文还观察到一种危险失败:Agent 先执行了不可逆动作,随后才意识到应该拒绝。
这说明 Agent Benchmark 不能只统计任务是否完成。权限检查、前置确认、工具错误处理和 abstention calibration 应该成为 harness 的基础能力。
可审计性要进入运行时,而不是留在日志里
Toward Auditable AI Scientists 提出的 HEP,把 hypothesis、test、evidence 和 belief update 变成显式操作。它的价值不只适用于 AI Scientist:任何长任务 Agent,如果关键决策只存在于非结构化对话日志中,就很难回放、比较和追责。
从 Agentic-DPO、AgentAbstain 到 HEP,可以看到一条共同趋势:模型能力仍然重要,但 Agent 系统的上限越来越取决于 harness 是否提供了正确的状态、动作、权限和审计抽象。
四、视频生成向“精确控制”和“长时稳定”推进
本周多模态生成与编辑方向收录 96 篇。相比单纯提高画质,代表工作更关注引用关系、运动控制和误差累积。
ReBind 解决多参考图视频编辑中的歧义:当人物来自参考图 A、衣服来自参考图 B、背景来自参考图 C 时,普通自然语言指令很难让模型稳定建立对应关系。它在语义位置插入 reference token,把属性和来源显式绑定,再通过专用 MLLM 生成结构化指令。
Controlling Motion Transfer in Diffusion Transformers 则把分析粒度下沉到 attention head,识别出偏运动和偏空间结构的不同 head。在不更新参数的情况下,它通过 motion-specialized head 和选择性 feature injection 完成运动迁移。这个结果也提示,DiT 内部的 head 并非完全同质,未来可控生成未必都需要增加 ControlNet 式外部模块。
长视频的核心问题仍是误差累积。Cycle-World 用反向预测建立 cycle consistency:训练时让前向生成序列保持可逆,推理时再把冻结的反向模型作为校正器。论文在 VBench 上测试到 60 秒视频,目标不是只让相邻帧平滑,而是阻止小误差沿自回归历史不断放大。
五、步数蒸馏继续从“少几步”走向真正的一步可用
IB-Flow 重新审视 CFG 蒸馏。它认为固定 guidance strength、无差别采样 teacher timestep 的方式忽略了生成过程中的熵逐步下降,因此用局部向量场范数选择注入目标,并让 guidance 随 SNR 动态衰减,论文报告在严格的 2-step 设置下改善了过度引导伪影。
视频编辑则更接近端到端应用。From Draft to Draft-Free 先让 teacher 把粗糙移除结果修复成高质量视频,再通过 privileged consistency distillation 把能力压到一步 student;随后使用 Temporal Masked Transformer 在 latent space 生成 pseudo-draft,最终摆脱外部 draft。论文报告单段视频的去噪过程约 1 秒。
这些工作延续了 DMD、DMD2 所代表的方向,但评价标准正在变化:只报告 FID 或少几次网络调用已经不够,端到端预处理、条件构造、显存和真实 wall-clock latency 才能决定蒸馏是否产生工程价值。
本周判断
如果只记住这一周的三件事,可以是:
- KV Cache 正在从张量优化升级为跨请求、跨 Agent 的系统状态。 压缩算法、语义淘汰和分布式复用会逐渐合流。
- Agent harness 正在成为独立的研究对象。 如何构造动作偏好、何时拒绝执行、如何保存可审计状态,不能只靠更大的模型解决。
- 生成模型的效率研究开始回到端到端系统。 区域调度、一步蒸馏和运行时控制都需要用真实吞吐、延迟、显存与质量共同评价。
下一周值得继续观察两个问题:第一,KV Cache 的跨请求复用能否进入主流 serving runtime 的稳定接口;第二,Agent abstention 能否从 Benchmark 指标变成真正的权限与确认机制。
统计口径:AIGCage 论文库中 published_at 位于 2026-07-10(含)至 2026-07-18(不含)的记录,共 570 篇。主题数量允许重叠;本文选取代表论文进行人工整理,不以匹配分数直接代替论文质量判断。