
7 月 18 日到 25 日的论文里,一个反复出现的信号是:研究者不再只问“怎样把一次计算做得更快”,而是在追问“这次完整计算是否有必要发生”。
长上下文推理开始复用压缩后的模型状态;视频生成先用低成本候选搜索,再只对胜者完整去噪;长视频理解在频域里判断哪些帧和哪些细节值得保留;Agent 则被要求学会判断,哪些动作值得沉淀成可复用工具。它们不是同一套算法,但都在试图让算力支出和最终结果的贡献对齐。
本文选取 arXiv 在 2026 年 7 月 18 日 00:00 至 7 月 25 日 23:59(UTC) 首次提交或更新、且与生成式 AI、推理系统、多模态和 Agent 直接相关的论文。文中的性能数字均为论文作者自报,不同模型、硬件、数据集和基线之间不能直接横向比较。
一、本周最值得关注的变化:优化对象从算子扩大到“计算决策”
过去常见的优化问题是:同一批矩阵乘、同一轮 attention、同一条去噪轨迹,能不能以更低延迟完成。本周几篇论文把问题向前推进了一步:
- 对长上下文,不一定每次都重新 prefill;
- 对视频候选,不一定每条分支都完整生成;
- 对视觉 token,不一定每一帧、每个空间位置都保留同等预算;
- 对 Agent,不一定每个动作都值得付出创建工具的固定成本。
这类方法有一个共同结构:先构造便宜但足够可靠的代理信号,再把完整计算留给少数高价值路径。难点也随之改变——代理信号不仅要便宜,还不能改变原本的排序和决策。
二、LLM 推理:KV Cache 不只要复用,还要能够压缩后重组
C²KV:把非前缀上下文变成可组合的缓存单元
C²KV: Compressed and Composable KV Cache Reuse for Efficient LLM Inference 处理的是 RAG 和多文档推理中很具体的浪费:文档已经处理过,但只要它在新请求里的顺序或位置发生变化,传统 prefix cache 就很难直接复用;如果把多个文档的 KV Cache 生硬拼接,又会因为位置和上下文不匹配而掉点。
论文在冻结的基础模型旁增加一个轻量 Extractor。它用可学习的 compression tokens 和结构化 attention,把每段上下文抽取成位置无关、可以单独存储的压缩表示;训练时同时约束“压缩后能保留信息”和“多段表示拼接后仍能被基础模型使用”。因此,缓存单元不再绑定某个固定前缀,而可以像文档模块一样被重新排序和组合。
作者在多种长上下文任务和模型上报告,在保持生成质量的同时降低 KV 存储与传输成本,特定长上下文设置下最高达到 17× 推理加速。这里的 17× 是论文实验中的最高值,不应理解为任意服务负载都能获得同等提升。真实系统还要把 Extractor 开销、缓存命中率、跨卡传输、并发调度和失配回退一起计入。
这篇工作的价值不只是“又一种 KV 压缩”。它把缓存复用的粒度从请求前缀推进到了可重组的语义片段,对多轮 RAG、多 Agent 共享资料和重复文档集合尤其有吸引力。
X-Stage:remote store 发出以后,通信并没有“结束”
X-Stage: An Overlooked Pipeline Stage for Communication-Computation Overlap in DiT Inference 关注分布式 DiT 推理中一个容易被时间线掩盖的阶段:GPU kernel 发出 remote store 之后,到数据真正对远端可见之前,仍然存在推进、排空和背压。
现有调度通常描述“什么时候发通信”和“什么时候消费收到的数据”,但没有显式建模发送后的 outstanding capacity。短 burst 可能在计算继续时自然排空;持续注入则会耗尽容量,让后续 issue 被迫等待。论文把这段软件可见的 post-issue progress 命名为 X-Stage,并用 Burst-Gap 模型描述无背压 issue 时间、有效排空速率和 outstanding capacity。
在八卡近期 NVIDIA 架构节点上,作者据此重排两类融合 kernel:DeepGEMM MegaMoE 在 84 个配置上相对 Expert-Wave 基线获得 1.18× 几何平均、最高 1.62× kernel 加速;Ulysses sequence-parallel attention 将 post-attention All-to-All 细化到 tile 粒度,与 FlashAttention 融合,最高 sender-visible 加速为 1.43× / 1.42×。
这些是 kernel 和发送侧可见时间,不等同于整个 DiT 服务的端到端吞吐提升。但它给系统工程一个很实用的提醒:通信已经 issue,不代表发送侧资源已经释放;真正可重叠的空间取决于 burst 形态和排空节奏。
三、视频与多模态:便宜探索、频域压缩和敏感通道保护
CachedSearch:候选可以“粗跑”,最终结果必须“精跑”
CachedSearch: Training-Free Cached Exploration for Test-Time Search in Video Diffusion 从 best-of-N 视频生成的浪费出发:为了选出一个结果,N 个候选都要完整去噪,但最终只有一个会被采用。
它提出两段式执行:
- 用 aggressive caching 低成本跑完所有候选,得到近似结果并交给 verifier 排序;
- 只把选中的 winner 用完整计算重新生成一次。
关键并不是缓存后单条视频看起来是否接近,而是 候选排序能否保持。论文在 Wan2.1-T2V-1.3B 上报告,缓存轨迹与完整轨迹的每个 prompt 中位 Spearman 相关系数为 0.905,top-1 一致率为 72%;对选出的胜者再做完整重算,可保留完整搜索收益的 90%–94%。在 N=8 时,CachedSearch 以 63% 成本获得 94.7% 的 best-of-N 收益。
作者还在 Wan、LTX、CogVideoX 和 Hunyuan 的 1.3B 到 14B 模型上做了迁移验证。不过,论文也明确指出不同模型家族需要重新校准一个参数;排序接近的候选仍可能互换。它更像是 test-time scaling 的加速器,而不是“不看模型就能套用”的固定缓存策略。
WaveZip:时间冗余和空间细节,不该用同一种压缩规则
WaveZip: Wavelet-Driven Space-Time Decoupling for Video Token Condensation 针对长视频 VLM 的视觉 token 膨胀,使用离散小波变换把时间冗余和空间细节拆开处理。
时间维使用 1D DWT 分析 query 与视频帧的相关性,再把高频系数和帧间差异结合起来,动态分配每一帧的 token 预算;空间维使用 2D DWT 分离低频结构和高频细节,并在 query 相关区域强化高频信息。它不是简单地均匀合并 token,也不是只按注意力分数硬剪枝。
论文报告,这种无需任务特定训练的方法在 10× token 压缩下保留完整模型 99.6% 的性能。这个百分比是论文多个长视频理解基准下的相对结果,不代表所有视频任务都会无损。对于 OCR、细粒度动作和短时突发事件,高频选择规则是否遗漏关键信号仍需要单独检查。
C-PTQ:量化误差相同,对任务的伤害并不相同
C-PTQ: Fisher-weighted Channel-wise Sensitivity for Post-training Quantization of MLLMs 讨论 MLLM 量化中的 outlier channel。现有 channel-wise scaling 往往用 token 或模态级统计量衡量重要性,但这些统计量与任务损失并不完全对齐。
C-PTQ 用 Fisher 加权目标近似二阶敏感度,把“这个通道的量化误差有多大”和“误差会让任务损失变化多少”放到同一个目标里。论文在 Qwen2.5-VL、InternVL2 和 LLaVA-OV 的 8 个基准上,同时测试 weight-only 与 weight-activation 设置,并强调无需增加 LoRA 等辅助模块。
这条路线的工程意义很直接:当量化预算不足时,优先保护任务真正敏感的通道,而不是只保护数值幅度最大的通道。但论文结果仍来自给定校准集和任务;换到 OCR、视频或特定领域数据后,Fisher 估计是否稳定,需要重新验证。
四、Agent:真正困难的不是“会调用工具”,而是知道何时值得造工具
AlloBench:抽象题会算,落到脚本构建就失效
AlloBench: Measuring Online Tool Allocation Capability in LLM Agents 把工具创建看成一个在线分配问题:创建可复用工具要先支付固定成本,后续重复调用才能回本。理想 Agent 应该只把高频、可复用的操作沉淀成工具,而不是为每个一次性任务都写脚本。
论文设计了成对测试:一组用抽象文本描述分配问题,另一组要求 Agent 真正构建脚本。作者报告,测试的 Claude Haiku、Claude Opus、GPT-5.4-mini 和 GPT-5.6 Sol 在抽象问题上接近最优,但无法把策略迁移到脚本分配;对 Qwen 做抽象分配策略训练后,也能泛化到词汇变化,却不能改善脚本场景。
这暴露的不是普通工具调用能力,而是“未来复用价值”与“当前构建成本”的联合判断。它也提醒我们:一个 Agent 在文字版规划题中表现理性,并不意味着进入真实代码环境后仍会保持同样的资源纪律。
SeekJudge:把长轨迹奖励拆成可搜索、可定位的判断过程
SeekJudge: A Practical Reward Framework for Reinforcement Learning in Computer-Use Agents 处理 computer-use Agent 训练中的奖励瓶颈。GUI 任务的规则评测容易随应用版本和在线内容变化而失效;直接用大型闭源模型读完整轨迹,又贵且难以扩展到长任务。
SeekJudge 把判断拆成 Condense、Ground、Seek 和 Analyze 四个角色,通过 Seek–Analyze 循环定位轨迹中的证据,最后给出结果。四个角色共享一个经过 seed-calibrated distillation 的 9B backbone,从而控制单次上下文和服务成本。
论文以 held-out RL 目标上的下游成功率衡量奖励质量,并报告模型式 reward 首次达到或超过原生规则监督,同时提供 step-level 判断。这里更准确的说法是:在论文覆盖的在线 RL 环境与目标上,SeekJudge 已经能作为规则评测的候选替代;它并没有证明模型 judge 在所有 GUI、所有版本漂移和所有安全边界下都比规则可靠。
把这两篇放在一起看,Agent 基础设施正在从“能否完成任务”转向更细的两个问题:执行前,是否值得创建一个长期资产;执行后,能否从长轨迹中找到足够可靠的训练信号。
五、生成模型:先把交互逻辑想清楚,再交给视频模型
AgentHOI: Multi-Agent Reasoning for Human-Object-Interaction Video Generation via Implicit Representation Alignment 尝试解决人和物体交互视频中的逻辑错误。穿戴、骑乘等动作不是单主体动画:模型必须同时理解物体状态、接触关系、动作顺序和运动约束。
AgentHOI 采用 “thinking-before-generation” 路线,让多个角色先完成感知、交互和运动规划,再用 implicit text-motion alignment 把 text-to-motion 先验蒸馏到视频扩散模型中。推理阶段不需要额外显式动作输入,文本规划直接影响生成。
论文报告在交互自然度、物体外观保持和复杂指令遵循上优于对比方法。值得继续观察的是,规划文本能否真正约束物理一致性,还是主要改善数据分布内的动作模板;对罕见物体、长时间接触和遮挡场景,还需要更严格的物理与时序评测。
六、本周判断
本周最清晰的方向,不是某一种新架构突然胜出,而是 “选择性计算”正在成为跨栈设计原则:
- 模型状态开始模块化。 C²KV 试图把上下文计算结果从请求前缀中解耦,变成可压缩、可组合的资产。
- 搜索开始分层定价。 CachedSearch 不要求便宜轨迹成为最终成品,只要求它足以选出值得完整计算的候选。
- 压缩开始面向任务。 WaveZip 和 C-PTQ 都不再把所有 token、通道视为同等重要,而是用频率结构或任务损失分配预算。
- Agent 评测开始进入训练系统。 AlloBench 测资源分配边界,SeekJudge 则把长轨迹判断变成可部署的 reward 服务。
真正落地时,最值得检查的不是论文中的单点最高倍数,而是代理决策失效的代价:缓存复用错了能否回退,候选排序错了损失多少,token 被压掉后能否发现,judge 给错奖励是否会被训练持续放大。只有这些失败路径可测、可控,选择性计算才会从论文技巧变成可靠的系统能力。
本期论文
整理说明:本文依据论文公开版本、摘要、方法图与实验部分整理;性能数字保留论文测试边界,不代表 AIGCage 独立复现。题图由生成模型制作,研究地图与机制图由 AIGCage 根据论文内容重新绘制。