AIGC 论文一周 DiT 免校准量化与 CFG 蒸馏 MoE 通信和缓存优化
9 月 30 日至 10 月 6 日的 16 篇论文,详解 CentriQ、GFD-OPD、MC-Sparse、VDOT++、QATFactory、MegaFlux、RailWave 与 KV²,覆盖 H3、FLUX、Wan、DeepSeek 和 Qwen 的训练推理问题。
RADAR WEEKLY SIGNAL
筛掉噪音,持续整理行业动态、开源框架更新与值得长期保存的 GPU 技术历史。每日论文已进入独立研究索引。
9 月 30 日至 10 月 6 日的 16 篇论文,详解 CentriQ、GFD-OPD、MC-Sparse、VDOT++、QATFactory、MegaFlux、RailWave 与 KV²,覆盖 H3、FLUX、Wan、DeepSeek 和 Qwen 的训练推理问题。
9 月 30 日至 10 月 6 日的 10 项开源进展,覆盖 DeepSeek、Kimi、Qwen、GLM 与 MiniMax-H3,详解 vLLM 0.31、SGLang 0.5.21、ComfyUI 0.39、vLLM-Omni RC 和 Transformers 5.19。
9 月 23—29 日 16 篇论文:Sol-H3、PDMD、PulseQuant、DraftAttention2、MpFA、QwenGyre、HyDra、PulseInfer 与 WavePP。详解视频蒸馏、低比特内核和热门模型的部署优化。
9 月 23—29 日 11 项开源进展:ComfyUI 0.38、H3 W6A8 与精确投影缓存、vLLM-Omni 0.30、GLM5.3-Flash 修复、Kimi K3 显存优化、Qwen 投机验证及 TensorRT-LLM RC。
9 月 16—22 日 16 篇论文:DeepSeek-V4.1、Qwen3.8-Omni、Video DeltaNet、SparkDiffusion、QuantWM、分阶段量化、Weave 与长上下文训练。拆解方法、测试条件和复现边界。
9 月 16—22 日开源进展:VDN-H3 参考图生成、vLLM 0.30、SGLang 0.5.20、ComfyUI 0.37、FlashInfer 0.7,以及 Qwen、DeepSeek、Kimi、GLM 与低比特推理的新部署路径。
9 月 10—16 日 16 篇论文:MiniMax-H3 物理推理评测、SSD-LLaMA、Fathom、GLM-5.3 缓存恢复、MoE 训练显存、mKernel、ASPIRE、OmniKVQuant,以及视频蒸馏、Vidu S2 和 vidax。
9 月 10—16 日开源进展:ComfyUI 0.36 的 H3 VAE 和循环工作流、vLLM-Omni、Kimi K3 DSpark、Chord W4A16、MiniMax M3 MI355X、分层 KV、SGLang、Transformer Engine 2.19 与 FlashAttention 4。
9 月 3—9 日论文精选:FP4 FlashAttention、Qwen 专家裁剪、BeaconKV、Kimi Linear 缓存、LeanGRPO、CIERA、LLaDA-Image 与 Wan 视频量化,展开方法、实验条件和落地限制。
9 月 3—9 日开源进展:详解 MiniMax-H3/FastH3、GLM-5.3、Qwen、DeepSeek、Kimi 的部署变化,以及 LLaDA-Image、Wan 量化、Diffusers 和 MLX 更新。
整理 2026 年 8 月 24 日至 9 月 2 日的论文进展,重点关注 Qwen3.8-Next、MiniMax-H3、LTX-2、Wan2.2、DeepSeek、Kimi、GLM 以及 KV 和扩散推理。
整理 2026 年 8 月 24 日至 9 月 2 日的开源进展,重点关注 MiniMax-H3、DeepSeek、Kimi、Qwen、GLM、LTX/Wan 生态在主流推理和工作流框架中的适配。
8 月 18 日到 25 日,论文把推理优化推进到状态管理:MoE 专家驻留、KV page 压缩、speculative decoding 候选相关性、异步 Agent RL 与 CPU/ANE 带宽协同成为共同主线。
8 月 18 日到 25 日,vLLM、SGLang、FlashInfer、FlashAttention 4、Megatron Core、Diffusers 和 ComfyUI 围绕模型支持、量化、MoE、KV、动态 shape 与视频工作流持续发布。
8 月 11 日到 17 日,论文把推理优化从单点算子扩展到权重驻留、输入自适应计算、KV Cache、Agent 回滚和跨节点迁移,运行时状态成为新的系统接口。
8 月 11 日到 17 日,vLLM、FlashInfer、FlashAttention 4、Transformer Engine 和 ComfyUI 集中处理 MoE serving、FP4/FP8、MLA、KV 布局、动态 shape 与视频工作流兼容性。
本周论文从视觉 token、扩散式推测解码到 KV Cache 和 SLO 调度,呈现出同一条主线:系统开始按请求、模态和缓存状态动态分配计算预算。
本周开源社区围绕 Kimi K3、混合注意力、长上下文和视频生成同步推进模型支持、Rust 前端、KV Cache、Kernel、量化与工作流工具。
扫描 7 月 26 日至 8 月 2 日的 2340 篇候选论文:KV Cache 开始暴露请求级风险并支持语义复用与选择性传输,视频生成同时优化速度、物理过程与多样性,Agent 评测转向过程错误和决策时延。
Flux.3 已官宣但截至发稿仍未公开源码和权重;MiniMax H3 已在 Hugging Face 开放权重,并通过 Diffusers 与 SGLang 提供部署路径,支持最长 15 秒、最高 2K 的音视频联合生成。
Kimi K3 公开 2.8T 开放权重;vLLM 0.26.0 与 SGLang 0.5.16 推进混合注意力、分层 KV 存储和推测解码,FlashAttention、ComfyUI 与 TRL 同步更新。
微软、英伟达等公司支持开放权重生态;Kimi K3 推向 2.8T;NVIDIA 分别与 SK Group、SSI 深度绑定,AMD 扩大 AI 基础设施合作,Agent 安全事件暴露持续监控缺口。
从 7 月 18 日至 25 日的 2076 篇 arXiv 论文中筛选 8 篇:KV Cache 走向压缩与组合复用,视频生成开始用低成本搜索筛选候选,Agent 评测进入训练闭环。
Dynamo v1.3.0 把 token 直通、权重热更新与 RL worker 管理接入分布式推理;TRL v1.9.0 重构多轮 Agent rollout 与 vLLM 权重同步。
Google 用 Gemini Flash 系列压低 Agent 成本并开放 Search 应用连接;OpenAI 与 Hugging Face 的安全事件,则暴露了高能力 Cyber Agent 的隔离问题。
扫描 7 月 10 日至 17 日的 570 篇论文:KV Cache 成为系统状态,Agent 开始学习动作偏好、拒绝执行与可审计性,视频生成转向精确编辑和长时稳定。
SpaceXAI 开源的不是 Grok 模型,而是模型外面的 Agent Runtime。本文从源码分析 Agent Loop、上下文压缩、Subagent、权限、沙箱以及 Coding Agent 真正难以复制的工程系统。
2026 年 7 月 8 日至 15 日,OpenAI 推进 GPT-5.6 与 ChatGPT 工作入口,Meta 图片生成遭遇授权争议,Mistral 进入机器人领域,生成内容透明度继续成为行业规则。
Kepler、Maxwell、Pascal、Volta、Turing、Ampere、Hopper、Ada Lovelace 和 Blackwell,不只是 GPU 架构代号,也串起了天文学、电磁学、计算机科学与统计决策理论的发展史。
2026 年 7 月 8 日至 15 日,vLLM v0.25 删除早期 PagedAttention kernel、让 Model Runner V2 成为默认路径;SGLang 发布 v0.5.15,并在主分支启动约 280 个 kernel 的统一迁移。