AIGC 开源一周|版本发布走向硬件、缓存与动态调度协同
8 月 18 日到 25 日,vLLM、SGLang、FlashInfer、FlashAttention 4、Megatron Core、Diffusers 和 ComfyUI 围绕模型支持、量化、MoE、KV、动态 shape 与视频工作流持续发布。
行业动态 · 来源整理 · AIGC 开源一周UPDATES AGGREGATED TIMELINE
按发布时间聚合推理优化、训练优化和技术雷达的内容;这里不是独立栏目。
8 月 18 日到 25 日,vLLM、SGLang、FlashInfer、FlashAttention 4、Megatron Core、Diffusers 和 ComfyUI 围绕模型支持、量化、MoE、KV、动态 shape 与视频工作流持续发布。
行业动态 · 来源整理 · AIGC 开源一周8 月 18 日到 25 日,论文把推理优化推进到状态管理:MoE 专家驻留、KV page 压缩、speculative decoding 候选相关性、异步 Agent RL 与 CPU/ANE 带宽协同成为共同主线。
论文周报 · 来源整理 · AIGC 论文一周8 月 11 日到 17 日,vLLM、FlashInfer、FlashAttention 4、Transformer Engine 和 ComfyUI 集中处理 MoE serving、FP4/FP8、MLA、KV 布局、动态 shape 与视频工作流兼容性。
行业动态 · 来源整理 · AIGC 开源一周8 月 11 日到 17 日,论文把推理优化从单点算子扩展到权重驻留、输入自适应计算、KV Cache、Agent 回滚和跨节点迁移,运行时状态成为新的系统接口。
论文周报 · 来源整理 · AIGC 论文一周从框架异步流水、micro-batch 重排到 tile-level 算子融合,系统梳理大模型训练和推理中的通信—计算协同,并区分资源卸载、GPU 发起通信与网内计算的真实边界。
工程手记 · 完整正文 · 系统架构本周开源社区围绕 Kimi K3、混合注意力、长上下文和视频生成同步推进模型支持、Rust 前端、KV Cache、Kernel、量化与工作流工具。
行业动态 · 来源整理 · AIGC 开源一周本周论文从视觉 token、扩散式推测解码到 KV Cache 和 SLO 调度,呈现出同一条主线:系统开始按请求、模态和缓存状态动态分配计算预算。
论文周报 · 来源整理 · AIGC 论文一周Flux.3 已官宣但截至发稿仍未公开源码和权重;MiniMax H3 已在 Hugging Face 开放权重,并通过 Diffusers 与 SGLang 提供部署路径,支持最长 15 秒、最高 2K 的音视频联合生成。
行业动态 · 官方页面与模型仓库核验 · 模型发布扫描 7 月 26 日至 8 月 2 日的 2340 篇候选论文:KV Cache 开始暴露请求级风险并支持语义复用与选择性传输,视频生成同时优化速度、物理过程与多样性,Agent 评测转向过程错误和决策时延。
论文周报 · 完整正文 · AIGC 论文一周从 7 月 18 日至 25 日的 2076 篇 arXiv 论文中筛选 8 篇:KV Cache 走向压缩与组合复用,视频生成开始用低成本搜索筛选候选,Agent 评测进入训练闭环。
论文周报 · 完整正文 · 论文每周总结微软、英伟达等公司支持开放权重生态;Kimi K3 推向 2.8T;NVIDIA 分别与 SK Group、SSI 深度绑定,AMD 扩大 AI 基础设施合作,Agent 安全事件暴露持续监控缺口。
行业动态 · 官方公告与媒体核验 · AIGC 行业一周Kimi K3 公开 2.8T 开放权重;vLLM 0.26.0 与 SGLang 0.5.16 推进混合注意力、分层 KV 存储和推测解码,FlashAttention、ComfyUI 与 TRL 同步更新。
行业动态 · 官方 Release 核验 · AIGC 开源一周Google 用 Gemini Flash 系列压低 Agent 成本并开放 Search 应用连接;OpenAI 与 Hugging Face 的安全事件,则暴露了高能力 Cyber Agent 的隔离问题。
行业动态 · 官方公告与媒体核验 · AIGC 行业一周Dynamo v1.3.0 把 token 直通、权重热更新与 RL worker 管理接入分布式推理;TRL v1.9.0 重构多轮 Agent rollout 与 vLLM 权重同步。
行业动态 · 官方 Release 核验 · AIGC 开源一周扫描 7 月 10 日至 17 日的 570 篇论文:KV Cache 成为系统状态,Agent 开始学习动作偏好、拒绝执行与可审计性,视频生成转向精确编辑和长时稳定。
论文周报 · 完整正文 · 论文每周总结SpaceXAI 开源的不是 Grok 模型,而是模型外面的 Agent Runtime。本文从源码分析 Agent Loop、上下文压缩、Subagent、权限、沙箱以及 Coding Agent 真正难以复制的工程系统。
深度分析 · 源码分析 · 开源项目解析沿着 DMD 的分布匹配路线,解释 DMD2 如何通过双时间尺度更新、GAN 监督和推理轨迹模拟,移除回归损失并支持少步生成。
理论到工程 · 完整推导 · 步数蒸馏从 KL 散度与 score 梯度出发,完整解释 DMD 如何匹配真实分布与学生分布,以及 fake score 网络和回归损失各自解决什么问题。
理论到工程 · 完整推导 · 步数蒸馏从潜变量生成模型出发,推导 VAE 的近似后验、KL 散度、ELBO 与重参数化技巧,并进一步说明层次 VAE 以及 VAE 在现代 latent image/video generation 中的作用。
数学基础 · 完整推导 · Math In AIGC2026 年 7 月 8 日至 15 日,vLLM v0.25 删除早期 PagedAttention kernel、让 Model Runner V2 成为默认路径;SGLang 发布 v0.5.15,并在主分支启动约 280 个 kernel 的统一迁移。
行业动态 · 来源公开 · 一周开源动态Kepler、Maxwell、Pascal、Volta、Turing、Ampere、Hopper、Ada Lovelace 和 Blackwell,不只是 GPU 架构代号,也串起了天文学、电磁学、计算机科学与统计决策理论的发展史。
GPU 编年史 · 资料公开 · GPU 编年史2026 年 7 月 8 日至 15 日,OpenAI 推进 GPT-5.6 与 ChatGPT 工作入口,Meta 图片生成遭遇授权争议,Mistral 进入机器人领域,生成内容透明度继续成为行业规则。
行业动态 · 来源公开 · 一周行业新闻本文复盘了 HunyuanVideo1.5 在单卡 L40S 上从 BF16 优化到 FP8 优化的过程。我们先把 BF16 路径做到相对充分优化,再引入 FP8,避免用一个过弱 baseline 放大 FP8 收益。 实践发现,FP8 并不是换掉 Linear dtype 就会自动变快。activation 需要运行期量化,weight layout 必须保持 column-major,不同 GEMM shape 也需要选择不同 backend。初始 FP8 版本反而明显慢于 BF16;经过 weight layout 修正、GEMM kernel 优化、多 backend selector、QKV 共享 activation quant、producer-side pre-quant 等优化后,最终 FP8 版本达到 282.44s,快于优化后的 BF16,也优于 vLLM-Omni 和 LightX2V 的 FP8 对比结果。 核心经验是:FP8 优化不是单个 GEMM benchmark 的胜利,而是完整推理 hot path 的系统工程。layout、量化开销、backend 选择、模型语义和 runtime 分发都会影响最终端到端收益。
工程手记 · 完整正文 · performance介绍 AIGC 图像与视频生成中的基础数学,包括最大似然估计、独立随机变量的分布、Jensen 不等式等内容。
数学基础 · 完整推导 · Math In AIGC