AIGC 开源一周 H3 超分和采样更新 vLLM 0.31 与 SGLang 0.5.21
9 月 30 日至 10 月 6 日的 10 项开源进展,覆盖 DeepSeek、Kimi、Qwen、GLM 与 MiniMax-H3,详解 vLLM 0.31、SGLang 0.5.21、ComfyUI 0.39、vLLM-Omni RC 和 Transformers 5.19。
行业动态 · 依据官方发布记录、代码与 PR 整理;性能数据为项目报告,本站未独立复现 · AIGC 开源一周UPDATES AGGREGATED TIMELINE
按发布时间聚合推理优化、训练优化和技术雷达的内容;这里不是独立栏目。
9 月 30 日至 10 月 6 日的 10 项开源进展,覆盖 DeepSeek、Kimi、Qwen、GLM 与 MiniMax-H3,详解 vLLM 0.31、SGLang 0.5.21、ComfyUI 0.39、vLLM-Omni RC 和 Transformers 5.19。
行业动态 · 依据官方发布记录、代码与 PR 整理;性能数据为项目报告,本站未独立复现 · AIGC 开源一周9 月 30 日至 10 月 6 日的 16 篇论文,详解 CentriQ、GFD-OPD、MC-Sparse、VDOT++、QATFactory、MegaFlux、RailWave 与 KV²,覆盖 H3、FLUX、Wan、DeepSeek 和 Qwen 的训练推理问题。
论文周报 · 依据论文与项目资料整理;实验数据为作者报告,本站未独立复现 · AIGC 论文一周9 月 23—29 日 11 项开源进展:ComfyUI 0.38、H3 W6A8 与精确投影缓存、vLLM-Omni 0.30、GLM5.3-Flash 修复、Kimi K3 显存优化、Qwen 投机验证及 TensorRT-LLM RC。
行业动态 · 依据官方发布记录、代码与 PR 整理;性能数据为项目报告,本站未独立复现 · AIGC 开源一周9 月 23—29 日 16 篇论文:Sol-H3、PDMD、PulseQuant、DraftAttention2、MpFA、QwenGyre、HyDra、PulseInfer 与 WavePP。详解视频蒸馏、低比特内核和热门模型的部署优化。
论文周报 · 依据论文与项目资料整理;实验数据为作者报告,本站未独立复现 · AIGC 论文一周9 月 16—22 日开源进展:VDN-H3 参考图生成、vLLM 0.30、SGLang 0.5.20、ComfyUI 0.37、FlashInfer 0.7,以及 Qwen、DeepSeek、Kimi、GLM 与低比特推理的新部署路径。
行业动态 · 依据官方仓库、发布记录和工程报告整理;性能数据未经本站独立复现 · AIGC 开源一周9 月 16—22 日 16 篇论文:DeepSeek-V4.1、Qwen3.8-Omni、Video DeltaNet、SparkDiffusion、QuantWM、分阶段量化、Weave 与长上下文训练。拆解方法、测试条件和复现边界。
论文周报 · 依据论文与项目资料整理;实验数据为作者报告,本站未独立复现 · AIGC 论文一周从元组与嵌套结构的数学定义出发,理解 profile、rank、depth 与 size,并对应到 CuTe 的 Tuple、Shape 和 Stride API。
深度教程 · 完整正文 · CUTLASS 与 CuTe:原理、编程与优化解释 Int<1>{}、静态整数与普通整数的区别,以及静态信息如何在类型、模板参数和运算中保留。
深度教程 · 完整正文 · CUTLASS 与 CuTe:原理、编程与优化从行优先、列优先和 padding 出发,理解 shape:stride 如何统一表达矩阵存储,并进一步描述分块与嵌套布局。
深度教程 · 完整正文 · CUTLASS 与 CuTe:原理、编程与优化9 月 10—16 日开源进展:ComfyUI 0.36 的 H3 VAE 和循环工作流、vLLM-Omni、Kimi K3 DSpark、Chord W4A16、MiniMax M3 MI355X、分层 KV、SGLang、Transformer Engine 2.19 与 FlashAttention 4。
行业动态 · 依据官方发布、已合并代码和工程报告整理;性能为项目方报告,本站未独立进行 GPU 复现 · AIGC 开源一周9 月 10—16 日 16 篇论文:MiniMax-H3 物理推理评测、SSD-LLaMA、Fathom、GLM-5.3 缓存恢复、MoE 训练显存、mKernel、ASPIRE、OmniKVQuant,以及视频蒸馏、Vidu S2 和 vidax。
论文周报 · 依据论文全文与项目资料整理;实验数据为作者报告,本站未独立复现 · AIGC 论文一周9 月 3—9 日开源进展:详解 MiniMax-H3/FastH3、GLM-5.3、Qwen、DeepSeek、Kimi 的部署变化,以及 LLaDA-Image、Wan 量化、Diffusers 和 MLX 更新。
行业动态 · 官方发布、仓库与工程报告整理;性能数据为项目方报告,本站未独立复现 · AIGC 开源一周9 月 3—9 日论文精选:FP4 FlashAttention、Qwen 专家裁剪、BeaconKV、Kimi Linear 缓存、LeanGRPO、CIERA、LLaDA-Image 与 Wan 视频量化,展开方法、实验条件和落地限制。
论文周报 · 论文与官方项目资料整理;性能和质量数据为作者报告,本站未独立复现 · AIGC 论文一周整理 2026 年 8 月 24 日至 9 月 2 日的开源进展,重点关注 MiniMax-H3、DeepSeek、Kimi、Qwen、GLM、LTX/Wan 生态在主流推理和工作流框架中的适配。
行业动态 · 基于官方 Release、仓库文档与项目方 benchmark 的行业动态整理 · AIGC 开源一周整理 2026 年 8 月 24 日至 9 月 2 日的论文进展,重点关注 Qwen3.8-Next、MiniMax-H3、LTX-2、Wan2.2、DeepSeek、Kimi、GLM 以及 KV 和扩散推理。
论文周报 · 来源整理与工程解读 · AIGC 论文一周8 月 18 日到 25 日,vLLM、SGLang、FlashInfer、FlashAttention 4、Megatron Core、Diffusers 和 ComfyUI 围绕模型支持、量化、MoE、KV、动态 shape 与视频工作流持续发布。
行业动态 · 来源整理 · AIGC 开源一周8 月 18 日到 25 日,论文把推理优化推进到状态管理:MoE 专家驻留、KV page 压缩、speculative decoding 候选相关性、异步 Agent RL 与 CPU/ANE 带宽协同成为共同主线。
论文周报 · 来源整理 · AIGC 论文一周8 月 11 日到 17 日,vLLM、FlashInfer、FlashAttention 4、Transformer Engine 和 ComfyUI 集中处理 MoE serving、FP4/FP8、MLA、KV 布局、动态 shape 与视频工作流兼容性。
行业动态 · 来源整理 · AIGC 开源一周8 月 11 日到 17 日,论文把推理优化从单点算子扩展到权重驻留、输入自适应计算、KV Cache、Agent 回滚和跨节点迁移,运行时状态成为新的系统接口。
论文周报 · 来源整理 · AIGC 论文一周从框架异步流水、micro-batch 重排到 tile-level 算子融合,系统梳理大模型训练和推理中的通信—计算协同,并区分资源卸载、GPU 发起通信与网内计算的真实边界。
工程手记 · 完整正文 · 系统架构本周开源社区围绕 Kimi K3、混合注意力、长上下文和视频生成同步推进模型支持、Rust 前端、KV Cache、Kernel、量化与工作流工具。
行业动态 · 来源整理 · AIGC 开源一周本周论文从视觉 token、扩散式推测解码到 KV Cache 和 SLO 调度,呈现出同一条主线:系统开始按请求、模态和缓存状态动态分配计算预算。
论文周报 · 来源整理 · AIGC 论文一周Flux.3 已官宣但截至发稿仍未公开源码和权重;MiniMax H3 已在 Hugging Face 开放权重,并通过 Diffusers 与 SGLang 提供部署路径,支持最长 15 秒、最高 2K 的音视频联合生成。
行业动态 · 官方页面与模型仓库核验 · 模型发布扫描 7 月 26 日至 8 月 2 日的 2340 篇候选论文:KV Cache 开始暴露请求级风险并支持语义复用与选择性传输,视频生成同时优化速度、物理过程与多样性,Agent 评测转向过程错误和决策时延。
论文周报 · 完整正文 · AIGC 论文一周从 7 月 18 日至 25 日的 2076 篇 arXiv 论文中筛选 8 篇:KV Cache 走向压缩与组合复用,视频生成开始用低成本搜索筛选候选,Agent 评测进入训练闭环。
论文周报 · 完整正文 · 论文每周总结微软、英伟达等公司支持开放权重生态;Kimi K3 推向 2.8T;NVIDIA 分别与 SK Group、SSI 深度绑定,AMD 扩大 AI 基础设施合作,Agent 安全事件暴露持续监控缺口。
行业动态 · 官方公告与媒体核验 · AIGC 行业一周Kimi K3 公开 2.8T 开放权重;vLLM 0.26.0 与 SGLang 0.5.16 推进混合注意力、分层 KV 存储和推测解码,FlashAttention、ComfyUI 与 TRL 同步更新。
行业动态 · 官方 Release 核验 · AIGC 开源一周Google 用 Gemini Flash 系列压低 Agent 成本并开放 Search 应用连接;OpenAI 与 Hugging Face 的安全事件,则暴露了高能力 Cyber Agent 的隔离问题。
行业动态 · 官方公告与媒体核验 · AIGC 行业一周Dynamo v1.3.0 把 token 直通、权重热更新与 RL worker 管理接入分布式推理;TRL v1.9.0 重构多轮 Agent rollout 与 vLLM 权重同步。
行业动态 · 官方 Release 核验 · AIGC 开源一周扫描 7 月 10 日至 17 日的 570 篇论文:KV Cache 成为系统状态,Agent 开始学习动作偏好、拒绝执行与可审计性,视频生成转向精确编辑和长时稳定。
论文周报 · 完整正文 · 论文每周总结SpaceXAI 开源的不是 Grok 模型,而是模型外面的 Agent Runtime。本文从源码分析 Agent Loop、上下文压缩、Subagent、权限、沙箱以及 Coding Agent 真正难以复制的工程系统。
深度分析 · 源码分析 · 开源项目解析沿着 DMD 的分布匹配路线,解释 DMD2 如何通过双时间尺度更新、GAN 监督和推理轨迹模拟,移除回归损失并支持少步生成。
理论到工程 · 完整推导 · 步数蒸馏从 KL 散度与 score 梯度出发,完整解释 DMD 如何匹配真实分布与学生分布,以及 fake score 网络和回归损失各自解决什么问题。
理论到工程 · 完整推导 · 步数蒸馏从潜变量生成模型出发,推导 VAE 的近似后验、KL 散度、ELBO 与重参数化技巧,并进一步说明层次 VAE 以及 VAE 在现代 latent image/video generation 中的作用。
数学基础 · 完整推导 · Math In AIGC2026 年 7 月 8 日至 15 日,vLLM v0.25 删除早期 PagedAttention kernel、让 Model Runner V2 成为默认路径;SGLang 发布 v0.5.15,并在主分支启动约 280 个 kernel 的统一迁移。
行业动态 · 来源公开 · 一周开源动态Kepler、Maxwell、Pascal、Volta、Turing、Ampere、Hopper、Ada Lovelace 和 Blackwell,不只是 GPU 架构代号,也串起了天文学、电磁学、计算机科学与统计决策理论的发展史。
GPU 编年史 · 资料公开 · GPU 编年史2026 年 7 月 8 日至 15 日,OpenAI 推进 GPT-5.6 与 ChatGPT 工作入口,Meta 图片生成遭遇授权争议,Mistral 进入机器人领域,生成内容透明度继续成为行业规则。
行业动态 · 来源公开 · 一周行业新闻本文复盘了 HunyuanVideo1.5 在单卡 L40S 上从 BF16 优化到 FP8 优化的过程。我们先把 BF16 路径做到相对充分优化,再引入 FP8,避免用一个过弱 baseline 放大 FP8 收益。 实践发现,FP8 并不是换掉 Linear dtype 就会自动变快。activation 需要运行期量化,weight layout 必须保持 column-major,不同 GEMM shape 也需要选择不同 backend。初始 FP8 版本反而明显慢于 BF16;经过 weight layout 修正、GEMM kernel 优化、多 backend selector、QKV 共享 activation quant、producer-side pre-quant 等优化后,最终 FP8 版本达到 282.44s,快于优化后的 BF16,也优于 vLLM-Omni 和 LightX2V 的 FP8 对比结果。 核心经验是:FP8 优化不是单个 GEMM benchmark 的胜利,而是完整推理 hot path 的系统工程。layout、量化开销、backend 选择、模型语义和 runtime 分发都会影响最终端到端收益。
工程手记 · 完整正文 · performance介绍 AIGC 图像与视频生成中的基础数学,包括最大似然估计、独立随机变量的分布、Jensen 不等式等内容。
数学基础 · 完整推导 · Math In AIGC