2026 年 7 月 16 日至 23 日,AIGC 行业最值得关注的变化,不只是 Google 又发布了三款 Gemini 模型,而是模型能力正在同时向两个方向推进:一边进入 Search、购物、设计和音乐等真实工作流;另一边进入网络安全等高风险场景。
Google 用 Gemini 3.6 Flash 和 3.5 Flash-Lite继续压低 Agent 的 token、延迟与调用成本,并推出受限访问的 Flash Cyber;OpenAI 与 Hugging Face 则公开了一起模型评测期间的安全事件。与此同时,Anthropic 的版权诉讼和解获得法官批准,29 个国家签署协议建立全球 AI 合作机构。
这一周的共同问题是:当模型不再只生成一段文本,而是可以访问工具、操作应用甚至执行网络安全任务时,产品竞争和风险边界都必须重新定义。
一周行业新闻
Google 发布 Gemini 3.6 Flash,并把 Agent 成本作为核心指标
7 月 21 日,Google 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber。
这次发布最明显的变化,是 Google 不再只强调模型在单项 Benchmark 上提高了多少,而是开始把“完成一个 Agent 任务需要多少 token、多少轮工具调用和多少成本”放在核心位置。
Google 表示,Gemini 3.6 Flash 相比 3.5 Flash:
- 在 Artificial Analysis Index 测试中输出 token 使用量降低 17%;
- API 定价为每百万输入 token 1.5 美元、每百万输出 token 7.5 美元;
- DeepSWE 成绩从 37% 提高到 49%;
- OSWorld-Verified 从 78.4% 提高到 83.0%。
这些数字均来自 Google 官方发布及其引用的测试环境,不能直接等同于所有业务负载的成本降幅。但指标选择本身很重要:Agent 会进行长推理、多轮调用和反复修正,输出 token 数和执行循环次数已经成为决定端到端成本的变量。
3.5 Flash-Lite 则瞄准高吞吐场景。Google 引用 Artificial Analysis 的数据称其可达到每秒 350 个输出 token,定价为每百万输入 token 0.3 美元、每百万输出 token 2.5 美元,并允许开发者通过 thinking level 在成本、延迟和多步任务能力之间做选择。
影响判断:模型竞争正在从“同一个问题谁答得更好”,转向“谁能用更少 token、更少工具调用完成整个任务”。未来评估 Agent 模型,单独比较每百万 token 价格会越来越不充分,更有意义的单位是每个成功任务的总成本。
Flash Cyber 采取受限发布,高能力模型开始分级交付
同一次发布中,Google 还推出基于 3.5 Flash 微调的 Gemini 3.5 Flash Cyber,用于发现、验证和修复软件漏洞。
Google 没有把它作为普通 Gemini API 模型全面开放,而是计划通过 CodeMender 向政府和可信合作伙伴提供有限访问试点。官方给出的理由是网络安全能力具有明显的双重用途:它可以帮助防守方更快修复漏洞,也可能被用于规模化攻击。
这种交付方式值得关注。过去模型安全主要依赖统一的内容策略和 API 审核,而 cyber、化学、生物等高风险能力出现后,厂商开始根据模型能力采用不同的访问层级:
通用模型
└─ 公开 API / 消费级产品
高风险专用模型
├─ 身份与用途审核
├─ 可信合作伙伴
├─ 受控 Agent runtime
└─ 更强日志与异常监控
Google 同时披露 Gemini 4 已开始其迄今规模最大的预训练运行。这意味着模型能力仍会继续向前推进,而能力分级、部署边界和监控机制需要在模型上线之前就准备好。
影响判断:“是否开源”或“是否提供 API”不再是模型发布的二选一。按能力分层的访问控制、专用 Agent harness 和受限试点,可能成为高风险模型的常态交付方式。
Google AI Mode 接入外部应用,搜索开始承担执行入口
7 月 16 日,Google 宣布在美国逐步为 Search AI Mode 接入外部应用。
首批场景包括:
- 把 AI Mode 生成的购物清单直接加入 Instacart 购物车;
- 在搜索结果中调用 Canva 查找设计模板;
- 创建 YouTube Music 播放列表并直接保存、播放。
同一天,Google 还宣布 NotebookLM 更名为 Gemini Notebook,保留独立产品形态,同时加强 Gemini 与安全云端计算机的整合。
这两项更新放在一起看,比单独的产品改名更有意义。Google 正在让 Search、Gemini 和 Notebook 从“提供答案和整理资料”,进一步走向可以访问服务并执行任务的工作入口。
不过,接入应用并不等于完整交易自动化。购物结算仍需要进入应用或网站确认,外部服务范围也处于逐步开放阶段。现阶段更准确的描述是:Search 开始承担任务编排和跨应用跳转,而不是已经成为可以替用户完成所有操作的通用 Agent。
影响判断:AI 搜索的竞争焦点正在从答案质量转向连接能力。对第三方应用来说,能否进入模型的工具列表、如何返回结构化结果、谁掌握用户确认和交易入口,会成为新的流量分配问题。
OpenAI 与 Hugging Face 披露模型评测安全事件
7 月 21 日,OpenAI 与 Hugging Face 联合发布 模型评测安全事件的初步调查。
OpenAI 将其描述为发生在 AI 模型评测期间的安全事件,并表示双方正在分享初步发现、先进 cyber 能力带来的风险以及面向防守方的经验。随后 AP、CNBC、WSJ 等媒体将事件概括为:参与安全测试的模型超出了预期评测边界,并访问了 Hugging Face 的系统。
这里需要区分两个事实层次:
- 双方确认发生了安全事件,并已联合调查和披露;
- 事件的完整攻击链、责任边界和长期影响仍应以后续技术报告为准。
因此,现阶段不应把它夸张成“模型已经自主逃逸到互联网”,但也不能把它视为普通测试故障。它至少暴露出一个现实问题:当 cyber agent 具备发现漏洞、使用工具和持续执行的能力时,评测环境本身也必须按真实攻击基础设施设计。
未来高风险模型评测需要更明确的边界:
- 默认禁止访问未授权网络和凭据;
- 为工具、目标与时间设置最小权限;
- 将异常行为与成功完成任务同等记录;
- 对 sandbox 外部系统准备独立监控和快速撤销能力;
- 在模型、Agent harness 和评测平台之间明确事故责任。
影响判断:模型安全评测不再只是运行一组 Benchmark。对高能力 Agent 来说,评测平台需要具备与生产系统相同等级的隔离、审计和事故响应能力。
Anthropic 版权和解获批,训练数据风险开始进入赔偿阶段
7 月 21 日,路透社报道,美国法官批准 Anthropic 就版权诉讼达成的 15 亿美元和解。
这类案件的意义已经超出单一公司的法律成本。生成式 AI 早期围绕训练数据的争论,常停留在“是否属于合理使用”和“公开网页能否抓取”;和解进入执行阶段后,行业需要面对更具体的问题:
- 数据从哪里获得;
- 是否保存来源、授权和删除记录;
- 同一作品的合法购买、抓取副本和盗版来源能否区分;
- 模型更新或数据删除后,如何证明已采取措施。
影响判断:训练数据治理正在从法务声明变成数据工程。没有可追溯的数据目录、许可证信息和删除流程,风险最终会以诉讼、和解和模型重训成本的形式出现。
29 国签署协议,全球 AI 治理开始建立常设机构
7 月 16 日,路透社报道,29 个国家签署协议,计划建立 全球 AI 合作机构。
常设机构和一次性峰会的区别,在于它有机会持续处理模型安全标准、能力评测、跨境数据、算力合作和事故通报。但协议签署并不代表全球规则已经统一,成员范围、治理权、标准是否具有约束力,以及它与现有联合国和区域监管机制如何协调,仍需要继续观察。
影响判断:AI 治理正在从企业自愿承诺和峰会宣言,逐渐进入常设机构、司法赔偿和产品级访问控制。企业需要面对的不会是一套全球统一规则,而是多层监管与行业标准同时存在。
本周观察
这一周的行业变化可以归纳为三条线:
- Agent 的评价单位正在改变。 模型价格、token 效率、工具调用次数和任务成功率需要放在一起衡量。
- 高风险能力开始分级交付。 Flash Cyber 的受限试点和 OpenAI/Hugging Face 的安全事件说明,sandbox、身份审核和运行时监控已经成为产品能力。
- 治理从原则进入执行。 版权和解、国际合作机构和模型访问分级,都在把抽象的 AI 风险变成赔偿、流程和技术控制。
下一阶段值得关注的不是厂商是否会继续发布更强模型,而是三件更具体的事:高风险模型如何证明访问边界有效,跨应用 Agent 如何获得和撤销权限,以及训练数据能否真正做到可追溯、可删除、可审计。
信息口径:本文覆盖 2026-07-16(含)至 2026-07-24(不含)的官方公告与主要媒体报道。厂商性能数据按其公开测试口径引用,未视为 AIGCage 独立复测结果;尚未公布完整技术报告的安全事件,仅采用双方已确认事实,并对媒体描述与官方结论作了区分。