AI Agent 真正进入生产以后,模型选择不再只看榜单分数。一次任务可能要做分类、检索、总结、工具调用、格式校验和多轮修正,如果每一步都用最高成本模型,系统很快就会被价格和延迟拖住。
Google 在 2026 年 7 月 21 日的 Gemini API 变更日志 中写到,Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite 已经 GA。官方描述里,Gemini 3.6 Flash 强调 token 效率、代码和 agentic planning;Gemini 3.5 Flash-Lite 则定位为低延迟、高性价比的高频自动化子 Agent 选项。这条信息和站内的 成本异常复盘、成本预算阈值、运行监控指标 是同一条线。
事实梳理
按照 Google 官方变更日志,Gemini 3.6 Flash 是稳定、可用于生产的 Flash 模型,重点是更好的 token 效率、更低价格,以及面向代码和 Agent 规划的能力。Gemini 3.5 Flash-Lite 则更偏高吞吐、低延迟和成本敏感场景。
Google Cloud 的 Gemini Enterprise Agent Platform 模型生命周期页面 也列出了 Gemini 3.5 Flash-Lite 的发布日期和生命周期。对做 Agent 产品的团队来说,这类生命周期信息很重要,因为企业部署不只看今天能不能调用,还要看后续维护和迁移节奏。
影响分析
规模化 Agent 会越来越需要分层模型路由。简单意图识别、字段抽取、内容初筛可以走低延迟低成本模型;复杂推理、长文档分析和高风险判断再切到更强模型。这样才能兼顾体验和预算。
子 Agent 也会更常见。一个主 Agent 不必把所有步骤都交给同一个模型,可以把高频、低风险、格式化的子任务交给更低延迟的模型处理,再把复杂判断留给更强模型。
老达点评
我更关注这次更新里的“规模化”含义。很多 Agent 原型看起来很聪明,是因为调用次数少、等待时间没人计较、账单还不明显。一旦每天跑几千几万次,价格、延迟、重试和工具空转都会变成产品问题。
所以 Agent 团队后面不能只会选一个最强模型,而要会设计路由、缓存、降级、质量门禁和成本告警。能稳定跑起来,比单次演示惊艳更重要。
总结
Google Gemini 3.6 Flash 和 3.5 Flash-Lite GA 提醒我们,规模化 Agent 的竞争会落到价格、延迟、模型路由和工具调用效率上。模型能力还会继续提升,但生产系统最终要回答的是:跑得准不准、快不快、贵不贵、能不能持续。