数字世界里的 Agent 出错,最多是发错一封邮件、改错一条记录、调用错一个接口。物理世界里的 Agent 出错,影响就不只停留在屏幕里。机器人会移动、抓取、递送、避障,安全边界和人工接管会变得更重要。
Google DeepMind 在 2026 年 7 月 30 日发布 Gemini Robotics 2 和 Gemini Robotics ER 2 相关介绍,强调机器人任务规划、视频理解、进度追踪、工具编排和多机器人协作。Gemini API 变更日志也显示,Gemini Robotics ER 2 已进入公开预览。这个方向和站内的 失败升级规则、转人工队列、质量门禁 可以放在一起看。
事实梳理
从官方信息看,Gemini Robotics 2 重点是让机器人具备更强的空间理解、长任务规划和身体动作控制。Gemini Robotics ER 2 则更偏 embodied reasoning,也就是在视频、音频、文本和低层控制接口之间做任务编排。
Google 还强调进度分类能力:机器人需要判断任务完成到什么程度,是否应该继续、调整、重试或进入下一步。对长任务来说,这比单次动作是否成功更关键。
影响分析
物理世界 Agent 会把“控制权”问题放大。软件 Agent 可以通过日志、回滚和审批降低风险,机器人 Agent 还要处理人靠近、物体位置变化、动作失败、环境不确定和远程接管。
这意味着机器人 Agent 不能只追求更会做事,还要把停止条件、低置信度处理、人工接管和安全评测做成系统能力。多机器人协作听起来很强,但协作越复杂,越需要明确谁在执行、谁在观察、谁能中断。
老达点评
我更关注这次发布里“物理 Agent”的边界感。Agent 从屏幕走向现实以后,很多原本在软件系统里已经麻烦的问题会变得更严肃:证据包、实时监控、失败升级、权限范围、人工接管,都不能靠事后补文档。
对普通团队来说,短期不一定会直接用机器人 Agent,但这条趋势值得看。今天在数字流程里补齐控制、审计和复核,未来面对更复杂的自动化系统时,才不会重新交学费。
总结
Google Gemini Robotics 2 的发布说明,Agent 正在从“会调用工具”走向“能理解环境并执行物理动作”。越接近真实世界,越要把安全边界、进度判断、人工接管和证据留存放到核心位置。