豆包手机助手消费者版发布:全球首款商用 AI 智能体手机 9 月 16 日开售,GUI 操作先签「同意书」

豆包手机助手消费者版发布资讯封面图,包含 SAEP 协议、GUI 自动化、第三方拒绝权、MCP 优先、端侧智能体、同意机制等中文关键词

2026 年 9 月 14 日,字节跳动发布豆包手机助手消费者版;9 月 16 日,搭载该版本的努比亚 NaviX Ultra 正式开售,中兴称这是全球首款 AI 智能体手机。先把事实按时间线梳理清楚,再谈它到底改变了什么。

事实梳理:这条产品线走到了哪一步

起点是 2025 年 12 月 1 日,豆包手机助手以技术预览版形态亮相,载体是与中兴合作的工程样机努比亚 M153,仅一个配置(16GB+512GB),售价 3499 元。首批备货约三万台当日售完,二手市场一度被炒到七千元甚至上万元。

热度之后是争议。技术预览版发布后,豆包手机遇到了「生态墙」——部分第三方 App 无法使用「操作手机」功能。12 月 5 日,豆包发布《关于调整 AI 操作手机能力的说明》,限制刷分、刷激励类场景,暂时下线银行和互联网支付等金融类应用的操作能力,并限制涉及竞技排名的游戏场景。

九个月后的消费者版本,官方强调的重点从「能力」转向了「稳定性和日常可用性」。首款量产机型努比亚 NaviX Ultra 已在京东、天猫开启预约,将于 9 月 16 日 14:00 开售,同时新版本也会推送给上一代工程机 M153 的老用户。

四大能力升级:从「会聊天」到「会干活」

交互。一个容易被忽略但很关键的改动是:独立 AI 键集成了指纹鉴权,按一下同步完成本人验证,锁屏状态下也能直接调起助手办事,不必先解锁再操作。语音唤醒针对远场、设备内外噪声、快语速做了优化;开启连续对话 Beta 后,不必每句话都喊唤醒词。

识屏。这一代把「识屏问答」升级成了「识屏办事」。官方演示的场景是:打开相机对准室内环境,直接说「根据这个装修风格,帮我选一个一米二以内、价格不超过一千元的柜子」,助手结合画面信息去电商平台筛选商品并给出推荐。屏幕内容不再只是被解释的对象,而是任务的输入。

记忆。用户授权后,助手可以检索电话录音、相册、短信、便签等本地数据,比如直接回答「港澳通行证什么时候到期」。用户还能用语音说一句「记一下」、三指上滑,或者同时按住 AI 键和音量键,把当前屏幕内容存成可检索的本地记忆。办公场景接入了飞书妙记,支持转录、实时翻译、区分说话人、自动总结。

任务执行。「操作手机」以 Beta 形式保留,通过模拟点击加调用工具完成跨 App 操作,并补齐了多任务排队与插队、锁屏查看任务状态、按时间或地点触发的自动指令、系统工具(电话、日历、闹钟、飞书)批量调用等能力。出行场景接入了曹操出行,首批支持北京和杭州。

真正的看点:SAEP 协议,第三方 App 拿到了「拒绝权」

这次发布里最值得单独拿出来讲的,不是某个功能,而是一纸协议。

豆包手机助手推出屏幕自动化操作声明协议(SAEP,Screen Automation Execution Protocol),自发布之日起启动为期 30 天的规则公示。核心规则四条:

(1)第三方应用可以自主声明操作边界——明确允许或拒绝 AI 助手在自己的应用内执行屏幕自动化操作。(2)拒绝可以细到操作粒度——除了「禁止全部」,还能对截图、模拟输入、内容修改等特定操作单独设限。(3)公示期内,助手只对系统自带应用、字节跳动旗下应用,以及已通过 SAEP 或邮件明确同意接入的第三方应用执行自动化操作,其余应用默认不操作。开发者提交拒绝声明后立即生效,相关应用会被列入不可操作清单。(4)公示期结束后会逐步扩大可操作范围,但明确表示拒绝的应用始终不在范围内。

另外,豆包给出的技术路线是双轨并行:高频任务优先走 MCP(应用主动开放接口),GUI 屏幕操作作为补充路径被 SAEP 约束。这个先后顺序很重要——它等于官方承认了「读屏点击」是兜底手段,而不是最优解。

安全合规方面,官方公布持有 ISO 27001、ISO 27701、ISO 42001 和信息系统安全等级保护三级认证,建立了分层的 Agent 防护体系,对可操作范围做分级管理,高敏感操作需要用户手动确认。此前的公开口径还包括:不代替用户完成授权、支付、身份验证等敏感操作;不在云端存储屏幕内容;相关内容不进入模型训练。

影响一:GUI Agent 从技术问题,变成「生态许可」问题

去年「操作手机」功能为什么吵得那么凶?因为 GUI 自动化在技术上绕过了应用本身——它不问你同不同意,直接读屏加模拟点击就把事办了。第三方应用的抵触非常实际:AI 可能绕过广告展示、会员引导和数据埋点,也可能因为操作不可控引发体验问题甚至经济损失。

SAEP 把这个矛盾第一次变成了一个可签署的机制。它的意义不在技术先进,而在于承认了一件事:Agent 能对谁做什么,最终由被操作方的授权决定,而不是由 Agent 的能力决定。这个思路和站里写过的 Agent 自主越权防线 是同一层逻辑——越权问题的正解不是让模型更自律,而是让边界由别人来划。

对企业内做 Agent 的人,这条可以直接抄:你的 Agent 要去操作别的部门、别的系统,有没有拿到对方明确的、可撤回的授权声明?如果没有,那就等着出事。授权体系怎么落地,参考 AI Agent 权限管理怎么做

影响二:能用接口就别读屏,这条路线图已经写明

「MCP 优先、GUI 兜底」这个排序,对做 Agent 的人是一条明确信号:屏幕操作是能力上限最高、但成本也最高的路径——慢、脆、每次界面改版都可能失效,而且合规负担最重。真正的正路是让应用开放结构化接口。

这也解释了为什么过去一年 MCP 生态扩张这么快。站里写过的浏览器自动化(OpenClaw 怎么接浏览器)是同一件事的另一面:能调接口就走接口,读屏只在没有接口时才用。做技术选型时判断标准很简单:这个任务有没有稳定的结构化通路?有就别去点屏幕。

影响三:端侧 Agent 的合规成本,正在前移

这次发布还有一个容易被忽略的信号:一个消费级产品把「同意机制 + 分级管控 + 审计可追溯 + 认证资质」当成发布内容的一部分来讲了。九个月前被争议逼出来的这套东西,现在成了产品说明书里的一节。

对行业的意义是,端侧 Agent 正在从「能不能做」进入「怎么合规地做」。此前我们写过端云分工(端侧 AI Agent 是什么)和荣耀的系统级 Agent Harness(荣耀 MagicOS 11 首发系统级 Agent Harness),加上这次的豆包,三条线拼起来是同一张图:手机厂商把 Agent 做进系统层,同时必须自己把权限、隐私和生态协商一起做掉。

顺便看一下同行节奏:小米澎湃 OS 4 的超级小爱 2.0 提出跨应用任务闭环;荣耀在 MagicOS 系列上持续扩展 YOYO 的自动化场景;华为把跨 App 执行与离线可用作为系统卖点;OPPO 在推端侧 Multi-Agent 内测;vivo 将于 9 月 16 日开发者大会发布新系统。端侧 Agent 的竞争,已经变成系统层之争。

老达点评

第一,这次最值钱的不是「会干活」,是「先问能不能干」。能力演示谁都能做,难的是让生态接受。SAEP 用一纸协议把「第三方同意」变成了流程上的前置条件,还附带 30 天公示期——这个设计相当克制,也相当聪明:它没有解决利益冲突,但它把冲突摆到了台面上,并且给了对方一个正式的否决入口。

第二,不要被「全球首款」这类定语带走节奏。上一代工程机也是同一批人做的,首款只是个时间定语。真正该看的是两件事:Beta 标签什么时候摘掉,以及拒绝名单会不会真的被尊重。如果一年后「明确拒绝的应用始终不在操作范围内」这条还站得住,这次发布的分量才算真正落下来。判断标准很朴素——看有没有大厂公开说「不」,以及豆包有没有守住。

第三,对做企业 Agent 的人,SAEP 是一份可以直接借用的模板。三条可以搬:能走接口就不读屏(成本与稳定性差一个量级);被操作方要有可撤回的同意声明(口头同意不算);敏感操作要人工确认并留审计轨迹(分层分级,而不是一刀切)。这套东西和你内部的 Agent 边界设计是相通的,安全分层怎么搭,可以对照 AI Agent 安全怎么防 里的七道防线。

第四,留意那个不起眼的转变:从「解释屏幕」到「拿屏幕当输入」。识屏问答是看,识屏办事是做。这是交互范式的切换——用户不再需要把需求翻译成文字,场景本身就是指令。但这条路径的副作用是:本地数据检索、屏幕记忆、跨应用执行叠在一起之后,隐私边界会变得非常难说清。消费者版本把「用户授权」写在了每一步,这是对的;但授权疲劳是所有 Agent 产品都要面对的下一道题。

总结

9 月 14 日,字节跳动发布豆包手机助手消费者版,9 月 16 日搭载它的努比亚 NaviX Ultra 正式开售,成为首款面向大众市场的 AI 智能体手机。这一代在交互、识屏、本地记忆和任务执行四条线上补齐了工程化能力,但真正的看点是 SAEP 屏幕自动化操作声明协议:第三方应用第一次拿到对 AI 自动操作说「不」的正式权利,并设置了 30 天公示期。技术路线上,官方明确了 MCP 优先、GUI 兜底的排序。老达点评:这次的关键词是「同意」而不是「能力」;对做 Agent 的人有三条现成启示——能走接口就别读屏、被操作方要有可撤回的授权声明、敏感动作要人工确认并留痕。真正要观察的是 Beta 何时摘牌,以及拒绝名单能否被守住。

发表评论

您的电子邮箱地址不会被公开,必填项已标注 *