阿里千问办公国际版 QwenWork 公测登顶全球 Agent 实测:杰富瑞八款主流 Agent 里唯一全维度超 90 分,国产办公 Agent 出海第一仗

阿里千问办公国际版 QwenWork 公测封面图,包含杰富瑞实测、八款主流 Agent、Slack 接入、多模态生成等中文关键词

8 月 26 日,阿里巴巴旗下 Agent 产品「千问办公」国际版(QwenWork)正式开启公测。海外个人和企业用户即日起可访问 qwenwork.ai 体验,网页版和 PC 客户端同步上线。这不是一次普通的出海动作——随公测一起放出的,是一份第三方投行实测报告:在杰富瑞对八款全球主流 Agent 的真实办公任务评测里,QwenWork 综合得分排名第一。

这篇把事件拆开讲:QwenWork 是什么、杰富瑞的实测含金量在哪、对办公 Agent 竞争格局意味着什么,最后是我的老达点评。

事实梳理:QwenWork 是什么,公测放出了哪些能力

QwenWork 是阿里「千问办公」的国际化版本,国内版 8 月初刚上线,三周后就出了国际版,节奏相当快。产品层面它融合了阿里三个 Agent 平台的底座能力——QoderWork、MuleRun 和 Wukong——整合成一个面向办公场景的 AI 生产力套件。

核心能力有几块:自主任务执行,用户用自然语言下指令,Agent 可浏览网页、操作电脑、执行多步工作流;网页交付,能生成高质量 HTML 页面,还提供域名和数据库服务,把想法变成可访问、可运行的网页应用;多模态,集成图像、视频、音频生成模型,用户不用在多个 AI 工具之间来回切换。

对企业市场,QwenWork 已接入 Slack、Notion 等海外协作平台,未来计划连企业的真实数据库和工作流。它强调的一个能力是「组织级 Skill」:资深员工完成一次复杂任务(比如律所律师做完一份并购尽调报告)后,可以把全过程沉淀成 Skill 共享给团队,新人遇到同类任务直接调用,不用再从头请教。

事实梳理:杰富瑞的实测,含金量到底在哪

这次被反复引用的数据来自华尔街投行杰富瑞的分析师:他们对八款全球主流 Agent 做了真实办公任务实测,设置 5 项真实办公任务,QwenWork 综合得分排名第一,超过美国的 Claude Cowork 和 Codex 等工具。

含金量在于三个「唯一」:它是唯一在所有测评维度都拿到 90 分以上的产品——尤其在复杂办公任务、网页浏览器控制、多模态内容生成三个场景表现突出;它是唯一综合排名超过 Claude Cowork 和 Codex 的产品——这两个是目前海外 Agent 第一梯队;它是第一次由第三方投行对国产 Agent 做横向实测并给出第一的成绩——不是厂商自评,是外部裁判。

这跟 AI Agent 评测怎么做 里说的逻辑一致:评测的价值在于「用同一套任务集横向比」,比出来的结果比任何宣传都有说服力。QwenWork 能扛住第三方实测,说明它的能力不是 PPT 里的,是真刀真枪跑出来的。

影响分析:办公 Agent 入口战,从国内打到海外

过去一个月,办公 Agent 入口战在国内已经白热化:字节豆包工作上线(字节豆包工作正式上线)、企业微信开放 CLI 和 MCP(企业微信 5.0.10 全面开放)、支付宝推 AHA 多智能体互联协议(支付宝发布 AHA 协议)——大厂全在抢「办公入口」这个位置,因为谁占了入口,谁就占了企业工作流的下一个十年。

QwenWork 出海的意义,是把这场仗从国内打到了海外。海外市场目前是微软 Copilot、Google Workspace 的天下,Claude Cowork 和 Codex 也在快速渗透开发者人群。阿里选择这个时候带着第三方实测第一的成绩出海,等于先立了个「客场标杆」——你要质疑我,先看看杰富瑞的报告。

另一个值得注意的背景:阿里近期动作密集——800 亿港元配售募资全部投向 AI 基础设施、AI 相关产品年化收入突破 495 亿元、千问 Token 计划持续拉低调用成本。模型、应用、资本三条线正在被串成一条完整的出海链路:模型开源打底、应用出海抢入口、资本锁定算力。

影响分析:竞争的本质,不是模型对决,是 Harness 和场景深度的对决

杰富瑞实测里 QwenWork 赢的不是「模型更强」——它背靠的是「模型 + Harness」的协同。正如 Agent = Model + Harness 里讲过的,决定 Agent 体验的,一半是模型智商,一半是执行框架、工具链和场景打磨。QwenWork 在复杂办公任务、浏览器控制、多模态生成上的 90+ 分,说明它的 Harness 层(任务编排、工具调用、网页操作)已经打磨到了一定水准。

这也解释了为什么实测第一的是「千问办公」而不是「千问模型」:办公 Agent 的护城河从来不只是模型能力,而是「能不能稳定地完成一整套办公任务」——读文件、查资料、写文档、做表格、发消息,一步都不能掉链子。谁把场景做深、把流程做稳,谁就能留住企业客户。

老达点评

第一,这次出海最值钱的不是产品本身,是「第三方实测第一」这个背书。国产 Agent 以前出海,最吃亏的就是缺一个国际化的裁判给打分。杰富瑞这份实测,等于给 QwenWork 发了一张国际信用背书——以后海外企业评估国产 Agent 的时候,第一眼看到的就是这个「唯一全维度 90 分」。信用是出海最贵的资产,这份报告是实打实的加分项。

第二,办公 Agent 的格局进入「双线作战」:国内卷入口(豆包、企微、飞书、钉钉),海外卷实测(QwenWork 对 Claude Cowork、Copilot)。对用户是好事——竞争越充分,产品越便宜越好用;对厂商是考验——两条战线都要投入,不是谁都能玩得起。我反而觉得,国产 Agent 出海的路子走对了:先用实测说话,再谈生态,比烧钱补贴实在。

第三,冷静泼盆冷水:公测第一 ≠ 商业成功。QwenWork 接下来要过三关——本地化关(语言、习惯、合规)、生态关(Slack/Notion 只是开始,企业核心系统才是主战场)、付费关(真实企业客户愿不愿意长期买单)。评测分数代表能力上限,商业验证代表真实落地,两码事。方向对了,路还长。

总结

8 月 26 日,阿里千问办公国际版 QwenWork 开启公测:融合 QoderWork、MuleRun、Wukong 三大平台能力,接入 Slack 和 Notion,主打自主任务执行、网页交付和多模态生成,并强调组织级 Skill 的企业知识沉淀。杰富瑞对八款全球主流 Agent 的 5 项真实办公任务实测中,QwenWork 综合第一、唯一全维度超 90 分,超过 Claude Cowork 和 Codex。老达点评:这是国产办公 Agent 第一次带着第三方实测背书出海,入口战从国内打到海外;但公测第一不等于商业成功,本地化、生态、付费三关还等着它闯。

发表评论

您的电子邮箱地址不会被公开,必填项已标注 *