阿里发布 Qwen3.8-Omni-Flash:原生全模态加百万上下文,音频成本砍掉 98%

阿里 Qwen3.8-Omni-Flash 原生全模态模型发布:百万上下文与音频成本下降 98%

9 月 18 日,阿里千问正式上线新一代原生全模态模型 Qwen3.8-Omni-Flash。这次发布值得认真看的原因,不在于又多了几个能力点,而在于它把音视频从模型的「感知输入」推到了 Agent 的「任务对象」位置:模型不只是听懂看懂了,还要能规划任务、调用工具、把成品交付出来。

把这条线拉到今年看会更清楚:8 月中旬 Qwen3.8 开源主打后训练 Scaling(国产大模型集体转向后训练),8 月上旬 Qwen3.8 Max 在 Agentic Index 登顶(Agent 开发链三条战线),办公版 QwenWork 出海拿下评测第一(QwenWork 公测登顶)。这次轮到了音视频。

事实梳理:这次发布了什么

先把可核实的信息摆清楚:

  • 能力:原生支持文本、图像、音频、视频四种输入,100 万 token 上下文(最大输入接近 99.2 万,思考模式下约 98.4 万,最大输出 13.1 万)。官方口径是文本性能与同尺寸纯文本模型相当。
  • 评测:在约 30 项评测中平均得分比上一代 Qwen3.5-Omni-Plus 提升超 26%。音视频 Agent 与长程任务提升最明显:WildClawBench-MM 提升 36.5 分(得分 71.0,官方对比 Gemini 3.8 Flash 为 58.9)、AgenticVBench 提升 22.3 分、UniClawBench 得 69.6 分。
  • 听觉能力:多说话人识别进步最大——AliMeeting 测试中说话人错误率(DER)从上代 88.11 降到 3.35,带说话人标注的字错误率(cpWER)从 89.61 降到 17.18。支持 113 种语言和方言的音频输入,支持双声道立体声与四声道空间音频分析。
  • 价格:每小时音频输入的 API 价格降幅超 98%,每小时音视频输入降幅超 93%。国际区域定价为每百万输入 token 0.15 美元、命中缓存的输入 token 0.016 美元、每百万输出 token 0.47 美元;国内多模态输入最低约 0.8 元/百万 token。
  • 配套开源:扩展多模态插件 Qwen-MM-Plugins,开源实时交互运行框架 Qwen-Live Harness;同时开源 Video2Note(把音视频与操作过程提炼成图文 PDF 笔记)和 Omni Skill Creator(从操作演示中提炼可复用的 Agent Skill)。另有低延迟版本 Qwen3.8-Omni-Flash-Realtime。
  • 获取方式:已上架千问 AI 平台与阿里云百炼,覆盖北京、新加坡、中国香港、东京、法兰克福、弗吉尼亚等区域。模型权重没有直接开源,开放的是配套插件与运行框架。

需要说明:上述对比数据来自官方口径,目前还没有第三方独立复现的结论。

这次真正的变化:Agentic 感知,token 反而更省

整篇发布里最值得琢磨的是一个数字:在 OmniVideoBench 上,模型从「静态理解」切换到「Agentic 理解」后,准确率从 63.4 提升到 67.8,而每次查询的 token 消耗从 145,736 降到 79,117,少了约 45.7%

道理不复杂:几小时的视频里,答案往往只在几分钟内。传统做法是把整段吃进去,Agentic 做法是让模型带着问题自己决定「该看哪、该听哪」,多轮由粗到细地找证据。这件事的意义在于,它证明了「会挑」比「看得多」更划算。过去大家默认长视频理解就是烧 token,这条数据把这个前提改掉了。

类似思路在其他场景也在落地:会议视频可以直接输入最长一小时,做说话人分离、转写、生成纪要、提取待办,还能接着调工具发邮件、建任务。这跟站内 OpenClaw 处理视频 里讲的「先抽字幕再分析」是两条路线——前者把切片、抽帧、串模型这些前置工程收进了模型内部,后者是本地流水线更可控。实际选型要看你更在意成本还是可控性。已经用 OpenClaw 接过语音能力 的团队,这次可以顺便评估一下是继续用 ASR 管线,还是整段交给多模态模型。

98% 的降价,改变了什么

能力提升是渐进式的,价格断崖才是会改变工作流的东西。音频输入每小时成本降超 98%,意味着这批事从「算不过账」变成「可以随便跑」:

  • 把过去一年的会议录音、播客、直播回放全量过一遍,做知识沉淀;
  • 客服通话全量质检,而不是抽样听 5%;
  • 批量给视频素材打标签、定位关键片段,直接供剪辑使用。

结合 100 万上下文和上下文缓存,批量处理时不再需要频繁切片和串多个模型——上下文怎么分层管理,可参考 上下文管理怎么做。成本控制的整体框架见 Agent 成本怎么算、怎么省,而 缓存怎么用 在这里尤其值得看:长音视频场景下缓存命中与否,成本能差一个量级。

一个被低估的细节:让模型自己优化模型

官方还提到一个实验:让 Qwen3.8-Omni-Flash 扮演算法工程师,自主完成选测评集、跑基线、听语音样本、构建针对性训练数据等环节,在 12 小时内把 Qwen2.5-Omni-3B 的四川话识别字符错误率从 25.79% 降到 15.30%。连续 4 轮实验累计构建 3413 条训练数据,过程中会根据评测反馈保留有效改进、回退无效尝试。

这个实验值得单独说,是因为它把前面几篇文章里的概念串起来了:评测集、评分反馈、样本构建、迭代回退,一套完整的评测驱动流程。它同时也提醒一件事:评测集的质量决定了自动迭代的天花板。评测怎么写,站内 AI Agent 评测怎么做 有完整拆解。

影响分析:四个值得关注的方向

(1)音视频正在变成 Agent 的一等公民。过去做音视频 Agent,最麻烦的是前置工程:抽帧、切片、ASR、跨模态对齐,光胶水代码就能拖垮一个项目。现在这些被收进模型,加上插件和运行框架,小团队做多模态 Agent 的启动成本大幅下降。

(2)Harness 层的竞争正式开场。这次除了模型,还开源了 Qwen-Live Harness 和 Qwen-MM-Plugins——注意这个组合的意味:模型厂开始抢「运行框架」这个位置。这和站内 Agent = Model + Harness 的判断是同一件事的两面:光有大脑不够,谁来管上下文、管记忆、管工具调度,谁就掌握了实际落地。国内厂商开始在这个层面出牌,是这一轮比较明显的变化。

(3)国产多模态选型多了一个选项,但要看清短板。官方对比数据里,它在音频类评测上全面领先(SpotSoundBench 67.2 对 39.7 尤其悬殊),但并非全项占优:AgenticVBench 上 36.8 低于 Gemini 3.8 Flash 的 45.0,OmniGAIA 上 74.0 略低于 78.6,部分视频理解项上对手仍有优势。做选型时应该按自己的场景挑评测项看,而不是看一个平均分。需要多来源并行的,配置思路见 多模型容灾怎么配

(4)「理解」和「交付」之间的缝被缝上了。发布里反复强调「智能体交付」:理解素材 → 规划 → 调用工具 → 出成品。这条链路一旦跑通,最直接受影响的是一些以「工具操作」为主的工作流,比如视频剪辑的粗剪、素材归档、字幕生成。做这类工具和外包服务的,值得重新评估自己的位置。

老达点评

第一,真正值钱的不是 26%,是那个 45.7%。绝大多数多模态发布都在堆能力指标,这次难得给了一个「更聪明反而更省」的实证。它说明 Agentic 的按需感知不是玄学,是可以量化的成本优势。如果这个结论能被第三方复现,对整个长视频理解领域的架构选择都会有影响。

第二,别被 98% 这个数字冲昏头。降价幅度大,一部分原因是上一代音频定价本身偏高,降下来之后不一定比同行便宜。算成本要算「完成一个任务的端到端花费」,而不是单价。音视频输入本身仍然不便宜,全量跑之前还是得先想清楚哪些数据值得入库。

第三,最值得盯的是 Harness 开源这件事。模型能力迟早会追平,而运行框架和生态一旦形成使用习惯就难换。国内厂商开始把 Harness 当战略资产开源,意味着接下来半年「Agent 运行层」会是竞争热点。做 Agent 的团队,现在就该把「换模型要不要换框架」这个问题想清楚,而不是等生态锁死了再迁移。

对做 Agent 的人,三个可执行建议

  1. 先拿一个小场景试成本。别一上来就把全部录音丢进去。挑一个高频、边界清晰的场景(比如每周例会纪要),跑两周,把 token 消耗和人工时间都记下来,再决定要不要扩。
  2. 把长音视频和纯文本场景分开评估。它的文本能力与同尺寸文本模型相当,但你得为多模态能力付额外的钱。纯文本任务继续用便宜的文本模型,别为了省事全量切换。
  3. 别现在就把架构绑死。多模态能力还在快速迭代,接口层留一层抽象、保留多模型并行的能力,比押注单一供应商更划算。

至于要不要用、用在哪,还得看你的数据里有多少是音视频。如果手上的素材大部分是文字和表格,这次发布的实际收益有限;但如果有一堆会议录音、培训视频、客服通话一直没被利用起来,那这是一个值得认真评估的时间点。

发表评论

您的电子邮箱地址不会被公开,必填项已标注 *