用 Agent 最别扭的一刻,是你人不在电脑前。开车路上突然想到要给客户发一封跟进邮件,做饭时想让它查一下明天几点开会,跑步时想把脑子里冒出来的选题记下来——这时候掏出手机打字,体验还不如直接发语音。
给 OpenClaw 接上语音,就是解决这个场景:说的进去(语音转文字)、念的出来(语音合成)。这一篇讲清两件事怎么选型、三种接入形态怎么配、延迟和成本怎么控,以及那些真正会绊倒你的坑。
先把能力拆成两块:听得懂 + 说得出
语音转文字(STT / ASR)负责把你说的话变成 Agent 能读的文字;语音合成(TTS)负责把 Agent 的结果变成能听的话。两块能力相互独立,可以只接一块,也可以两块都接。只接 STT 是「动口不动耳」,适合派活场景;两块都接才叫语音助手。
这两块能力本身都是现成的 API 或本地模型,OpenClaw 要做的是把它们串进自己的工具链——和 OpenClaw 怎么接 MCP 工具 是同一套思路:能力以工具的形式挂上去,Agent 该调就调。
第一步:语音转文字怎么选
两个方向:本地方案——在服务器上跑开源识别模型(Whisper 系列及其各种加速版),优点是免费、断网可用、音频不出本机;缺点是吃 CPU/GPU、装起来麻烦、长音频慢。云方案——调厂商的语音识别 API,优点是准、快、支持方言和长音频;缺点是按量付费、音频要上传、依赖网络。
怎么定?按内容敏感度分:涉及客户、合同、内部会议的音频走本地;日常指令、随笔记录走云端。这个分法和站里 OpenClaw 密钥边界 讲的原则一致——敏感数据尽量别出机器,出机器的都必须有明确边界。
选型时重点看四项:中文与方言准确率、单次可处理时长、延迟(是否支持流式)、单价。别只看标称准确率,拿你自己真实的口音录三段话去试,比看任何评测都准。
第二步:语音合成怎么选
同样两条路:本地合成(免费、离线,音色机械感强一些,但播报通知类内容完全够用)和云端合成(音色自然、多语言、支持语速和停顿控制,按字符或时长付费)。
挑选时看三件事:音色是否自然(播报一天几十条,机械音听久了会烦)、是否支持文本到语音的细节控制(数字、英文缩写、多音字的读法)、响应延迟(是否支持边生成边播放)。如果是给自己听,建议先用免费方案跑一周,真受不了机械音再换云端。
第三步:三种接入形态,从简单到复杂
形态一:语音当输入。你在手机上发一条语音,Agent 收到后转写成文字,再当普通指令处理。落地方式可以走 IM 机器人——比如把语音文件发到机器人,OpenClaw 转写后执行,接入配置参考 OpenClaw 怎么接 Telegram;也可以在飞书、企业微信里挂一个语音指令入口。这是最容易落地的一种,先做这个。
形态二:语音当输出。任务结果转成语音,推给你听。最典型的用法是「每天早上一段三分钟语音简报」,把夜里跑完的巡检结果、行业摘要、待办清单念一遍。定时任务的配置方式和 OpenClaw 定时发日报周报 完全一样,只是在推送前多一步「文字转语音」。这个形态对开车的场景特别值。
形态三:双向语音对话。麦克风常驻,你说它听、你停它答,能被打断、能追问。这一层最复杂,因为它要求底层语音模型支持流式输入输出和打断处理,本地拼 STT + LLM + TTS 三段式往往延迟感人。如果 OpenClaw 走的是自建三段式,建议先只做「按住说话」,别一上来就做全双工。
另外两个工程细节:密钥别硬编码在脚本里,按 密钥边界 的方式放到环境变量或密钥管理里;如果语音指令会触发对外动作(发邮件、下单),必须在执行前把「我要做什么」回读一遍让你确认——这正是 客户可见动作确认 讲的规矩,语音场景下更容易误触发,这一步不能省。
第四步:延迟和成本怎么控
延迟可以拆成四段:录音结束 → 转写 → 模型处理 → 合成播放。想快就三段下手:转写用流式(边说边转,不必等你说完)、模型用快模型(复杂任务再升级)、合成边生成边播(不用等整段生成完)。实测里,「说完到听见回应」能压到两三秒,体验就已经很顺了。
成本主要是两块:识别按分钟、合成按字符。按每天十条短语音加一次三分钟播报估算,云端方案一个月通常只要几块到几十块,比想象中便宜。真正的成本风险是失控调用——麦克风常驻、反复误触发、循环播报,这类问题必须设预算上限,方法见 AI Agent 成本控制清单。
六个真正会绊倒你的坑
坑一:环境噪音和车噪。识别模型在安静环境下 95 分,在马路边可能掉到七十几。要么配降噪,要么在提示里加一句「如果音频质量差,先反问确认」。
坑二:方言和多音字。中文方言差异大,专有名词(人名、公司名、型号)特别容易转错。解决办法是给识别配「热词表」——把常出现的专有名词提前喂进去,这一步的效果比换模型明显得多。
坑三:语音没有标点。转写出来的是一串连续文字,指令含义容易变味。转写后让模型整理一遍断句和标点,再交给 Agent 执行,成本很低但收益很大。
坑四:长语音要分片。一口气说三分钟,识别服务可能有单次时长上限,或者中途丢字。超过一两分钟就提醒分次说,别硬塞。
坑五:语音指令歧义。「把那个文件发给他」——哪个文件、哪个他,语音里全是这种指代。规则很简单:能产生真实动作的指令,执行前必须回读确认;纯查询类可以直接做。
坑六:隐私没想清楚。常驻麦克风意味着持续采集,录音存哪里、存多久、谁能听,上线前要有答案。本地识别是这里最省心的选择。
适合与不适合
适合:经常离开电脑但要给 Agent 派活的人;有大量「随手记」需求的内容创作者;想把晨间简报做成语音播报的运维和运营人员;以及给家里长辈用的场景(语音比打字门槛低得多)。不适合:工作是纯桌面深度操作的(键盘鼠标本来就比语音精准)、对隐私要求极高又不愿上本地模型的、以及需要极低延迟实时对话的——本地三段式拼出来的延迟目前还撑不住这种场景。
总结
OpenClaw 加语音,一条清晰路径:先接 STT 做语音指令,再加 TTS 做结果播报,最后才考虑双向对话。三个心法:敏感音频走本地、专有名词配热词表、有副作用的指令必须回读确认。语音能力不是锦上添花——它把 Agent 从「你得坐到电脑前才用得上」变成「随时随地都能用」,这一步跨过去,Agent 才真正变成随身的助手。