一场两小时的会议录屏、一节买了没看的课程、手机里几百个随手拍的素材——这些东西的共同点是:真正要用的只有几分钟,但占的空间和整理的时间一点都不少。想剪吧,打开剪辑软件光是导入导出就够劝退了。
这类活特别适合交给 OpenClaw,因为它有三个特点:规则明确、动作重复、判断标准可以写下来。这篇按「先分清要做什么 → 再动手」的顺序讲,重点在参数怎么选和执行怎么兜底,而不是让它自己发挥。
第零步:先把需求拆成四件不同的事
「帮我处理一下视频」这种指令没法执行,因为里面混了四件目的完全不同的事:
(1)压缩/转码。目的只有一个:体积变小、还能看。它不改变内容。
(2)抽字幕。目的是把语音变成文本,产出字幕文件、纯文本,或者直接烧进画面。
(3)切片。目的是把长视频切成短片段,切完之后内容变了,可逆性最差,也最容易出错。
(4)转格式与归档。目的是让文件能进播放器、能上传、能被检索到,属于收尾工作。
先拆开的意义在于:压缩和转格式出错了无所谓,重新跑一遍就行;切片出错是要丢内容的,必须单独确认。把这两类混在一个指令里,风险就绑在一起了。
前置:把工具装好,让 OpenClaw 知道有的可用
两条依赖:一是 ffmpeg(压缩、切片、转格式、抽音轨全靠它);二是语音转写工具,用来出字幕。转写这块的选型与接入方式,站里在 OpenClaw 怎么加语音能力 里写过,本地模型和云端接口各有取舍,视频转写通常更推荐本地跑,因为一次要处理的是小时级的音频,按量计费不是小数目。
装完之后做一件很关键的事:把处理规则写成一个文件交给它读,比如「输出统一放 output 目录」「压缩目标控制在 500MB 以内」「命名模板是 日期-主题-序号」。规则写在文件里,比每次在对话里重新说一遍靠谱得多,也方便你以后改。
一、批量压缩:参数怎么选,别只盯体积
压缩有三个维度只能选两个:体积、画质、时间。所以先想清楚这份视频给谁看。
(1)画质优先的压缩。用质量参数(CRF 这类按感知质量给值的模式),让编码器自动决定码率。同一条命令适用于不同分辨率的素材,不会出现「低分辨率被压得太狠」。这是最省心的做法,适合长期存档和对外发布的片子。
(2)体积优先的压缩。用固定码率,直接卡死目标体积。适合要上传、要发群、有大小限制的场景。代价是画面复杂的地方会明显糊,而且糊的地方不可预期。
(3)时间优先。用硬件加速编码,速度快很多,同体积下画质略差。适合一次要转几百个文件的批处理。
一个容易忽略的细节:音频也要单独看一眼。视频压得很小、音频还是原样,体积可能有一半白花。大多数场景把音频降到 96 到 128kbps 完全够听。
另外务必让 OpenClaw 在动手前先出一张体积预估表:原文件大小、预计压缩后大小、预计耗时。看了表格再决定批量跑不跑,比跑完两百个才发现压过头要划算得多。
二、自动抽字幕:三种产物要分清
抽字幕这件事,产出的东西是不同的三种,用途也不同:
(1)纯文本稿。用来做会议纪要、写摘要、喂给知识库检索。这是最有用的一种,因为文字可以搜、可以引用、可以归档。
(2)字幕文件。外挂的 srt 或 vtt,播放器能加载、平台能上传。要注意时间轴要跟原片对齐,如果中途做过剪辑,字幕和画面对不上,必须重新生成而不是挪时间。
(3)烧录字幕。直接把字幕压进画面。好处是任何设备都能看到,坏处是不可关闭、不可改字、体积还变大。除非要发到不支持外挂字幕的地方,否则不建议烧录。
实操上有两个提效点:一是先分离音轨再转写,比直接丢视频给转写工具快得多,也更省资源;二是让 OpenClaw 顺手做一遍术语校正,把公司名、产品名、人名这类高频错词替换掉。转写工具在专有名词上几乎一定会出错,而这类错在后续检索里最致命。
三、切片:三种切法,风险和适用场景不一样
切片是最需要谨慎的一步,因为它改变了内容。三种常见规则:
(1)按静音切分。适合课程、讲座、访谈这种「一段话讲完停一下」的内容。优点是全自动、不需要人工标记。缺点是停顿长的地方会切碎,说话快的地方会切不断,所以必须留一个最小片段长度做下限。
(2)按时间点切分。你给一组起止时间,它照做。最可控、最不会出错,适合已经知道要哪几段的场景。建议配合字幕稿先看一遍文字,再定时间点——看文字找位置,比拖进度条快十倍。
(3)按字幕关键词切分。先转写、再按关键词命中位置划分片段。适合「把讲到某个主题的段落都截出来」这种需求,也是最省人力的半自动方式。
三条硬约束,建议写进规则文件:原片一律不动(只读、只输出到新目录);切片时长有上下限(避免几十毫秒的碎片);切完必须生成一张片段清单(文件名、起止时间、对应字幕摘要),方便你核对有没有漏。
四、批量转格式与统一命名归档
收尾这一步看着简单,其实是「下次还找不找得到」的关键。三条经验:
(1)命名走统一模板。建议「日期-主题-类型-序号」,日期用 YYYY-MM-DD 格式,这样排序天然正确。批量重命名的完整思路,和 OpenClaw 整理本地文件 里讲的是同一套,包括必须留一张原名与新名的映射表。
(2)输出目录按用途分层。推荐「输出/日期/主题」这样三层以内,避免目录深到懒得点。每一层放一个说明文件,写清这批素材的来源和状态。
(3)保留一份「可检索版本」。把每段视频的字幕摘要、关键词、时长写进一张 CSV。以后你不记得某个片段在哪,搜关键词就行,不用一个个点开看。整理成表格的做法参考 AI Agent 处理 Excel 表格怎么做;如果这批素材最后是要做汇报,出稿流程可以接 OpenClaw 自动做汇报材料。
顺便提醒一句:视频素材的体积很容易失控,动手前先确认备份。备份与迁移的原则见 OpenClaw 数据备份与迁移。
执行侧:怎么才敢让它一次动几百个文件
四段式,建议写死在流程里:
(1)先试运行。让它只打印准备执行的命令,不真的跑。重点看三件事:输出路径对不对、会不会覆盖同名文件、压缩参数是不是你要的那档。
(2)先跑十个。拿十个文件做样本,跑完人工看一遍成片质量。这一步能挡住绝大多数参数错误——参数错了,跑十个和跑三百个的差别只是浪费多少时间。
(3)分批推进。按批次跑,每批跑完看一遍日志。批处理出错往往是「错在同一个规则上」,分批能把影响面控住。
(4)留日志和清单。每个文件的处理动作、耗时、结果都记下来。哪批有问题,直接重跑那一批就行,不用全部推倒。
优缺点
优点:原本要开剪辑软件、导入导出折腾一下午的活,变成一条命令跑完;体积肉眼可见地降下来,归档和传输都轻松;字幕稿能直接变成可搜索的文本资产,价值比视频本身还高;整套流程可以挂成定时任务,新素材丢进目录就自动处理。
缺点:转写质量直接决定切片质量,口音重、多人抢话、专业术语多的素材效果会明显打折,得留人工校对的时间;第一次配置和调参比较费劲,参数需要针对自己的素材试几轮;涉及人脸、涉密内容的素材,得先想清楚能不能交给工具处理——本地跑转写能缓解这个问题,但不是全部。
适合人群
适合:经常处理会议录屏、培训课程、访谈录音的人;手上有一批要归档、要对外发布、要压缩上传的素材;想把视频里的内容变成可搜索文字资产(比如做知识库)的团队。不适合:需要精细剪辑、转场、调色的创作型工作——那是剪辑软件的活,让 Agent 做只会两头不讨好;也不适合只偶尔处理一两个文件的人,配置成本收不回来。
六个坑
坑一:一句话让它「处理一下视频」。需求没拆清,它只能猜,猜错还得重来。坑二:只压视频不管音频。体积白花一半。坑三:直接对原片动手。切片误操作是不可逆的,原片必须只读并先备份。坑四:不校对就烧录字幕。错了改不回来,而且专有名词一定是错的。坑五:一次跑几百个文件不试运行。参数错了,浪费的是几小时机器时间加上你的心情。坑六:处理完不留索引。素材越攒越多,最后还是找不到——这跟没整理没区别。
总结
OpenClaw 处理视频,一条主线:先把需求拆成压缩、抽字幕、切片、转格式归档四件事,各有各的风险等级;压缩按画质优先、体积优先、时间优先三档选参数,音频别放过;抽字幕区分纯文本、字幕文件、烧录三种产物,先分离音轨再转写并做术语校正;切片支持按静音、按时间点、按关键词三种规则,原片只读、时长有上下限、切完出清单;转格式统一命名并建索引;执行侧先试运行、再跑十个样本、分批推进、全程留日志。一句心法:视频处理真正费时间的从来不是转码,而是「切之前想清楚要哪几段、切完还找不找得到」。