用 OpenClaw 跑自动化的人,迟早会撞上同一堵墙:Agent 会聊天、会调工具、会写代码,但不会「上网」。查个竞品价格、填个报名表单、盯一个页面有没有更新、从网页上抓一份数据——这些事 Agent 干不了,只能你自己手动开浏览器。一个号称「替你干活」的 Agent,干不了最常见的活,体验就很割裂。
这篇教程讲清 OpenClaw 接浏览器自动化的完整路径:主流方案是接 Playwright MCP,让 Agent 拥有一个「可以操作的真实浏览器」;再配网页内容提取、表单填写、登录态管理这些实用技能;最后是常见报错排查。照着配,OpenClaw 就能自己上网干活了。
先想清楚:Agent「上网」有哪几种姿势
给 Agent 接浏览器,先分清三种能力,别一上来就上最重的方案:
读网页内容。Agent 只需要把网页文字抓下来理解——比如查资料、看公告、读文档。这种最轻,用网页抓取工具或 MCP 的 content 能力就够了,不用真的开浏览器。
操作页面。Agent 需要点击、填表、翻页、提交——比如报名、下单、管理后台操作。这种必须有一个真实浏览器,用 Playwright MCP 最合适。
看页面渲染。Agent 需要理解页面长什么样(截图分析),或者页面是 JS 动态渲染的。Playwright 方案天然支持,能看到渲染后的真实页面。
大部分需求落在第二、三种,所以主流做法就是接 Playwright MCP。它本质上是一个 MCP 工具服务,把「打开网页、点击、输入、截图、提取内容」包装成 Agent 能调用的工具,底层跑一个真实的 Chromium 浏览器。
第一步:安装并配置 Playwright MCP
Playwright MCP 的接入分三步:安装、初始化浏览器、在 OpenClaw 里配置。
安装服务。用 npx 或 pip 安装 Playwright MCP 服务端,然后执行它的浏览器初始化命令下载 Chromium 内核(国内网络慢的话,设置镜像或耐心等一等,一次装好之后不用再装)。
配置到 OpenClaw。在 OpenClaw 的 MCP 配置文件里新增一个 mcpServers 条目,指向 Playwright MCP 的启动命令,就像 OpenClaw 接数据库 里配置 MySQL/PostgreSQL MCP 一样——写好服务名、命令、参数,保存后重载配置。
验证连接。启动 OpenClaw,随便问一句「用浏览器打开一下 example.com,告诉我页面上有什么」。如果 Agent 能调用浏览器工具并返回页面内容,说明配置成功。这一步出问题先看 OpenClaw 日志与排错——MCP 服务连不上、工具加载失败,八成在日志里有线索。
第二步:给 Agent 配「网页技能」
有了浏览器工具,还要让 Agent 用得顺手。推荐按需开发几个自定义技能(OpenClaw 自定义技能开发 的流程):
网页资料抓取技能。输入「目标网站 + 要提取的信息」,Agent 自动打开页面、提取正文或表格、整理成结构化结果返回。适合竞品监控、资讯汇总、数据采集。
表单操作技能。定义好「打开表单页 → 填写字段 → 提交 → 确认结果」的流程模板,Agent 照着执行。适合报名、预约、日常填报这类重复劳动。
定时巡检技能。把「每隔 X 小时打开某页面,检查是否有更新,有就通知」包装成技能,配合 OpenClaw 的 定时任务能力,就组成了一个无人值守的网页监控员。
技能里记得约束清楚:哪些网站能操作、哪些操作需要人工确认(比如提交订单、删除内容),别让 Agent 在网上「自由发挥」。
第三步:处理登录态,让 Agent 进「会员区」
很多网页需要登录才能操作。Playwright 方案里,最实用的做法是「持久化登录态」:先用浏览器手动登录一次,把登录态(Cookie/Storage)保存下来,之后 Agent 启动浏览器时自动带上,就不用每次重新登录。
这里有两个安全要点:一是登录态本质是凭证,存放位置要跟 Agent 密钥边界 的规矩对齐——别明文放在容易被插件、日志读到的地方;二是涉及敏感账号(比如支付、管理后台),别让 Agent 长期持有登录态,用完即清,或者关键操作强制人工确认。
第四步:常见报错排查,一次讲清
接浏览器自动化,下面几个报错是高频:
浏览器启动失败。多半是 Chromium 内核没装好、路径不对,或沙箱权限问题。检查 MCP 服务启动日志,重装内核或用带沙箱参数的配置。
元素找不到 / 点击无效。页面是 JS 动态渲染的,内容出现有延迟。让 Agent 等一等再操作,或在技能里加「等待元素出现」的步骤。这类问题别让 Agent 反复重试硬试——工具调用失败排查 的套路是:先确认是「页面没加载完」还是「选择器写错」,再对症下药。
验证码 / 反爬拦截。频繁访问或行为像机器,会被网站拦。解法按优先级:降低访问频率、加随机延迟(Agent 的行为要像人一点)、优先用站方提供的公开 API(比硬抓网页更稳),实在要抓就只抓必要页面、控制并发。权限管理 的思维在这里同样适用:给 Agent 的最小抓取范围,能少抓就少抓。
MCP 连接超时。工具调用迟迟不返回。检查 Playwright MCP 服务是否还活着、浏览器是否卡死,必要时重启服务。配合 回放对照,把失败的那次会话回放一遍,能看清 Agent 到底在哪一步卡住。
上线前:合规与留痕,两条底线
让 Agent 上网干活,两条底线要守住:
一是合规。抓数据要遵守目标网站的 robots 协议和用户协议,涉及个人信息、版权内容的采集要谨慎;登录态操作要确保是本人授权范围。
二是留痕。Agent 访问了哪些页面、做了什么操作,要有日志记录——证据包 机制在这里同样适用,出问题(比如误操作、被投诉)能复盘。生产环境建议把 Agent 浏览器操作记录到独立日志,配合 质量门禁 做抽查,而不是「放出去就不管了」。
优缺点与适合人群
好处:把「人开浏览器手动干活」变成「Agent 按指令自动干」,查资料、填表、盯价格、采集数据这些重复活能省下大量时间;和定时任务组合后,能形成无人值守的自动化链路。代价:浏览器自动化比纯 API 调用「脆」——网页改版就可能失效,需要维护;反爬环境不稳定,偶尔要人工介入;跑在生产环境要配好权限和留痕。
适合:需要大量网页操作的运营、数据分析、个人自动化爱好者;有公开信息采集需求的小团队。不适合:对稳定性要求极高、页面频繁改版且无 API 的核心业务流程——那种场景优先找官方 API,浏览器自动化做兜底。
总结
OpenClaw 怎么接浏览器,核心就三步:接上 Playwright MCP(让 Agent 拥有真实浏览器)、配上网页技能(抓取、填表、巡检)、管好登录态与权限(安全底线)。浏览器自动化让 OpenClaw 从「会聊天的助手」升级成「能上网干活的员工」——但记住,它脆、要维护、要守规矩。把报错排查(浏览器启动、元素定位、反爬)和留痕机制配好,这个「员工」就能长期稳定替你干活了。