很多团队跑 OpenClaw,卡在一个纠结上:数据不想出网,token 想省一点,网络还时不时不稳。这时候自然会想到本地模型——把推理放在自己的机器上,私有数据不出门,还能省掉 API 调用费。OpenClaw 最近的版本已经把本地模型接入(Ollama、llama.cpp、LM Studio)的引导做得更顺了,这条路现在是可以真走的。
但本地模型不是万能解。它牺牲的是模型能力上限,换来的是隐私、可控和零 API 成本。要不要上本地,得先算清楚这笔账。这篇把选型和配置的思路讲透,跟 OpenClaw 模型版本管理 正好是上下游。
什么时候该用本地,什么时候别用
适合本地的场景很明确:数据不能出网(金融、医疗、内部文档);任务简单且固定(分类、摘要、格式整理、内部问答);想彻底摆脱 API 涨价和限流。不适合的场景也很明确:需要长程推理、复杂工具编排、高质量代码生成的任务,本地中小模型的能力跟不上,强行用反而让 Agent 变笨。
一个务实的做法是分级:简单的、敏感的任务走本地模型,复杂的、需要强推理的走云端 API。两者可以在 OpenClaw 里并存,按任务类型路由。
三种本地后端怎么选
Ollama 是最省事的选择,一条命令起服务,自带量化模型,适合先跑通。llama.cpp 更偏性能,在苹果芯片和消费级显卡上跑量化模型的效率很好,适合追求速度。LM Studio 带图形界面,选模型、调参数、看显存占用都在窗口里完成,适合不熟命令行的同学。
选型原则一句话:先跑通用 Ollama,要性能用 llama.cpp,要直观用 LM Studio。三者产出的都是 OpenAI 兼容接口,OpenClaw 接起来是同一套逻辑。
接进去之后别忘了这几点
本地模型的上下文窗口通常比云端旗舰小,别指望它一次吞下几万 token 的资料。所以知识库检索要更精准,把最相关的那几条喂进去,而不是把整篇文档塞进去。这正好要配合 知识库陈旧内容巡检 和 引用白名单,保证本地模型引用的资料是新鲜的、可信的。
另外,本地模型也逃不开成本和安全的账。省了 API 费,但买显卡、跑机器、维护推理服务都是成本。本地服务的端口如果暴露,凭证没管好,风险一点不比云 API 小,凭证轮换 那套该做还得做。
总结
OpenClaw 接本地模型,本质是在隐私、能力和成本之间做取舍。数据敏感、任务简单的场景值得上,复杂推理就别硬撑。选型上先跑通用 Ollama、要性能用 llama.cpp、要直观用 LM Studio,接进去后配好精准检索和凭证管理,让本地模型成为云端 API 的补充,而不是替身。