openclawapp 中文文档 下载 App

本地模型全离线:Ollama 与 llama.cpp 接入

OpenClaw 的架构天然支持「全离线」:模型跑在自己机器上,数据从头到尾不出门。这是它和托管式 AI 产品最本质的区别之一。

支持的本地运行时

运行时适合
Ollama最省心:一条命令起模型,个人桌面首选
LM Studio图形界面管理模型,Mac/Windows 友好
llama.cpp极致可控,底层玩家
vLLM / SGLang有显卡服务器,要吞吐量
本地 GGUF 嵌入记忆语义检索也能离线(见记忆搜索)

任何 OpenAI 或 Anthropic 兼容端点都能接——自建代理、局域网推理盒都行。

接入要点

  1. 先把运行时跑起来:比如 Ollama 拉一个模型并保持服务在线。
  2. 在 OpenClaw 里加提供商:把本地端点地址配进模型提供商配置,像填普通 API 一样,只是指向 localhost。
  3. 指定给智能体:把需要隐私的智能体(比如日记助手)固定路由到本地模型。

合理的分工预期

本地小模型干不了旗舰模型的大活,按能力分工:

官方文档里「压缩前记忆刷新」就给了用本地小模型的配置示例(如 Ollama 上的 8B 级别),这是最典型的省钱又保隐私用法。

完全离线的边界

模型本地了,但有些能力仍可能触网:Web 搜索、部分渠道、图像视频生成的云端提供商——想要真离线,把这些开关关掉即可;语音转写与 TTS 也各有本地选项(系统语音、本地 MLX)。

算清账单这件事,看下一篇成本控制。