本地模型全离线:Ollama 与 llama.cpp 接入
OpenClaw 的架构天然支持「全离线」:模型跑在自己机器上,数据从头到尾不出门。这是它和托管式 AI 产品最本质的区别之一。
支持的本地运行时
| 运行时 | 适合 |
|---|---|
| Ollama | 最省心:一条命令起模型,个人桌面首选 |
| LM Studio | 图形界面管理模型,Mac/Windows 友好 |
| llama.cpp | 极致可控,底层玩家 |
| vLLM / SGLang | 有显卡服务器,要吞吐量 |
| 本地 GGUF 嵌入 | 记忆语义检索也能离线(见记忆搜索) |
任何 OpenAI 或 Anthropic 兼容端点都能接——自建代理、局域网推理盒都行。
接入要点
- 先把运行时跑起来:比如 Ollama 拉一个模型并保持服务在线。
- 在 OpenClaw 里加提供商:把本地端点地址配进模型提供商配置,像填普通 API 一样,只是指向 localhost。
- 指定给智能体:把需要隐私的智能体(比如日记助手)固定路由到本地模型。
合理的分工预期
本地小模型干不了旗舰模型的大活,按能力分工:
- 适合本地:记忆整理轮次、简单摘要、隐私敏感的日常对话、Heartbeat 巡检的低成本轮次。
- 不适合本地:长链推理、大代码库重构、复杂浏览器自动化——这些交给云端旗舰。
官方文档里「压缩前记忆刷新」就给了用本地小模型的配置示例(如 Ollama 上的 8B 级别),这是最典型的省钱又保隐私用法。
完全离线的边界
模型本地了,但有些能力仍可能触网:Web 搜索、部分渠道、图像视频生成的云端提供商——想要真离线,把这些开关关掉即可;语音转写与 TTS 也各有本地选项(系统语音、本地 MLX)。
算清账单这件事,看下一篇成本控制。