Talk 语音对话:从听写到实时通话的完整形态
Talk 模式是 OpenClaw 的语音形态:你说话,它听;它回答,直接朗读。不是简单的「语音转文字聊天」,而是一套连续循环。
它怎么工作
原生 Talk 是一个连续循环:监听语音 → 把转写文本送进当前会话 → 等模型响应 → 用配置的 TTS 朗读回复。短暂停顿后自动发送;默认开着语音打断——它正在朗读时你开口,播放立刻停下,打断时间戳会记进下一轮提示。
五种运行形态
| 形态 | 说明 |
|---|---|
| 原生 macOS/iOS/Android Talk | 设备端语音识别 + 网关聊天 + talk.speak 朗读 |
| iOS 实时 Talk | OpenAI 实时配置可走客户端 WebRTC,低延迟对讲 |
| Android 实时 Talk | 显式配置网关中继后启用,否则用原生循环 |
| 浏览器 Talk | Control UI 里直接开语音 |
| 仅转录客户端 | 只出字幕/听写,不要语音回复 |
TTS 提供商支持 ElevenLabs、本地 MLX、系统语音等;静音判定窗口 macOS 与安卓约 700 毫秒、iOS 约 900 毫秒,都可调。
手机端入口(安卓为例)
安卓的语音入口集中在 Chat 编辑器里,没有单独的语音页:
- 点按麦克风:设备端听写,文字插进输入框。
- 长按麦克风:录一条语音留言附件。
- 从波形启动连续 Talk:进入持续对话。
三条路径互斥——开一个,其他自动停。蓝牙耳机优先,断开自动回退机内麦克风。

手表上也能聊
配套手表应用复用已配对手机的认证连接,手表不存网关凭据:可以选会话、听写回复、中止运行、直接开实时 Talk(音频经临时通道传输)。表盘控件三选:双击开线程、按住听写、轻点实时。
安全细节
语音发起的请求若要执行高影响操作(发消息、控节点、浏览器操作、破坏性命令、发布),需要新的、明确的口头确认——确认只对被拦工具的确切参数生效、只用一次。通话结束还可以把本次「语音通话变更摘要」发到该会话的目标渠道。
回复里能带语音指令
助手回复的首行可以放一段 JSON 控制朗读(音色、语速、稳定性等参数,仅对当条生效或设为新默认),播放前会被移除——播客感的固定音色就是这么来的。
下一步把「主动干活」配上:定时任务。