图片、语音与视频:媒体理解与生成能力
聊天窗口不只是文字通道。OpenClaw 把媒体做成了双向能力:收进来能理解,发出去能生成。
收进来:媒体理解
- 图像:发截图、照片,助手直接看图说话;「院子里来了条蛇,拍照发给它」就是官方社区里的真实用法。
- 音频:语音留言自动转写后理解,支持多家转写提供商。
- 视频与文档:视频同样能理解;PDF 有专门工具。
手机端的加成:设备上的相机、屏幕、麦克风都能作为输入源——让助手「看看我拍的这个」时,App 的相机快照(jpg)与短视频(mp4)能力直接顶上,权限全在你的开关里(见手机配对)。
发出去:媒体生成
官方提供统一的能力接口,底层接多家提供商:
- 图像生成与视频生成:结果直接发回聊天窗口。
- 音乐生成:配好提供商即可点歌。
- 文本转语音(TTS):多个提供商可选,Talk 模式与消息朗读共用这条链路。
媒体在会话里的位置
- 图片、音频、视频、文档都是会话上下文的一部分,之后可以继续追问细节。
- 生成的媒体会作为助手消息投递到你所在的渠道——Telegram 里要图,图就回 Telegram。
实用建议
- 先试截图理解:把报错截图丢给它,是最常用的起手式。
- 生成类配额:图像视频生成走提供商计费,成本意识看成本控制。
- 压缩与格式:手机端上传前 App 会处理附件;过大的媒体注意网络与排队容量(安卓离线队列附件上限 48 MB)。
声音这条线还有更完整的形态:Talk 语音对话。