OpenClaw 媒体能力:图片、语音、文档的收发与生成
聊天助手不能只会发文字。OpenClaw 的媒体链路覆盖收、转、发、生成四段,渠道间差异是唯一需要留意的坑。
收:入站媒体
- 各渠道发来的图片、音频、视频、文档会规范化成统一信封交给智能体,模型可以看图、读文档、听语音。
- 语音留言自动转录:WhatsApp 等渠道的长语音可以转成文字再进模型,官方功能列表里明确列了这项。
- 支持情况因渠道而异——Telegram/Discord 这类 Bot API 完善的渠道最完整,部分渠道只保文本。
发:出站媒体
- 智能体可以生成或引用文件后发回渠道:Markdown 图片语法在 Telegram 上会尽量转成真正的媒体消息。
- 长回复自动分块、富消息格式(表格、清单等)在支持的渠道上可选开启,默认关闭以保证旧客户端兼容。
生成:统一接口
- 图像生成 / 视频生成 / 音乐生成:OpenClaw 把这几类生成能力做成统一接口,底层接 Fal、Runway、ComfyUI(本地)等提供商,配置里选谁就用谁。
- 文本转语音(TTS):多家语音提供商(Azure Speech、ElevenLabs、Deepgram 等)可配;手机节点上还能把回复直接朗读出来。
手机端的媒体玩法
媒体能力和移动节点组合才有完整体验:
- 拍照/录像给智能体看:Android/iOS 节点提供 camera 拍照与短视频命令,智能体可以主动请求镜头。
- 语音对话(Talk 模式):手机端连续对话,识别与合成可走网关配置的提供商链。
- 听回复:聊天里长按消息选择聆听,网关 TTS 不可用时回退到设备系统语音。
实用提醒
- 媒体文件占空间,状态目录会持续增长,定期清理或把媒体目录挂到大盘。
- 生成类提供商按量计费,图像视频尤其贵——给常驻智能体开发能力前,先设用量预算(见 用量成本)。
- 公开群里的媒体是上下文的一部分,配合上下文可见性过滤避免陌生人图片进提示词。