Skip to main content
OpenClaw 可生成图像、视频和音乐,理解传入媒体 (图像、音频、视频),并通过文本转语音将回复朗读出来。所有 媒体能力都由工具驱动:代理会根据对话决定何时使用它们, 并且每个工具只有在至少配置了一个后端提供商时才会出现。 实时语音使用 Talk 会话契约,而不是一次性媒体工具路径。Talk 有三种模式:提供商原生 realtime、本地或流式 stt-tts,以及用于仅观察式语音采集的 transcription。这些模式与电话、会议、浏览器实时和原生按住说话客户端共享提供商目录、事件封装和取消语义。

功能

图像生成

通过文本提示或参考图像,使用 image_generate 创建和编辑图像。聊天会话中异步运行——在后台运行,并在准备好时发布结果。

视频生成

通过 video_generate 实现文生视频、图生视频和视频转视频。 异步——在后台运行,并在准备好时发布结果。

音乐生成

通过 music_generate 生成音乐或音轨。聊天会话中异步运行,使用共享的媒体生成任务生命周期。

文本转语音

通过 tts 工具以及 tts 配置将对外回复转换为语音音频。同步。

媒体理解

使用具备视觉能力的模型提供商和专用媒体理解插件,对传入的图像、音频和视频进行摘要。

语音转文本

通过批量 STT 或语音通话流式 STT 提供商转录传入的语音消息。

媒体播放

在控制界面和原生应用中以内嵌方式播放助手的音频和视频,并提供受管理的访问权限和便携式播放版本。

提供商能力矩阵

此表涵盖专用的媒体生成、TTS 和 STT 插件。许多聊天模型提供商(Anthropic、Google、OpenAI 等)也能通过其回复模型理解传入媒体;请参阅 媒体理解 中的完整提供商列表。
这里的 实时语音 指的是提供商原生的双向实时能力(Talk realtime 模式,例如 Gemini Live 或 OpenAI Realtime API)——目前只有 Google 和 OpenAI 注册了这一能力。Deepgram、ElevenLabs、Mistral、OpenAI 和 xAI 另外注册了语音通话流式 STT(单向音频转文本);请参阅下方 语音转文本和语音通话。 xAI 实时语音是上游能力,但在共享的 realtime-voice 合同能够表示它之前,尚未在 OpenClaw 中注册。

异步与同步

对于异步工具,OpenClaw 会将请求提交给提供商,立即返回一个任务 id,并在任务账本中跟踪该作业。代理在作业运行期间继续响应其他消息。当提供商完成后,OpenClaw 会用生成的媒体路径唤醒代理,以便它可以通过会话的正常可见回复模式告知用户:如果已配置,则自动发送最终回复;如果会话需要消息工具,则使用 message(action="send")。如果请求者会话处于非活动状态,或者其活动唤醒失败,并且完成回复中仍缺少某些生成的媒体,OpenClaw 会仅针对缺失的媒体发送幂等的直接回退。已由完成回复发送过的媒体不会再次发布。

语音转文字和语音通话

Deepgram、DeepInfra、ElevenLabs、Google、Groq、Mistral、OpenAI、OpenRouter、 SenseAudio 和 xAI 在完成配置后,都可以通过批处理 tools.media.audio 路径转录传入的音频。会在提及门控或命令解析前预检查语音消息的频道插件,会在传入上下文中标记已转录的附件,使共享的媒体理解流程能够复用该转录结果,而无需对同一音频再次发起 STT 调用。 Deepgram、ElevenLabs、Mistral、OpenAI 和 xAI 还会注册语音通话 流式 STT 提供商,因此实时通话音频可以转发给所选的 提供商,无需等待录音结束。 对于实时用户对话,优先使用 通话模式。批量音频附件仍然通过媒体路径处理;浏览器实时音频、原生按住说话、电话和会议音频应使用 Talk 事件以及 Gateway 返回的会话作用域目录。

供应商映射(各供应商如何分布到不同表面)

图片、视频、音乐、批量 TTS、批量 STT、后端实时语音,以及 媒体理解表面。
图像、视频、批量 TTS、批量 STT、Voice Call 流式 STT、后端 实时语音,以及记忆嵌入相关能力。
聊天/模型路由、图像生成/编辑、文本转视频、批量 TTS、 批量 STT、图像媒体理解,以及记忆嵌入表面。 DeepInfra 还暴露了 reranking、classification、object-detection,以及 其他原生模型类型;OpenClaw 目前尚未为这些类别提供供应商合约, 因此此插件不会注册它们。
图像、视频、搜索、代码执行、批量 TTS、批量 STT,以及 Voice Call 流式 STT。xAI Realtime 语音是上游能力,但在共享实时语音合约能够表示它之前, 不会在 OpenClaw 中注册。

相关内容