Skip to main content
Deepgram 是一个语音转文本 API。OpenClaw 使用它通过 tools.media.audio 进行入站音频/语音笔记 转录,并通过 plugins.entries.voice-call.config.streaming 进行 Voice Call 流式 STT。 批量转录会将完整的音频文件上传到 Deepgram,并将转录文本注入到回复流程中 ({{Transcript}} + [Audio] 块)。 Voice Call 流式转录会通过 Deepgram 的 WebSocket listen 端点转发实时 G.711 u-law 帧,并在 Deepgram 返回部分/最终转录时发出它们。

入门

1

设置你的 API 密钥

2

启用音频提供方

3

发送语音笔记

通过任意已连接的渠道发送音频消息。OpenClaw 会通过 Deepgram 转录它,并将转录文本注入回复流水线。

配置选项

providerOptions.deepgram 会将额外的查询参数直接合并到 Deepgram /listen 请求中,因此可以使用 Deepgram 支持的任何参数名称 (例如 detect_languagepunctuatesmart_format):

Voice Call 流式 STT

内置的 deepgram 插件还会为 Voice Call 插件注册一个实时转录提供方。
对于 Deepgram 自定义端点, 将 baseUrl 设置为端点根地址,包括任何基础路径,但不包括 /listen。 实时端点接受 http://https://ws://wss://。HTTP 会映射为 WS,HTTPS 会映射为 WSS,而显式的 WebSocket 协议保持不变。 格式错误的 URL 和其他协议会在会话设置期间失败。
Voice Call 接收的是 8 kHz G.711 u-law 电话音频。Deepgram 流式提供方默认使用 encoding: "mulaw"sampleRate: 8000,因此 Twilio 媒体帧可以直接转发。

说明

认证遵循标准的提供方认证顺序。DEEPGRAM_API_KEY 是 最简单的方式。
使用代理时,覆盖 Deepgram tools.media.models[] 条目中的端点或请求头。
输出遵循与其他提供方相同的音频规则(大小限制、超时、 转录注入)。

相关内容

媒体工具

音频、图像和视频处理流水线概览。

配置

包括媒体工具设置在内的完整配置参考。

故障排查

常见问题和调试步骤。

常见问题

关于 OpenClaw 设置的常见问题。