tools.media.audio 进行入站音频/语音笔记
转录,并通过 plugins.entries.voice-call.config.streaming 进行 Voice Call 流式 STT。
批量转录会将完整的音频文件上传到 Deepgram,并将转录文本注入到回复流程中
({{Transcript}} + [Audio] 块)。
Voice Call 流式转录会通过 Deepgram 的
WebSocket listen 端点转发实时 G.711 u-law 帧,并在 Deepgram 返回部分/最终转录时发出它们。
入门
1
设置你的 API 密钥
2
启用音频提供方
3
发送语音笔记
通过任意已连接的渠道发送音频消息。OpenClaw 会通过
Deepgram 转录它,并将转录文本注入回复流水线。
配置选项
providerOptions.deepgram 会将额外的查询参数直接合并到
Deepgram /listen 请求中,因此可以使用 Deepgram 支持的任何参数名称
(例如 detect_language、punctuate、smart_format):
- 使用语言提示
- 使用 Deepgram 选项
Voice Call 流式 STT
内置的deepgram 插件还会为 Voice Call 插件注册一个实时转录提供方。
baseUrl 设置为端点根地址,包括任何基础路径,但不包括 /listen。
实时端点接受 http://、https://、ws:// 和 wss://。HTTP
会映射为 WS,HTTPS 会映射为 WSS,而显式的 WebSocket 协议保持不变。
格式错误的 URL 和其他协议会在会话设置期间失败。
Voice Call 接收的是 8 kHz G.711 u-law 电话音频。Deepgram
流式提供方默认使用
encoding: "mulaw" 和 sampleRate: 8000,因此
Twilio 媒体帧可以直接转发。说明
认证
认证
认证遵循标准的提供方认证顺序。
DEEPGRAM_API_KEY 是
最简单的方式。代理和自定义端点
代理和自定义端点
使用代理时,覆盖 Deepgram
tools.media.models[] 条目中的端点或请求头。输出行为
输出行为
输出遵循与其他提供方相同的音频规则(大小限制、超时、
转录注入)。
相关内容
媒体工具
音频、图像和视频处理流水线概览。
配置
包括媒体工具设置在内的完整配置参考。
故障排查
常见问题和调试步骤。
常见问题
关于 OpenClaw 设置的常见问题。