Skip to main content
Azure Speech 是一个捆绑的 Azure AI Speech 文本转语音提供商。OpenClaw 通过 SSML 直接调用 Azure Speech REST API,为标准回复合成 MP3,为语音笔记合成原生 Ogg/Opus,并为 Voice Call 等电话渠道合成 8 kHz mulaw。请求通过 X-Microsoft-OutputFormat 标头发送提供商拥有的输出格式。

开始使用

1

创建 Azure Speech 资源

在 Azure 门户中,创建一个 Speech 资源。从 Resource Management > Keys and Endpoint 中复制 KEY 1,并复制资源位置 例如 eastus
2

Select Azure Speech in tts

3

发送消息

通过任意已连接的通道发送回复。OpenClaw 使用 Azure Speech 合成音频, 标准音频发送 MP3,而当通道期望语音笔记时则发送 Ogg/Opus。

配置选项

All options live under tts.providers["azure-speech"]. 在设置了 apiKey 以及 regionendpointbaseUrl 其中之一后,即视为该提供者已配置。仅当配置键未设置时,才会将环境变量作为回退项进行检查。工作区的 .env 文件不能设置 AZURE_SPEECH_ENDPOINT;请使用进程环境、全局运行时 dotenv,或显式配置来进行端点路由。

说明

Azure Speech 使用 Speech 资源密钥,而不是 Azure OpenAI 密钥。该密钥 会作为 Ocp-Apim-Subscription-Key 发送;OpenClaw 会根据 region 推导出 https://<region>.tts.speech.microsoft.com,除非你 提供 endpointbaseUrl
使用 Azure Speech 语音的 ShortName 值,例如 en-US-JennyNeural。内置提供程序可以通过同一个 Speech 资源列出语音, 并会过滤掉标记为已弃用、已退役或已禁用的语音。
Azure 接受诸如 audio-24khz-48kbitrate-mono-mp3ogg-24khz-16bit-mono-opusriff-24khz-16bit-mono-pcm 等输出格式。OpenClaw 会为 voice-note 目标请求 Ogg/Opus,以便通道可以发送原生语音气泡而无需额外的 MP3 转换, 并且会为电话目标强制使用 raw-8khz-8bit-mono-mulaw
azure 可作为现有配置的提供程序别名被接受,但新配置应使用 azure-speech, 以避免与 Azure OpenAI 模型提供程序混淆。

相关内容

Text-to-speech

TTS overview, providers, and tts config.

Configuration

Full config reference including tts settings.

提供程序

所有捆绑的 OpenClaw 提供程序。

故障排除

常见问题和调试步骤。