Skip to main content
ds4 从本地 Metal 后端提供 DeepSeek V4 Flash,并带有 OpenAI 兼容的 /v1 API。OpenClaw 通过通用的 openai-completions 提供方家族连接到 ds4。 ds4 不是内置的 OpenClaw 提供方插件。请在 models.providers.ds4 下进行配置,然后选择 ds4/deepseek-v4-flash

要求

  • 具有 Metal 支持的 macOS。
  • 一个可正常工作的 ds4 检出环境,包含 ds4-server 和 DeepSeek V4 Flash GGUF 文件。
  • 针对你选择的上下文准备足够的内存;更大的 --ctx 值会在服务器启动时分配更多 KV 内存。
OpenClaw agent 的轮次包含工具 schema 和工作区上下文。像 --ctx 4096 这样很小的上下文 可能可以通过直接的 curl 测试,但在完整的 agent 运行中会失败,并出现 500 prompt exceeds context。用于 agent 和工具的冒烟测试时,请至少使用 --ctx 32768。 仅在内存足够且需要启用 ds4 Think Max 时才使用 --ctx 393216

快速开始

1

启动 ds4-server

<DS4_DIR> 替换为你的 ds4 检出路径。
2

验证 OpenAI 兼容端点

响应中应包含 deepseek-v4-flash
3

添加 OpenClaw 提供方配置

添加 完整配置 中的配置,然后运行一次性模型 检查:

完整配置

当 ds4 已经在 127.0.0.1:18000 上运行时,使用此配置。
保持 contextWindowds4-server --ctx 一致。保持 maxTokens--tokens 一致,除非你有意让 OpenClaw 请求比服务器默认值更少的输出。

按需启动

当选择了 ds4/... 模型时,OpenClaw 可以只启动 ds4。将 localService 添加到同一个提供方条目中:
command 必须是绝对可执行路径。不会使用 shell 查找和 ~ 展开。 有关每个 localService 字段,请参见 本地模型服务

Think Max

ds4 仅在以下两个条件都满足时才会应用 Think Max:
  • ds4-server--ctx 393216 或更高参数启动。
  • 请求使用 reasoning_effort: "max"(或等效的 ds4 effort 字段)。
如果你运行这么大的上下文,请同时更新服务器标志和 OpenClaw 模型 元数据:

测试

直接 HTTP 检查,绕过 OpenClaw:
OpenClaw 模型路由(与快速开始检查相同):
完整的 agent 和工具调用冒烟测试,至少包含 32768 的上下文:
预期结果:
  • executionTrace.winnerProviderds4
  • executionTrace.winnerModeldeepseek-v4-flash
  • toolSummary.calls 至少为 1
  • finalAssistantVisibleTexttool-ok 开头

故障排查

ds4 未运行,或未绑定到 baseUrl 中的主机/端口。先启动 ds4-server,然后重试:
配置的 --ctx 对 OpenClaw 的回合来说太小了。提高 ds4-server --ctx,然后将 models.providers.ds4.models[].contextWindow 更新为匹配的值。带工具的完整 agent 回合所需上下文远多于 直接的一条消息 curl 请求。
ds4 只有在 --ctx 至少为 393216 且请求 指定 reasoning_effort: "max" 时才会使用 Think Max。更小的上下文会回退到高 推理。
ds4 有冷启动的 Metal 驻留和模型预热阶段。若 OpenClaw 按需启动服务器,请设置 localService.readyTimeoutMs: 300000

相关内容

本地模型服务

在模型请求之前按需启动本地模型服务器。

本地模型

选择并操作本地模型后端。

模型提供方

配置提供方引用、认证和故障转移。

DeepSeek

原生 DeepSeek 提供方行为和思维控制。