Skip to main content
个人代理基准包是一个体积较小、由仓库支持的 QA 场景包,用于本地个人助手工作流。它不是一个通用模型基准,也不需要新的运行器:它复用了私有 QA 栈(QA 概览)、合成的 QA channel,以及现有的 qa/scenarios YAML 目录。

场景

qa/scenarios/personal/*.yaml 中定义了十个场景: 机器可读的 personal-agent 配置文件位于根目录 taxonomy.yaml 中,作为 语义覆盖 ID。QA Lab 会从目录中解析每个主负责人; 不存在第二个场景 ID 列表。运行方式如下:
使用重复的 --scenario 标志来缩小配置文件范围。场景文件和 taxonomy 顺序不会影响成员关系或执行顺序。 该包面向 qa-channel,使用 mock-openai 或其他本地 QA provider lane。不要将其指向在线聊天服务或真实个人账户。

隐私模型

场景仅使用假用户、假偏好设置、假密钥以及由测试套件创建的临时 QA 网关工作区。它们不得读取或写入真实的 OpenClaw 用户记忆、会话、凭据、启动代理、全局配置或实时网关状态。 工件保留在现有的 QA 测试套件工件目录下,并被视为测试输出。脱敏检查使用假标记,因此即使失败,检查结果也可以安全地查看并在 issue 中提交。

扩展包

qa/scenarios/personal/ 下添加新的 .yaml 案例,声明它们所证明的确切主覆盖 ID,并在该语义 ID 属于此基准时,将其添加到分类配置中。每个案例都应在 mock-openai 中保持小型、局部且确定性,并专注于一种个人助手行为。 不错的后续候选项:脱敏轨迹导出检查、仅本地 插件工作流检查。 在场景目录积累足够稳定的案例以证明需要该表面之前,不要添加新的运行器、插件、依赖、实时传输或模型裁判。