Skip to content

快速开始

本页所有命令全程离线:无需 API key、无需注册、无需联网。

1. 第一份 verdict(几秒钟)

pip install eval-mock
eval-mock quickstart

内置的 email-basic 预置场景 + 脚本化 demo agent,直接打印一份通过的 verdict 和 run 目录。CI 在冷机器上为这条命令计时——从安装到第一份 verdict 必须 ≤ 60 秒。

2. 同一个世界,换你的 agent

MCP(agent 一行不改,服务地址在环境变量 EVAL_MOCK_MCP_URL):

eval-mock run --preset email-basic -- <你的 agent 命令>

或原生 function calling,自己的循环里接 ~10 行:

from eval_mock.integrations.env import EvalMockEnv

env = EvalMockEnv("scenario.yaml")
tools = env.openai_tools()  # 或 env.anthropic_tools()
message = env.call(tool_call)  # 执行模型的 tool_call,返回可回填的消息
env.finish(final_answer)
env.assert_pass()

工具名会为 provider 自动净化(email.sendemail__send)并在调用时映射 回来。

3. 变成门禁

eval-mock run --preset email-gate --repeat 5 --pass-threshold 0.8 -- <agent>
eval-mock run scenario.yaml --null-agent    # 变异测试:零动作 agent 必须不通过

退出码:0 通过 · 1 断言失败 · 2 运行无效(fail-closed)· 3 超预算。

4. 证明它发生过

eval-mock verify runs/run-<id>     # 第三方重放,复现同一份 verdict
eval-mock diff runs/run-<id>       # 世界改了什么
eval-mock compare runs/A runs/B    # 两次运行行为差在哪

更多内容(DSL 参考、BYO 域、集成指南)见英文文档——中文维护 README 与本页两处(保证质量优先于覆盖面)。