快速开始
本页所有命令全程离线:无需 API key、无需注册、无需联网。
1. 第一份 verdict(几秒钟)
pip install eval-mock
eval-mock quickstart
内置的 email-basic 预置场景 + 脚本化 demo agent,直接打印一份通过的
verdict 和 run 目录。CI 在冷机器上为这条命令计时——从安装到第一份
verdict 必须 ≤ 60 秒。
2. 同一个世界,换你的 agent
走 MCP(agent 一行不改,服务地址在环境变量 EVAL_MOCK_MCP_URL):
eval-mock run --preset email-basic -- <你的 agent 命令>
或原生 function calling,自己的循环里接 ~10 行:
from eval_mock.integrations.env import EvalMockEnv
env = EvalMockEnv("scenario.yaml")
tools = env.openai_tools() # 或 env.anthropic_tools()
message = env.call(tool_call) # 执行模型的 tool_call,返回可回填的消息
env.finish(final_answer)
env.assert_pass()
工具名会为 provider 自动净化(email.send → email__send)并在调用时映射
回来。
3. 变成门禁
eval-mock run --preset email-gate --repeat 5 --pass-threshold 0.8 -- <agent>
eval-mock run scenario.yaml --null-agent # 变异测试:零动作 agent 必须不通过
退出码:0 通过 · 1 断言失败 · 2 运行无效(fail-closed)· 3 超预算。
4. 证明它发生过
eval-mock verify runs/run-<id> # 第三方重放,复现同一份 verdict
eval-mock diff runs/run-<id> # 世界改了什么
eval-mock compare runs/A runs/B # 两次运行行为差在哪
更多内容(DSL 参考、BYO 域、集成指南)见英文文档——中文维护 README 与本页两处(保证质量优先于覆盖面)。