AgentRig
Supports evaluating agents that expose an OpenAI-compatible Chat Completions tool-calling API, including running regression cases and ingesting production traffic through an OpenAI-compatible gateway.
Click on "Deploy Server".
Wait a few minutes for the server to deploy. Once ready, it will show a "Started" state.
In the chat, type
@followed by the MCP server name and your instructions, e.g., "@AgentRigCreate a regression case from the latest production trace and run it against our candidate agent."
That's it! The server will respond to your query, and you can continue using it as needed.
Here is a step-by-step guide with screenshots.
Agent 上线后的风险通常不来自“接口能否调用”,而来自模型、提示词、工具、上下文和依赖变化后, 行为是否仍然满足业务与安全约束。AgentRig 将评测目标转换为可预览、必须确认、幂等提交的 执行计划,并保存从工具调用到最终裁决的完整证据链。任何组件都不能通过一段看似成功的文本改写 运行事实,也不能绕过确认、权限或证据门禁。
为什么是 AgentRig
常见问题 | AgentRig 的处理方式 |
回答看起来正确,但过程无法复核 | 保存不可变运行快照、RunEvent、工具结果、评判记录与引用 |
工具调用难以稳定复现 | 按 Fixture → Sample → Simulation Curator → Real Tool 的受控 Provider 链执行 |
“执行完成”被误当成“测试通过” | 分离运行状态、Rule、Evidence Judge 与外部控制方结论; |
单次成功掩盖模型方差 | Cell 与独立 Attempt 暴露重复执行的真实分布 |
模型或运行时故障后记录丢失 | 以数据库事实链为准,支持幂等重试、断线恢复和显式失败投影 |
评测入口权限过大 | Web 助手、MCP 控制方与执行内核使用分离的权限面和确认边界 |
Related MCP server: agent-replay-debugger-mcp
工作原理
flowchart LR
U[用户目标 / 外部控制方] --> A[评测助手 或 MCP 工具]
A --> P[EvaluationPlan 预览]
P -->|用户确认| G{AgentRig Core Gate}
G --> T[被测 Agent]
T -->|缺少可靠工具结果| C[Simulation Curator]
T --> E[(不可变运行证据)]
C --> E
E --> R[Deterministic Rules]
E --> J[Evidence Judge]
R --> V[可追溯结论]
J --> V角色 | 负责 | 明确不负责 |
评测助手 / 外部控制方 | 理解目标、查询资产、形成计划、解释结果 | 绕过用户确认、直接写入评判事实 |
Simulation Curator | 在可靠样本缺失时生成并校验受控工具结果 | 调用真实业务工具、决定最终 pass/fail |
Evidence Judge | 依据 rubric 和冻结证据独立裁决并引用事件 | 修改 RunEvent、补造不存在的证据 |
AgentRig Core | 执行、权限、状态机、证据、Rule 与审计事实 | 依赖模型或聊天文本才能保持正确性 |
已验证的场景
场景 | 预期 | 可核验证据 |
成功回归 | 受控工具调用完成,Rule 通过 | 工具事件、Provider 命中与规则引用 |
策略回归 | Candidate 未先确认即执行,明确判 | A/B 差异、门禁阻断与同一违规事件引用 |
显式恢复 | 第一次 503/超时保持失败;新 Run 恢复通过 | 两个不可变 Run、错误分类、未覆盖的历史证据 |
三个场景由 Public Reference Target 提供,无需模型 Key 或私有依赖即可在 CI 与本机完整复现。
五分钟复现
路径 A:公开确定性 Demo(推荐)
只需 Python 3.12+、uv 和 Node.js 20+;场景运行不需要模型 Key 或 Docker。
git clone https://github.com/ChenCJ-io/agentrig.git
cd agentrig
scripts/reference_demo.sh all --profile reference-ci脚本会从干净环境完成依赖安装、Web 构建、数据库迁移、服务启动、三个场景执行、证据导出及
离线完整性校验。完成后访问 http://127.0.0.1:8020,产物位于
.agentrig/reference-demo/evidence/。
scripts/reference_demo.sh validate-evidence --require-clean-source
scripts/reference_demo.sh down路径 B:最小本地服务
uv sync --extra dev
cd web && npm ci && npm run build && cd ..
uv run agentrig db upgrade
uv run agentrig serve默认入口:Web http://127.0.0.1:8000/、HTTP API /api/、Streamable HTTP MCP /mcp/。
配置、鉴权和网络边界见快速开始与安全部署。
接入自己的 Agent
创建一个 Target 指向你的 Agent,选择匹配的 Driver,再用 ExecutionProfile 决定工具控制方式:
Driver | 适用协议 |
| stdio Agent Client Protocol(Goose 等编码 Agent) |
| 通用外置 tool-calling SSE 协议 |
| AG-UI 协议(AgentScope 2.x 等) |
| AgentScope 原生运行时 |
| OpenAI Chat Completions tool-calling |
| 部署 allowlist 内的自定义 Driver |
字段、探针与配置合并规则见 实现与接入; Codex、Claude Code 等编码 Agent 可直接按 Skill 目录 通过 MCP 控制评测。
核心能力
领域 | 能力 |
评测编排 | 单用例、批量、多版本、重复运行、双 Target A/B、计划预览与确认 |
工具控制 | controlled、CaseRun 级 MCP proxy、observe-only;Fixture/Sample/Curator/Real Tool 链 |
评判体系 | Deterministic Rule、Evidence Judge、External Controller 分层存档 |
证据与恢复 | 不可变快照、append-only RunEvent、结果引用、幂等状态机、断线恢复 |
质量门禁 | QualityReport、A/B ComparisonReport、版本化 ReleaseGate 与稳定来源哈希 |
生产接入 | OTel 带外上报(OTLP protobuf/JSON)与 OpenAI 兼容网关双车道、接入向导、接入源级 token/限流/保留期 |
生产回归 | 双重脱敏与三档正文策略、Trace→Case 审批、真实工具调用自动生成 Sample 草稿、人工标注与 Judge 对齐 |
工程与安全 | SQLite/PostgreSQL、Alembic、Secret 引用、出站策略、脱敏、SBOM 与校验和 |
交付界面 | React 管理界面、评测助手、HTTP API、MCP、CLI、JSON/Markdown/HTML 报告 |
文档导航
想做什么 | 从这里开始 |
运行第一个可复现场景 | |
理解系统边界和数据流 | |
接入新的被测 Agent | |
把线上流量接进来做回归 | |
了解 Web 评测助手 | |
编排 MCP 工作流 | |
查看全部权威文档 |
质量门禁
主分支 CI 覆盖 Python 3.12/3.13、PostgreSQL migration、公开参考场景、wheel 隔离安装、前端 单元测试、浏览器与可访问性测试、依赖审计和生产构建。
uv run ruff check src tests scripts examples
uv run mypy src/agentrig
uv run pytest
cd web && npm run typecheck && npm run test:coverage && npm run e2e && npm run build版本与成熟度
当前版本为 0.3.0a0,定位为 Alpha。公开 Reference CI、证据导出与安全边界均已实现并
完成本机验收;当前适合评测复现和受控试点,尚不是无人值守生产环境的通用 GA 版本。生产试点
应保留计划确认、人工审批、最小权限和审计门禁。
参与项目
提交问题或改进前请阅读支持指南、贡献指南和 安全策略。安全漏洞请使用 GitHub Private Vulnerability Reporting,不要创建 公开 Issue。
AgentRig 使用 MIT License。
This server cannot be deployed
Maintenance
Related MCP Connectors
AI agent observability for production traces, natural-language insights, and improvement loops.
Pre-execution governance for AI agents. Deterministic PASS/FAIL/REVIEW verdicts, replayable proof.
Synthetic checks, nightly regression replay and model-drift alerts for AI agents
See, price, and control every tool call your AI agents make: policy checks, cost, and audit tools.
Related MCP Servers
- AlicenseCqualityDmaintenanceEnables acceptance gates for AI coding-agent runs by recording evidence, running deterministic validation, applying a quality gate, and rendering auditable outcomes.7Apache 2.0
- AlicenseNot gradedqualityDmaintenanceEnables step-debugging, deterministic replay, and signed audit evidence for AI agents, compliant with EU AI Act.93 PyPIMIT
- AlicenseNot gradedqualityCmaintenanceCaptures AI agent runs and turns them into tamper-evident execution records showing tool use, timing, failures, recoveries, and human interventions. Records can be inspected, exported, and verified offline.MIT
- AlicenseNot gradedqualityBmaintenanceEnables governed tool-calling agents with policy decisions, optional human approval, hash-chained audit logging, and deterministic evaluation.MIT