agent-eval-gate
agent-eval-gate
Trace Inspector + Eval Gate para Codex, agentes compatibles con OpenAI y clientes MCP. Esta es una implementación independiente con licencia MIT; no copia código fuente restringido ni se presenta como un complemento oficial de OpenAI/Codex.
Instalación
Requiere Python 3.11+.
python -m pip install -e .
python -m pip install -e '.[dev]'Related MCP server: agent-eval-mcp
CLI
agent-eval-gate inspect fixtures/normal.jsonl
agent-eval-gate eval cases/safe_search.json
agent-eval-gate gate cases/budget_fail.json # exits 1 when a check fails
agent-eval-gate schema fixtures/normal.jsonleval imprime JSON y es informativo; gate es compatible con CI y devuelve un valor distinto de cero en caso de error.
Esquema de trace
Un objeto JSON por línea. type es uno de run, model_call, tool_call, tool_result o error.
Los campos opcionales incluyen id, parent_id, timestamp, status, tool, arguments, latency_ms, attempt, tokens: {input, output} y error_type.
Las métricas cuentan llamadas a herramientas, herramientas únicas, firmas repetidas (tool, arguments), reintentos (attempt > 1), latencia, totales de tokens, tipos de error, clases de fallo normalizadas, estado final y uso del presupuesto de contexto. Un presupuesto de contexto se compara con los tokens de entrada más los de salida; la tokenización se delega al productor, por lo que esta herramienta no estima tokens ocultos.
Las clases de fallo incluyen schema_error, permission_denied, timeout, tool_error, duplicate_operation, unknown_side_effect, model_error y unknown.
Casos golden
El JSON de un caso nombra un trace y restricciones opcionales: expected_tools, forbidden_tools, max_tokens, max_steps, expected_final_status y context_budget. Los fixtures de este repositorio son sintéticos y públicos.
MCP
Instale el SDK opcional con pip install -e '.[mcp]' y luego ejecute python -m agent_eval_gate.mcp_server. Expone las herramientas de solo lectura inspect_trace y evaluate_case_file que devuelven JSON estructurado. Configure su cliente MCP para lanzar este comando; no se implica ninguna relación oficial con complementos.
Integración con Codex
Se puede llamar directamente a la CLI desde una skill o complemento de Codex. Una skill mínima puede invocar agent-eval-gate inspect <trace> y agent-eval-gate gate <case>; el servidor MCP se puede registrar como servidor stdio local. Mantenga los traces y casos en el espacio de trabajo que realiza la llamada.
Arquitectura y desarrollo
JSONL -> parser -> typed events -> deterministic analysis -> eval checks -> CLI / MCP JSONEjecute pytest, ruff check . y mypy agent_eval_gate. GitHub Actions ejecuta estas comprobaciones en cada push y pull request. Limitaciones conocidas: sin adaptadores de trace específicos de proveedores, sin puntuación probabilística y sin recuento de tokens a partir de prompts sin procesar.
Nota en chino
Esta es una implementación independiente de Trace Inspector + Eval Gate para Codex, agentes compatibles con OpenAI y clientes MCP, con licencia MIT. No es un complemento oficial de OpenAI o Codex ni copia código de repositorios restringidos.
La instalación requiere Python 3.11+: python -m pip install -e .. inspect genera métricas JSON, eval ejecuta y muestra las comprobaciones de casos golden, y gate devuelve un código de salida distinto de cero cuando fallan las restricciones, adecuado para integrarse en CI. El type del JSONL de eventos admite run, model_call, tool_call, tool_result y error; los campos opcionales incluyen nombre de la herramienta, argumentos, latencia, tokens, número de reintentos y tipo de error. Las métricas de tokens utilizan tokens.input y tokens.output proporcionados por el productor; esta herramienta no adivina tokens ocultos.
Los fixtures y casos del repositorio son datos públicos generados por nosotros. El SDK de MCP es una dependencia opcional; el servicio solo analiza traces y casos locales de forma de solo lectura. Las limitaciones actuales incluyen la ausencia de adaptadores de traces específicos de proveedores, sin puntuación probabilística y sin recontar tokens a partir del prompt original.
This server cannot be installed
Maintenance
Resources
Unclaimed servers have limited discoverability.
Looking for Admin?
If you are the server author, to access and configure the admin panel.
Related MCP Servers
- AlicenseAqualityCmaintenanceA local MCP server that packages LLM evaluation gates as reusable CI/CD primitives, enabling AI agents to run datasets against models, score responses, and enforce quality thresholds.10MIT
- AlicenseBqualityBmaintenanceAn MCP-style stdio server for evaluating AI agent outputs, enabling CI-friendly quality gates, regression comparisons, and canary promotion decisions.3MIT
- AlicenseNot gradedqualityAmaintenanceEnables LLM evaluation and observability by uploading documents, building test sets, running RAG pipelines, and automatically scoring answers for groundedness, hallucination risk, retrieval quality, latency, and cost, with tools exposed to MCP-compatible clients.1MIT
- AlicenseAqualityAmaintenanceMCP server for gavel, a code-quality gate for Bazel monorepos. Exposes judge, findings, coverage and architecture tools so a coding agent can check its change against the quality gate (lint, coverage, layer rules) before declaring it done — all off the Bazel build graph, over just what changed.88Apache 2.0
Related MCP Connectors
MCP server providing access to the Scorecard API to evaluate and optimize LLM systems.
Remote MCP for Gemini upgrade evals, prompt regressions, output diffs, and eval receipts.
Agent-native MCP server over the public saagarpatel.dev corpus. Read-only, stateless.
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/dxwss/agent-eval-gate'
If you have feedback or need assistance with the MCP directory API, please join our Discord server