verdict
verdict
Comentarios de verificación estructurados y en sandbox para agentes de codificación.
Un servidor MCP que reemplaza las invocaciones a pytest de tu agente con algo construido para el bucle interno del agente: pruebas seleccionadas por impacto, ejecutadas en un entorno aislado, que devuelven veredictos tipados compactos en lugar de 40,000 tokens de salida cruda del ejecutor — con huellas de fallo que le dicen al agente si un fallo es su regresión o si ya estaba roto desde antes.
raw pytest dump: ~40,000 tokens, unstructured, run un-sandboxed on your machine
verdict: ~400 tokens, typed JSON, run in a rootless container, with memoryPor qué
La llamada de herramienta de mayor frecuencia en la codificación agéntica es la verificación — y es la menos estructurada. Los agentes vuelven a ejecutar suites completas cuando un módulo cambió, queman contexto analizando tracebacks con códigos ANSI, ejecutan código arbitrario directamente en tu máquina y, con frecuencia, diagnostican erróneamente fallos preexistentes como su propia regresión (y luego "arreglan" código que no estaba roto). verdict soluciona los cuatro problemas.
Related MCP server: Debugging MCP Server
Herramientas
Herramienta | Qué hace |
| Selecciona las pruebas afectadas por el diff de tu árbol de trabajo (grafo de importación estático mediante grimp), las ejecuta vía podman/docker con el árbol de trabajo montado de solo lectura, devuelve fallos tipados con huellas y una bandera |
| Traceback completo para un fallo, bajo demanda — el volumen nunca viaja en el resumen |
| Primera vez visto / última vez visto / veces visto — regresión vs. fallo de larga duración |
| Comprobaciones de lint y tipos, normalizadas en el mismo esquema de veredicto |
Cada fallo lleva una huella: un hash estable de la firma de fallo normalizada (tokens volátiles — direcciones, rutas tmp, ids, duraciones — colapsados). El mismo fallo lógico, la misma huella, a través de ejecuciones y refactorizaciones. Las huellas son lo que le dan memoria a verdict.
Inicio rápido
No se necesita paso de instalación — uvx lo obtiene en el primer uso. (O uv tool install verdict-mcp / pip install verdict-mcp para un comando verdict-mcp permanente.)
Claude Code — .mcp.json en la raíz de tu proyecto:
{
"mcpServers": {
"verdict": {
"command": "uvx",
"args": ["verdict-mcp"],
"env": { "VERDICT_PROJECT": "." }
}
}
}Cursor — la misma forma en .cursor/mcp.json.
Opcional verdict.toml en la raíz de tu repositorio:
[project]
packages = ["your_package"] # for impact selection (auto-guessed if omitted)
[runner]
image = "ghcr.io/you/yourproj-test" # prebuilt env with your deps
setup_cmd = "pip install -e .[test]" # or install on the fly (runs with network; tests don't)
# prefer = "local" # escape hatch if you have no container runtime
[limits]
max_failures = 10Pruébalo sin un agente:
cd examples/demo_project
VERDICT_PROJECT=. verdict-mcp # then connect any MCP client, or use the MCP inspectorPostura de sandbox (v0.1)
Las comprobaciones se ejecutan en un contenedor efímero (podman preferido, docker como respaldo): el árbol de trabajo se monta de solo lectura en /src, se copia a un /work escribible dentro del contenedor, --network=none para la ejecución de la comprobación. Tu entorno anfitrión nunca es mutado por una ejecución de prueba. Si setup_cmd está configurado, ese paso se ejecuta con red antes de la comprobación; prefiere una imagen preconstruida para una postura más estricta. Sin runtime de contenedor → el respaldo explícito prefer = "local" ejecuta comprobaciones contra una copia temporal de tu árbol de trabajo (aún nunca en el lugar). Consulta SECURITY.md para el modelo de amenazas completo y las limitaciones conocidas.
Solución de problemas: si un veredicto dice container engine 'podman' could not start the check, ejecuta el sugerido podman pull <image> manualmente — el error del propio motor es la respuesta. Una trampa conocida en macOS: una línea "credsStore": "gcloud" en ~/.docker/config.json hace que podman llame al ayudante de credenciales de gcloud para cada registro, incluido docker.io; un inicio de sesión de gcloud caducado entonces rompe todas las descargas. Solución: gcloud auth login o elimina esa línea.
Limitaciones honestas
La selección de impacto utiliza el grafo de importación estático — aproximado por diseño. Las importaciones dinámicas, la resolución de fixtures por nombre y las pruebas basadas en datos pueden pasarse por alto;
verify(scope="all")siempre está disponible y verdict lo indica enselection_notecada vez que recurre a ello.Solo Python/pytest hoy, además de ruff/mypy. La interfaz de adaptadores es pequeña y está documentada — los adaptadores de vitest y
go test -jsonson las contribuciones más solicitadas (CONTRIBUTING.md).La detección de flake y la selección basada en mapa de cobertura son v0.2 (roadmap).
Hoja de ruta
v0.2: mapas de impacto basados en cobertura (selección precisa), detección de flake mediante alternancia de huellas, soporte de devcontainer.json, caché de resultados clave en (hash de árbol, comprobación, digest de imagen). Más adelante: adaptadores de vitest/jest, go test, cargo test; modo daemon de verdict por repositorio.
Licencia
Apache-2.0
Maintenance
Resources
Unclaimed servers have limited discoverability.
Looking for Admin?
If you are the server author, to access and configure the admin panel.
Related MCP Servers
- AlicenseAqualityDmaintenanceProvides secure access to containerized build environments for software projects, enabling AI assistants to execute builds, run tests, manage git operations, and inspect build artifacts without requiring local installation of dependencies.6MIT
- FlicenseAqualityDmaintenanceEnables LLMs to automatically diagnose coding errors through codebase search, test execution, and live debugger integration (DAP/V8 CDP). Provides a secure, policy-gated environment for investigating failures while preventing destructive operations.9
- FlicenseNot gradedqualityDmaintenanceProvides AI coding agents with dependency analysis, impact detection, and build verification tools.
- AlicenseAqualityCmaintenanceProvides an isolated workspace for testing candidate code, runs tests, and returns deterministic pass/fail verdicts. Enables automated grading of software engineering solutions by ensuring reproducible test runs.5MIT
Related MCP Connectors
Deterministic context layer for your codebase: change impact, blast radius, answers with receipts.
Deterministic pre-execution audit for trading agents. PASS/WAIT/FAIL, reproducible verdict_hash.
Proves AI-generated Python does what you asked: lint, types, security, sandbox run, exact fixes.
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/Dgotlieb/verdict-mcp'
If you have feedback or need assistance with the MCP directory API, please join our Discord server