Skip to main content
Glama

verdict

Strukturiertes, in einer Sandbox ausgeführtes Verifikations-Feedback für Coding-Agenten.

Ein MCP-Server, der die pytest-Shell-Aufrufe deines Agents durch etwas ersetzt, das für die innere Schleife von Agenten gebaut ist: wirkungsselektierte Tests, die in einer isolierten Umgebung laufen und kompakte typisierte Verdicts zurückgeben, statt 40.000 Token roher Runner-Ausgabe – mit Fehler-Fingerprints, die dem Agenten sagen, ob ein Fehler seine Regression ist oder schon immer bestand.

raw pytest dump:  ~40,000 tokens, unstructured, run un-sandboxed on your machine
verdict:              ~400 tokens, typed JSON, run in a rootless container, with memory

Warum

Der am häufigsten aufgerufene Tool-Call in agentischem Coding ist die Verifikation – und sie ist am wenigsten strukturiert. Agenten führen ganze Test-Suiten erneut aus, wenn sich ein Modul geändert hat, verbrennen Kontext beim Parsen von ANSI-codierten Tracebacks, führen beliebigen Code direkt auf deiner Maschine aus und diagnostizieren routinemäßig vorbestehende Fehler fälschlich als eigene Regression (und "reparieren" dann Code, der nicht kaputt war). verdict behebt alle vier Probleme.

Related MCP server: Debugging MCP Server

Tools

Tool

Was es tut

verify(scope?, base?)

Wählt Tests aus, die von deinem Working-Tree-Diff betroffen sind (statischer Import-Graph über grimp), führt sie über podman/docker mit schreibgeschützt gemountetem Worktree aus, gibt typisierte Fehler mit Fingerprints und einem preexisting-Flag zurück

explain_failure(check_id)

Vollständiger Traceback für einen Fehler, auf Abruf – Bulk wird nie in der Zusammenfassung mitgeliefert

history(fingerprint)

Erstmals gesehen / zuletzt gesehen / wie oft gesehen – Regression vs. langjährige Störung

run_checks(["ruff","mypy"])

Lint- und Typprüfungen, normalisiert in dasselbe Verdict-Schema

Jeder Fehler trägt einen Fingerprint: einen stabilen Hash der normalisierten Fehlersignatur (flüchtige Tokens – Adressen, tmp-Pfade, IDs, Dauern – werden kollabiert). Derselbe logische Fehler, derselbe Fingerprint, über Läufe und Refactorings hinweg. Fingerprints sind es, die verdict ein Gedächtnis geben.

Schnellstart

Kein Installationsschritt nötig – uvx holt es bei der ersten Verwendung. (Oder uv tool install verdict-mcp / pip install verdict-mcp für einen dauerhaften verdict-mcp-Befehl.)

Claude Code.mcp.json im Projektstamm:

{
  "mcpServers": {
    "verdict": {
      "command": "uvx",
      "args": ["verdict-mcp"],
      "env": { "VERDICT_PROJECT": "." }
    }
  }
}

Cursor – gleiche Form in .cursor/mcp.json.

Optionale verdict.toml im Repo-Stamm:

[project]
packages = ["your_package"]          # for impact selection (auto-guessed if omitted)

[runner]
image = "ghcr.io/you/yourproj-test"  # prebuilt env with your deps
setup_cmd = "pip install -e .[test]" # or install on the fly (runs with network; tests don't)
# prefer = "local"                   # escape hatch if you have no container runtime

[limits]
max_failures = 10

Probiere es ohne Agent aus:

cd examples/demo_project
VERDICT_PROJECT=. verdict-mcp   # then connect any MCP client, or use the MCP inspector

Sandbox-Posture (v0.1)

Checks laufen in einem ephemeren Container (podman bevorzugt, docker als Fallback): Worktree schreibgeschützt unter /src gemountet, in ein beschreibbares /work im Container kopiert, --network=none für den Check-Lauf. Deine Host-Umgebung wird durch einen Testlauf nie verändert. Wenn setup_cmd konfiguriert ist, läuft dieser Schritt mit Netzwerk vor dem Check; bevorzuge ein vorgebautes Image für eine strengere Posture. Kein Container-Runtime → expliziter prefer = "local"-Fallback führt Checks gegen eine temporäre Kopie deines Worktrees aus (immer noch nie an Ort und Stelle). Siehe SECURITY.md für das vollständige Bedrohungsmodell und bekannte Einschränkungen.

Fehlerbehebung: Wenn ein Verdict sagt container engine 'podman' could not start the check, führe das vorgeschlagene podman pull <image> von Hand aus – die eigene Fehlermeldung der Engine ist die Antwort. Eine bekannte Falle auf macOS: Eine "credsStore": "gcloud"-Zeile in ~/.docker/config.json bringt podman dazu, den gcloud-Credential-Helper für jede Registry aufzurufen, einschließlich docker.io; ein abgelaufener gcloud-Login bricht dann alle Pulls. Behebe das mit gcloud auth login oder entferne diese Zeile.

Ehrliche Einschränkungen

  • Die Wirkungsauswahl verwendet den statischen Import-Graph – von Natur aus approximativ. Dynamische Importe, Auflösung von Fixtures nach Namen und datengetriebene Tests können übersehen werden; verify(scope="all") ist immer verfügbar und verdict sagt in selection_note, wann immer es zurückfällt.

  • Python/pytest nur heute, plus ruff/mypy. Die Adapter-Schnittstelle ist klein und dokumentiert – vitest- und go test -json-Adapter sind die am meisten gewünschten Beiträge (CONTRIBUTING.md).

  • Flake-Erkennung und Auswahl auf Basis von Coverage-Maps sind v0.2 (roadmap).

Roadmap

v0.2: Coverage-basierte Wirkungs-Karten (präzise Auswahl), Flake-Erkennung über Fingerprint-Alternation, devcontainer.json-Unterstützung, Ergebnis-Cache mit Schlüssel (Baum-Hash, Check, Image-Digest). Später: vitest/jest, go test, cargo test-Adapter; Per-Repo-verdict-Daemon-Modus.

Lizenz

Apache-2.0

Install Server
A
license - permissive license
A
quality
B
maintenance

Maintenance

Maintainers
Response time
Release cycle
Releases (12mo)
Commit activity

Resources

Unclaimed servers have limited discoverability.

Looking for Admin?

If you are the server author, to access and configure the admin panel.

Related MCP Servers

  • A
    license
    A
    quality
    D
    maintenance
    Provides secure access to containerized build environments for software projects, enabling AI assistants to execute builds, run tests, manage git operations, and inspect build artifacts without requiring local installation of dependencies.
    6
    MIT
  • F
    license
    A
    quality
    D
    maintenance
    Enables LLMs to automatically diagnose coding errors through codebase search, test execution, and live debugger integration (DAP/V8 CDP). Provides a secure, policy-gated environment for investigating failures while preventing destructive operations.
    9
  • A
    license
    A
    quality
    C
    maintenance
    Provides an isolated workspace for testing candidate code, runs tests, and returns deterministic pass/fail verdicts. Enables automated grading of software engineering solutions by ensuring reproducible test runs.
    5
    MIT

View all related MCP servers

Related MCP Connectors

  • Deterministic context layer for your codebase: change impact, blast radius, answers with receipts.

  • Deterministic pre-execution audit for trading agents. PASS/WAIT/FAIL, reproducible verdict_hash.

  • Proves AI-generated Python does what you asked: lint, types, security, sandbox run, exact fixes.

View all MCP Connectors

Latest Blog Posts

MCP directory API

We provide all the information about MCP servers via our MCP API.

curl -X GET 'https://glama.ai/api/mcp/v1/servers/Dgotlieb/verdict-mcp'

If you have feedback or need assistance with the MCP directory API, please join our Discord server