mcp-eval
MCP Agent Evaluation Harness
Ein kompaktes Referenzprojekt zur Evaluierung von Coding-Agenten, die Tools des Model Context Protocol verwenden. Das Harness verschafft einem Agenten kontrollierten Repository-Zugriff, führt wiederholbare Prüfungen aus, vergleicht wiederholte Ausführungen und gibt einen strukturierten Verifikationsbericht zurück.
Was das Projekt demonstriert
Ein MCP-Server mit Tools zum Auflisten, Lesen, Durchsuchen und Verifizieren von Repositories
Auf das Root-Verzeichnis begrenzter Dateizugriff mit Schutz vor Pfad-Traversierung
Deterministische Befehlsausführung mit festem Locale, fester Zeitzone und festem Python-Hash-Seed
Prüfungen für erforderliche und verbotene Codemuster
Vergleich wiederholter Läufe zur Erkennung von Nichtdeterminismus
Golden-Reference-Material für eine reproduzierbare Bugfixing-Aufgabe
Unit-Tests auf Basis der Standardbibliothek und ein Continuous-Integration-Workflow
Related MCP server: phionyx-pipeline-mcp
Architektur
MCP client or coding agent
|
v
Repository MCP tools
|
v
SafeWorkspace boundary
|
v
DeterministicVerifier
|
v
Structured VerificationReportDer zentrale Verifizierer ist frei von Drittanbieter-Abhängigkeiten. Der MCP-Adapter verwendet das offizielle Python SDK v2.
Schnellstart
Führen Sie die Unit-Tests aus.
python -m unittest discover -s tests -vFühren Sie die enthaltene Evaluierungsaufgabe aus.
PYTHONPATH=src python -m mcp_eval_harness.cli verify \
examples/rounding-bug/task.json \
examples/rounding-bug/workspaceInstallieren Sie den MCP-Adapter und starten Sie den stdio-Server.
python -m pip install -e ".[mcp]"
mcp-eval serveMCP-Tools
Tool | Zweck |
| Gibt eine stabile, sortierte Dateiliste unter dem konfigurierten Root-Verzeichnis zurück |
| Liest eine UTF-8-Datei und blockiert dabei Pfad-Traversierung |
| Findet wörtlichen Text mit deterministischer Reihenfolge und Ergebnislimit |
| Führt die Aufgabespezifikation aus und gibt einen strukturierten Bericht zurück |
Aufgabespezifikation
Jede Aufgabe ist als JSON definiert und legt die Dateien, die Code-Anforderungen, den Verifizierungsbefehl, das Timeout und die Wiederholungsanzahl fest.
{
"task_id": "decimal-rounding-fix",
"required_files": ["calculator.py", "test_calculator.py"],
"required_patterns": {"calculator.py": ["Decimal", "ROUND_HALF_UP"]},
"forbidden_patterns": {"calculator.py": ["round("]},
"command": ["python", "-m", "unittest", "discover", "-s", ".", "-p", "test_*.py"],
"timeout_seconds": 10,
"repeat_count": 2
}Sicherheitsgrenze
Die Pfadprüfungen schützen das konfigurierte Repository-Root. Der Befehlsverifizierer ist für vertrauenswürdige lokale Aufgabendefinitionen ausgelegt. Führen Sie nicht vertrauenswürdigen Kandidatencode in einem Container oder einer anderen Betriebssystem-Sandbox aus.
Autor
Mohammed Ibrahim Sadiq
Lizenz
MIT
This server cannot be installed
Maintenance
Resources
Unclaimed servers have limited discoverability.
Looking for Admin?
If you are the server author, to access and configure the admin panel.
Related MCP Servers
- AlicenseCqualityCmaintenanceEnables acceptance gates for AI coding-agent runs by recording evidence, running deterministic validation, applying a quality gate, and rendering auditable outcomes.7Apache 2.0
- AlicenseAqualityAmaintenanceEnables verification of AI coding agent self-reports against git diff truth and a deterministic gate, producing pass/regenerate/reject directives to ensure claimed work matches actual changes.6AGPL 3.0
- FlicenseNot gradedqualityDmaintenanceProvides AI coding agents with dependency analysis, impact detection, and build verification tools.
- AlicenseNot gradedqualityAmaintenanceEnables AI agents to scan code for security and quality issues and receive machine-readable reports with suggested fixes and verification criteria.892MIT
Related MCP Connectors
Deterministic AI code review, with an audit record. Governance inside the agent loop.
Cross-agent artifact workspace with provenance across Claude Code, Codex, Cursor, LangGraph.
Evaluate, benchmark, and simulate AI agents on the VerifyAX agent-evaluation platform.
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/Mohammedibrahim111/mcp-agent-evaluation-harness'
If you have feedback or need assistance with the MCP directory API, please join our Discord server