llm-eval-mcp
Click on "Install Server".
Wait a few minutes for the server to deploy. Once ready, it will show a "Started" state.
In the chat, type
@followed by the MCP server name and your instructions, e.g., "@llm-eval-mcpGenerate adversarial tasks and score my agent's responses"
That's it! The server will respond to your query, and you can continue using it as needed.
Here is a step-by-step guide with screenshots.
llm-eval-mcp
Un serveur MCP (Model Context Protocol) qui expose des outils d'évaluation de fiabilité pour les agents LLM : génération de tâches adversariales, jugement automatisé (LLM-as-judge) et statistiques de confiance.
État : Bloc 4 — trois outils MCP, persistance (SQLite/PostgreSQL), conteneurisation Docker (build multi-étapes) et CI GitHub Actions (lint + tests à chaque push). Le bloc suivant ajoutera le transport HTTP distant, l'authentification et le déploiement en production.
Architecture
src/llm_eval_mcp/
├── domain/ # Logique métier PURE (aucun réseau, aucun fournisseur, aucun SQL)
│ ├── adversarial.py # génération de tâches adversariales
│ ├── judging.py # verdict, contrat `Judge`, rubrique, orchestration
│ └── eval_run.py # entité EvalRun, contrat `EvalRunRepository`, stats
├── adapters/ # Détails techniques (réseau, fournisseurs, base de données)
│ ├── groq_judge.py # implémentation réelle du juge (Groq)
│ └── persistence.py # implémentation réelle du repository (SQLAlchemy)
└── server.py # Fine couche MCP : publie le domaine en outils + câblage
tests/
├── test_adversarial.py # Tests du générateur
├── test_judging.py # Tests du jugement (FAUX juge)
├── test_groq_judge.py # Tests de l'adaptateur Groq (faux client)
├── test_persistence.py # Tests stats + repo SQL (SQLite) + intégration serveur
└── fakes.py # Doublures de test (FakeJudge, InMemoryEvalRunRepository)Mêmes principes partout : le domaine ignore MCP, le fournisseur LLM ET la
base de données. Les adaptateurs isolent les détails. Grâce aux contrats
Judge et EvalRunRepository (injection de dépendance), les tests tournent avec
des doublures — sans clé, sans réseau, sans base — de façon déterministe.
Related MCP server: groundcheck
Configuration
Le juge a besoin d'une clé Groq (gratuite, sans carte, sur https://console.groq.com) :
cp .env.example .env # puis colle ta clé dans GROQ_API_KEYBase de données : par défaut un fichier SQLite local (eval_runs.db, ignoré par
Git). En production, définir DATABASE_URL vers un PostgreSQL — le code ne change
pas. Pour le driver PostgreSQL : pip install -e ".[postgres]".
Évolution du schéma : ce MVP crée les tables au démarrage. En production sérieuse, on gérerait les migrations avec Alembic (next step).
Installation
python -m venv .venv
source .venv/bin/activate # Windows : .venv\Scripts\activate
pip install -e ".[dev]"Lancer les tests
pytestLancer le serveur
Le serveur parle le transport stdio : il ne s'utilise pas « à la main », mais via un client MCP. Le plus simple pour l'inspecter :
mcp dev src/llm_eval_mcp/server.pyCela ouvre MCP Inspector dans le navigateur : on y voit l'outil
generate_adversarial_tasks, on le liste et on l'appelle interactivement.
Docker
Image de production construite en multi-étapes (l'image finale ne contient ni les outils de build ni les caches), tournant sous un utilisateur non-root.
docker build -t llm-eval-mcp .
docker run --rm -i --env-file .env llm-eval-mcpIntégration continue (CI)
À chaque push et pull request, GitHub Actions installe le projet, lance le
linter (ruff) et les tests (pytest) sur une machine propre. Aucun secret
n'est requis : les tests utilisent les doublures (FakeJudge,
InMemoryEvalRunRepository), donc ni clé API ni base de données.
Licence
MIT.
Maintenance
Resources
Unclaimed servers have limited discoverability.
Looking for Admin?
If you are the server author, to access and configure the admin panel.
Related MCP Servers
- AlicenseAqualityBmaintenanceAn MCP server that lets any AI agent evaluate RAG outputs -- faithfulness scoring, hallucination detection, and retrieval quality metrics -- with zero API keys, using MCP sampling.6MIT
- AlicenseAqualityCmaintenanceAn MCP server that audits LLM-as-judge evaluations, detecting judge drift across runs, measuring bias through controlled probes, and comparing judge agreement with human raters.6MIT
- Alicense-qualityBmaintenanceMCP server that analyzes AI agent execution logs to calculate reliability scores, detect failure patterns, and suggest concrete improvements for making AI agents more reliable.MIT
Related MCP Connectors
MCP server providing access to the Scorecard API to evaluate and optimize LLM systems.
Security scanner for MCP servers. Detect vulnerabilities, prompt injection, and tool poisoning.
MCP server for AI agents to plan, verify, and deploy Cloudflare-native apps.
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/cdywolf/llm-eval-mcp'
If you have feedback or need assistance with the MCP directory API, please join our Discord server