Kryve Agent Evaluation MCP
# Kryve Agent Evaluation MCP
[](https://github.com/louislaurent1/kryve-agent-eval-mcp/actions/workflows/ci.yml)
Un serveur MCP local et open source pour **concevoir des tests d’agents IA**, noter une exécution et documenter les preuves avant d’accorder davantage d’autonomie.
Il expose trois outils en lecture seule :
- `generate_test_plan` : construit des cas nominaux, ambigus et sensibles selon le niveau de risque ;
- `score_agent_run` : calcule une auto-évaluation provisoire du résultat, des preuves déclarées, des validations et du coût des corrections ;
- `evaluation_scorecard` : renvoie les colonnes d’une scorecard réutilisable.
## Installation
```bash
npm install
npm run build
```
Puis lance le serveur sur `stdio` :
```bash
npm start
```
Configuration d’un client MCP :
```json
{
"mcpServers": {
"kryve-agent-eval": {
"command": "node",
"args": ["/chemin/vers/kryve-agent-eval-mcp/dist/src/index.js"]
}
}
}
```
## Tester avec MCP Inspector
```bash
npx @modelcontextprotocol/inspector node dist/src/index.js
```
## Philosophie
Une démo réussie ne prouve pas qu’un agent est fiable. Le test doit mesurer un résultat attendu, conserver des preuves, détecter les actions hors permission et rendre visible le coût des corrections humaines.
Pour comprendre le protocole et choisir une infrastructure :
- [MCP Servers : 8 serveurs MCP indispensables](https://www.kryve.fr/blog/serveurs-mcp-indispensables)
- [Évaluer un agent IA avant de lui donner plus d’autonomie](https://www.kryve.fr/blog/evaluer-agent-ia)
- [Tracer les décisions et accès sensibles d’un agent IA](https://www.kryve.fr/blog/tracer-agent-ia)
Le kit CSV complémentaire est disponible dans le dépôt [Kryve Agent Evaluation Kit](https://github.com/louislaurent1/kryve-agent-evaluation-kit).
## Limites
Le score est une grille opérationnelle simple, pas une certification. Les champs sont déclarés par l’appelant : chaque résultat porte donc le statut `unverified_self_report`, n’est jamais éligible à une décision d’autonomie et doit être recoupé avec des preuves indépendantes.
La similarité textuelle sert uniquement d’indicateur provisoire. Elle ne remplace ni des critères structurés, ni un journal d’actions, ni une validation humaine vérifiable.
## Licence
MIT — Kryve Solutions.
TDQS
Scored across 3 tools
Each tool addresses a distinct phase of evaluation: generating test plans, scoring an agent run, and retrieving a scorecard structure. There is no functional overlap or ambiguity between them.
Two tools follow a clear verb_noun pattern (generate_test_plan, score_agent_run), but evaluation_scorecard is noun-led rather than verb-led. The inconsistency is minor and all names remain readable and predictable.
Three tools is an appropriate, focused scope for an evaluation-oriented MCP server. Each tool serves a core need without bloat, making the surface easy to navigate.
The set covers planning, assessment, and structure retrieval, but lacks an explicit verification or finalization tool. The 'unverified' caveat on score_agent_run hints at this gap, but the core workflow is still functional.