retrieval
retriEVAL
LLM-Evaluierung als MCP-Server. Bewerten Sie die Ausgaben Ihrer KI auf Faithfulness, Relevanz und Halluzination aus jedem MCP-Client heraus – ohne Pipeline, ohne Test-Harness. Jedes Ergebnis wird mit einem Link zu einem Dashboard zurückgegeben, das den Verlauf speichert.
Live ausprobieren (ohne Anmeldung) · 2-Minuten-Demo ansehen · Dashboard
Warum
Fünf Kundenservice-Antworten, bewertet nach zwei Metriken:
Metrik | Punktzahl | bestanden |
answer_relevancy | 0.98 | 5/5 |
faithfulness | 0.70 | 3/5 |
Jede Antwort war thematisch passend und gut geschrieben. Zwei davon widersprachen der Richtlinie, auf der sie angeblich basierten – eine versprach kostenlosen Rückversand, den die Richtlinie nicht vorsieht, eine andere erfand einen kostenlosen Express-Ersatz. Bei einer manuellen Prüfung würden Sie alle fünf abzeichnen.
Genau diese Lücke ist der Punkt. Relevanz fragt: Hat es die Frage beantwortet? Faithfulness fragt: Steht es tatsächlich in der Quelle? Sie brauchen beides, und das zweite fängt die teuren Fehler ab.
Related MCP server: mcp-llm-eval
Verbinden
Self-hosted. Klonen Sie es, richten Sie es auf einen Judge aus, führen Sie es aus – Ihre Daten verlassen nie Ihren Rechner, und es gibt keinen Dienst, für den Sie sich anmelden müssen.
git clone https://github.com/hcarrillo001/retrieval-mcp
cd retrieval-mcp
pip install -r requirements.txt
export ANTHROPIC_API_KEY=sk-ant-... # or a local judge, below
python server.py # stdio, for Claude Desktop / CursorDann fragen Sie einfach:
Score these cases with faithfulness: [{"input": "...", "actual_output": "...", "retrieval_context": ["..."]}]
Übergeben Sie Ihre Fälle inline, und es wird nichts gespeichert – ein Aufruf, kein Einrichtungsschritt. Siehe Lokal ausführen (stdio) für die Client-Konfiguration und Als HTTP bereitstellen, wenn Sie eine eigene dauerhaft laufende Instanz mit Dashboard möchten.
Möchten Sie es ausprobieren, bevor Sie etwas installieren? Es gibt eine Live-Sandbox unter retrieval-mcp.com – keine Anmeldung, läuft auf einem kostenlosen Judge, nichts wird gespeichert.
Alles lokal halten: Setzen Sie RETRIEVAL_JUDGE_BACKEND=ollama, und der Judge läuft ebenfalls auf Ihrem Rechner, sodass zu keinem Zeitpunkt Daten Ihr Netzwerk verlassen. Nützlich, wenn Sie etwas bewerten, das Sie nicht an einen Dritten senden können.
Was Sie bekommen
9 integrierte Metriken plus benutzerdefinierte Metriken, die Sie in einfachem Englisch verfassen
Austauschbare Judges – Anthropic, Groq, Gemini, OpenRouter oder ein lokales Ollama-Modell, sodass nichts Ihr Netzwerk verlassen muss
Golden Sets aus Dateien, URLs, Inline-JSON, JSONL, CSV oder TSV
Laufverlauf in Supabase mit teilbaren Permalinks und Laufvergleich
Ein Ausgabenlimit, weil ein judge-basiertes Tool sonst eine hohe Rechnung verursachen kann
Ehrliche Einschränkungen
Die Übereinstimmung des Judges wurde noch nicht gegen menschliche Bewertungen validiert. Behandeln Sie die Ergebnisse daher als Signal und nicht als absolute Wahrheit.
Golden Sets enthalten derzeit ihre eigenen Ausgaben. Ein erneuter Lauf gegen neue Modellausgaben erfordert daher das Laden eines zweiten Sets. Diese Trennung ist die nächste Änderung.
Golden Sets und selbst erstellte Metriken leben im Serverprozess und gehen bei einem Neustart verloren. Läufe bleiben erhalten; diese nicht.
Metriken (DeepEval-kompatibel)
faithfulness · answer_relevancy · contextual_precision · contextual_recall · contextual_relevancy · hallucination · bias · toxicity · summarization — plus selbst erstellte G-Eval-Metriken, die Sie in einfacher Sprache definieren. Alle sind normalisiert, sodass höher = besser gilt (bias/toxicity geben den sauberen Anteil an), und jede begründet ihre Bewertung.
Vielseitige Golden Sets
load_golden_set akzeptiert einen Dateipfad (einschließlich hochgeladener Dateien), eine http(s)-URL, ein Inline-JSON-Array oder JSONL-Text in JSON / JSONL / CSV / TSV. Feldnamen werden automatisch normalisiert (question→input, answer→actual_output, ground_truth→expected_output, contexts→context, passages→retrieval_context, …), sodass die meisten öffentlichen Benchmarks unverändert geladen werden.
Kurze Antworten standardmäßig
run_eval bewertet jeden Fall, gibt aber standardmäßig nur die 3 am schlechtesten bewerteten zurück (einstellbar mit limit), mit total_cases/shown und einem Verweis auf show_run_cases(run_id, offset, limit, metric), um die restlichen zu durchblättern.
Ausgabenlimit (damit keine hohe Rechnung entsteht)
Die Ausgaben des Judges werden anhand des tatsächlichen Token-Verbrauchs gemessen und gespeichert. Legen Sie eine harte Obergrenze fest:
export RETRIEVAL_BUDGET_USD=20 # 0/unset = unlimitedSobald die kumulierten Ausgaben die Obergrenze erreichen, werden weitere Anthropic-Aufrufe gestoppt und die Tools geben eine klare budget_exceeded-Meldung zurück. Prüfen/löschen Sie mit get_budget / reset_budget. (Preise sind ungefähr – überschreiben Sie RETRIEVAL_PRICE_IN/OUT $/1M Tokens, um die aktuellen Preise für Ihr Modell anzupassen.)
Hybrid-Setup (lokal + dauerhaftes Dashboard)
Der Laufverlauf verwendet einen austauschbaren Speicher, der per Umgebungsvariable gewählt wird:
FileStore (Standard) – JSONL in
~/.retrieval. Keine Einrichtung, nur lokal.SupabaseStore – wenn
SUPABASE_URL+SUPABASE_SERVICE_KEYgesetzt sind. Der Laufverlauf liegt in Postgres und wird von der lokalen CLI, dem bereitgestellten MCP und dem Website-Dashboard gemeinsam genutzt.
Empfohlener Hybrid-Ablauf:
Führen Sie
supabase_schema.sqlin Supabase aus (erstellt die Tabelleruns).Setzen Sie
SUPABASE_URL+SUPABASE_SERVICE_KEYauf dem MCP (lokal und/oder Railway), damit jeder Lauf zentral geschrieben wird. Jeder Lauf zeichnetgenerator_modelundjudge_modelfür den Modellvergleich auf.Stellen Sie
web/auf Vercel bereit (setzen Sie dieselben Supabase-Umgebungsvariablen) und ordnen Sie esretrieval-mcp.comzu. Das Dashboard liest den Verlauf über/api/runs(der Service-Key bleibt serverseitig) und rendert Trend nach Modell, ein Modell-Ranking und den Laufverlauf. Es zeigt Beispieldaten, bis Supabase angebunden ist.
Lokal bleibt Ihre kostenlose Sandbox (Ollama-Judge, Dateiverlauf); die Website ist das dauerhaft verfügbare Fenster in den gemeinsamen Verlauf.
Lokal ausführen (stdio) – Claude Desktop
pip install -r requirements.txt
export ANTHROPIC_API_KEY=sk-ant-...{
"mcpServers": {
"retrieval": {
"command": "python",
"args": ["/ABSOLUTE/PATH/server.py"],
"env": { "ANTHROPIC_API_KEY": "sk-ant-...", "RETRIEVAL_BUDGET_USD": "10" }
}
}
}Dann: "Load examples/rag_golden.jsonl as 'space', run faithfulness, label it v1."
Als HTTP bereitstellen (von überall erreichbar)
export RETRIEVAL_TOKEN=$(openssl rand -hex 24) # required for a public endpoint
export ANTHROPIC_API_KEY=sk-ant-...
export RETRIEVAL_BUDGET_USD=20
python app.py # serves $PORT (default 8000); MCP at /mcp, health at /healthzStellen Sie auf Railway (oder einem beliebigen Host) bereit: Die enthaltenen Dockerfile / Procfile funktionieren unverändert. Setzen Sie ANTHROPIC_API_KEY, RETRIEVAL_TOKEN, RETRIEVAL_BUDGET_USD in der Host-Umgebung. Clients verbinden sich mit https://<host>/mcp mit dem Header Authorization: Bearer <token> – fügen Sie es als benutzerdefinierten Connector in claude.ai / Claude Desktop hinzu oder richten Sie Agent Builder / CI darauf aus. Der Zustand (Golden Sets, Laufverlauf, Ausgaben) liegt serverseitig und bleibt so über Maschinen hinweg erhalten.
Sehen Sie es an einer echten RAG-Pipeline (Demo)
demo/rag_demo.py baut eine kleine End-to-End-RAG über einem kleinen beschrifteten Datensatz (demo/labeled.json + demo/corpus.json): Es ruft mit BM25 ab, berechnet recall@k gegen die Gold-Passagen (deterministisch – die Punktzahl des Retrievers), generiert eine Antwort und bewertet dann Faithfulness (die Punktzahl des Generators). Eine Antwort ist absichtlich halluziniert, sodass Sie die beiden Fehlermodi getrennt beobachten können.
python demo/rag_demo.py # offline, no key needed
python demo/rag_demo.py --real # real generation + RetriEval judge (needs ANTHROPIC_API_KEY)Es schreibt auch demo/generated_goldenset.jsonl – laden Sie das in den MCP (load_golden_set → run_eval) für die vom Judge bewertete Version. Das ist die Brücke: Ihre Pipeline erzeugt Vorhersagen, der Datensatz liefert die Beschriftungen, und RetriEval bewertet Retriever und Generator unabhängig.
Anbindung an eine RAG-Pipeline
Offline (Standard): Exportieren Sie den abgerufenen Kontext + die Antwort Ihrer Pipeline in ein Golden Set und bewerten Sie es – RetriEval berührt Ihre Pipeline nie.
Live: Fügen Sie ein
query_rag(question)-Tool hinzu, das Ihren RAG-Endpunkt oder Ihren Vektor-Store (Chroma / Supabase pgvector) aufruft, Kontext + Antwort erfasst und in einem Schritt bewertet.
Judge-Backend
export RETRIEVAL_JUDGE_BACKEND=anthropic # default
export RETRIEVAL_JUDGE_MODEL=claude-sonnet-4-6
# or local, free:
export RETRIEVAL_JUDGE_BACKEND=ollama
export RETRIEVAL_JUDGE_MODEL=deepseek-r1:70bTools
Tool | Zweck |
| integrierte + selbst erstellte Metriken |
| ein Set für die Wiederverwendung benennen (nur Self-Host – geteilt und bei Neustart verloren) |
| was geladen ist |
| einfache Sprache → ein Bewerter |
| ein Set bewerten; |
| die restlichen durchblättern |
| einmalige Bewertung |
| die Konsistenz einer Ausgabe mit einer Webseite prüfen (keine Beschriftungen – Konsistenz, nicht Korrektheit) |
| gespeicherte Läufe |
| Inline-Diagramme |
| Ausgabenlimit-Status / zurücksetzen |
Lizenz
Apache License 2.0. Erstellt von Hanns Carrillo.
This server cannot be installed
Maintenance
Resources
Unclaimed servers have limited discoverability.
Looking for Admin?
If you are the server author, to access and configure the admin panel.
Related MCP Servers
AlicenseNot gradedqualityCmaintenanceProvides advanced evaluation tools for assessing AI safety, alignment, and performance of LLM outputs. Enables programmatic evaluation of quality, safety metrics like toxicity and PII detection, and operational metrics including carbon footprint and cost estimation.4Apache 2.0- AlicenseAqualityCmaintenanceA local MCP server that packages LLM evaluation gates as reusable CI/CD primitives, enabling AI agents to run datasets against models, score responses, and enforce quality thresholds.10MIT
- AlicenseAqualityDmaintenanceRuntime quality validation for AI agent outputs. Detect hallucinations, enforce scope compliance, and score output quality — all via MCP.626MIT
- AlicenseNot gradedqualityAmaintenanceEnables LLM evaluation and observability by uploading documents, building test sets, running RAG pipelines, and automatically scoring answers for groundedness, hallucination risk, retrieval quality, latency, and cost, with tools exposed to MCP-compatible clients.1MIT
Related MCP Connectors
MCP server providing access to the Scorecard API to evaluate and optimize LLM systems.
A paid remote MCP for AI SDK eval dashboard, built to return verdicts, receipts, usage logs, and aud
Enterprise AI Control Plane: governance, guardrails, spend tracking, compliance & smart routing.
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/hcarrillo001/retrieval-mcp'
If you have feedback or need assistance with the MCP directory API, please join our Discord server