Skip to main content
Glama

retriEVAL

LLM-Evaluierung als MCP-Server. Bewerten Sie die Ausgaben Ihrer KI auf Faithfulness, Relevanz und Halluzination aus jedem MCP-Client heraus – ohne Pipeline, ohne Test-Harness. Jedes Ergebnis wird mit einem Link zu einem Dashboard zurückgegeben, das den Verlauf speichert.

Live ausprobieren (ohne Anmeldung) · 2-Minuten-Demo ansehen · Dashboard


Warum

Fünf Kundenservice-Antworten, bewertet nach zwei Metriken:

Metrik

Punktzahl

bestanden

answer_relevancy

0.98

5/5

faithfulness

0.70

3/5

Jede Antwort war thematisch passend und gut geschrieben. Zwei davon widersprachen der Richtlinie, auf der sie angeblich basierten – eine versprach kostenlosen Rückversand, den die Richtlinie nicht vorsieht, eine andere erfand einen kostenlosen Express-Ersatz. Bei einer manuellen Prüfung würden Sie alle fünf abzeichnen.

Genau diese Lücke ist der Punkt. Relevanz fragt: Hat es die Frage beantwortet? Faithfulness fragt: Steht es tatsächlich in der Quelle? Sie brauchen beides, und das zweite fängt die teuren Fehler ab.

Related MCP server: mcp-llm-eval

Verbinden

Self-hosted. Klonen Sie es, richten Sie es auf einen Judge aus, führen Sie es aus – Ihre Daten verlassen nie Ihren Rechner, und es gibt keinen Dienst, für den Sie sich anmelden müssen.

git clone https://github.com/hcarrillo001/retrieval-mcp
cd retrieval-mcp
pip install -r requirements.txt

export ANTHROPIC_API_KEY=sk-ant-...        # or a local judge, below
python server.py                            # stdio, for Claude Desktop / Cursor

Dann fragen Sie einfach:

Score these cases with faithfulness: [{"input": "...", "actual_output": "...", "retrieval_context": ["..."]}]

Übergeben Sie Ihre Fälle inline, und es wird nichts gespeichert – ein Aufruf, kein Einrichtungsschritt. Siehe Lokal ausführen (stdio) für die Client-Konfiguration und Als HTTP bereitstellen, wenn Sie eine eigene dauerhaft laufende Instanz mit Dashboard möchten.

Möchten Sie es ausprobieren, bevor Sie etwas installieren? Es gibt eine Live-Sandbox unter retrieval-mcp.com – keine Anmeldung, läuft auf einem kostenlosen Judge, nichts wird gespeichert.

Alles lokal halten: Setzen Sie RETRIEVAL_JUDGE_BACKEND=ollama, und der Judge läuft ebenfalls auf Ihrem Rechner, sodass zu keinem Zeitpunkt Daten Ihr Netzwerk verlassen. Nützlich, wenn Sie etwas bewerten, das Sie nicht an einen Dritten senden können.

Was Sie bekommen

  • 9 integrierte Metriken plus benutzerdefinierte Metriken, die Sie in einfachem Englisch verfassen

  • Austauschbare Judges – Anthropic, Groq, Gemini, OpenRouter oder ein lokales Ollama-Modell, sodass nichts Ihr Netzwerk verlassen muss

  • Golden Sets aus Dateien, URLs, Inline-JSON, JSONL, CSV oder TSV

  • Laufverlauf in Supabase mit teilbaren Permalinks und Laufvergleich

  • Ein Ausgabenlimit, weil ein judge-basiertes Tool sonst eine hohe Rechnung verursachen kann

Ehrliche Einschränkungen

  • Die Übereinstimmung des Judges wurde noch nicht gegen menschliche Bewertungen validiert. Behandeln Sie die Ergebnisse daher als Signal und nicht als absolute Wahrheit.

  • Golden Sets enthalten derzeit ihre eigenen Ausgaben. Ein erneuter Lauf gegen neue Modellausgaben erfordert daher das Laden eines zweiten Sets. Diese Trennung ist die nächste Änderung.

  • Golden Sets und selbst erstellte Metriken leben im Serverprozess und gehen bei einem Neustart verloren. Läufe bleiben erhalten; diese nicht.


Metriken (DeepEval-kompatibel)

faithfulness · answer_relevancy · contextual_precision · contextual_recall · contextual_relevancy · hallucination · bias · toxicity · summarization — plus selbst erstellte G-Eval-Metriken, die Sie in einfacher Sprache definieren. Alle sind normalisiert, sodass höher = besser gilt (bias/toxicity geben den sauberen Anteil an), und jede begründet ihre Bewertung.

Vielseitige Golden Sets

load_golden_set akzeptiert einen Dateipfad (einschließlich hochgeladener Dateien), eine http(s)-URL, ein Inline-JSON-Array oder JSONL-Text in JSON / JSONL / CSV / TSV. Feldnamen werden automatisch normalisiert (question→input, answer→actual_output, ground_truth→expected_output, contexts→context, passages→retrieval_context, …), sodass die meisten öffentlichen Benchmarks unverändert geladen werden.

Kurze Antworten standardmäßig

run_eval bewertet jeden Fall, gibt aber standardmäßig nur die 3 am schlechtesten bewerteten zurück (einstellbar mit limit), mit total_cases/shown und einem Verweis auf show_run_cases(run_id, offset, limit, metric), um die restlichen zu durchblättern.

Ausgabenlimit (damit keine hohe Rechnung entsteht)

Die Ausgaben des Judges werden anhand des tatsächlichen Token-Verbrauchs gemessen und gespeichert. Legen Sie eine harte Obergrenze fest:

export RETRIEVAL_BUDGET_USD=20     # 0/unset = unlimited

Sobald die kumulierten Ausgaben die Obergrenze erreichen, werden weitere Anthropic-Aufrufe gestoppt und die Tools geben eine klare budget_exceeded-Meldung zurück. Prüfen/löschen Sie mit get_budget / reset_budget. (Preise sind ungefähr – überschreiben Sie RETRIEVAL_PRICE_IN/OUT $/1M Tokens, um die aktuellen Preise für Ihr Modell anzupassen.)

Hybrid-Setup (lokal + dauerhaftes Dashboard)

Der Laufverlauf verwendet einen austauschbaren Speicher, der per Umgebungsvariable gewählt wird:

  • FileStore (Standard) – JSONL in ~/.retrieval. Keine Einrichtung, nur lokal.

  • SupabaseStore – wenn SUPABASE_URL + SUPABASE_SERVICE_KEY gesetzt sind. Der Laufverlauf liegt in Postgres und wird von der lokalen CLI, dem bereitgestellten MCP und dem Website-Dashboard gemeinsam genutzt.

Empfohlener Hybrid-Ablauf:

  1. Führen Sie supabase_schema.sql in Supabase aus (erstellt die Tabelle runs).

  2. Setzen Sie SUPABASE_URL + SUPABASE_SERVICE_KEY auf dem MCP (lokal und/oder Railway), damit jeder Lauf zentral geschrieben wird. Jeder Lauf zeichnet generator_model und judge_model für den Modellvergleich auf.

  3. Stellen Sie web/ auf Vercel bereit (setzen Sie dieselben Supabase-Umgebungsvariablen) und ordnen Sie es retrieval-mcp.com zu. Das Dashboard liest den Verlauf über /api/runs (der Service-Key bleibt serverseitig) und rendert Trend nach Modell, ein Modell-Ranking und den Laufverlauf. Es zeigt Beispieldaten, bis Supabase angebunden ist.

Lokal bleibt Ihre kostenlose Sandbox (Ollama-Judge, Dateiverlauf); die Website ist das dauerhaft verfügbare Fenster in den gemeinsamen Verlauf.

Lokal ausführen (stdio) – Claude Desktop

pip install -r requirements.txt
export ANTHROPIC_API_KEY=sk-ant-...
{
  "mcpServers": {
    "retrieval": {
      "command": "python",
      "args": ["/ABSOLUTE/PATH/server.py"],
      "env": { "ANTHROPIC_API_KEY": "sk-ant-...", "RETRIEVAL_BUDGET_USD": "10" }
    }
  }
}

Dann: "Load examples/rag_golden.jsonl as 'space', run faithfulness, label it v1."

Als HTTP bereitstellen (von überall erreichbar)

export RETRIEVAL_TOKEN=$(openssl rand -hex 24)   # required for a public endpoint
export ANTHROPIC_API_KEY=sk-ant-...
export RETRIEVAL_BUDGET_USD=20
python app.py        # serves $PORT (default 8000); MCP at /mcp, health at /healthz

Stellen Sie auf Railway (oder einem beliebigen Host) bereit: Die enthaltenen Dockerfile / Procfile funktionieren unverändert. Setzen Sie ANTHROPIC_API_KEY, RETRIEVAL_TOKEN, RETRIEVAL_BUDGET_USD in der Host-Umgebung. Clients verbinden sich mit https://<host>/mcp mit dem Header Authorization: Bearer <token> – fügen Sie es als benutzerdefinierten Connector in claude.ai / Claude Desktop hinzu oder richten Sie Agent Builder / CI darauf aus. Der Zustand (Golden Sets, Laufverlauf, Ausgaben) liegt serverseitig und bleibt so über Maschinen hinweg erhalten.

Sehen Sie es an einer echten RAG-Pipeline (Demo)

demo/rag_demo.py baut eine kleine End-to-End-RAG über einem kleinen beschrifteten Datensatz (demo/labeled.json + demo/corpus.json): Es ruft mit BM25 ab, berechnet recall@k gegen die Gold-Passagen (deterministisch – die Punktzahl des Retrievers), generiert eine Antwort und bewertet dann Faithfulness (die Punktzahl des Generators). Eine Antwort ist absichtlich halluziniert, sodass Sie die beiden Fehlermodi getrennt beobachten können.

python demo/rag_demo.py            # offline, no key needed
python demo/rag_demo.py --real     # real generation + RetriEval judge (needs ANTHROPIC_API_KEY)

Es schreibt auch demo/generated_goldenset.jsonl – laden Sie das in den MCP (load_golden_setrun_eval) für die vom Judge bewertete Version. Das ist die Brücke: Ihre Pipeline erzeugt Vorhersagen, der Datensatz liefert die Beschriftungen, und RetriEval bewertet Retriever und Generator unabhängig.

Anbindung an eine RAG-Pipeline

  • Offline (Standard): Exportieren Sie den abgerufenen Kontext + die Antwort Ihrer Pipeline in ein Golden Set und bewerten Sie es – RetriEval berührt Ihre Pipeline nie.

  • Live: Fügen Sie ein query_rag(question)-Tool hinzu, das Ihren RAG-Endpunkt oder Ihren Vektor-Store (Chroma / Supabase pgvector) aufruft, Kontext + Antwort erfasst und in einem Schritt bewertet.

Judge-Backend

export RETRIEVAL_JUDGE_BACKEND=anthropic          # default
export RETRIEVAL_JUDGE_MODEL=claude-sonnet-4-6
# or local, free:
export RETRIEVAL_JUDGE_BACKEND=ollama
export RETRIEVAL_JUDGE_MODEL=deepseek-r1:70b

Tools

Tool

Zweck

list_metrics

integrierte + selbst erstellte Metriken

load_golden_set(name, source, fmt)

ein Set für die Wiederverwendung benennen (nur Self-Host – geteilt und bei Neustart verloren)

list_golden_sets

was geladen ist

author_metric(name, criteria, examples)

einfache Sprache → ein Bewerter

run_eval(metrics, cases, golden_set, threshold, outputs, label, limit)

ein Set bewerten; cases inline übergeben (JSON/JSONL/CSV/TSV/Pfad/URL) – nichts wird gespeichert

show_run_cases(run_id, offset, limit, metric)

die restlichen durchblättern

evaluate_case(...)

einmalige Bewertung

ground_against_url(url, output, question)

die Konsistenz einer Ausgabe mit einer Webseite prüfen (keine Beschriftungen – Konsistenz, nicht Korrektheit)

list_runs(golden_set, last_n)

gespeicherte Läufe

plot_metric_trend / plot_run / compare_runs

Inline-Diagramme

get_budget / reset_budget

Ausgabenlimit-Status / zurücksetzen


Lizenz

Apache License 2.0. Erstellt von Hanns Carrillo.

A
license - permissive license
Not graded
quality - not tested
B
maintenance

Maintenance

Maintainers
Response time
Release cycle
Releases (12mo)
Commit activity

Resources

Unclaimed servers have limited discoverability.

Looking for Admin?

If you are the server author, to access and configure the admin panel.

Related MCP Servers

  • A
    license
    Not graded
    quality
    C
    maintenance
    Provides advanced evaluation tools for assessing AI safety, alignment, and performance of LLM outputs. Enables programmatic evaluation of quality, safety metrics like toxicity and PII detection, and operational metrics including carbon footprint and cost estimation.
    4
    Apache 2.0
  • A
    license
    Not graded
    quality
    A
    maintenance
    Enables LLM evaluation and observability by uploading documents, building test sets, running RAG pipelines, and automatically scoring answers for groundedness, hallucination risk, retrieval quality, latency, and cost, with tools exposed to MCP-compatible clients.
    1
    MIT

View all related MCP servers

Related MCP Connectors

  • MCP server providing access to the Scorecard API to evaluate and optimize LLM systems.

  • A paid remote MCP for AI SDK eval dashboard, built to return verdicts, receipts, usage logs, and aud

  • Enterprise AI Control Plane: governance, guardrails, spend tracking, compliance & smart routing.

View all MCP Connectors

Latest Blog Posts

MCP directory API

We provide all the information about MCP servers via our MCP API.

curl -X GET 'https://glama.ai/api/mcp/v1/servers/hcarrillo001/retrieval-mcp'

If you have feedback or need assistance with the MCP directory API, please join our Discord server