judge-mcp
judge-mcp
English: README.en.md
LLM-as-Judge-Textqualitätsbewertung als MCP-Server.
Bewertet Paare aus Original- und überarbeitetem Text anhand einer mehrdimensionalen gewichteten Rubrik, testet Bewertungsmodelle mit einem Golden Set aus menschlichen Labels („Testen, nicht Trainieren") und validiert die Übereinstimmung zweier Bewerter kreuzweise. Alles wird über MCP-Tools bereitgestellt, sodass Bewertungen in jedem MCP-Client wie Claude Desktop oder Claude Code per Dialog ausgeführt werden können.
Warum
Für Korrektur, Rewriting und Zusammenfassung gibt es keine eindeutige richtige Antwort, weshalb immer mehr Teams LLM-Bewerter einsetzen. Doch ein unvalidierter Bewerter ist nur eine weitere Meinung. Dieser Server verallgemeinert eine Methodik, die in einem Projekt zur Analyse von Produktionslogs validiert wurde, zu einem Werkzeug.
Mehrdimensionale gewichtete Rubrik — Bedeutungserhalt, Natürlichkeit, Verbesserungsgrad, Zurückhaltung bei Überkorrektur. Statt einer undurchsichtigen Einzelpunktzahl wird pro Achse bewertet.
Golden-Set-Test — Bewerterkandidaten werden mit menschlichen Labels (gut korrigiert/übersehen/überkorrigiert) getestet. Sie werden niemals zum Training verwendet, sodass das Golden Set als Prüfungsbogen erhalten bleibt und bei jeder Rubrikänderung als Regressionstest wiederverwendet wird.
Kreuzvalidierung durch Doppelbewertung — Dieselben Fragen werden von zwei Bewertern bewertet, die Übereinstimmungsrate wird gemessen und empirisch geprüft, ob die Schlussfolgerung robust gegenüber der Bewerterwahl ist.
Deterministischer Pre-Filter — Unveränderte Paare werden ohne LLM vom Code bewertet. Günstig und immer dieselbe Antwort.
Related MCP server: mcp-eval-harness
Werkzeuge
Werkzeug | Funktion |
| Bewertet ein Paar aus Original und Überarbeitung → Punktzahl pro Achse, gewichtete Gesamtnote, good/fair/poor-Urteil, Begründung |
| Testet den Bewerter mit dem Golden Set → Leistungsübersicht gesamt und nach Bucket |
| Doppelbewertung zweier Modelle → ±1-Punkt-Übereinstimmung, Übereinstimmung bei Schlechtqualitäts-Urteilen, mittlere Differenz |
| Listet Rubriken mit Achsen und Gewichten auf |
Ein synthetisches Golden Set für koreanische Korrekturen mit 24 Fragen (3 Buckets) ist eingebaut; über golden_path kann ein eigenes Golden Set (JSONL: id, original, revised, label) verwendet werden.
Installation & Konfiguration
Jedes OpenAI-kompatible Backend funktioniert — OpenAI, lokales vLLM, Ollama, LM Studio.
pip install -e .
export JUDGE_API_BASE="https://api.openai.com/v1" # vLLM이면 http://localhost:8000/v1
export JUDGE_API_KEY="sk-..." # 로컬 서버는 아무 값
export JUDGE_MODEL="gpt-4o-mini" # 또는 Qwen/Qwen2.5-7B-Instruct-AWQEin Beispiel für die Claude-Desktop-Konfiguration finden Sie in examples/. Nach der Einrichtung können Sie zum Beispiel Folgendes fragen:
„Bewerte diese Korrektur: Original ‚오늘 회의 몇시에 시작하나요', Überarbeitung ‚몇 시에 시작하나요?'"
„Führe das Golden Set mit gpt-4o-mini aus und zeig mir die Leistungsübersicht"
„Vergleiche, ob gpt-4o-mini und lokales Qwen als Bewerter übereinstimmen"
Gemessene Ergebnisse
Ergebnis des Tests des eingebauten Golden Sets mit 24 Fragen durch Claude Sonnet (claude-cli-Backend):
Bucket | Genauigkeit |
Gut korrigiert (good_fix) | 8/8 |
Übersehen (missed) | 7/8 |
Überkorrigiert (overcorrected) | 5/8 |
Gesamt | 83,3 % |
Selbst reproduzierbar: python scripts/run_golden.py --backend claude-cli (für OpenAI-kompatible APIs: --backend api).
Fallstudie: Das Golden Set deckte einen Designfehler auf
Der erste Lauf ergab 62,5 % — der Übersehen-Bucket lag bei 0/8. Die Ursache war nicht der Bewerter, sondern das Urteilsdesign. Übersehene Korrekturen erhalten bei Bedeutungserhalt und ohne Überkorrektur die volle Punktzahl auf den beiden stark gewichteten Achsen (0,40+0,35); selbst mit 1 Punkt auf der Verbesserungsachse ergibt sich eine Gesamtnote von 8–9. Übersehene Fälle über die Gesamtnote zu erkennen war mathematisch unmöglich.
Änderung: Das Urteil für den Übersehen-Bucket wurde von der Gesamtnote auf Verbesserungsachse ≤ 4 umgestellt. Der erneute Test ergab 62,5 % → 83,3 %, Übersehen 0/8 → 7/8. Genau dafür existiert die Golden-Set-Regressionsschleife — ein still versteckter Designfehler der Bewertung wurde durch Messung aufgedeckt, behoben und per Regressionstest abgesichert. (Verbleibende Lücke: Im Überkorrigiert-Bucket wurde Lauf-zu-Lauf-Varianz der LLM-Bewertung beobachtet — ein Kandidat für Few-Shot-Anker, deren Verbesserung mit derselben Regressionsschleife validiert werden kann.)
Designhinweise
Die Validierung des Bewerters ist der Kern. Bewertermodelle haben im Ausgangszustand extrem gegensätzliche Tendenzen; ohne Test zu wählen ist Spekulation. Die Genauigkeit wird über die Richtung beurteilt — gut korrigierte Überarbeitungen werden hoch bewertet (≥7), übersehene und überkorrigierte niedrig (≤5). Die Grauzone (5–7) wird bewusst als falsch gewertet.
Reproduzierbarkeit zuerst. Temperatur 0, erzwungene JSON-Ausgabe mit Parsing, das gegen Codefences und Geschwätz robust ist, Begrenzung des Punktzahlbereichs, und Fälle ohne Modellbedarf (unverändert) laufen über den Codepfad.
Handlungsorientierte Fehler. Verbindungs- und Schemafehler liefern keine Stacktraces, sondern Nachrichten, die erklären, „was zu beheben ist".
Tests
pip install -e ".[dev]"
pytest # 21건, 네트워크 불필요 (모의 LLM)Lizenz
MIT
This server cannot be installed
Maintenance
Resources
Unclaimed servers have limited discoverability.
Looking for Admin?
If you are the server author, to access and configure the admin panel.
Related MCP Servers
AlicenseNot gradedqualityBmaintenanceHuman-evaluation infrastructure for AI quality. 25,000+ blind human reviews by 200+ verified reviewers across 58 AI models — query the data via five MCP tools (get_model_scores, compare_models, get_flags, check_content, get_latest).2MIT- FlicenseNot gradedqualityCmaintenanceMCP-based code evaluation harness — sandboxed execution + LLM quality scoring.
- AlicenseNot gradedqualityCmaintenanceEvaluates RAG outputs on faithfulness, answer relevancy, and context precision using an LLM-as-a-Judge backend. Exposes tools for running evaluations, scoring individual samples, and checking thresholds, enabling CI gating and on-demand assessment via MCP.MIT
- AlicenseAqualityCmaintenanceAn MCP server that audits LLM-as-judge evaluations, detecting judge drift across runs, measuring bias through controlled probes, and comparing judge agreement with human raters.6MIT
Related MCP Connectors
MCP server providing access to the Scorecard API to evaluate and optimize LLM systems.
Remote MCP for Gemini upgrade evals, prompt regressions, output diffs, and eval receipts.
Hosted MCP server for LLM cost estimation, model comparison, and budget-aware routing.
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/egoring/judge-mcp'
If you have feedback or need assistance with the MCP directory API, please join our Discord server