judge-mcp
judge-mcp
English: README.en.md
Оценка качества текста по принципу LLM-as-Judge в виде MCP-сервера.
Оценивает пары «оригинал — исправленный текст» по многокритериальной взвешенной рубрике, проверяет модель-оценщика на золотом наборе с человеческими метками («проверка, а не обучение») и перекрёстно сверяет согласованность двух оценщиков. Всё это доступно через инструменты MCP, поэтому оценку можно запускать в диалоге из любого MCP-клиента — Claude Desktop, Claude Code и других.
Зачем это сделано
У правки, переписывания и суммаризации нет единственно верного ответа, поэтому всё больше команд используют LLM-оценщиков. Но непроверенный оценщик — это просто ещё одно мнение. Этот сервер обобщает в инструмент методологию, проверенную в проекте по анализу логов реального сервиса.
Многокритериальная взвешенная рубрика — сохранение смысла, естественность, наличие улучшения, сдержанность при чрезмерной правке. Вместо непрозрачной единой оценки — оценка по каждому критерию.
Проверка на золотом наборе — кандидат-оценщик проверяется на человеческих метках (хорошая правка / пропущенная правка / чрезмерная правка). Золотой набор никогда не используется для обучения, поэтому остаётся экзаменационным билетом и переиспользуется как регрессионный тест при каждом изменении рубрики.
Перекрёстная сверка двух оценщиков — один и тот же вопрос оценивается двумя оценщиками, измеряется согласованность, и эмпирически проверяется, устойчив ли вывод к выбору оценщика.
Детерминированный предварительный фильтр — пары без изменений оцениваются кодом, без LLM. Дёшево и всегда с одинаковым ответом.
Related MCP server: mcp-eval-harness
Инструменты
Инструмент | Функция |
| Оценка пары «оригинал — исправление» → баллы по критериям, взвешенный итог, вердикт good/fair/poor, обоснование |
| Проверка оценщика на золотом наборе → табель успеваемости по общему и побакетному качеству |
| Двойная оценка двумя моделями → согласованность ±1 балл, согласованность вердиктов о низком качестве, средняя разница |
| Просмотр списка рубрик, критериев и весов |
Встроен синтетический золотой набор из 24 вопросов по корейской правке (3 бакета); через golden_path можно подключить собственный золотой набор (JSONL: id, original, revised, label).
Установка и настройка
Работает с любым бэкендом, совместимым с OpenAI, — OpenAI, локальный vLLM, Ollama, LM Studio.
pip install -e .
export JUDGE_API_BASE="https://api.openai.com/v1" # vLLM이면 http://localhost:8000/v1
export JUDGE_API_KEY="sk-..." # 로컬 서버는 아무 값
export JUDGE_MODEL="gpt-4o-mini" # 또는 Qwen/Qwen2.5-7B-Instruct-AWQПример настройки Claude Desktop — в examples/. После настройки можно спрашивать, например:
«Оцени эту правку: оригинал "오늘 회의 몇시에 시작하나요", исправление "몇 시에 시작하나요?"»
«Прогони золотой набор на gpt-4o-mini и покажи табель успеваемости»
«Сравни, согласуются ли gpt-4o-mini и локальный Qwen как оценщики»
Реальные результаты
Результаты проверки встроенного золотого набора из 24 вопросов на Claude Sonnet (бэкенд claude-cli):
Бакет | Точность |
Хорошая правка (good_fix) | 8/8 |
Пропущенная правка (missed) | 7/8 |
Чрезмерная правка (overcorrected) | 5/8 |
Итого | 83.3% |
Воспроизведение: python scripts/run_golden.py --backend claude-cli (для API, совместимого с OpenAI, — --backend api).
Кейс-стади: золотой набор выявил дефект дизайна
Первый запуск дал 62.5% — бакет пропущенных правок 0/8. Причина была не в оценщике, а в дизайне вердикта. Пропущенная правка сохраняет смысл и не содержит чрезмерной правки, поэтому два критерия с большим весом (0.40+0.35) получают максимум, и даже при 1 балле за критерий улучшения итог составляет 8–9 баллов. Поймать пропущенную правку по итоговому баллу было математически невозможно.
Исправление: вердикт для бакета пропущенных правок изменён с итогового балла на критерий улучшения (improvement) ≤ 4. Повторная проверка: 62.5% → 83.3%, пропущенные правки 0/8 → 7/8. Именно для этого существует регрессионный цикл на золотом наборе — он эмпирически вскрыл тихо скрывавшийся дефект дизайна оценки, позволил его исправить и зафиксировать регрессионным тестом. (Оставшийся разрыв: в бакете чрезмерных правок наблюдается изменчивость LLM-оценки между запусками — кандидат на усиление few-shot якорями; улучшение можно проверить тем же регрессионным циклом.)
Заметки по дизайну
Проверка оценщика — ключевое. Модели-оценщики в исходном состоянии имеют полярно противоположные склонности, поэтому выбор без проверки — это гадание. Точность определяется по направлению: хорошая правка оценивается высоко (≥7), пропущенная и чрезмерная — низко (≤5). Серая зона (5–7) намеренно считается ошибкой.
Приоритет воспроизводимости. temperature 0, принудительный JSON-вывод + парсинг, устойчивый к код-фенсам и посторонним словам, клампинг диапазона баллов, а случаи, не требующие модели (без изменений), обрабатываются кодом.
Действенные ошибки. При сбоях соединения или схемы возвращается не стектрейс, а сообщение о том, «что нужно исправить».
Тесты
pip install -e ".[dev]"
pytest # 21건, 네트워크 불필요 (모의 LLM)Лицензия
MIT
This server cannot be installed
Maintenance
Resources
Unclaimed servers have limited discoverability.
Looking for Admin?
If you are the server author, to access and configure the admin panel.
Related MCP Servers
AlicenseNot gradedqualityBmaintenanceHuman-evaluation infrastructure for AI quality. 25,000+ blind human reviews by 200+ verified reviewers across 58 AI models — query the data via five MCP tools (get_model_scores, compare_models, get_flags, check_content, get_latest).2MIT- FlicenseNot gradedqualityCmaintenanceMCP-based code evaluation harness — sandboxed execution + LLM quality scoring.
- AlicenseNot gradedqualityCmaintenanceEvaluates RAG outputs on faithfulness, answer relevancy, and context precision using an LLM-as-a-Judge backend. Exposes tools for running evaluations, scoring individual samples, and checking thresholds, enabling CI gating and on-demand assessment via MCP.MIT
- AlicenseAqualityCmaintenanceAn MCP server that audits LLM-as-judge evaluations, detecting judge drift across runs, measuring bias through controlled probes, and comparing judge agreement with human raters.6MIT
Related MCP Connectors
MCP server providing access to the Scorecard API to evaluate and optimize LLM systems.
Remote MCP for Gemini upgrade evals, prompt regressions, output diffs, and eval receipts.
Hosted MCP server for LLM cost estimation, model comparison, and budget-aware routing.
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/egoring/judge-mcp'
If you have feedback or need assistance with the MCP directory API, please join our Discord server