retrieval
retriEVAL
LLM 评估作为 MCP 服务器。 在任何 MCP 客户端内为你的 AI 输出打分,评估其忠实度、相关性和幻觉——无需管道,无需测试框架。每个结果都会附带一个指向仪表盘的链接,该仪表盘保存历史记录。
为什么
五个客户支持回答,按两个指标评分:
指标 | 分数 | 通过 |
answer_relevancy | 0.98 | 5/5 |
faithfulness | 0.70 | 3/5 |
每个回答都切题且文笔良好。其中两个与它们所依据的政策相矛盾——一个承诺了政策不提供的免费退货运输,另一个虚构了免费隔夜更换。如果人工审查,你会全部通过。
这个差距就是重点。相关性问的是是否回答了问题。忠实度问的是是否真的在来源中。两者都需要,而第二个能抓住代价高昂的失败。
Related MCP server: mcp-llm-eval
连接
自托管。克隆它,指向一个评判模型,运行它——你的数据永远不会离开你的机器,也无需注册任何服务。
git clone https://github.com/hcarrillo001/retrieval-mcp
cd retrieval-mcp
pip install -r requirements.txt
export ANTHROPIC_API_KEY=sk-ant-... # or a local judge, below
python server.py # stdio, for Claude Desktop / Cursor然后只需问:
用 faithfulness 评估这些案例:[{"input": "...", "actual_output": "...", "retrieval_context": ["..."]}]
内联传递案例,不存储任何内容——一次调用,无需设置步骤。客户端配置请参阅本地运行(stdio),如果你想要自己的常驻实例并带仪表盘,请参阅部署为 HTTP。
想在安装任何东西之前先试试? 在 retrieval-mcp.com 有一个实时沙箱——无需注册,使用免费评判模型,不保存任何内容。
保持一切本地化: 设置 RETRIEVAL_JUDGE_BACKEND=ollama,评判模型也在你的机器上运行,因此数据在任何时候都不会离开你的网络。如果你要评估任何不能发送给第三方的数据,这很有用。
你得到什么
9 个内置指标,以及你用纯英文编写的自定义指标
可更换的评判模型——Anthropic、Groq、Gemini、OpenRouter 或本地 Ollama 模型,因此数据不必离开你的网络
黄金集来自文件、URL、内联 JSON、JSONL、CSV 或 TSV
运行历史存储在 Supabase 中,支持可分享的永久链接和运行比较
支出上限,因为基于评判模型的工具否则可能会产生高额账单
诚实的局限性
评判模型的一致性尚未针对人工标签进行验证,因此请将分数视为信号而非绝对真理。
黄金集目前保存自己的输出,因此针对新模型输出重新运行需要加载第二个集。拆分它们是下一个更改。
黄金集和编写的指标存在于服务器进程中,重启后会丢失。运行记录会保留;这些不会。
指标(与 DeepEval 对齐)
faithfulness · answer_relevancy · contextual_precision ·
contextual_recall · contextual_relevancy · hallucination · bias ·
toxicity · summarization — 以及你用自然语言定义的 编写的 G-Eval 指标。所有指标都归一化,因此 越高 = 越好(bias/toxicity 报告干净分数),并且每个指标在评分前都会进行推理。
多功能的黄金集
load_golden_set 接受文件路径(包括上传的文件)、http(s) URL、内联 JSON 数组或 JSONL 文本,格式为 JSON / JSONL / CSV / TSV。字段名会自动归一化(question→input,answer→actual_output,ground_truth→expected_output,contexts→context,passages→retrieval_context,…),因此大多数公共基准可以直接加载。
默认返回简短回复
run_eval 对每个案例评分,但默认只返回得分最低的 3 个(可通过 limit 调整),并带有 total_cases/shown 和指向 show_run_cases(run_id, offset, limit, metric) 的指针,用于分页查看其余案例。
支出上限(防止产生高额账单)
评判模型的支出根据实际 token 使用量计量并持久化。设置硬性上限:
export RETRIEVAL_BUDGET_USD=20 # 0/unset = unlimited一旦累计支出达到上限,进一步的 Anthropic 调用将停止,工具会返回明确的 budget_exceeded 消息。使用 get_budget / reset_budget 检查/清除。(价格是近似值——覆盖 RETRIEVAL_PRICE_IN/OUT $/1M tokens 以匹配你模型的当前定价。)
混合设置(本地 + 常驻仪表盘)
运行历史使用可插拔的存储,由环境变量选择:
FileStore(默认)—
~/.retrieval中的 JSONL。零设置,仅本地。SupabaseStore — 当设置了
SUPABASE_URL+SUPABASE_SERVICE_KEY时。运行历史存储在 Postgres 中,由本地 CLI、部署的 MCP 和网站仪表盘共享。
推荐的混合流程:
在 Supabase 中运行
supabase_schema.sql(创建runs表)。在 MCP(本地和/或 Railway)上设置
SUPABASE_URL+SUPABASE_SERVICE_KEY,以便每次运行都集中写入。每次运行记录其generator_model和judge_model,用于跨模型比较。将
web/部署到 Vercel(设置相同的 Supabase 环境变量)并将其映射到retrieval-mcp.com。仪表盘通过/api/runs读取历史(服务密钥保留在服务器端),并渲染按模型趋势、模型排行榜和运行历史。在 Supabase 连接之前,它显示示例数据。
本地保持你的免费沙箱(Ollama 评判模型、文件历史);网站是共享历史的常驻窗口。
本地运行(stdio)— Claude Desktop
pip install -r requirements.txt
export ANTHROPIC_API_KEY=sk-ant-...{
"mcpServers": {
"retrieval": {
"command": "python",
"args": ["/ABSOLUTE/PATH/server.py"],
"env": { "ANTHROPIC_API_KEY": "sk-ant-...", "RETRIEVAL_BUDGET_USD": "10" }
}
}
}然后:"将 examples/rag_golden.jsonl 加载为 'space',运行 faithfulness,标记为 v1。"
部署为 HTTP(从任何地方访问)
export RETRIEVAL_TOKEN=$(openssl rand -hex 24) # required for a public endpoint
export ANTHROPIC_API_KEY=sk-ant-...
export RETRIEVAL_BUDGET_USD=20
python app.py # serves $PORT (default 8000); MCP at /mcp, health at /healthz部署到 Railway(或任何主机):附带的 Dockerfile / Procfile 可直接使用。在主机环境中设置 ANTHROPIC_API_KEY、RETRIEVAL_TOKEN、RETRIEVAL_BUDGET_USD。客户端连接到 https://<host>/mcp,并带有 Authorization: Bearer <token> 头——在 claude.ai / Claude Desktop 中将其添加为自定义连接器,或将 Agent Builder / CI 指向它。状态(黄金集、运行历史、支出)存储在服务器端,因此跨机器持久化。
在真实 RAG 管道上查看(演示)
demo/rag_demo.py 在一个小的带标签数据集(demo/labeled.json + demo/corpus.json)上构建了一个微型端到端 RAG:它使用 BM25 检索,针对黄金段落计算 recall@k(确定性——检索器的分数),生成答案,然后对忠实度评分(生成器的分数)。其中一个答案被故意幻觉化,以便你观察两种失败模式如何分离。
python demo/rag_demo.py # offline, no key needed
python demo/rag_demo.py --real # real generation + RetriEval judge (needs ANTHROPIC_API_KEY)它还写入 demo/generated_goldenset.jsonl——将那个加载到 MCP 中(load_golden_set → run_eval)以获得评判模型评分的版本。这是桥梁:你的管道生成预测,数据集提供标签,RetriEval 独立地对检索器和生成器评分。
连接到 RAG 管道
离线(默认): 将你的管道检索到的上下文 + 答案导出到黄金集中并评分——RetriEval 从不接触你的管道。
实时: 添加一个
query_rag(question)工具,调用你的 RAG 端点或你的向量存储(Chroma / Supabase pgvector),捕获上下文 + 答案,并一次性评分。
评判模型后端
export RETRIEVAL_JUDGE_BACKEND=anthropic # default
export RETRIEVAL_JUDGE_MODEL=claude-sonnet-4-6
# or local, free:
export RETRIEVAL_JUDGE_BACKEND=ollama
export RETRIEVAL_JUDGE_MODEL=deepseek-r1:70b工具
工具 | 用途 |
| 内置 + 编写的指标 |
| 命名一个集以供重用(仅自托管——共享并在重启时丢失) |
| 已加载的内容 |
| 自然语言 → 评分器 |
| 对集评分;内联传递 |
| 分页查看其余内容 |
| 一次性评分 |
| 检查输出与网页的一致性(无标签——一致性,而非正确性) |
| 已保存的运行 |
| 内联图表 |
| 支出上限状态 / 重置 |
许可证
Apache License 2.0。由 Hanns Carrillo 构建。
This server cannot be installed
Maintenance
Resources
Unclaimed servers have limited discoverability.
Looking for Admin?
If you are the server author, to access and configure the admin panel.
Related MCP Servers
AlicenseNot gradedqualityCmaintenanceProvides advanced evaluation tools for assessing AI safety, alignment, and performance of LLM outputs. Enables programmatic evaluation of quality, safety metrics like toxicity and PII detection, and operational metrics including carbon footprint and cost estimation.4Apache 2.0- AlicenseAqualityCmaintenanceA local MCP server that packages LLM evaluation gates as reusable CI/CD primitives, enabling AI agents to run datasets against models, score responses, and enforce quality thresholds.10MIT
- AlicenseAqualityDmaintenanceRuntime quality validation for AI agent outputs. Detect hallucinations, enforce scope compliance, and score output quality — all via MCP.626MIT
- AlicenseNot gradedqualityAmaintenanceEnables LLM evaluation and observability by uploading documents, building test sets, running RAG pipelines, and automatically scoring answers for groundedness, hallucination risk, retrieval quality, latency, and cost, with tools exposed to MCP-compatible clients.1MIT
Related MCP Connectors
MCP server providing access to the Scorecard API to evaluate and optimize LLM systems.
A paid remote MCP for AI SDK eval dashboard, built to return verdicts, receipts, usage logs, and aud
Enterprise AI Control Plane: governance, guardrails, spend tracking, compliance & smart routing.
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/hcarrillo001/retrieval-mcp'
If you have feedback or need assistance with the MCP directory API, please join our Discord server