Agent Reliability MCP server
Agent Reliability — MCP 服务器
对自主 AI 智能体进行测试、基准测试与审计——方法、测试工具与证据。
一个远程 MCP 服务器,构建于托管的知识图谱之上。它返回的每个断言都绑定到一个已注册来源:工具在回传断言时会 带上 引用来源和置信度值,因此智能体可以展示依据,而不是凭空断言。
无需安装任何东西。它是一个托管的 streamable-HTTP 端点:
https://agentreliability.dev/mcp添加到客户端
Claude Code
claude mcp add --transport http agent-reliability https://agentreliability.dev/mcpClaude Desktop / 任意读取 mcpServers 的客户端
{
"mcpServers": {
"agent-reliability": {
"type": "streamable-http",
"url": "https://agentreliability.dev/mcp"
}
}
}无需 API 密钥、无需账户、无需认证。只读。
无需任何客户端,即可检查它能否回答:
curl -s https://agentreliability.dev/mcp \
-H 'Content-Type: application/json' \
-H 'Accept: application/json, text/event-stream' \
-H 'mcp-protocol-version: 2025-06-18' \
-d '{"jsonrpc":"2.0","id":1,"method":"tools/list"}'Related MCP server: knowledgelib-mcp
工具
共有八个工具,每个都有 outputSchema,且均返回 structuredContent。
工具 | 参数 | 作用 |
| — | 语料库概览:此实例掌握了什么、按类型统计的对象数量、已发布标签、新鲜度。当你刚到达,且还不确定该语料库能否回答你的问题时,请从这里开始。 |
|
| 对知识图谱进行全文搜索。不区分重音和撇号,因此可用你得的原语查询;每个命中结果都会带有相关性得分和命中的字段。 |
|
| 从语料库中回答问题。返回匹配对象的断言及其来源和置信度——绝不返回没有来源的回答。 |
|
| 按 id 获取一个知识对象,包括其断言,以及每条断言所引用的来源。 |
|
| 列出带有某个标签的知识对象(话题是有内容支持的标签)。 |
|
| 某个对象的图谱邻居:出向关系和入向关系,各附关系类型。 |
|
| 全部来源注册表,或仅返回某个对象引用的来源。在信任语料库之前,可以用它来做判断。 |
|
| 最近验证的知识对象——这是一条新鲜度信号。 |
建议的调用路径是 get_overview → search 或 answer → get_entity → get_related。get_overview 的存在,是因为刚到达的智能体需要先知道该语料库能否提供帮助,而不用先花费一次调用来猜测。
语料库里有什么
知识对象 | 38 |
注册来源 | 31 |
已发布话题 | 93 |
类型 | 对象 |
实体 | 25 |
指南 | 9 |
对比 | 2 |
常见问题 | 1 |
术语表 | 1 |
主题包括:评测和基准(GAIA、AgentBench、Inspect)、LLM-as-judge 及其失败模式、古德哈特定律与基准污染、故障注入与混沌测试、审批关卡与自主层级、智能体关联性与忠实性。
它被构建用于回答的问题
如何区分真实的评估,还是我的智能体已经记忆的基准?
校准对 LLM 评判者而言意味着什么,它如何度量?
故障注入实际能够捕获哪些失败模式?
实际返回的回答长什么样
针对实时端点的一次真实调用——用 answer 处理问题 "how do I tell a real eval from a benchmark pollution" ——会返回如下 structuredContent(已截断):
{
"answered": true,
"entity": {
"id": "agent-reliability-glossary",
"name": "Agent reliability glossary",
"evidence_tier": "secondary",
"confidence": 0.85,
"last_verified": "2026-08-08",
"canonical_url": "https://agentreliability.dev/k/agent-reliability-glossary"
},
"claims": [
{
"text": "An eval is a structured, repeatable test that measures an LLM or LLM-based system against a defined dimension; frameworks package evals as registries of reusable templates.",
"sources": [{ "title": "openai/evals — framework for evaluating LLMs and LLM systems" }]
}
]
}注意随回答一并承载的内容:证据层级、置信度、最后验证日期,以及断言背后的来源——它们不是需要智能体解析的 prose,而是可以采信的字段。智能体可以放弃置信度较弱的断言,也可以直接引用原始来源。
当语料库无法回答时,answered 值为 false。它不会即兴编造,而且未命中会被记录下来,以便将来填补空白。
机器可读的接口
MCP 端点是多个接口之一。同一语料库也可以序列化为智能体可直接读取的纯文本文件:
入口 | 说明 |
索引, | |
整个语料库,汇入单一一份文件 | |
该实例发布的所有页面及其“内容类型” | |
每个知识对象对应一个 JSON 文档 | |
完整的来源注册表 | |
此服务器的 manifest 文件 |
每个知识对象都有一个人工可读页面和一个机器可读配对页面,它们在相同 id 下,并拥有一个在所有接口间都可以对齐的规范 URL。
在集成前值得了解的行为
仅
POST接口。其他任何方法都返回405,并带Allow: POST, OPTIONS响应头。速率限制: 每个客户端每分钟 120 次请求,在共享存储中计数,并公布在每次响应的
RateLimit-Limit、RateLimit-Remaining和RateLimit-Reset中(这三者均通过 CORS 暴露)。它采取 fail open 策略:若共享存储不可达,请求仍然得到正常处理。格式错误的请求会返回符合规范的 JSON-RPC 格式错误——无法解析的正文返回
-32700,未知工具返回-32602——绝不会返回 HTML 错误页面。请求正文有大小限制,并且在传输前经过校验。
隐私
无账户、无 cookie、无广告。使用统计仅以聚合目标进行,使用每日轮换的哈希标识符,并保留 200 天;原始 IP 从不存储。完整政策:PRIVACY.md。
来源与许可
知识内容采用 CC-BY-4.0:可以使用,使用时请注明来源。来源注册表公开,正是为了让断言可以被核实,而非被简单信任——get_sources 返回任何断言所依赖的具体依据。
断言带有证据层级和 last_verified 日期。凡是证据较弱的地方,对象会明确如实说明,而不会将其美化或四舍五入。
它是如何构建的
由 Citarium 编译并运行。Citarium 是一个开源框架,用于将知识图谱转换成浏览器网站、API、MCP 服务器和智能体可读的文件——这些全部来自单一数据源;目前它正处于外部评估之中,贡献者和教育记录均公开可见。
此仓库是本服务器的公开对外呈现:其结构和文档。语料库本身位于 agentreliability.dev。
This server cannot be installed
Maintenance
Related MCP Servers
- AlicenseAqualityAmaintenanceTrust, identity, and reputation infrastructure for AI agents. Register agents with W3C DID (Ed25519), check EigenTrust reputation scores, submit peer attestations, search agents by capability, and verify IPFS-anchored audit trails. 11 tools.2014MIT
- AlicenseAqualityBmaintenanceSearch 1,500+ pre-verified, cited knowledge units across 16 domains. 6 tools: query, batch query, get unit, list domains, suggest topics, report issues. Free, no API key required.62371MIT

Openchainbenchofficial
AlicenseNot gradedqualityAmaintenanceLive, reproducible crypto infrastructure benchmarks for AI agents: RPC latency, bridge fees, L1 finality, gas oracle accuracy, stablecoin pegs. Three tools (list_benchmarks, get_benchmark,query_prom), no API key, CC-BY-4.0 data.5MIT- AlicenseNot gradedqualityCmaintenanceProvides AI agents with honest benchmark rankings (Agentic Memory Index and Agentic Search Index) for AI tools, plus graded checks and telemetry for x402 endpoints.MIT
Related MCP Connectors
Gateway between LLM agents and world data through eight tools and a bundled endpoint catalog.
Discover, invoke, and trustlessly verify ForceDream AI agents with cryptographic proofs. 17 tools.
Curated knowledge API for AI agents - skill packs, semantic search, validated patterns.
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/citarium/agentreliability-mcp'
If you have feedback or need assistance with the MCP directory API, please join our Discord server