Skip to main content
Glama
citarium

Agent Reliability MCP server

Agent Reliability — MCP 服务器

对自主 AI 智能体进行测试、基准测试与审计——方法、测试工具与证据。

一个远程 MCP 服务器,构建于托管的知识图谱之上。它返回的每个断言都绑定到一个已注册来源:工具在回传断言时会 带上 引用来源和置信度值,因此智能体可以展示依据,而不是凭空断言。

无需安装任何东西。它是一个托管的 streamable-HTTP 端点:

https://agentreliability.dev/mcp

添加到客户端

Claude Code

claude mcp add --transport http agent-reliability https://agentreliability.dev/mcp

Claude Desktop / 任意读取 mcpServers 的客户端

{
  "mcpServers": {
    "agent-reliability": {
      "type": "streamable-http",
      "url": "https://agentreliability.dev/mcp"
    }
  }
}

无需 API 密钥、无需账户、无需认证。只读。

无需任何客户端,即可检查它能否回答:

curl -s https://agentreliability.dev/mcp \
  -H 'Content-Type: application/json' \
  -H 'Accept: application/json, text/event-stream' \
  -H 'mcp-protocol-version: 2025-06-18' \
  -d '{"jsonrpc":"2.0","id":1,"method":"tools/list"}'

Related MCP server: knowledgelib-mcp

工具

共有八个工具,每个都有 outputSchema,且均返回 structuredContent

工具

参数

作用

get_overview

语料库概览:此实例掌握了什么、按类型统计的对象数量、已发布标签、新鲜度。当你刚到达,且还不确定该语料库能否回答你的问题时,请从这里开始

search

query, limit?

对知识图谱进行全文搜索。不区分重音和撇号,因此可用你得的原语查询;每个命中结果都会带有相关性得分和命中的字段。

answer

question

从语料库中回答问题。返回匹配对象的断言及其来源和置信度——绝不返回没有来源的回答

get_entity

id

按 id 获取一个知识对象,包括其断言,以及每条断言所引用的来源。

get_topic

tag

列出带有某个标签的知识对象(话题是有内容支持的标签)。

get_related

id

某个对象的图谱邻居:出向关系和入向关系,各附关系类型。

get_sources

object_id?

全部来源注册表,或仅返回某个对象引用的来源。在信任语料库之前,可以用它来做判断。

get_latest

limit?

最近验证的知识对象——这是一条新鲜度信号。

建议的调用路径是 get_overviewsearchanswerget_entityget_relatedget_overview 的存在,是因为刚到达的智能体需要先知道该语料库能否提供帮助,而不用花费一次调用来猜测。

语料库里有什么

知识对象

38

注册来源

31

已发布话题

93

类型

对象

实体

25

指南

9

对比

2

常见问题

1

术语表

1

主题包括:评测和基准(GAIA、AgentBench、Inspect)、LLM-as-judge 及其失败模式、古德哈特定律与基准污染、故障注入与混沌测试、审批关卡与自主层级、智能体关联性与忠实性。

它被构建用于回答的问题

  • 如何区分真实的评估,还是我的智能体已经记忆的基准?

  • 校准对 LLM 评判者而言意味着什么,它如何度量?

  • 故障注入实际能够捕获哪些失败模式?

实际返回的回答长什么样

针对实时端点的一次真实调用——用 answer 处理问题 "how do I tell a real eval from a benchmark pollution" ——会返回如下 structuredContent(已截断):

{
  "answered": true,
  "entity": {
    "id": "agent-reliability-glossary",
    "name": "Agent reliability glossary",
    "evidence_tier": "secondary",
    "confidence": 0.85,
    "last_verified": "2026-08-08",
    "canonical_url": "https://agentreliability.dev/k/agent-reliability-glossary"
  },
  "claims": [
    {
      "text": "An eval is a structured, repeatable test that measures an LLM or LLM-based system against a defined dimension; frameworks package evals as registries of reusable templates.",
      "sources": [{ "title": "openai/evals — framework for evaluating LLMs and LLM systems" }]
    }
  ]
}

注意随回答一并承载的内容:证据层级置信度最后验证日期,以及断言背后的来源——它们不是需要智能体解析的 prose,而是可以采信的字段。智能体可以放弃置信度较弱的断言,也可以直接引用原始来源。

当语料库无法回答时,answered 值为 false。它不会即兴编造,而且未命中会被记录下来,以便将来填补空白。

机器可读的接口

MCP 端点是多个接口之一。同一语料库也可以序列化为智能体可直接读取的纯文本文件:

入口

说明

/llms.txt

索引,text/plain 格式

/llms-full.txt

整个语料库,汇入单一一份文件

/ai-index.json

该实例发布的所有页面及其“内容类型”

/api/index.json

每个知识对象对应一个 JSON 文档

/api/sources.json

完整的来源注册表

/.well-known/mcp/server.json

此服务器的 manifest 文件

每个知识对象都有一个人工可读页面和一个机器可读配对页面,它们在相同 id 下,并拥有一个在所有接口间都可以对齐的规范 URL。

在集成前值得了解的行为

  • POST 接口。其他任何方法都返回 405,并带 Allow: POST, OPTIONS 响应头。

  • 速率限制: 每个客户端每分钟 120 次请求,在共享存储中计数,并公布在每次响应的 RateLimit-LimitRateLimit-RemainingRateLimit-Reset 中(这三者均通过 CORS 暴露)。它采取 fail open 策略:若共享存储不可达,请求仍然得到正常处理。

  • 格式错误的请求会返回符合规范的 JSON-RPC 格式错误——无法解析的正文返回 -32700,未知工具返回 -32602——绝不会返回 HTML 错误页面。

  • 请求正文有大小限制,并且在传输前经过校验。

隐私

无账户、无 cookie、无广告。使用统计仅以聚合目标进行,使用每日轮换的哈希标识符,并保留 200 天;原始 IP 从不存储。完整政策:PRIVACY.md

来源与许可

知识内容采用 CC-BY-4.0:可以使用,使用时请注明来源。来源注册表公开,正是为了让断言可以被核实,而非被简单信任——get_sources 返回任何断言所依赖的具体依据。

断言带有证据层级和 last_verified 日期。凡是证据较弱的地方,对象会明确如实说明,而不会将其美化或四舍五入。

它是如何构建的

Citarium 编译并运行。Citarium 是一个开源框架,用于将知识图谱转换成浏览器网站、API、MCP 服务器和智能体可读的文件——这些全部来自单一数据源;目前它正处于外部评估之中,贡献者和教育记录均公开可见。

此仓库是本服务器的公开对外呈现:其结构和文档。语料库本身位于 agentreliability.dev

A
license - permissive license
Not graded
quality - not tested
C
maintenance

Maintenance

Maintainers
Response time
Release cycle
Releases (12mo)
Commit activity

Related MCP Servers

  • A
    license
    A
    quality
    B
    maintenance
    Search 1,500+ pre-verified, cited knowledge units across 16 domains. 6 tools: query, batch query, get unit, list domains, suggest topics, report issues. Free, no API key required.
    6
    237
    1
    MIT
  • A
    license
    Not graded
    quality
    A
    maintenance
    Live, reproducible crypto infrastructure benchmarks for AI agents: RPC latency, bridge fees, L1 finality, gas oracle accuracy, stablecoin pegs. Three tools (list_benchmarks, get_benchmark,query_prom), no API key, CC-BY-4.0 data.
    5
    MIT

View all related MCP servers

Related MCP Connectors

  • Gateway between LLM agents and world data through eight tools and a bundled endpoint catalog.

  • Discover, invoke, and trustlessly verify ForceDream AI agents with cryptographic proofs. 17 tools.

  • Curated knowledge API for AI agents - skill packs, semantic search, validated patterns.

View all MCP Connectors

Latest Blog Posts

MCP directory API

We provide all the information about MCP servers via our MCP API.

curl -X GET 'https://glama.ai/api/mcp/v1/servers/citarium/agentreliability-mcp'

If you have feedback or need assistance with the MCP directory API, please join our Discord server