Agent Reliability MCP server
Agent Reliability — MCPサーバー
自律型AIエージェントのテスト、ベンチマーキング、監査 — 手法、ハーネス、エビデンス
厳選されたナレッジグラフ上のリモートMCPサーバーです。返されるすべての主張は登録済みソースに紐付けられています。ツールは、引用情報と信頼度の値を伴った主張を返すため、エージェントは断言するのではなく根拠を示せます。
インストールは不要です。ホスト型の streamable-HTTP エンドポイントとして提供されます:
https://agentreliability.dev/mcpクライアントへの追加
Claude Code
claude mcp add --transport http agent-reliability https://agentreliability.dev/mcpClaude Desktop / mcpServers を読み取る任意のクライアント
{
"mcpServers": {
"agent-reliability": {
"type": "streamable-http",
"url": "https://agentreliability.dev/mcp"
}
}
}APIキー不要、アカウント不要、認証不要。読み取り専用です。
クライアントを一切使わずに、応答を確認する:
curl -s https://agentreliability.dev/mcp \
-H 'Content-Type: application/json' \
-H 'Accept: application/json, text/event-stream' \
-H 'mcp-protocol-version: 2025-06-18' \
-d '{"jsonrpc":"2.0","id":1,"method":"tools/list"}'Related MCP server: knowledgelib-mcp
ツール
8つのツールがあり、それぞれがoutputSchemaを持ち、structuredContentを返します。
ツール | 引数 | 機能 |
| — | コーパスの概要:このインスタンスが保持する知識、タイプ別の件数、公開済みタグ、鮮度。このコーパスが質問に答えられるかまだ分からないまま到着した場合は、ここから始めてください。 |
|
| ナレッジグラフ上の全文検索。アクセントとアポストロフィの違いを無視するため、ユーザーの言葉そのままで検索できます。各ヒットには関連性スコアと一致したフィールドが付属します。 |
|
| コーパスから質問に回答します。一致したオブジェクトの主張を、ソースと信頼度とともに返します — ソースなしの回答は決して返しません。 |
|
| IDで1つの知識オブジェクトを取得し、その主張と各主張が引用するソースを返します。 |
|
| タグを持つ知識オブジェクトの一覧を返します(トピックはコンテンツに裏付けられたタグです)。 |
|
| オブジェクトのグラフ上の隣接ノード:発信・着信の関係を、それぞれの関係タイプとともに返します。 |
|
| ソース登録簿の全体、または1つのオブジェクトが引用するソースだけを返します。コーパスを信頼する前に判断するために使ってください。 |
|
| 最近検証された知識オブジェクト — 鮮度を示すシグナルです。 |
想定される利用経路は get_overview → search または answer → get_entity → get_related です。get_overview があるのは、到着したばかりのエージェントが、推測に1回の呼び出しを費やす前に、このコーパスが役立つかどうかを知る必要があるからです。
コーパスに含まれるもの
知識オブジェクト | 38 |
登録済みソース | 31 |
公開済みトピック | 93 |
type | objects |
entity | 25 |
guide | 9 |
comparison | 2 |
faq | 1 |
glossary | 1 |
対象分野:評価とベンチマーク(GAIA、AgentBench、Inspect)、LLM-as-judgeとその失敗モード、Goodhartとベンチマーク汚染、フォールトインジェクションとカオステスト、承認ゲートと自律レベル、グラウンディングと忠実性。
答えることを目的とした質問
エージェントが記憶したベンチマークと、本物の評価を見分けるにはどうすればよいか?
LLMジャッジにとってキャリブレーションとは何を意味し、どのように測定されるのか?
フォールトインジェクションは実際にどのような失敗モードを検出するのか?
回答が実際にどのようなものか
ライブエンドポイントへの実際の呼び出し — 「ベンチマーク汚染から本物の評価を見分けるには」 という answer — は、以下の structuredContent を返します(一部省略):
{
"answered": true,
"entity": {
"id": "agent-reliability-glossary",
"name": "Agent reliability glossary",
"evidence_tier": "secondary",
"confidence": 0.85,
"last_verified": "2026-08-08",
"canonical_url": "https://agentreliability.dev/k/agent-reliability-glossary"
},
"claims": [
{
"text": "An eval is a structured, repeatable test that measures an LLM or LLM-based system against a defined dimension; frameworks package evals as registries of reusable templates.",
"sources": [{ "title": "openai/evals — framework for evaluating LLMs and LLM systems" }]
}
]
}回答に付随するものに注目してください:evidence tier(エビデンスの階層)、confidence(信頼度)、last verified(最終検証日)、そして主張の背後にあるソースです。これはエージェントが解析しなければならない散文ではなく、そのまま行動に使えるフィールドです。エージェントは弱い主張の使用を断ったり、一次ソースを直接引用したりできます。
コーパスが回答できない場合、answered は false になります。でっち上げはせず、未回答は記録されるため、ギャップを埋めることができます。
機械可読なサーフェス
MCPエンドポイントは複数のサーフェスの1つです。同じコーパスは、エージェントが直接読み取れるプレーンファイルとしても提供されます:
surface | what it is |
| |
コーパス全体を1つのファイルにまとめたもの | |
このインスタンスが公開するすべてのサーフェスとそのコンテンツタイプ | |
知識オブジェクトごとに1つのJSONドキュメント | |
ソース登録簿の全体 | |
このサーバーのマニフェスト |
各知識オブジェクトには、同じIDで人間向けページと機械向けページがあり、すべてのサーフェス間で一致する正規URLが付与されています。
統合前に知っておくべき挙動
POSTのみ。 それ以外のメソッドには、Allow: POST, OPTIONSヘッダー付きで405を返します。レート制限: クライアントごとに毎分120リクエスト。共有ストアでカウントされ、すべてのレスポンスで
RateLimit-Limit、RateLimit-Remaining、RateLimit-Resetとして公開されます(3つともCORS経由で公開)。フェイルオープンです:ストアに到達できない場合、リクエストは処理されます。不正な入力には、仕様に準拠したJSON-RPCエラーが返ります — 解析不能なボディには
-32700、未知のツールには-32602— HTMLエラーページが返ることは決してありません。リクエストボディには上限が設定され、転送前に検証されます。
プライバシー
アカウントもクッキーも広告もありません。利用状況は、毎日ローテーションされるハッシュ化識別子によって集計され、200日間保持されます。生のIPアドレスは決して保存されません。完全なポリシーは PRIVACY.md をご覧ください。
出典とライセンス
知識コンテンツは CC-BY-4.0 です:利用して、引用してください。ソース登録簿が公開されているのは、主張を信用するのではなく検証できるようにするためです — get_sources は、各主張が何に基づいているかを返します。
主張にはエビデンスの階層と last_verified の日付が含まれます。エビデンスが弱い場合、オブジェクトは切り上げるのではなく、その旨を明記します。
構築の仕組み
Citarium によってコンパイルおよび提供されています。Citariumは、単一のソースからナレッジグラフをウェブサイト、API、MCPサーバー、エージェントが読み取れるファイルに変換するオープンソースフレームワークです。外部評価を受け、ガーディアンと反証記録を公開した状態で開発されています。
このリポジトリはサーバーの公開窓口です:マニフェストとドキュメントを提供します。コーパス自体は agentreliability.dev にあります。
This server cannot be installed
Maintenance
Related MCP Servers
- AlicenseAqualityAmaintenanceTrust, identity, and reputation infrastructure for AI agents. Register agents with W3C DID (Ed25519), check EigenTrust reputation scores, submit peer attestations, search agents by capability, and verify IPFS-anchored audit trails. 11 tools.2014MIT
- AlicenseAqualityBmaintenanceSearch 1,500+ pre-verified, cited knowledge units across 16 domains. 6 tools: query, batch query, get unit, list domains, suggest topics, report issues. Free, no API key required.62371MIT

Openchainbenchofficial
AlicenseNot gradedqualityAmaintenanceLive, reproducible crypto infrastructure benchmarks for AI agents: RPC latency, bridge fees, L1 finality, gas oracle accuracy, stablecoin pegs. Three tools (list_benchmarks, get_benchmark,query_prom), no API key, CC-BY-4.0 data.5MIT- AlicenseNot gradedqualityCmaintenanceProvides AI agents with honest benchmark rankings (Agentic Memory Index and Agentic Search Index) for AI tools, plus graded checks and telemetry for x402 endpoints.MIT
Related MCP Connectors
Gateway between LLM agents and world data through eight tools and a bundled endpoint catalog.
Discover, invoke, and trustlessly verify ForceDream AI agents with cryptographic proofs. 17 tools.
Curated knowledge API for AI agents - skill packs, semantic search, validated patterns.
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/citarium/agentreliability-mcp'
If you have feedback or need assistance with the MCP directory API, please join our Discord server