Skip to main content
Glama
citarium

Agent Reliability MCP server

Agent Reliability — MCPサーバー

自律型AIエージェントのテスト、ベンチマーキング、監査 — 手法、ハーネス、エビデンス

厳選されたナレッジグラフ上のリモートMCPサーバーです。返されるすべての主張は登録済みソースに紐付けられています。ツールは、引用情報と信頼度の値を伴った主張を返すため、エージェントは断言するのではなく根拠を示せます。

インストールは不要です。ホスト型の streamable-HTTP エンドポイントとして提供されます:

https://agentreliability.dev/mcp

クライアントへの追加

Claude Code

claude mcp add --transport http agent-reliability https://agentreliability.dev/mcp

Claude Desktop / mcpServers を読み取る任意のクライアント

{
  "mcpServers": {
    "agent-reliability": {
      "type": "streamable-http",
      "url": "https://agentreliability.dev/mcp"
    }
  }
}

APIキー不要、アカウント不要、認証不要。読み取り専用です。

クライアントを一切使わずに、応答を確認する:

curl -s https://agentreliability.dev/mcp \
  -H 'Content-Type: application/json' \
  -H 'Accept: application/json, text/event-stream' \
  -H 'mcp-protocol-version: 2025-06-18' \
  -d '{"jsonrpc":"2.0","id":1,"method":"tools/list"}'

Related MCP server: knowledgelib-mcp

ツール

8つのツールがあり、それぞれがoutputSchemaを持ち、structuredContentを返します。

ツール

引数

機能

get_overview

コーパスの概要:このインスタンスが保持する知識、タイプ別の件数、公開済みタグ、鮮度。このコーパスが質問に答えられるかまだ分からないまま到着した場合は、ここから始めてください

search

query, limit?

ナレッジグラフ上の全文検索。アクセントとアポストロフィの違いを無視するため、ユーザーの言葉そのままで検索できます。各ヒットには関連性スコアと一致したフィールドが付属します。

answer

question

コーパスから質問に回答します。一致したオブジェクトの主張を、ソースと信頼度とともに返します — ソースなしの回答は決して返しません

get_entity

id

IDで1つの知識オブジェクトを取得し、その主張と各主張が引用するソースを返します。

get_topic

tag

タグを持つ知識オブジェクトの一覧を返します(トピックはコンテンツに裏付けられたタグです)。

get_related

id

オブジェクトのグラフ上の隣接ノード:発信・着信の関係を、それぞれの関係タイプとともに返します。

get_sources

object_id?

ソース登録簿の全体、または1つのオブジェクトが引用するソースだけを返します。コーパスを信頼する前に判断するために使ってください。

get_latest

limit?

最近検証された知識オブジェクト — 鮮度を示すシグナルです。

想定される利用経路は get_overviewsearch または answerget_entityget_related です。get_overview があるのは、到着したばかりのエージェントが、推測に1回の呼び出しを費やす前に、このコーパスが役立つかどうかを知る必要があるからです。

コーパスに含まれるもの

知識オブジェクト

38

登録済みソース

31

公開済みトピック

93

type

objects

entity

25

guide

9

comparison

2

faq

1

glossary

1

対象分野:評価とベンチマーク(GAIA、AgentBench、Inspect)、LLM-as-judgeとその失敗モード、Goodhartとベンチマーク汚染、フォールトインジェクションとカオステスト、承認ゲートと自律レベル、グラウンディングと忠実性。

答えることを目的とした質問

  • エージェントが記憶したベンチマークと、本物の評価を見分けるにはどうすればよいか?

  • LLMジャッジにとってキャリブレーションとは何を意味し、どのように測定されるのか?

  • フォールトインジェクションは実際にどのような失敗モードを検出するのか?

回答が実際にどのようなものか

ライブエンドポイントへの実際の呼び出し — 「ベンチマーク汚染から本物の評価を見分けるには」 という answer — は、以下の structuredContent を返します(一部省略):

{
  "answered": true,
  "entity": {
    "id": "agent-reliability-glossary",
    "name": "Agent reliability glossary",
    "evidence_tier": "secondary",
    "confidence": 0.85,
    "last_verified": "2026-08-08",
    "canonical_url": "https://agentreliability.dev/k/agent-reliability-glossary"
  },
  "claims": [
    {
      "text": "An eval is a structured, repeatable test that measures an LLM or LLM-based system against a defined dimension; frameworks package evals as registries of reusable templates.",
      "sources": [{ "title": "openai/evals — framework for evaluating LLMs and LLM systems" }]
    }
  ]
}

回答に付随するものに注目してください:evidence tier(エビデンスの階層)、confidence(信頼度)、last verified(最終検証日)、そして主張の背後にあるソースです。これはエージェントが解析しなければならない散文ではなく、そのまま行動に使えるフィールドです。エージェントは弱い主張の使用を断ったり、一次ソースを直接引用したりできます。

コーパスが回答できない場合、answeredfalse になります。でっち上げはせず、未回答は記録されるため、ギャップを埋めることができます。

機械可読なサーフェス

MCPエンドポイントは複数のサーフェスの1つです。同じコーパスは、エージェントが直接読み取れるプレーンファイルとしても提供されます:

surface

what it is

/llms.txt

text/plain 形式のインデックス

/llms-full.txt

コーパス全体を1つのファイルにまとめたもの

/ai-index.json

このインスタンスが公開するすべてのサーフェスとそのコンテンツタイプ

/api/index.json

知識オブジェクトごとに1つのJSONドキュメント

/api/sources.json

ソース登録簿の全体

/.well-known/mcp/server.json

このサーバーのマニフェスト

各知識オブジェクトには、同じIDで人間向けページと機械向けページがあり、すべてのサーフェス間で一致する正規URLが付与されています。

統合前に知っておくべき挙動

  • POST のみ。 それ以外のメソッドには、Allow: POST, OPTIONS ヘッダー付きで 405 を返します。

  • レート制限: クライアントごとに毎分120リクエスト。共有ストアでカウントされ、すべてのレスポンスで RateLimit-LimitRateLimit-RemainingRateLimit-Reset として公開されます(3つともCORS経由で公開)。フェイルオープンです:ストアに到達できない場合、リクエストは処理されます。

  • 不正な入力には、仕様に準拠したJSON-RPCエラーが返ります — 解析不能なボディには -32700、未知のツールには -32602 — HTMLエラーページが返ることは決してありません。

  • リクエストボディには上限が設定され、転送前に検証されます。

プライバシー

アカウントもクッキーも広告もありません。利用状況は、毎日ローテーションされるハッシュ化識別子によって集計され、200日間保持されます。生のIPアドレスは決して保存されません。完全なポリシーは PRIVACY.md をご覧ください。

出典とライセンス

知識コンテンツは CC-BY-4.0 です:利用して、引用してください。ソース登録簿が公開されているのは、主張を信用するのではなく検証できるようにするためです — get_sources は、各主張が何に基づいているかを返します。

主張にはエビデンスの階層と last_verified の日付が含まれます。エビデンスが弱い場合、オブジェクトは切り上げるのではなく、その旨を明記します。

構築の仕組み

Citarium によってコンパイルおよび提供されています。Citariumは、単一のソースからナレッジグラフをウェブサイト、API、MCPサーバー、エージェントが読み取れるファイルに変換するオープンソースフレームワークです。外部評価を受け、ガーディアンと反証記録を公開した状態で開発されています。

このリポジトリはサーバーの公開窓口です:マニフェストとドキュメントを提供します。コーパス自体は agentreliability.dev にあります。

A
license - permissive license
Not graded
quality - not tested
C
maintenance

Maintenance

Maintainers
Response time
Release cycle
Releases (12mo)
Commit activity

Related MCP Servers

  • A
    license
    A
    quality
    B
    maintenance
    Search 1,500+ pre-verified, cited knowledge units across 16 domains. 6 tools: query, batch query, get unit, list domains, suggest topics, report issues. Free, no API key required.
    6
    237
    1
    MIT
  • A
    license
    Not graded
    quality
    A
    maintenance
    Live, reproducible crypto infrastructure benchmarks for AI agents: RPC latency, bridge fees, L1 finality, gas oracle accuracy, stablecoin pegs. Three tools (list_benchmarks, get_benchmark,query_prom), no API key, CC-BY-4.0 data.
    5
    MIT

View all related MCP servers

Related MCP Connectors

  • Gateway between LLM agents and world data through eight tools and a bundled endpoint catalog.

  • Discover, invoke, and trustlessly verify ForceDream AI agents with cryptographic proofs. 17 tools.

  • Curated knowledge API for AI agents - skill packs, semantic search, validated patterns.

View all MCP Connectors

Latest Blog Posts

MCP directory API

We provide all the information about MCP servers via our MCP API.

curl -X GET 'https://glama.ai/api/mcp/v1/servers/citarium/agentreliability-mcp'

If you have feedback or need assistance with the MCP directory API, please join our Discord server