Agent Reliability MCP server
Agent Reliability — MCP server
Testen, Benchmarking und Prüfung autonomer KI-Agenten — Methoden, Testumgebungen, Evidenz.
Ein Remote-MCP-Server, der auf einem kuratierten Wissensgraphen basiert. Jede Aussage, die er zurückgibt, ist an eine registrierte Quelle gebunden: Die Tools liefern Aussagen mit ihren Quellenangaben und einem Konfidenzwert zurück, sodass ein Agent seine Arbeit zeigen kann, statt zu behaupten.
Nichts zu installieren. Es ist ein gehosteter Streamable-HTTP-Endpunkt:
https://agentreliability.dev/mcpIn einen Client einbinden
Claude Code
claude mcp add --transport http agent-reliability https://agentreliability.dev/mcpClaude Desktop / jeder Client, der mcpServers liest
{
"mcpServers": {
"agent-reliability": {
"type": "streamable-http",
"url": "https://agentreliability.dev/mcp"
}
}
}Kein API-Schlüssel, kein Konto, keine Authentifizierung. Nur lesend.
Prüfen Sie, ob es antwortet, ganz ohne Client:
curl -s https://agentreliability.dev/mcp \
-H 'Content-Type: application/json' \
-H 'Accept: application/json, text/event-stream' \
-H 'mcp-protocol-version: 2025-06-18' \
-d '{"jsonrpc":"2.0","id":1,"method":"tools/list"}'Related MCP server: knowledgelib-mcp
Tools
Acht, jedes mit einem outputSchema, jedes gibt structuredContent zurück.
Tool | Argumente | Beschreibung |
| — | Korpusübersicht: was diese Instanz weiß, Anzahl nach Typ, veröffentlichte Tags, Aktualität. Hier beginnen, wenn Sie ankommen und noch nicht wissen, ob dieser Korpus Ihre Frage beantworten kann. |
|
| Volltextsuche über den Wissensgraphen. Akzent- und Apostroph-unempfindlich, sodass in den eigenen Worten des Nutzers gesucht werden kann; jeder Treffer enthält seinen Relevanzwert und die Felder, die er gematcht hat. |
|
| Beantwortet eine Frage auf Basis des Korpus. Liefert die Aussagen des gefundenen Objekts mit Quellen und Konfidenz — niemals eine unbelegte Antwort. |
|
| Ruft ein Wissensobjekt per ID ab, mit seinen Aussagen und den Quellen, die jede Aussage zitiert. |
|
| Listet die Wissensobjekte, die ein Tag tragen (Themen sind inhaltsgestützte Tags). |
|
| Graph-Nachbarn eines Objekts: ausgehende und eingehende Beziehungen, jeweils mit ihrem Beziehungstyp. |
|
| Das gesamte Quellenregister oder nur die Quellen, die ein Objekt zitiert. Nutzen Sie es, um den Korpus zu beurteilen, bevor Sie ihm vertrauen. |
|
| Zuletzt verifizierte Wissensobjekte — ein Aktualitätssignal. |
Der vorgesehene Pfad ist get_overview → search oder answer → get_entity
→ get_related. get_overview gibt es, weil ein Agent, der gerade angekommen ist, wissen muss, ob dieser Korpus helfen kann, bevor er einen Aufruf mit Raten verschwendet.
Was der Korpus enthält
Wissensobjekte | 38 |
registrierte Quellen | 31 |
veröffentlichte Themen | 93 |
Typ | Objekte |
Entität | 25 |
Leitfaden | 9 |
Vergleich | 2 |
FAQ | 1 |
Glossar | 1 |
Themen: Evals und Benchmarks (GAIA, AgentBench, Inspect), LLM-as-judge und seine Fehlermodi, Goodhart und Benchmark-Kontamination, Fehlerinjektion und Chaos-Tests, Freigabestufen und Autonomiegrade, Grounding und Faithfulness.
Fragen, die es beantworten soll
Wie unterscheide ich ein echtes Eval von einem Benchmark, den mein Agent auswendig gelernt hat?
Was bedeutet Kalibrierung für einen LLM-Judge, und wie wird sie gemessen?
Welche Fehlermodi deckt Fehlerinjektion tatsächlich auf?
Wie eine Antwort tatsächlich aussieht
Ein echter Aufruf gegen den Live-Endpunkt — answer mit „Wie unterscheide ich ein echtes Eval von Benchmark-Kontamination?“ — gibt dieses structuredContent gekürzt zurück:
{
"answered": true,
"entity": {
"id": "agent-reliability-glossary",
"name": "Agent reliability glossary",
"evidence_tier": "secondary",
"confidence": 0.85,
"last_verified": "2026-08-08",
"canonical_url": "https://agentreliability.dev/k/agent-reliability-glossary"
},
"claims": [
{
"text": "An eval is a structured, repeatable test that measures an LLM or LLM-based system against a defined dimension; frameworks package evals as registries of reusable templates.",
"sources": [{ "title": "openai/evals — framework for evaluating LLMs and LLM systems" }]
}
]
}Beachten Sie, was mit der Antwort mitgeliefert wird: die Evidenzstufe, eine Konfidenz, das Datum der letzten Verifizierung und die Quelle hinter der Aussage — nicht als Prosa, die ein Agent parsen muss, sondern als Felder, mit denen er arbeiten kann. Ein Agent kann eine schwache Aussage ablehnen oder die Primärquelle direkt zitieren.
Wenn der Korpus nicht antworten kann, ist answered false. Er improvisiert nicht, und der Fehlversuch wird aufgezeichnet, damit die Lücke geschlossen werden kann.
Maschinenlesbare Oberflächen
Der MCP-Endpunkt ist einer von mehreren. Derselbe Korpus wird als einfache Dateien bereitgestellt, die ein Agent direkt lesen kann:
Oberfläche | Beschreibung |
der Index als | |
der gesamte Korpus in einer Datei | |
jede Oberfläche, die diese Instanz veröffentlicht, mit ihrem Inhaltstyp | |
ein JSON-Dokument pro Wissensobjekt | |
das Quellenregister vollständig | |
das Manifest dieses Servers |
Jedes Wissensobjekt hat eine Seite für Menschen und ein maschinenlesbares Gegenstück unter derselben ID, mit einer kanonischen URL, die über alle hinweg übereinstimmt.
Verhalten, das Sie vor der Integration kennen sollten
Nur
POST. Jede andere Methode antwortet mit405und einemAllow: POST, OPTIONS-Header.Rate-Limit: 120 Anfragen pro Minute und Client, gezählt in einem gemeinsamen Speicher, auf jeder Antwort als
RateLimit-Limit,RateLimit-RemainingundRateLimit-Resetveröffentlicht (alle drei über CORS zugänglich). Im Fehlerfall verhält es sich offen: Ist der Speicher nicht erreichbar, wird die Anfrage bedient.Fehlerhafter Input erhält einen spezifikationskonformen JSON-RPC-Fehler —
-32700für nicht parsebare Bodies,-32602für ein unbekanntes Tool — niemals eine HTML-Fehlerseite.Anfrage-Bodies sind begrenzt und werden vor der Übertragung validiert.
Datenschutz
Keine Konten, keine Cookies, keine Werbung. Die Nutzung wird aggregiert gemessen, mit täglich rotierenden gehashten Identifikatoren und einer Aufbewahrungsfrist von 200 Tagen; rohe IP-Adressen werden nie gespeichert. Vollständige Richtlinie: PRIVACY.md.
Herkunft und Lizenz
Wissensinhalte sind CC-BY-4.0: nutzen Sie sie, zitieren Sie sie. Das Quellenregister ist genau deshalb öffentlich, damit eine Aussage geprüft statt geglaubt werden kann — get_sources liefert, worauf eine bestimmte Aussage beruht.
Aussagen tragen eine Evidenzstufe und ein last_verified-Datum. Wo die Evidenz schwächer ist, sagt das Objekt das, statt zu beschönigen.
Wie es aufgebaut ist
Kompiliert und bereitgestellt von Citarium, einem Open-Source-Framework, das einen Wissensgraphen als einzige Quelle nimmt und in eine Website, eine API, einen MCP-Server und agentenlesbare Dateien verwandelt — unter externer Evaluierung, bei der die Verantwortlichen und das Falsifikationsprotokoll offen einsehbar sind.
Dieses Repository ist das öffentliche Gesicht des Servers: sein Manifest und seine Dokumentation. Der Korpus selbst liegt unter agentreliability.dev.
This server cannot be installed
Maintenance
Related MCP Servers
- AlicenseAqualityAmaintenanceTrust, identity, and reputation infrastructure for AI agents. Register agents with W3C DID (Ed25519), check EigenTrust reputation scores, submit peer attestations, search agents by capability, and verify IPFS-anchored audit trails. 11 tools.2014MIT
- AlicenseAqualityBmaintenanceSearch 1,500+ pre-verified, cited knowledge units across 16 domains. 6 tools: query, batch query, get unit, list domains, suggest topics, report issues. Free, no API key required.62371MIT

Openchainbenchofficial
AlicenseNot gradedqualityAmaintenanceLive, reproducible crypto infrastructure benchmarks for AI agents: RPC latency, bridge fees, L1 finality, gas oracle accuracy, stablecoin pegs. Three tools (list_benchmarks, get_benchmark,query_prom), no API key, CC-BY-4.0 data.5MIT- AlicenseNot gradedqualityCmaintenanceProvides AI agents with honest benchmark rankings (Agentic Memory Index and Agentic Search Index) for AI tools, plus graded checks and telemetry for x402 endpoints.MIT
Related MCP Connectors
Gateway between LLM agents and world data through eight tools and a bundled endpoint catalog.
Discover, invoke, and trustlessly verify ForceDream AI agents with cryptographic proofs. 17 tools.
Curated knowledge API for AI agents - skill packs, semantic search, validated patterns.
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/citarium/agentreliability-mcp'
If you have feedback or need assistance with the MCP directory API, please join our Discord server