Skip to main content
Glama
citarium

Agent Reliability MCP server

Agent Reliability — MCP server

Testen, Benchmarking und Prüfung autonomer KI-Agenten — Methoden, Testumgebungen, Evidenz.

Ein Remote-MCP-Server, der auf einem kuratierten Wissensgraphen basiert. Jede Aussage, die er zurückgibt, ist an eine registrierte Quelle gebunden: Die Tools liefern Aussagen mit ihren Quellenangaben und einem Konfidenzwert zurück, sodass ein Agent seine Arbeit zeigen kann, statt zu behaupten.

Nichts zu installieren. Es ist ein gehosteter Streamable-HTTP-Endpunkt:

https://agentreliability.dev/mcp

In einen Client einbinden

Claude Code

claude mcp add --transport http agent-reliability https://agentreliability.dev/mcp

Claude Desktop / jeder Client, der mcpServers liest

{
  "mcpServers": {
    "agent-reliability": {
      "type": "streamable-http",
      "url": "https://agentreliability.dev/mcp"
    }
  }
}

Kein API-Schlüssel, kein Konto, keine Authentifizierung. Nur lesend.

Prüfen Sie, ob es antwortet, ganz ohne Client:

curl -s https://agentreliability.dev/mcp \
  -H 'Content-Type: application/json' \
  -H 'Accept: application/json, text/event-stream' \
  -H 'mcp-protocol-version: 2025-06-18' \
  -d '{"jsonrpc":"2.0","id":1,"method":"tools/list"}'

Related MCP server: knowledgelib-mcp

Tools

Acht, jedes mit einem outputSchema, jedes gibt structuredContent zurück.

Tool

Argumente

Beschreibung

get_overview

Korpusübersicht: was diese Instanz weiß, Anzahl nach Typ, veröffentlichte Tags, Aktualität. Hier beginnen, wenn Sie ankommen und noch nicht wissen, ob dieser Korpus Ihre Frage beantworten kann.

search

query, limit?

Volltextsuche über den Wissensgraphen. Akzent- und Apostroph-unempfindlich, sodass in den eigenen Worten des Nutzers gesucht werden kann; jeder Treffer enthält seinen Relevanzwert und die Felder, die er gematcht hat.

answer

question

Beantwortet eine Frage auf Basis des Korpus. Liefert die Aussagen des gefundenen Objekts mit Quellen und Konfidenz — niemals eine unbelegte Antwort.

get_entity

id

Ruft ein Wissensobjekt per ID ab, mit seinen Aussagen und den Quellen, die jede Aussage zitiert.

get_topic

tag

Listet die Wissensobjekte, die ein Tag tragen (Themen sind inhaltsgestützte Tags).

get_related

id

Graph-Nachbarn eines Objekts: ausgehende und eingehende Beziehungen, jeweils mit ihrem Beziehungstyp.

get_sources

object_id?

Das gesamte Quellenregister oder nur die Quellen, die ein Objekt zitiert. Nutzen Sie es, um den Korpus zu beurteilen, bevor Sie ihm vertrauen.

get_latest

limit?

Zuletzt verifizierte Wissensobjekte — ein Aktualitätssignal.

Der vorgesehene Pfad ist get_overviewsearch oder answerget_entityget_related. get_overview gibt es, weil ein Agent, der gerade angekommen ist, wissen muss, ob dieser Korpus helfen kann, bevor er einen Aufruf mit Raten verschwendet.

Was der Korpus enthält

Wissensobjekte

38

registrierte Quellen

31

veröffentlichte Themen

93

Typ

Objekte

Entität

25

Leitfaden

9

Vergleich

2

FAQ

1

Glossar

1

Themen: Evals und Benchmarks (GAIA, AgentBench, Inspect), LLM-as-judge und seine Fehlermodi, Goodhart und Benchmark-Kontamination, Fehlerinjektion und Chaos-Tests, Freigabestufen und Autonomiegrade, Grounding und Faithfulness.

Fragen, die es beantworten soll

  • Wie unterscheide ich ein echtes Eval von einem Benchmark, den mein Agent auswendig gelernt hat?

  • Was bedeutet Kalibrierung für einen LLM-Judge, und wie wird sie gemessen?

  • Welche Fehlermodi deckt Fehlerinjektion tatsächlich auf?

Wie eine Antwort tatsächlich aussieht

Ein echter Aufruf gegen den Live-Endpunkt — answer mit „Wie unterscheide ich ein echtes Eval von Benchmark-Kontamination?“ — gibt dieses structuredContent gekürzt zurück:

{
  "answered": true,
  "entity": {
    "id": "agent-reliability-glossary",
    "name": "Agent reliability glossary",
    "evidence_tier": "secondary",
    "confidence": 0.85,
    "last_verified": "2026-08-08",
    "canonical_url": "https://agentreliability.dev/k/agent-reliability-glossary"
  },
  "claims": [
    {
      "text": "An eval is a structured, repeatable test that measures an LLM or LLM-based system against a defined dimension; frameworks package evals as registries of reusable templates.",
      "sources": [{ "title": "openai/evals — framework for evaluating LLMs and LLM systems" }]
    }
  ]
}

Beachten Sie, was mit der Antwort mitgeliefert wird: die Evidenzstufe, eine Konfidenz, das Datum der letzten Verifizierung und die Quelle hinter der Aussage — nicht als Prosa, die ein Agent parsen muss, sondern als Felder, mit denen er arbeiten kann. Ein Agent kann eine schwache Aussage ablehnen oder die Primärquelle direkt zitieren.

Wenn der Korpus nicht antworten kann, ist answered false. Er improvisiert nicht, und der Fehlversuch wird aufgezeichnet, damit die Lücke geschlossen werden kann.

Maschinenlesbare Oberflächen

Der MCP-Endpunkt ist einer von mehreren. Derselbe Korpus wird als einfache Dateien bereitgestellt, die ein Agent direkt lesen kann:

Oberfläche

Beschreibung

/llms.txt

der Index als text/plain

/llms-full.txt

der gesamte Korpus in einer Datei

/ai-index.json

jede Oberfläche, die diese Instanz veröffentlicht, mit ihrem Inhaltstyp

/api/index.json

ein JSON-Dokument pro Wissensobjekt

/api/sources.json

das Quellenregister vollständig

/.well-known/mcp/server.json

das Manifest dieses Servers

Jedes Wissensobjekt hat eine Seite für Menschen und ein maschinenlesbares Gegenstück unter derselben ID, mit einer kanonischen URL, die über alle hinweg übereinstimmt.

Verhalten, das Sie vor der Integration kennen sollten

  • Nur POST. Jede andere Methode antwortet mit 405 und einem Allow: POST, OPTIONS-Header.

  • Rate-Limit: 120 Anfragen pro Minute und Client, gezählt in einem gemeinsamen Speicher, auf jeder Antwort als RateLimit-Limit, RateLimit-Remaining und RateLimit-Reset veröffentlicht (alle drei über CORS zugänglich). Im Fehlerfall verhält es sich offen: Ist der Speicher nicht erreichbar, wird die Anfrage bedient.

  • Fehlerhafter Input erhält einen spezifikationskonformen JSON-RPC-Fehler — -32700 für nicht parsebare Bodies, -32602 für ein unbekanntes Tool — niemals eine HTML-Fehlerseite.

  • Anfrage-Bodies sind begrenzt und werden vor der Übertragung validiert.

Datenschutz

Keine Konten, keine Cookies, keine Werbung. Die Nutzung wird aggregiert gemessen, mit täglich rotierenden gehashten Identifikatoren und einer Aufbewahrungsfrist von 200 Tagen; rohe IP-Adressen werden nie gespeichert. Vollständige Richtlinie: PRIVACY.md.

Herkunft und Lizenz

Wissensinhalte sind CC-BY-4.0: nutzen Sie sie, zitieren Sie sie. Das Quellenregister ist genau deshalb öffentlich, damit eine Aussage geprüft statt geglaubt werden kann — get_sources liefert, worauf eine bestimmte Aussage beruht.

Aussagen tragen eine Evidenzstufe und ein last_verified-Datum. Wo die Evidenz schwächer ist, sagt das Objekt das, statt zu beschönigen.

Wie es aufgebaut ist

Kompiliert und bereitgestellt von Citarium, einem Open-Source-Framework, das einen Wissensgraphen als einzige Quelle nimmt und in eine Website, eine API, einen MCP-Server und agentenlesbare Dateien verwandelt — unter externer Evaluierung, bei der die Verantwortlichen und das Falsifikationsprotokoll offen einsehbar sind.

Dieses Repository ist das öffentliche Gesicht des Servers: sein Manifest und seine Dokumentation. Der Korpus selbst liegt unter agentreliability.dev.

A
license - permissive license
Not graded
quality - not tested
C
maintenance

Maintenance

Maintainers
Response time
Release cycle
Releases (12mo)
Commit activity

Related MCP Servers

  • A
    license
    A
    quality
    B
    maintenance
    Search 1,500+ pre-verified, cited knowledge units across 16 domains. 6 tools: query, batch query, get unit, list domains, suggest topics, report issues. Free, no API key required.
    6
    237
    1
    MIT
  • A
    license
    Not graded
    quality
    A
    maintenance
    Live, reproducible crypto infrastructure benchmarks for AI agents: RPC latency, bridge fees, L1 finality, gas oracle accuracy, stablecoin pegs. Three tools (list_benchmarks, get_benchmark,query_prom), no API key, CC-BY-4.0 data.
    5
    MIT

View all related MCP servers

Related MCP Connectors

  • Gateway between LLM agents and world data through eight tools and a bundled endpoint catalog.

  • Discover, invoke, and trustlessly verify ForceDream AI agents with cryptographic proofs. 17 tools.

  • Curated knowledge API for AI agents - skill packs, semantic search, validated patterns.

View all MCP Connectors

Latest Blog Posts

MCP directory API

We provide all the information about MCP servers via our MCP API.

curl -X GET 'https://glama.ai/api/mcp/v1/servers/citarium/agentreliability-mcp'

If you have feedback or need assistance with the MCP directory API, please join our Discord server