Agent Reliability MCP server
Agent Reliability — servidor MCP
Pruebas, evaluación comparativa y auditoría de agentes de IA autónomos — métodos, entornos de prueba, evidencia
Un servidor MCP remoto sobre un grafo de conocimiento curado. Cada afirmación que devuelve está vinculada a una fuente registrada: las herramientas entregan afirmaciones con sus citas y un valor de confianza, para que un agente pueda mostrar su trabajo en lugar de afirmar sin más.
Nada que instalar. Es un endpoint streamable-HTTP alojado:
https://agentreliability.dev/mcpAñádelo a un cliente
Claude Code
claude mcp add --transport http agent-reliability https://agentreliability.dev/mcpClaude Desktop / cualquier cliente que lea mcpServers
{
"mcpServers": {
"agent-reliability": {
"type": "streamable-http",
"url": "https://agentreliability.dev/mcp"
}
}
}Sin clave de API, sin cuenta, sin autenticación. Solo lectura.
Comprueba que responde, sin ningún cliente en absoluto:
curl -s https://agentreliability.dev/mcp \
-H 'Content-Type: application/json' \
-H 'Accept: application/json, text/event-stream' \
-H 'mcp-protocol-version: 2025-06-18' \
-d '{"jsonrpc":"2.0","id":1,"method":"tools/list"}'Related MCP server: knowledgelib-mcp
Herramientas
Ocho, cada una con un outputSchema, todas devuelven structuredContent.
herramienta | argumentos | qué hace |
| — | Resumen del corpus: qué sabe esta instancia, recuentos por tipo, etiquetas publicadas, frescura. Empieza aquí cuando llegues y aún no sepas si este corpus puede responder a tu pregunta. |
|
| Búsqueda de texto completo sobre el grafo de conocimiento. Insensible a acentos y apóstrofos, de modo que se puede consultar con las propias palabras del usuario; cada resultado incluye su puntuación de relevancia y los campos en los que coincidió. |
|
| Responde a una pregunta a partir del corpus. Devuelve las afirmaciones del objeto coincidente con sus fuentes y su confianza: nunca una respuesta sin fuente. |
|
| Recupera un objeto de conocimiento por su id, con sus afirmaciones y las fuentes que cita cada afirmación. |
|
| Lista los objetos de conocimiento que llevan una etiqueta (los temas son etiquetas respaldadas por contenido). |
|
| Vecinos en el grafo de un objeto: relaciones salientes y entrantes, cada una con su tipo de relación. |
|
| El registro completo de fuentes, o solo las fuentes citadas por un objeto. Úsalo para evaluar el corpus antes de confiar en él. |
|
| Objetos de conocimiento verificados más recientemente: una señal de frescura. |
El flujo previsto es get_overview → search o answer → get_entity → get_related. get_overview existe porque un agente que acaba de llegar necesita saber si este corpus puede ayudar antes de gastar una llamada adivinando.
Qué contiene el corpus
objetos de conocimiento | 38 |
fuentes registradas | 31 |
temas publicados | 93 |
tipo | objetos |
entidad | 25 |
guía | 9 |
comparativa | 2 |
FAQ | 1 |
glosario | 1 |
Temática: evaluaciones y benchmarks (GAIA, AgentBench, Inspect), LLM como juez y sus modos de fallo, Goodhart y contaminación de benchmarks, inyección de fallos y pruebas de caos, compuertas de aprobación y niveles de autonomía, anclaje y fidelidad.
Preguntas para las que está diseñado
¿Cómo distingo una evaluación real de un benchmark que mi agente ha memorizado?
¿Qué significa la calibración para un juez LLM y cómo se mide?
¿Qué modos de fallo detecta realmente la inyección de fallos?
Qué aspecto tiene una respuesta real
Una llamada real al endpoint en vivo — answer con "how do I tell a real eval from benchmark contamination" — devuelve este structuredContent, recortado:
{
"answered": true,
"entity": {
"id": "agent-reliability-glossary",
"name": "Agent reliability glossary",
"evidence_tier": "secondary",
"confidence": 0.85,
"last_verified": "2026-08-08",
"canonical_url": "https://agentreliability.dev/k/agent-reliability-glossary"
},
"claims": [
{
"text": "An eval is a structured, repeatable test that measures an LLM or LLM-based system against a defined dimension; frameworks package evals as registries of reusable templates.",
"sources": [{ "title": "openai/evals — framework for evaluating LLMs and LLM systems" }]
}
]
}Observa lo que viaja con la respuesta: el nivel de evidencia, una confianza, la fecha de última verificación y la fuente detrás de la afirmación — no como prosa que el agente tenga que interpretar, sino como campos sobre los que puede actuar. Un agente puede rechazar una afirmación débil o citar directamente la fuente primaria.
Cuando el corpus no puede responder, answered es false. No improvisa, y el fallo queda registrado para poder cubrir la laguna.
Superficies legibles por máquina
El endpoint MCP es uno de varios. El mismo corpus se sirve como archivos de texto plano que un agente puede leer directamente:
superficie | qué es |
el índice, como | |
todo el corpus en un solo archivo | |
cada superficie que publica esta instancia, con su tipo de contenido | |
un documento JSON por objeto de conocimiento | |
el registro de fuentes completo | |
el manifiesto de este servidor |
Cada objeto de conocimiento tiene una página para humanos y una gemela para máquinas en el mismo id, con una URL canónica que coincide en todas ellas.
Comportamiento que conviene conocer antes de integrarlo
Solo
POST. Cualquier otro método responde405con una cabeceraAllow: POST, OPTIONS.Límite de peticiones: 120 peticiones por minuto por cliente, contabilizadas en un almacén compartido, publicadas en cada respuesta como
RateLimit-Limit,RateLimit-RemainingyRateLimit-Reset(las tres expuestas vía CORS). Falla en modo abierto: si el almacén no está disponible, la petición se sirve.Entrada malformada recibe un error JSON-RPC correcto según la especificación:
-32700para cuerpos no parseables,-32602para una herramienta desconocida — nunca una página de error HTML.Los cuerpos de las peticiones tienen un límite y se validan antes del transporte.
Privacidad
Sin cuentas, sin cookies, sin anuncios. El uso se mide de forma agregada con identificadores hash que rotan a diario y una retención de 200 días; las IP brutas nunca se almacenan. Política completa: PRIVACY.md.
Procedencia y licencia
El contenido de conocimiento es CC-BY-4.0: úsalo, cítalo. El registro de fuentes es público precisamente para que una afirmación pueda comprobarse en lugar de confiar en ella: get_sources devuelve aquello en lo que se sustenta cualquier afirmación dada.
Las afirmaciones llevan un nivel de evidencia y una fecha last_verified. Cuando la evidencia es más débil, el objeto lo dice en lugar de redondear al alza.
Cómo está construido
Compilado y servido por Citarium, un framework de código abierto para convertir un grafo de conocimiento en un sitio web, una API, un servidor MCP y archivos legibles por agentes desde una única fuente — bajo evaluación externa, con los guardianes y el registro de falsación a la vista.
Este repositorio es la cara pública del servidor: su manifiesto y su documentación. El corpus en sí se encuentra en agentreliability.dev.
This server cannot be installed
Maintenance
Related MCP Servers
- AlicenseAqualityAmaintenanceTrust, identity, and reputation infrastructure for AI agents. Register agents with W3C DID (Ed25519), check EigenTrust reputation scores, submit peer attestations, search agents by capability, and verify IPFS-anchored audit trails. 11 tools.2014MIT
- AlicenseAqualityBmaintenanceSearch 1,500+ pre-verified, cited knowledge units across 16 domains. 6 tools: query, batch query, get unit, list domains, suggest topics, report issues. Free, no API key required.62371MIT

Openchainbenchofficial
AlicenseNot gradedqualityAmaintenanceLive, reproducible crypto infrastructure benchmarks for AI agents: RPC latency, bridge fees, L1 finality, gas oracle accuracy, stablecoin pegs. Three tools (list_benchmarks, get_benchmark,query_prom), no API key, CC-BY-4.0 data.5MIT- AlicenseNot gradedqualityCmaintenanceProvides AI agents with honest benchmark rankings (Agentic Memory Index and Agentic Search Index) for AI tools, plus graded checks and telemetry for x402 endpoints.MIT
Related MCP Connectors
Gateway between LLM agents and world data through eight tools and a bundled endpoint catalog.
Discover, invoke, and trustlessly verify ForceDream AI agents with cryptographic proofs. 17 tools.
Curated knowledge API for AI agents - skill packs, semantic search, validated patterns.
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/citarium/agentreliability-mcp'
If you have feedback or need assistance with the MCP directory API, please join our Discord server