Skip to main content
Glama
citarium

Agent Reliability MCP server

Agent Reliability — servidor MCP

Pruebas, evaluación comparativa y auditoría de agentes de IA autónomos — métodos, entornos de prueba, evidencia

Un servidor MCP remoto sobre un grafo de conocimiento curado. Cada afirmación que devuelve está vinculada a una fuente registrada: las herramientas entregan afirmaciones con sus citas y un valor de confianza, para que un agente pueda mostrar su trabajo en lugar de afirmar sin más.

Nada que instalar. Es un endpoint streamable-HTTP alojado:

https://agentreliability.dev/mcp

Añádelo a un cliente

Claude Code

claude mcp add --transport http agent-reliability https://agentreliability.dev/mcp

Claude Desktop / cualquier cliente que lea mcpServers

{
  "mcpServers": {
    "agent-reliability": {
      "type": "streamable-http",
      "url": "https://agentreliability.dev/mcp"
    }
  }
}

Sin clave de API, sin cuenta, sin autenticación. Solo lectura.

Comprueba que responde, sin ningún cliente en absoluto:

curl -s https://agentreliability.dev/mcp \
  -H 'Content-Type: application/json' \
  -H 'Accept: application/json, text/event-stream' \
  -H 'mcp-protocol-version: 2025-06-18' \
  -d '{"jsonrpc":"2.0","id":1,"method":"tools/list"}'

Related MCP server: knowledgelib-mcp

Herramientas

Ocho, cada una con un outputSchema, todas devuelven structuredContent.

herramienta

argumentos

qué hace

get_overview

Resumen del corpus: qué sabe esta instancia, recuentos por tipo, etiquetas publicadas, frescura. Empieza aquí cuando llegues y aún no sepas si este corpus puede responder a tu pregunta.

search

query, limit?

Búsqueda de texto completo sobre el grafo de conocimiento. Insensible a acentos y apóstrofos, de modo que se puede consultar con las propias palabras del usuario; cada resultado incluye su puntuación de relevancia y los campos en los que coincidió.

answer

question

Responde a una pregunta a partir del corpus. Devuelve las afirmaciones del objeto coincidente con sus fuentes y su confianza: nunca una respuesta sin fuente.

get_entity

id

Recupera un objeto de conocimiento por su id, con sus afirmaciones y las fuentes que cita cada afirmación.

get_topic

tag

Lista los objetos de conocimiento que llevan una etiqueta (los temas son etiquetas respaldadas por contenido).

get_related

id

Vecinos en el grafo de un objeto: relaciones salientes y entrantes, cada una con su tipo de relación.

get_sources

object_id?

El registro completo de fuentes, o solo las fuentes citadas por un objeto. Úsalo para evaluar el corpus antes de confiar en él.

get_latest

limit?

Objetos de conocimiento verificados más recientemente: una señal de frescura.

El flujo previsto es get_overviewsearch o answerget_entityget_related. get_overview existe porque un agente que acaba de llegar necesita saber si este corpus puede ayudar antes de gastar una llamada adivinando.

Qué contiene el corpus

objetos de conocimiento

38

fuentes registradas

31

temas publicados

93

tipo

objetos

entidad

25

guía

9

comparativa

2

FAQ

1

glosario

1

Temática: evaluaciones y benchmarks (GAIA, AgentBench, Inspect), LLM como juez y sus modos de fallo, Goodhart y contaminación de benchmarks, inyección de fallos y pruebas de caos, compuertas de aprobación y niveles de autonomía, anclaje y fidelidad.

Preguntas para las que está diseñado

  • ¿Cómo distingo una evaluación real de un benchmark que mi agente ha memorizado?

  • ¿Qué significa la calibración para un juez LLM y cómo se mide?

  • ¿Qué modos de fallo detecta realmente la inyección de fallos?

Qué aspecto tiene una respuesta real

Una llamada real al endpoint en vivo — answer con "how do I tell a real eval from benchmark contamination" — devuelve este structuredContent, recortado:

{
  "answered": true,
  "entity": {
    "id": "agent-reliability-glossary",
    "name": "Agent reliability glossary",
    "evidence_tier": "secondary",
    "confidence": 0.85,
    "last_verified": "2026-08-08",
    "canonical_url": "https://agentreliability.dev/k/agent-reliability-glossary"
  },
  "claims": [
    {
      "text": "An eval is a structured, repeatable test that measures an LLM or LLM-based system against a defined dimension; frameworks package evals as registries of reusable templates.",
      "sources": [{ "title": "openai/evals — framework for evaluating LLMs and LLM systems" }]
    }
  ]
}

Observa lo que viaja con la respuesta: el nivel de evidencia, una confianza, la fecha de última verificación y la fuente detrás de la afirmación — no como prosa que el agente tenga que interpretar, sino como campos sobre los que puede actuar. Un agente puede rechazar una afirmación débil o citar directamente la fuente primaria.

Cuando el corpus no puede responder, answered es false. No improvisa, y el fallo queda registrado para poder cubrir la laguna.

Superficies legibles por máquina

El endpoint MCP es uno de varios. El mismo corpus se sirve como archivos de texto plano que un agente puede leer directamente:

superficie

qué es

/llms.txt

el índice, como text/plain

/llms-full.txt

todo el corpus en un solo archivo

/ai-index.json

cada superficie que publica esta instancia, con su tipo de contenido

/api/index.json

un documento JSON por objeto de conocimiento

/api/sources.json

el registro de fuentes completo

/.well-known/mcp/server.json

el manifiesto de este servidor

Cada objeto de conocimiento tiene una página para humanos y una gemela para máquinas en el mismo id, con una URL canónica que coincide en todas ellas.

Comportamiento que conviene conocer antes de integrarlo

  • Solo POST. Cualquier otro método responde 405 con una cabecera Allow: POST, OPTIONS.

  • Límite de peticiones: 120 peticiones por minuto por cliente, contabilizadas en un almacén compartido, publicadas en cada respuesta como RateLimit-Limit, RateLimit-Remaining y RateLimit-Reset (las tres expuestas vía CORS). Falla en modo abierto: si el almacén no está disponible, la petición se sirve.

  • Entrada malformada recibe un error JSON-RPC correcto según la especificación: -32700 para cuerpos no parseables, -32602 para una herramienta desconocida — nunca una página de error HTML.

  • Los cuerpos de las peticiones tienen un límite y se validan antes del transporte.

Privacidad

Sin cuentas, sin cookies, sin anuncios. El uso se mide de forma agregada con identificadores hash que rotan a diario y una retención de 200 días; las IP brutas nunca se almacenan. Política completa: PRIVACY.md.

Procedencia y licencia

El contenido de conocimiento es CC-BY-4.0: úsalo, cítalo. El registro de fuentes es público precisamente para que una afirmación pueda comprobarse en lugar de confiar en ella: get_sources devuelve aquello en lo que se sustenta cualquier afirmación dada.

Las afirmaciones llevan un nivel de evidencia y una fecha last_verified. Cuando la evidencia es más débil, el objeto lo dice en lugar de redondear al alza.

Cómo está construido

Compilado y servido por Citarium, un framework de código abierto para convertir un grafo de conocimiento en un sitio web, una API, un servidor MCP y archivos legibles por agentes desde una única fuente — bajo evaluación externa, con los guardianes y el registro de falsación a la vista.

Este repositorio es la cara pública del servidor: su manifiesto y su documentación. El corpus en sí se encuentra en agentreliability.dev.

A
license - permissive license
Not graded
quality - not tested
C
maintenance

Maintenance

Maintainers
Response time
Release cycle
Releases (12mo)
Commit activity

Related MCP Servers

  • A
    license
    A
    quality
    B
    maintenance
    Search 1,500+ pre-verified, cited knowledge units across 16 domains. 6 tools: query, batch query, get unit, list domains, suggest topics, report issues. Free, no API key required.
    6
    237
    1
    MIT
  • A
    license
    Not graded
    quality
    A
    maintenance
    Live, reproducible crypto infrastructure benchmarks for AI agents: RPC latency, bridge fees, L1 finality, gas oracle accuracy, stablecoin pegs. Three tools (list_benchmarks, get_benchmark,query_prom), no API key, CC-BY-4.0 data.
    5
    MIT

View all related MCP servers

Related MCP Connectors

  • Gateway between LLM agents and world data through eight tools and a bundled endpoint catalog.

  • Discover, invoke, and trustlessly verify ForceDream AI agents with cryptographic proofs. 17 tools.

  • Curated knowledge API for AI agents - skill packs, semantic search, validated patterns.

View all MCP Connectors

Latest Blog Posts

MCP directory API

We provide all the information about MCP servers via our MCP API.

curl -X GET 'https://glama.ai/api/mcp/v1/servers/citarium/agentreliability-mcp'

If you have feedback or need assistance with the MCP directory API, please join our Discord server