Skip to main content
Glama
citarium

Agent Reliability MCP server

Agent Reliability — MCP-сервер

Тестирование, бенчмаркинг и аудит автономных ИИ-агентов — методы, стенды, доказательная база

Удалённый MCP-сервер поверх курируемого графа знаний. Любое утверждение, которое он возвращает, привязано к зарегистрированному источнику: инструменты передают утверждения вместе с их цитатами и значением уверенности, так что агент может показать свою работу, а не просто что-то заявлять.

Ничего устанавливать не нужно. Это публичный endpoint со streamable-HTTP:

https://agentreliability.dev/mcp

Подключение к клиенту

Claude Code

claude mcp add --transport http agent-reliability https://agentreliability.dev/mcp

Claude Desktop / любой клиент, читающий mcpServers

{
  "mcpServers": {
    "agent-reliability": {
      "type": "streamable-http",
      "url": "https://agentreliability.dev/mcp"
    }
  }
}

Никаких API-ключей, аккаунтов и авторизации. Только чтение.

Проверьте, что он отвечает, вообще без клиента:

curl -s https://agentreliability.dev/mcp \
  -H 'Content-Type: application/json' \
  -H 'Accept: application/json, text/event-stream' \
  -H 'mcp-protocol-version: 2025-06-18' \
  -d '{"jsonrpc":"2.0","id":1,"method":"tools/list"}'

Related MCP server: knowledgelib-mcp

Инструменты

Восемь, у каждого есть outputSchema, каждый возвращает structuredContent.

инструмент

аргументы

описание

get_overview

Обзор корпуса: что знает этот экземпляр, количество по типам, опубликованные теги, актуальность. Начните здесь, когда вы только появились и ещё не знаете, может ли этот корпус ответить на вопрос.

search

query, limit?

Полнотекстовый поиск по графу знаний. Нечувствителен к диакритике и апострофам, поэтому можно вводить запрос словами пользователя; каждый результат содержит оценку релевантности и поля, которые совпали.

answer

question

Отвечает на вопрос по корпусу. Возвращает утверждения соответствующего объекта с источниками и уверенностью — никогда не некорректный ответ.

get_entity

id

Получает один объект знания по идентификатору, вместе с его утверждениями и источниками, которые цитирует каждое утверждение.

get_topic

tag

Перечисляет объекты знания, несущие заданный тег (темы — это теги, за которыми стоит содержимое).

get_related

id

Соседние объекты по графу: исходящие и входящие связи, каждая с указанием типа связи.

get_sources

object_id?

Весь реестр источников или только источники, цитируемые одним объектом. Используйте его, чтобы оценить корпус, прежде чем доверять ему.

get_latest

limit?

Самые недавние проверенные объекты знаний — сигнал свежести.

Предполагаемый путь: get_overviewsearch или answerget_entityget_related. get_overview нужен потому, что агенту, который только что прибыл, следует узнать возможность этого корпуса до того, как тратить запрос на догадки.

Что находится в корпусе

объекты знаний

38

зарегистрированные источники

31

опубликованные темы

93

тип

объектов

сущность

25

руководство

9

сравнение

2

FAQ

1

глоссарий

1

Тематика: эвалы и бенчмарки (GAIA, AgentBench, Inspect), LLM как судья и его режимы отказов, закон Гонхарта и загрязнение бенчмарков, инжекция отказов (fault injection) и хаос-тестирование, шлюзы согласования и уровни автономии, основанность (grounding) и верность (faithfulness).

Вопросы, на которые он умеет отвечать

  • Как отличить настоящую эвалу от бенчмарка, который мой агент запомнил?

  • Что калибровка значит для судьи-LLM и как её измерить?

  • Какие реальные неполадки выявляет внедрение отказов?

Как на самом деле выглядит ответ

Реальный вызов к активному endpoint — answer с запросом "how do I tell a real eval from benchmark contamination" — возвращает следующий structuredContent, сокращённый:

{
  "answered": true,
  "entity": {
    "id": "agent-reliability-glossary",
    "name": "Agent reliability glossary",
    "evidence_tier": "secondary",
    "confidence": 0.85,
    "last_verified": "2026-08-08",
    "canonical_url": "https://agentreliability.dev/k/agent-reliability-glossary"
  },
  "claims": [
    {
      "text": "An eval is a structured, repeatable test that measures an LLM or LLM-based system against a defined dimension; frameworks package evals as registries of reusable templates.",
      "sources": [{ "title": "openai/evals — framework for evaluating LLMs and LLM systems" }]
    }
  ]
}

Обратите внимание, что возвращается вместе с нужным набором:уровень доказательности (evidence tier), уверенность, дата последней проверки и источник за объектом — не текст, который агенту приходится разбирать, а поля данных, которые он может использовать в решениях. Агент может отказаться от слабого утверждения или прямо процитировать источник.

Когда корпус не может ответить, answered будет false. Он не фантазирует, и пропущенный вопрос фиксируется — чтобы пробел можно было закрыть.

Машинно-читаемые поверхности

Endpoint MCP — один из нескольких. Тот же corpus доступен как обычные текстовые файлы, которые агент может читать напрямую.

поверхности

что это

/llms.txt

оглавление, в виде text/plain

/llms-full.txt

весь корпус одним файлом

/ai-index.json

все публикуемые этим экземпляром поверхности с их типами содержимого

/api/index.json

один JSON-документ на каждый объект знаний

/api/sources.json

весь реестр источников в полном виде

/.well-known/mcp/server.json

манифест этого сервера

У каждого отдельного объекта знаний есть человекочитаемая страница и машиночитаемая версия по одному и тому же идентификатору, с каноническим URL, одинаковым во всех формах.

Feature:

  • POST только. Все остальные методы возвращают 405 с заголовком Allow: POST, OPTIONS.

  • Лимит запросов: 120 запросов в минуту на одного клиента, учитывается в общем хранилище и публикуется в каждом ответе как RateLimit-Limit, RateLimit-Remaining и RateLimit-Reset (все три доступны через CORS). Сбой включает fail-open: если хранилище доступно, запрос всё равно обрабатывается.

  • **Проблем входной данные приводят к корректной JSON-RPC-ошибке — -32700» для непарсерного тела, -32602` для неизвестного инструмента — никогда не HTML-странице с ошибкой.

  • Размер тела запроса ограничен и проверяется до передачи.

Конфиденциальность

Без учёток, без файлов cookie, без рекламы. Использование измеряется в обобщённом виде: ежегодно меняющиеся хэшированные идентификаторы и храненине 200 дней; сырые IP-адреса никогда не сохраняются. Полная политика: PRIVACY.md.

Происхождение данных

Содержимое знаний имеет лицензию CC-BY-4.0: используйте, цитируйте. Реестр источников открыт именно потому, что любое утверждение можно проверить, а не просто принять на веру get_sources возвращает то, на чём стоит конкретное заявление.

Утверждения несут уровень доказательности и дату last_verified. Там, где доказательства слабее, объект прямо говорит об этом, а не округляет лучше.

Как это устроено

Собран и обслуживается Citarium — открытым языком, который превращает граф знаний в выбора, API, MCP-сервер и файлы, понятные агенту, из одного источника: внешняя оценка, с хранителями и журналом фальсифика взачет (открытыми).

Этот репозиторий — публичная страница сервера: его манифест и документация. Сам корпус расположен здесь: agentreliability.dev.

A
license - permissive license
Not graded
quality - not tested
C
maintenance

Maintenance

Maintainers
Response time
Release cycle
Releases (12mo)
Commit activity

Related MCP Servers

  • A
    license
    A
    quality
    B
    maintenance
    Search 1,500+ pre-verified, cited knowledge units across 16 domains. 6 tools: query, batch query, get unit, list domains, suggest topics, report issues. Free, no API key required.
    6
    237
    1
    MIT
  • A
    license
    Not graded
    quality
    A
    maintenance
    Live, reproducible crypto infrastructure benchmarks for AI agents: RPC latency, bridge fees, L1 finality, gas oracle accuracy, stablecoin pegs. Three tools (list_benchmarks, get_benchmark,query_prom), no API key, CC-BY-4.0 data.
    5
    MIT

View all related MCP servers

Related MCP Connectors

  • Gateway between LLM agents and world data through eight tools and a bundled endpoint catalog.

  • Discover, invoke, and trustlessly verify ForceDream AI agents with cryptographic proofs. 17 tools.

  • Curated knowledge API for AI agents - skill packs, semantic search, validated patterns.

View all MCP Connectors

Latest Blog Posts

MCP directory API

We provide all the information about MCP servers via our MCP API.

curl -X GET 'https://glama.ai/api/mcp/v1/servers/citarium/agentreliability-mcp'

If you have feedback or need assistance with the MCP directory API, please join our Discord server