Agent Reliability MCP server
Agent Reliability — MCP-сервер
Тестирование, бенчмаркинг и аудит автономных ИИ-агентов — методы, стенды, доказательная база
Удалённый MCP-сервер поверх курируемого графа знаний. Любое утверждение, которое он возвращает, привязано к зарегистрированному источнику: инструменты передают утверждения вместе с их цитатами и значением уверенности, так что агент может показать свою работу, а не просто что-то заявлять.
Ничего устанавливать не нужно. Это публичный endpoint со streamable-HTTP:
https://agentreliability.dev/mcpПодключение к клиенту
Claude Code
claude mcp add --transport http agent-reliability https://agentreliability.dev/mcpClaude Desktop / любой клиент, читающий mcpServers
{
"mcpServers": {
"agent-reliability": {
"type": "streamable-http",
"url": "https://agentreliability.dev/mcp"
}
}
}Никаких API-ключей, аккаунтов и авторизации. Только чтение.
Проверьте, что он отвечает, вообще без клиента:
curl -s https://agentreliability.dev/mcp \
-H 'Content-Type: application/json' \
-H 'Accept: application/json, text/event-stream' \
-H 'mcp-protocol-version: 2025-06-18' \
-d '{"jsonrpc":"2.0","id":1,"method":"tools/list"}'Related MCP server: knowledgelib-mcp
Инструменты
Восемь, у каждого есть outputSchema, каждый возвращает structuredContent.
инструмент | аргументы | описание |
| — | Обзор корпуса: что знает этот экземпляр, количество по типам, опубликованные теги, актуальность. Начните здесь, когда вы только появились и ещё не знаете, может ли этот корпус ответить на вопрос. |
|
| Полнотекстовый поиск по графу знаний. Нечувствителен к диакритике и апострофам, поэтому можно вводить запрос словами пользователя; каждый результат содержит оценку релевантности и поля, которые совпали. |
|
| Отвечает на вопрос по корпусу. Возвращает утверждения соответствующего объекта с источниками и уверенностью — никогда не некорректный ответ. |
|
| Получает один объект знания по идентификатору, вместе с его утверждениями и источниками, которые цитирует каждое утверждение. |
|
| Перечисляет объекты знания, несущие заданный тег (темы — это теги, за которыми стоит содержимое). |
|
| Соседние объекты по графу: исходящие и входящие связи, каждая с указанием типа связи. |
|
| Весь реестр источников или только источники, цитируемые одним объектом. Используйте его, чтобы оценить корпус, прежде чем доверять ему. |
|
| Самые недавние проверенные объекты знаний — сигнал свежести. |
Предполагаемый путь: get_overview → search или answer → get_entity → get_related. get_overview нужен потому, что агенту, который только что прибыл, следует узнать возможность этого корпуса до того, как тратить запрос на догадки.
Что находится в корпусе
объекты знаний | 38 |
зарегистрированные источники | 31 |
опубликованные темы | 93 |
тип | объектов |
сущность | 25 |
руководство | 9 |
сравнение | 2 |
FAQ | 1 |
глоссарий | 1 |
Тематика: эвалы и бенчмарки (GAIA, AgentBench, Inspect), LLM как судья и его режимы отказов, закон Гонхарта и загрязнение бенчмарков, инжекция отказов (fault injection) и хаос-тестирование, шлюзы согласования и уровни автономии, основанность (grounding) и верность (faithfulness).
Вопросы, на которые он умеет отвечать
Как отличить настоящую эвалу от бенчмарка, который мой агент запомнил?
Что калибровка значит для судьи-LLM и как её измерить?
Какие реальные неполадки выявляет внедрение отказов?
Как на самом деле выглядит ответ
Реальный вызов к активному endpoint — answer с запросом "how do I tell a real eval from benchmark contamination" — возвращает следующий structuredContent, сокращённый:
{
"answered": true,
"entity": {
"id": "agent-reliability-glossary",
"name": "Agent reliability glossary",
"evidence_tier": "secondary",
"confidence": 0.85,
"last_verified": "2026-08-08",
"canonical_url": "https://agentreliability.dev/k/agent-reliability-glossary"
},
"claims": [
{
"text": "An eval is a structured, repeatable test that measures an LLM or LLM-based system against a defined dimension; frameworks package evals as registries of reusable templates.",
"sources": [{ "title": "openai/evals — framework for evaluating LLMs and LLM systems" }]
}
]
}Обратите внимание, что возвращается вместе с нужным набором:уровень доказательности (evidence tier), уверенность, дата последней проверки и источник за объектом — не текст, который агенту приходится разбирать, а поля данных, которые он может использовать в решениях. Агент может отказаться от слабого утверждения или прямо процитировать источник.
Когда корпус не может ответить, answered будет false. Он не фантазирует, и пропущенный вопрос фиксируется — чтобы пробел можно было закрыть.
Машинно-читаемые поверхности
Endpoint MCP — один из нескольких. Тот же corpus доступен как обычные текстовые файлы, которые агент может читать напрямую.
поверхности | что это |
оглавление, в виде | |
весь корпус одним файлом | |
все публикуемые этим экземпляром поверхности с их типами содержимого | |
один JSON-документ на каждый объект знаний | |
весь реестр источников в полном виде | |
манифест этого сервера |
У каждого отдельного объекта знаний есть человекочитаемая страница и машиночитаемая версия по одному и тому же идентификатору, с каноническим URL, одинаковым во всех формах.
Feature:
POSTтолько. Все остальные методы возвращают405с заголовкомAllow: POST, OPTIONS.Лимит запросов: 120 запросов в минуту на одного клиента, учитывается в общем хранилище и публикуется в каждом ответе как
RateLimit-Limit,RateLimit-RemainingиRateLimit-Reset(все три доступны через CORS). Сбой включает fail-open: если хранилище доступно, запрос всё равно обрабатывается.**Проблем входной данные приводят к корректной JSON-RPC-ошибке —
-32700» для непарсерного тела,-32602` для неизвестного инструмента — никогда не HTML-странице с ошибкой.Размер тела запроса ограничен и проверяется до передачи.
Конфиденциальность
Без учёток, без файлов cookie, без рекламы. Использование измеряется в обобщённом виде: ежегодно меняющиеся хэшированные идентификаторы и храненине 200 дней; сырые IP-адреса никогда не сохраняются. Полная политика: PRIVACY.md.
Происхождение данных
Содержимое знаний имеет лицензию CC-BY-4.0: используйте, цитируйте. Реестр источников открыт именно потому, что любое утверждение можно проверить, а не просто принять на веру get_sources возвращает то, на чём стоит конкретное заявление.
Утверждения несут уровень доказательности и дату last_verified. Там, где доказательства слабее, объект прямо говорит об этом, а не округляет лучше.
Как это устроено
Собран и обслуживается Citarium — открытым языком, который превращает граф знаний в выбора, API, MCP-сервер и файлы, понятные агенту, из одного источника: внешняя оценка, с хранителями и журналом фальсифика взачет (открытыми).
Этот репозиторий — публичная страница сервера: его манифест и документация. Сам корпус расположен здесь: agentreliability.dev.
This server cannot be installed
Maintenance
Related MCP Servers
- AlicenseAqualityAmaintenanceTrust, identity, and reputation infrastructure for AI agents. Register agents with W3C DID (Ed25519), check EigenTrust reputation scores, submit peer attestations, search agents by capability, and verify IPFS-anchored audit trails. 11 tools.2014MIT
- AlicenseAqualityBmaintenanceSearch 1,500+ pre-verified, cited knowledge units across 16 domains. 6 tools: query, batch query, get unit, list domains, suggest topics, report issues. Free, no API key required.62371MIT

Openchainbenchofficial
AlicenseNot gradedqualityAmaintenanceLive, reproducible crypto infrastructure benchmarks for AI agents: RPC latency, bridge fees, L1 finality, gas oracle accuracy, stablecoin pegs. Three tools (list_benchmarks, get_benchmark,query_prom), no API key, CC-BY-4.0 data.5MIT- AlicenseNot gradedqualityCmaintenanceProvides AI agents with honest benchmark rankings (Agentic Memory Index and Agentic Search Index) for AI tools, plus graded checks and telemetry for x402 endpoints.MIT
Related MCP Connectors
Gateway between LLM agents and world data through eight tools and a bundled endpoint catalog.
Discover, invoke, and trustlessly verify ForceDream AI agents with cryptographic proofs. 17 tools.
Curated knowledge API for AI agents - skill packs, semantic search, validated patterns.
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/citarium/agentreliability-mcp'
If you have feedback or need assistance with the MCP directory API, please join our Discord server