Agent Reliability MCP server
Agent Reliability — MCP server
자율 AI 에이전트의 테스트, 벤치마킹, 감사 — 방법, 하네스, 증거
큐레이팅된 지식 그래프 위의 원격 MCP 서버입니다. 반환되는 모든 주장은 등록된 출처에 연결됩니다: 도구는 인용과 신뢰도 값을 동반한 주장을 돌려주므로, 에이전트는 주장만 하지 않고 근거를 보여줄 수 있습니다.
설치할 것이 없습니다. 호스팅된 streamable-HTTP 엔드포인트입니다:
https://agentreliability.dev/mcp클라이언트에 추가하기
Claude Code
claude mcp add --transport http agent-reliability https://agentreliability.dev/mcpClaude Desktop / mcpServers를 읽는 모든 클라이언트
{
"mcpServers": {
"agent-reliability": {
"type": "streamable-http",
"url": "https://agentreliability.dev/mcp"
}
}
}API 키 없음, 계정 없음, 인증 없음. 읽기 전용입니다.
클라이언트 없이도 응답하는지 확인하기:
curl -s https://agentreliability.dev/mcp \
-H 'Content-Type: application/json' \
-H 'Accept: application/json, text/event-stream' \
-H 'mcp-protocol-version: 2025-06-18' \
-d '{"jsonrpc":"2.0","id":1,"method":"tools/list"}'Related MCP server: knowledgelib-mcp
도구
여덟 개이며, 각각 outputSchema를 갖고 각자 structuredContent를 반환합니다.
도구 | 인수 | 설명 |
| — | 코퍼스 개요: 이 인스턴스가 알고 있는 내용, 유형별 개수, 게시된 태그, 최신성. 도착했을 때 이 코퍼스가 질문에 답할 수 있는지 아직 모른다면 여기서 시작하세요. |
|
| 지식 그래프에 대한 전문 검색. 악센트와 아포스트로피를 구분하지 않으므로 사용자가 쓴 그대로 질의하세요. 모든 검색 결과는 관련성 점수와 일치한 필드를 함께 전달합니다. |
|
| 코퍼스에서 질문에 답합니다. 일치하는 객체의 주장을 출처 및 신뢰도와 함께 반환합니다 — 출처 없는 답변은 절대 없습니다. |
|
| id로 지식 객체 하나를 가져옵니다. 해당 객체의 주장과 각 주장이 인용하는 출처를 포함합니다. |
|
| 태그가 달린 지식 객체 목록을 표시합니다(토픽은 콘텐츠로 뒷받침되는 태그입니다). |
|
| 객체의 그래프 이웃: 나가는 관계와 들어오는 관계를 각각의 관계 유형과 함께 보여줍니다. |
|
| 전체 소스 레지스트리 또는 한 객체가 인용한 출처만 표시합니다. 코퍼스를 신뢰하기 전에 판단하는 데 사용하세요. |
|
| 가장 최근에 검증된 지식 객체 — 최신성 신호입니다. |
권장 경로는 get_overview → search 또는 answer → get_entity → get_related입니다. get_overview가 존재하는 이유는 막 도착한 에이전트가 추측에 호출을 낭비하기 전에 이 코퍼스가 도움이 될 수 있는지 알아야 하기 때문입니다.
코퍼스 구성
지식 객체 | 38 |
등록된 출처 | 31 |
게시된 토픽 | 93 |
유형 | 객체 |
엔티티 | 25 |
가이드 | 9 |
비교 | 2 |
FAQ | 1 |
용어집 | 1 |
주제: 평가와 벤치마크(GAIA, AgentBench, Inspect), LLM-as-judge와 그 실패 모드, 구드하트의 법칙과 벤치마크 오염, 장애 주입과 카오스 테스트, 승인 게이트와 자율성 수준, 근거(grounding)와 충실성.
답변하도록 설계된 질문
내 에이전트가 암기한 벤치마크와 진짜 평가를 어떻게 구별할까?
LLM 심판에게 보정(calibration)이란 무엇이며, 어떻게 측정할까?
장애 주입이 실제로 잡아내는 실패 모드는 무엇일까?
실제 답변의 모습
라이브 엔드포인트에 대한 실제 호출 — answer에 *"벤치마크 오염과 진짜 평가를 어떻게 구별할까"*라고 질문한 결과, 반환되는 structuredContent는 다음과 같습니다(일부 생략됨):
{
"answered": true,
"entity": {
"id": "agent-reliability-glossary",
"name": "Agent reliability glossary",
"evidence_tier": "secondary",
"confidence": 0.85,
"last_verified": "2026-08-08",
"canonical_url": "https://agentreliability.dev/k/agent-reliability-glossary"
},
"claims": [
{
"text": "An eval is a structured, repeatable test that measures an LLM or LLM-based system against a defined dimension; frameworks package evals as registries of reusable templates.",
"sources": [{ "title": "openai/evals — framework for evaluating LLMs and LLM systems" }]
}
]
}답변과 함께 전달되는 것에 주목하세요: 증거 등급, 신뢰도, 최종 검증된 날짜, 그리고 주장 뒤에 있는 출처 — 에이전트가 파싱해야 하는 글이 아니라, 에이전트가 바로 활용할 수 있는 필드로 전달됩니다. 에이전트는 근거가 약한 주장을 사용하지 않기로 결정하거나 기본 출처를 직접 인용할 수 있습니다.
코퍼스가 답할 수 없으면 answered는 false입니다. 즉흥적으로 답을 만들지 않으며, 누락이 기록되어 해당 공백을 채울 수 있습니다.
기계 판독 가능한 표면
MCP 엔드포인트는 여러 표면 중 하나입니다. 동일한 코퍼스가 에이전트가 직접 읽을 수 있는 일반 파일로도 제공됩니다:
표면 | 설명 |
인덱스, | |
코퍼스 전체를 하나의 파일로 | |
이 인스턴스가 게시하는 모든 표면과 해당 콘텐츠 유형 | |
지식 객체별 JSON 문서 하나 | |
소스 레지스트리 전체 | |
이 서버의 매니페스트 |
각 지식 객체는 동일한 id에 사람용 페이지와 기계용 트윈을 가지며, 모든 표면에서 일치하는 canonical URL을 갖습니다.
통합 전에 알아두면 좋은 동작
POST만 허용. 다른 모든 메서드는Allow: POST, OPTIONS헤더와 함께405를 응답합니다.속도 제한: 클라이언트당 분당 120회 요청. 공유 저장소에서 집계되며 모든 응답에
RateLimit-Limit,RateLimit-Remaining,RateLimit-Reset으로 게시됩니다(세 가지 모두 CORS를 통해 노출됨). 실패 시 열림(open) 상태입니다: 저장소에 연결할 수 없으면 요청이 처리됩니다.형식이 잘못된 입력은 스펙에 맞는 JSON-RPC 오류를 받습니다 — 파싱할 수 없는 본문은
-32700, 알 수 없는 도구는-32602— HTML 오류 페이지는 절대 반환되지 않습니다.요청 본문은 크기 상한이 있으며 전송 전에 검증됩니다.
개인정보 보호
계정 없음, 쿠키 없음, 광고 없음. 사용량은 일 단위로 교체되는 해시 식별자로 집계 측정되며 200일 동안 보관됩니다. 원시 IP는 절대 저장되지 않습니다. 전체 정책: PRIVACY.md.
출처와 라이선스
지식 콘텐츠는 CC-BY-4.0입니다: 사용하고 인용하세요. 소스 레지스트리가 공개된 이유는 주장을 신뢰하는 대신 검증할 수 있도록 하기 위해서입니다 — get_sources는 주어진 주장이 근거하는 바를 반환합니다.
주장은 증거 등급과 last_verified 날짜를 담고 있습니다. 증거가 약한 경우 객체는 부풀리지 않고 그 사실을 명시합니다.
구축 방식
Citarium이 컴파일하고 제공합니다. Citarium은 단일 소스의 지식 그래프를 웹사이트, API, MCP 서버, 에이전트가 읽을 수 있는 파일로 변환하는 오픈소스 프레임워크이며 — 외부 평가를 받고 있고, 가디언과 반증 기록이 공개되어 있습니다.
이 저장소는 서버의 공개적인 얼굴, 즉 매니페스트와 문서입니다. 코퍼스 자체는 agentreliability.dev에 있습니다.
This server cannot be installed
Maintenance
Related MCP Servers
- AlicenseAqualityAmaintenanceTrust, identity, and reputation infrastructure for AI agents. Register agents with W3C DID (Ed25519), check EigenTrust reputation scores, submit peer attestations, search agents by capability, and verify IPFS-anchored audit trails. 11 tools.2014MIT
- AlicenseAqualityBmaintenanceSearch 1,500+ pre-verified, cited knowledge units across 16 domains. 6 tools: query, batch query, get unit, list domains, suggest topics, report issues. Free, no API key required.62371MIT

Openchainbenchofficial
AlicenseNot gradedqualityAmaintenanceLive, reproducible crypto infrastructure benchmarks for AI agents: RPC latency, bridge fees, L1 finality, gas oracle accuracy, stablecoin pegs. Three tools (list_benchmarks, get_benchmark,query_prom), no API key, CC-BY-4.0 data.5MIT- AlicenseNot gradedqualityCmaintenanceProvides AI agents with honest benchmark rankings (Agentic Memory Index and Agentic Search Index) for AI tools, plus graded checks and telemetry for x402 endpoints.MIT
Related MCP Connectors
Gateway between LLM agents and world data through eight tools and a bundled endpoint catalog.
Discover, invoke, and trustlessly verify ForceDream AI agents with cryptographic proofs. 17 tools.
Curated knowledge API for AI agents - skill packs, semantic search, validated patterns.
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/citarium/agentreliability-mcp'
If you have feedback or need assistance with the MCP directory API, please join our Discord server