Skip to main content
Glama
citarium

Agent Reliability MCP server

Agent Reliability — MCP server

자율 AI 에이전트의 테스트, 벤치마킹, 감사 — 방법, 하네스, 증거

큐레이팅된 지식 그래프 위의 원격 MCP 서버입니다. 반환되는 모든 주장은 등록된 출처에 연결됩니다: 도구는 인용과 신뢰도 값을 동반한 주장을 돌려주므로, 에이전트는 주장만 하지 않고 근거를 보여줄 수 있습니다.

설치할 것이 없습니다. 호스팅된 streamable-HTTP 엔드포인트입니다:

https://agentreliability.dev/mcp

클라이언트에 추가하기

Claude Code

claude mcp add --transport http agent-reliability https://agentreliability.dev/mcp

Claude Desktop / mcpServers를 읽는 모든 클라이언트

{
  "mcpServers": {
    "agent-reliability": {
      "type": "streamable-http",
      "url": "https://agentreliability.dev/mcp"
    }
  }
}

API 키 없음, 계정 없음, 인증 없음. 읽기 전용입니다.

클라이언트 없이도 응답하는지 확인하기:

curl -s https://agentreliability.dev/mcp \
  -H 'Content-Type: application/json' \
  -H 'Accept: application/json, text/event-stream' \
  -H 'mcp-protocol-version: 2025-06-18' \
  -d '{"jsonrpc":"2.0","id":1,"method":"tools/list"}'

Related MCP server: knowledgelib-mcp

도구

여덟 개이며, 각각 outputSchema를 갖고 각자 structuredContent를 반환합니다.

도구

인수

설명

get_overview

코퍼스 개요: 이 인스턴스가 알고 있는 내용, 유형별 개수, 게시된 태그, 최신성. 도착했을 때 이 코퍼스가 질문에 답할 수 있는지 아직 모른다면 여기서 시작하세요.

search

query, limit?

지식 그래프에 대한 전문 검색. 악센트와 아포스트로피를 구분하지 않으므로 사용자가 쓴 그대로 질의하세요. 모든 검색 결과는 관련성 점수와 일치한 필드를 함께 전달합니다.

answer

question

코퍼스에서 질문에 답합니다. 일치하는 객체의 주장을 출처 및 신뢰도와 함께 반환합니다 — 출처 없는 답변은 절대 없습니다.

get_entity

id

id로 지식 객체 하나를 가져옵니다. 해당 객체의 주장과 각 주장이 인용하는 출처를 포함합니다.

get_topic

tag

태그가 달린 지식 객체 목록을 표시합니다(토픽은 콘텐츠로 뒷받침되는 태그입니다).

get_related

id

객체의 그래프 이웃: 나가는 관계와 들어오는 관계를 각각의 관계 유형과 함께 보여줍니다.

get_sources

object_id?

전체 소스 레지스트리 또는 한 객체가 인용한 출처만 표시합니다. 코퍼스를 신뢰하기 전에 판단하는 데 사용하세요.

get_latest

limit?

가장 최근에 검증된 지식 객체 — 최신성 신호입니다.

권장 경로는 get_overviewsearch 또는 answerget_entityget_related입니다. get_overview가 존재하는 이유는 막 도착한 에이전트가 추측에 호출을 낭비하기 전에 이 코퍼스가 도움이 될 수 있는지 알아야 하기 때문입니다.

코퍼스 구성

지식 객체

38

등록된 출처

31

게시된 토픽

93

유형

객체

엔티티

25

가이드

9

비교

2

FAQ

1

용어집

1

주제: 평가와 벤치마크(GAIA, AgentBench, Inspect), LLM-as-judge와 그 실패 모드, 구드하트의 법칙과 벤치마크 오염, 장애 주입과 카오스 테스트, 승인 게이트와 자율성 수준, 근거(grounding)와 충실성.

답변하도록 설계된 질문

  • 내 에이전트가 암기한 벤치마크와 진짜 평가를 어떻게 구별할까?

  • LLM 심판에게 보정(calibration)이란 무엇이며, 어떻게 측정할까?

  • 장애 주입이 실제로 잡아내는 실패 모드는 무엇일까?

실제 답변의 모습

라이브 엔드포인트에 대한 실제 호출 — answer*"벤치마크 오염과 진짜 평가를 어떻게 구별할까"*라고 질문한 결과, 반환되는 structuredContent는 다음과 같습니다(일부 생략됨):

{
  "answered": true,
  "entity": {
    "id": "agent-reliability-glossary",
    "name": "Agent reliability glossary",
    "evidence_tier": "secondary",
    "confidence": 0.85,
    "last_verified": "2026-08-08",
    "canonical_url": "https://agentreliability.dev/k/agent-reliability-glossary"
  },
  "claims": [
    {
      "text": "An eval is a structured, repeatable test that measures an LLM or LLM-based system against a defined dimension; frameworks package evals as registries of reusable templates.",
      "sources": [{ "title": "openai/evals — framework for evaluating LLMs and LLM systems" }]
    }
  ]
}

답변과 함께 전달되는 것에 주목하세요: 증거 등급, 신뢰도, 최종 검증된 날짜, 그리고 주장 뒤에 있는 출처 — 에이전트가 파싱해야 하는 글이 아니라, 에이전트가 바로 활용할 수 있는 필드로 전달됩니다. 에이전트는 근거가 약한 주장을 사용하지 않기로 결정하거나 기본 출처를 직접 인용할 수 있습니다.

코퍼스가 답할 수 없으면 answeredfalse입니다. 즉흥적으로 답을 만들지 않으며, 누락이 기록되어 해당 공백을 채울 수 있습니다.

기계 판독 가능한 표면

MCP 엔드포인트는 여러 표면 중 하나입니다. 동일한 코퍼스가 에이전트가 직접 읽을 수 있는 일반 파일로도 제공됩니다:

표면

설명

/llms.txt

인덱스, text/plain 형식

/llms-full.txt

코퍼스 전체를 하나의 파일로

/ai-index.json

이 인스턴스가 게시하는 모든 표면과 해당 콘텐츠 유형

/api/index.json

지식 객체별 JSON 문서 하나

/api/sources.json

소스 레지스트리 전체

/.well-known/mcp/server.json

이 서버의 매니페스트

각 지식 객체는 동일한 id에 사람용 페이지와 기계용 트윈을 가지며, 모든 표면에서 일치하는 canonical URL을 갖습니다.

통합 전에 알아두면 좋은 동작

  • POST만 허용. 다른 모든 메서드는 Allow: POST, OPTIONS 헤더와 함께 405를 응답합니다.

  • 속도 제한: 클라이언트당 분당 120회 요청. 공유 저장소에서 집계되며 모든 응답에 RateLimit-Limit, RateLimit-Remaining, RateLimit-Reset으로 게시됩니다(세 가지 모두 CORS를 통해 노출됨). 실패 시 열림(open) 상태입니다: 저장소에 연결할 수 없으면 요청이 처리됩니다.

  • 형식이 잘못된 입력은 스펙에 맞는 JSON-RPC 오류를 받습니다 — 파싱할 수 없는 본문은 -32700, 알 수 없는 도구는 -32602 — HTML 오류 페이지는 절대 반환되지 않습니다.

  • 요청 본문은 크기 상한이 있으며 전송 전에 검증됩니다.

개인정보 보호

계정 없음, 쿠키 없음, 광고 없음. 사용량은 일 단위로 교체되는 해시 식별자로 집계 측정되며 200일 동안 보관됩니다. 원시 IP는 절대 저장되지 않습니다. 전체 정책: PRIVACY.md.

출처와 라이선스

지식 콘텐츠는 CC-BY-4.0입니다: 사용하고 인용하세요. 소스 레지스트리가 공개된 이유는 주장을 신뢰하는 대신 검증할 수 있도록 하기 위해서입니다 — get_sources는 주어진 주장이 근거하는 바를 반환합니다.

주장은 증거 등급과 last_verified 날짜를 담고 있습니다. 증거가 약한 경우 객체는 부풀리지 않고 그 사실을 명시합니다.

구축 방식

Citarium이 컴파일하고 제공합니다. Citarium은 단일 소스의 지식 그래프를 웹사이트, API, MCP 서버, 에이전트가 읽을 수 있는 파일로 변환하는 오픈소스 프레임워크이며 — 외부 평가를 받고 있고, 가디언과 반증 기록이 공개되어 있습니다.

이 저장소는 서버의 공개적인 얼굴, 즉 매니페스트와 문서입니다. 코퍼스 자체는 agentreliability.dev에 있습니다.

A
license - permissive license
Not graded
quality - not tested
C
maintenance

Maintenance

Maintainers
Response time
Release cycle
Releases (12mo)
Commit activity

Related MCP Servers

  • A
    license
    A
    quality
    B
    maintenance
    Search 1,500+ pre-verified, cited knowledge units across 16 domains. 6 tools: query, batch query, get unit, list domains, suggest topics, report issues. Free, no API key required.
    6
    237
    1
    MIT
  • A
    license
    Not graded
    quality
    A
    maintenance
    Live, reproducible crypto infrastructure benchmarks for AI agents: RPC latency, bridge fees, L1 finality, gas oracle accuracy, stablecoin pegs. Three tools (list_benchmarks, get_benchmark,query_prom), no API key, CC-BY-4.0 data.
    5
    MIT

View all related MCP servers

Related MCP Connectors

  • Gateway between LLM agents and world data through eight tools and a bundled endpoint catalog.

  • Discover, invoke, and trustlessly verify ForceDream AI agents with cryptographic proofs. 17 tools.

  • Curated knowledge API for AI agents - skill packs, semantic search, validated patterns.

View all MCP Connectors

Latest Blog Posts

MCP directory API

We provide all the information about MCP servers via our MCP API.

curl -X GET 'https://glama.ai/api/mcp/v1/servers/citarium/agentreliability-mcp'

If you have feedback or need assistance with the MCP directory API, please join our Discord server