rag-mcp-server
rag-mcp-server
프로덕션 RAG 파이프라인(rag-eval-service)을 에이전트용 표준 프로토콜(Model Context Protocol)로 감싸는 MCP 서버입니다. 하이브리드 검색(dense 임베딩 + BM25 + RRF)이 모든 MCP 클라이언트(Claude Desktop, Claude Code 또는 자체 에이전트)가 호출할 수 있는 도구가 됩니다.
아키텍처
Client (Claude Desktop / Claude Code / любой MCP-клиент)
|
v MCP over stdio (JSON-RPC)
FastMCP server (rag_mcp_server/server.py)
|
+--> search_documents(query, top_k)
+--> get_document(doc_id)
+--> rerank_results(query, doc_ids)
|
v
Hybrid retrieval (rag_mcp_server/core/retrieval.py)
|
+---> Dense retriever --- OpenAI text-embedding-3-small ---> Qdrant (cosine, 1536d)
| |
+---> Sparse retriever -- BM25 (rank-bm25 / BM25Okapi) ----------+
| |
| +-------------------------------+
| v
| Reciprocal Rank Fusion (k=60)
| |
+---------------------------------v
Top-k документов --> клиент (LLM формирует ответ)Qdrant는 기본적으로 임베디드 모드(디스크의 파일, 별도 프로세스 없음)로 동작하므로 서버는 self-contained이며 데모에 외부 인프라가 필요하지 않습니다. 원한다면 docker-compose.yml을 통해 완전한 Qdrant 서버로 전환할 수 있습니다(아래 참조).
Related MCP server: RAG In A Box MCP Server
이것이 무엇이고 왜 필요한가
이것은 retrieval 로직을 재발명하는 것이 아니라 MCP 래퍼입니다. 하이브리드 검색(dense + BM25 + RRF) 자체는 rag-eval-service에서 거의 변경 없이 포팅되었습니다. 이 래퍼가 새로 추가하는 것은 다음과 같습니다:
HTTP API 대신 프로토콜 — 커스텀 HTTP 클라이언트를 작성하거나 REST용으로 서비스를 계속 실행할 필요 없이, 도구가 모든 MCP 클라이언트(Claude Desktop, Claude Code)에 표시됩니다.
Self-contained 데모 모드 — 도커 컨테이너 대신 임베디드 Qdrant를 사용하여
git clone→ 동작하는 도구까지 최소한의 단계로 구성됩니다.doc_id/title 스키마 및 문서 수준(청크가 아닌) 결과 집계 —
search_documents→get_document를 호출하는 LLM 클라이언트의 요구에 맞춰 원시 청크를 직접 다루지 않습니다.API 문서를 읽는 사람이 아닌, 도구의 LLM 소비자를 위해 작성된 Docstring 계약(
rag_mcp_server/server.py참조).
로컬에서 실행하는 방법
요구 사항: Python 3.10+, OpenAI API 키(임베딩용).
git clone https://github.com/q6066697/rag-mcp-server.git
cd rag-mcp-server
python3 -m venv .venv
source .venv/bin/activate # Windows: .venv\Scripts\activate
pip install -r requirements.txt # или: pip install -e ".[dev]"
cp .env.example .env
# впишите свой OPENAI_API_KEY в .env인덱스 구축(1회성; data/를 읽고 OpenAI를 통해 청크를 임베딩한 후 임베디드 Qdrant에 업로드):
python -m rag_mcp_server.core.indexing(선택 사항) 임베디드 모드 대신 실제 Qdrant:
docker-compose up -d
# затем в .env: QDRANT_MODE=server서버 실행(stdio 전송):
python -m rag_mcp_server.serverMCP Inspector로 확인(mcp[cli]에 내장된 인스펙터, 도구를 수동으로 호출할 수 있는 웹 UI를 엽니다):
mcp dev rag_mcp_server/server.py테스트(실제 Qdrant/OpenAI가 필요 없음 — 벡터 검색과 cross-encoder가 모킹됨):
pytestClaude Desktop / Claude Code에 연결하는 방법
claude_desktop_config.json에 추가합니다(Claude Desktop: Settings → Developer → Edit Config; Claude Code: 프로젝트의 .mcp.json 또는 claude mcp add):
{
"mcpServers": {
"rag-mcp-server": {
"command": "/absolute/path/to/rag-mcp-server/.venv/bin/python",
"args": ["-m", "rag_mcp_server.server"],
"cwd": "/absolute/path/to/rag-mcp-server",
"env": {
"OPENAI_API_KEY": "sk-..."
}
}
}
}클라이언트를 재시작하면 search_documents, get_document, rerank_results 도구가 사용 가능한 도구 목록에 나타납니다.
도구 호출 예시
search_documents
search_documents(query="что такое Reciprocal Rank Fusion", top_k=3)[
{
"doc_id": "reciprocal-rank-fusion.md",
"title": "Reciprocal Rank Fusion",
"snippet": "RRF сливает несколько ранжированных списков без нормализации сырых score — документ на позиции r получает вклад 1/(k+r)…",
"score": 0.0328
},
{
"doc_id": "hybrid-search.md",
"title": "Hybrid Search",
"snippet": "Гибридный поиск комбинирует dense-эмбеддинги и BM25, чтобы ловить и семантическое сходство, и точные термины…",
"score": 0.0301
}
]get_document
get_document(doc_id="reciprocal-rank-fusion.md")"# Reciprocal Rank Fusion (RRF)\n\nRRF — метод слияния нескольких ранжированных списков результатов…"rerank_results
rerank_results(
query="как оценивать качество ретривера",
doc_ids=["eval-retrieval-metrics.md", "reranking.md", "hybrid-search.md"]
)[
{
"doc_id": "eval-retrieval-metrics.md",
"title": "Evaluating Retrieval Quality",
"snippet": "Метрики retrieval — hit@k, recall@k, MRR, nDCG@k — измеряют, находит ли поиск релевантные документы…",
"score": 4.81
},
{
"doc_id": "reranking.md",
"title": "Reranking",
"snippet": "Cross-encoder реранкинг переупорядочивает шортлист кандидатов, читая query и passage вместе…",
"score": 1.02
}
]저장소 구조
rag-mcp-server/
├── rag_mcp_server/
│ ├── server.py # точка входа, FastMCP инстанс, регистрация tools
│ ├── core/
│ │ ├── retrieval.py # портированная гибридная логика поиска (dense + BM25 + RRF + rerank)
│ │ └── indexing.py # загрузка корпуса, чанкинг, индексация в Qdrant
│ └── config.py # конфигурация из .env
├── data/ # bootstrap-корпус (15 markdown-доков, копия из rag-eval-service)
├── tests/
│ └── test_server.py # unit-тесты на MCP tools (мокают поиск)
├── docker-compose.yml # опциональный Qdrant-сервер
├── pyproject.toml / requirements.txt
├── .env.example
└── LICENSE (MIT)retrieval 로직의 출처
하이브리드 검색(rag_mcp_server/core/retrieval.py, core/indexing.py)은 rag-eval-service에서 포팅되었습니다. eval-harness(NFCorpus/BEIR 벤치마크, 커스텀 golden set, hit@k/recall@k/MRR/nDCG 메트릭)도 그곳에 있으며, 이 저장소에는 의도적으로 포함하지 않았습니다. rag-mcp-server는 이미 검증된 retrieval 파이프라인 위의 얇은 프로토콜 래퍼이지, 그 파이프라인을 재평가하는 도구가 아니기 때문입니다.
향후 추가할 것
MCP 서버 자체를 위한 Docker — 현재는 Qdrant만 컨테이너로 감싸고 있습니다. 서버 자체를 배포하려면 자체 Dockerfile이 필요합니다.
SSE/HTTP 전송 — stdio는 클라이언트와 같은 머신의 로컬 프로세스를 전제로 합니다. 원격 액세스(여러 사용자, 클라우드 배포)에는 MCP SDK의 SSE 또는 Streamable HTTP 전송이 필요합니다.
인증 — stdio 전송은 설계상 인증이 없습니다(신뢰할 수 있는 프로세스가 로컬에서 실행됨). 네트워크 전송으로 전환하면 서버 수준의 API 키/OAuth가 필요합니다.
증분 인덱싱 — 현재
core.indexing은 컬렉션을 전체적으로 재생성합니다. 성장하는 코퍼스에는 변경된 문서만 upsert하는 방식이 필요합니다.CI/프로덕션에서 기본적으로 실제 Qdrant 사용 — 임베디드 모드는 데모와 테스트에 적합하지만, 여러 프로세스의 동시 액세스에는 서버가 필요합니다.
Maintenance
Resources
Unclaimed servers have limited discoverability.
Looking for Admin?
If you are the server author, to access and configure the admin panel.
Related MCP Servers
- AlicenseNot gradedqualityDmaintenanceMCP server for document ingestion and semantic search on Qdrant. Enables ingesting local documents, generating embeddings with OpenAI, and performing vector search with metadata filters.Apache 2.0
- FlicenseNot gradedqualityBmaintenanceEnables any MCP-compatible AI assistant to search, filter, and retrieve information from a local document collection using a hybrid search pipeline with vector, BM25, reranking, and LLM enrichment.4
- FlicenseNot gradedqualityCmaintenanceIndexes PDF documents into Qdrant and exposes semantic search as MCP tools, enabling RAG-based interactions with your documents.
- FlicenseNot gradedqualityCmaintenanceProvides RAG-based knowledge retrieval and document management as MCP tools, supporting hybrid search, reranking, and retrieval process visualization.
Related MCP Connectors
Turn a GitHub repo or docs site into agent-ready context: pack it or search it, over MCP.
OCR, transcription, file extraction, and image generation for AI agents via MCP.
Agentic search over your Dewey document collections from any MCP-compatible client.
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/q6066697/rag-mcp-server'
If you have feedback or need assistance with the MCP directory API, please join our Discord server