xinPlugin_Chroma_fastMCP
xChroma_1fastMCP
Die Vektorabrufschicht der MinIO-Wissensdatenbank: extrahiert den Text aus den in MinIO hochgeladenen Dokumenten (PDF/txt/md) → zerlegt ihn in Chunks → speichert die Vektoren in Chroma und stellt die „Suche“ über FastMCP als MCP-Tool bereit, damit der dsh-mcp-client von DSH (DeepSeek Harness) sich verbinden kann und der Agent beim Beantworten von Fragen direkt den Originaltext durchsucht.
Aufbau
Datei | Rolle |
| Chroma-Persistenz + Chunking (mit Seiten-/Zeilennummern) + Hybride Suche (semantisch + Zeichen-Bigramm-BM25, RRF-Fusion) |
| CLI-Import: |
| FastMCP-stdio-Dienst, bereit für |
| chromadb / fastmcp / pypdf |
Related MCP server: Modular RAG MCP Server
Installation
pip install -r requirements.txt
# 首次检索会下载默认 embedding(all-MiniLM-L6-v2,约 80MB,缓存在 ~/.cache/chroma)Verwendung
# 入库
python ingest.py "广州十五五规划.pdf" "广州十五五规划.pdf"
# 检索(或经 MCP 工具 search)
python -c "from chroma_store import search; import json; print(json.dumps(search('广州 人工智能+ 大模型 算力 数据要素', 6), ensure_ascii=False))"MCP-Werkzeuge
search(query, top_k=6): Hybride Suche aus Semantik und Schlüsselwörtern, retourniert Fragmente des Originaltexts samt Herkunft (Datei + Seite + Zeile).ingest_file(path, source_name): synchronisiert eine lokale Datei in den Bestand.list_sources(): Liste der bereits importierten Quellen.
Auf der DSH-Seite wird server.py per stdio verbunden (dsh-mcp-client); die Werkzeugnamen haben etwa die Form mcp__chroma__search.
Suchprinzip
Chunking: Der Text wird asynchron in Seiten gebrochen, Seitennr/Header/Footer werden herausgefiltert, aus je 6 Zeilen ein Absatz (mit 1 gemeinsamer Zeile) erzeugt, Metadaten werden unter
source/page/line_start/line_endgespeichert.Hybride Suche: Chroma-Semantikvektoren (Kosinus) + Zeichen-Bigramm-BM25-Suchschicht, RRF-Fusion – bei einer schwachen semantischen Einbettung Chinesischer Begriffe fängt BM25 exakte Schlüsselwörter wie „大模型/算力/数据要素“ ab und garantiert damit eine stabile Quellenlage.
Abgeleitete Sparse-Cache wird bei Ingest neu gefüllt; erneuter Import merged und überschreibt vorhandene Bestände.
This server cannot be installed
Maintenance
Resources
Unclaimed servers have limited discoverability.
Looking for Admin?
If you are the server author, to access and configure the admin panel.
Related MCP Servers
- AlicenseNot gradedqualityDmaintenanceEnables AI agents to search, deep-read, and build knowledge bases from Markdown, PDF, DOCX, and PPTX documents via MCP tools for retrieval, document navigation, and ingestion.70616MIT
- AlicenseNot gradedqualityBmaintenanceConverts unstructured documents into a searchable knowledge base and exposes retrieval tools via MCP protocol for AI agents to query.MIT
- FlicenseNot gradedqualityCmaintenanceMCP server that indexes a knowledge base into Chroma and provides search tools for retrieving document fragments via vector embeddings.
- FlicenseAqualityBmaintenanceA local-first document retrieval engine that mounts as an MCP tool for agents to index files, search for relevant passages, and let the agent's own LLM answer.4
Related MCP Connectors
OCR, transcription, file extraction, and image generation for AI agents via MCP.
Shared, governed long-term memory for AI agents across tools and sessions via MCP and REST.
Agentic search over your Dewey document collections from any MCP-compatible client.
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/KimTsegzc/xinPlugin_Chroma_fastMCP'
If you have feedback or need assistance with the MCP directory API, please join our Discord server