ChunkTuner
chunktuner
Optimizador automático de fragmentación y servidor MCP para pipelines de RAG.
Proporciónale tus documentos. Prueba múltiples estrategias de fragmentación, mide cuál permite a una IA responder preguntas con mayor precisión y te indica la ganadora.
Qué hace
Al construir un pipeline de RAG, la forma en que divides los documentos en fragmentos afecta directamente la calidad de la recuperación. chunktuner automatiza el proceso de encontrar la estrategia de fragmentación óptima para tu corpus, modelo de embedding y caso de uso específicos.
Evalúa estrategias como ventanas de tokens fijos, división recursiva de caracteres, división semántica, fragmentación estructural de PDF y fragmentación de código basada en AST; luego califica cada una según métricas de recuperación reales (recuperación de tokens, MRR, NDCG) y métricas de generación opcionales (fidelidad RAGAS, relevancia de la respuesta).
Related MCP server: golden-dataset-mcp
Interfaces
Biblioteca de Python — integración programática en tu pipeline
CLI (
chunk-tune) — ajuste guiado por el usuario desde la terminalServidor MCP — úsalo directamente desde Claude Desktop o cualquier host MCP
Inicio rápido
# Install
uv tool install chunktuner
# Initialize workspace
chunk-tune init --provider openai
# See cost estimate before running anything
chunk-tune estimate ./my_docs --use-case rag_qa
# Get a recommendation
chunk-tune recommend ./my_docs --use-case rag_qaAPI de Python:
from pathlib import Path
from chunktuner import FileIngestor, LiteLLMEmbeddingFunction, AutoTuner
from chunktuner import default_registry, Evaluator, ScoreCalculator
docs = FileIngestor().ingest_dir(Path("./my_docs"))
embedding_fn = LiteLLMEmbeddingFunction("text-embedding-3-small")
tuner = AutoTuner(
strategies=default_registry,
evaluator=Evaluator(embedding_fn),
scorer=ScoreCalculator(use_case="rag_qa"),
)
result = tuner.recommend(docs, use_case="rag_qa")
print(result.best.config)Estrategias soportadas
Estrategia | Ideal para |
| Base; ventanas de tokens uniformes |
| Prosa general y documentación |
| Artículos con carga temática |
| Documentos Markdown estructurados |
| PDFs con regiones de diseño y tablas |
| PDF/DOCX con diseño y texto mixtos |
| Documentos largos con referencias cruzadas densas |
| Documentos narrativos de alto valor |
| Repositorios de código (Python, JavaScript) |
| Base de código (ventana deslizante) |
Servidor MCP (Claude Desktop)
FastMCP de Python (chunk-tune-mcp, stdio). Sin compilación de Node.js. Consulta docs/mcp_setup.md.
Añádelo a tu .mcp.json:
{
"mcpServers": {
"chunktuner": {
"command": "uvx",
"args": ["--from", "chunktuner[mcp]", "chunk-tune-mcp"],
"env": {
"CHUNK_TUNER_BASE_DIR": "/path/to/your/corpus"
}
}
}
}Herramientas disponibles: list_strategies, preview_chunks, evaluate_chunking, recommend_config.
Referencia de CLI
chunk-tune init Bootstrap workspace config
chunk-tune analyze Quick structural scan (no API cost)
chunk-tune estimate Dry-run cost/token estimate
chunk-tune evaluate Full evaluation across strategies
chunk-tune recommend Evaluation + best config recommendation
chunk-tune compare Side-by-side comparison of specific strategies
chunk-tune preview Inspect how a strategy splits a document
chunk-tune cache Manage embedding and chunk cacheOpciones de instalación
uv add chunktuner # library
uv tool install chunktuner # global CLI
uvx chunktuner # ephemeral, no install
# With optional extras
uv add "chunktuner[docling]" # PDF/DOCX support
uv add "chunktuner[ragas]" # generation metrics
uv add "chunktuner[semantic]" # semantic chunking
uv add "chunktuner[code]" # AST code chunking
uv add "chunktuner[all]" # everythingContribución
Consulta CONTRIBUTING.md.
👨🏻💻 Autor
Desarrollador full stack con experiencia en la creación de aplicaciones de IA de extremo a extremo.
Maintenance
Resources
Unclaimed servers have limited discoverability.
Looking for Admin?
If you are the server author, to access and configure the admin panel.
Related MCP Servers
- AlicenseNot gradedqualityDmaintenanceExposes queryable GPU inference benchmark data (quantization, throughput, VRAM, concurrent users) as tools for LLM clients.MIT
- AlicenseAqualityBmaintenanceEnables version-controlled golden dataset management and semantic evaluation for RAG/LLM pipelines using TF-IDF cosine similarity, without requiring an LLM API key.9MIT
- AlicenseNot gradedqualityDmaintenanceEnables LLMs to search and retrieve information from large technical documentation (OpenAPI specs, markdown) via intelligent chunking and semantic search.MIT
- AlicenseNot gradedqualityCmaintenanceEvaluates RAG outputs on faithfulness, answer relevancy, and context precision using an LLM-as-a-Judge backend. Exposes tools for running evaluations, scoring individual samples, and checking thresholds, enabling CI gating and on-demand assessment via MCP.MIT
Related MCP Connectors
Multi-LLM entity enrichment: schemas, single/batch enrichment, fusion, model benchmarks.
Bounded tools for rendering, extraction, RAG, enrichment, local discovery and review analysis.
Machine-readable utilities and datasets for AI agents.
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/shantanu-deshmukh/chunktuner'
If you have feedback or need assistance with the MCP directory API, please join our Discord server