ChunkTuner
chunktuner
Автоматический настройщик разбиения на чанки и MCP-сервер для RAG-конвейеров.
Предоставьте ему свои документы. Он опробует несколько стратегий разбиения, оценит, какая из них позволяет ИИ отвечать на вопросы наиболее точно, и укажет победителя.
Что он делает
При создании RAG-конвейера то, как вы разбиваете документы на чанки, напрямую влияет на качество поиска. chunktuner автоматизирует процесс поиска оптимальной стратегии разбиения для вашего конкретного корпуса, модели эмбеддингов и варианта использования.
Он тестирует такие стратегии, как окна с фиксированным количеством токенов, рекурсивное разбиение по символам, семантическое разбиение, структурное разбиение PDF и разбиение кода на основе AST, а затем оценивает каждую из них по реальным метрикам поиска (отзыв токенов, MRR, NDCG) и дополнительным метрикам генерации (достоверность RAGAS, релевантность ответа).
Related MCP server: golden-dataset-mcp
Интерфейсы
Библиотека Python — программная интеграция в ваш конвейер
CLI (
chunk-tune) — ручная настройка из терминалаMCP-сервер — использование напрямую из Claude Desktop или любого хоста MCP
Быстрый старт
# Install
uv tool install chunktuner
# Initialize workspace
chunk-tune init --provider openai
# See cost estimate before running anything
chunk-tune estimate ./my_docs --use-case rag_qa
# Get a recommendation
chunk-tune recommend ./my_docs --use-case rag_qaPython API:
from pathlib import Path
from chunktuner import FileIngestor, LiteLLMEmbeddingFunction, AutoTuner
from chunktuner import default_registry, Evaluator, ScoreCalculator
docs = FileIngestor().ingest_dir(Path("./my_docs"))
embedding_fn = LiteLLMEmbeddingFunction("text-embedding-3-small")
tuner = AutoTuner(
strategies=default_registry,
evaluator=Evaluator(embedding_fn),
scorer=ScoreCalculator(use_case="rag_qa"),
)
result = tuner.recommend(docs, use_case="rag_qa")
print(result.best.config)Поддерживаемые стратегии
Стратегия | Лучше всего подходит для |
| Базовый уровень; равномерные окна токенов |
| Общая проза и документация |
| Статьи с выраженной тематикой |
| Структурированные Markdown-документы |
| PDF-файлы с областями макета и таблицами |
| PDF/DOCX со смешанным макетом и текстом |
| Длинные документы с плотными перекрестными ссылками |
| Важные повествовательные документы |
| Репозитории кода (Python, JavaScript) |
| Базовый уровень для кода (скользящее окно) |
MCP-сервер (Claude Desktop)
Python FastMCP (chunk-tune-mcp, stdio). Без сборки Node.js. См. docs/mcp_setup.md.
Добавьте в ваш .mcp.json:
{
"mcpServers": {
"chunktuner": {
"command": "uvx",
"args": ["--from", "chunktuner[mcp]", "chunk-tune-mcp"],
"env": {
"CHUNK_TUNER_BASE_DIR": "/path/to/your/corpus"
}
}
}
}Доступные инструменты: list_strategies, preview_chunks, evaluate_chunking, recommend_config.
Справочник CLI
chunk-tune init Bootstrap workspace config
chunk-tune analyze Quick structural scan (no API cost)
chunk-tune estimate Dry-run cost/token estimate
chunk-tune evaluate Full evaluation across strategies
chunk-tune recommend Evaluation + best config recommendation
chunk-tune compare Side-by-side comparison of specific strategies
chunk-tune preview Inspect how a strategy splits a document
chunk-tune cache Manage embedding and chunk cacheВарианты установки
uv add chunktuner # library
uv tool install chunktuner # global CLI
uvx chunktuner # ephemeral, no install
# With optional extras
uv add "chunktuner[docling]" # PDF/DOCX support
uv add "chunktuner[ragas]" # generation metrics
uv add "chunktuner[semantic]" # semantic chunking
uv add "chunktuner[code]" # AST code chunking
uv add "chunktuner[all]" # everythingУчастие в разработке
См. CONTRIBUTING.md.
👨🏻💻 Автор
Full-stack разработчик с опытом создания E2E AI-приложений.
Maintenance
Resources
Unclaimed servers have limited discoverability.
Looking for Admin?
If you are the server author, to access and configure the admin panel.
Related MCP Servers
- AlicenseNot gradedqualityDmaintenanceExposes queryable GPU inference benchmark data (quantization, throughput, VRAM, concurrent users) as tools for LLM clients.MIT
- AlicenseAqualityBmaintenanceEnables version-controlled golden dataset management and semantic evaluation for RAG/LLM pipelines using TF-IDF cosine similarity, without requiring an LLM API key.9MIT
- AlicenseNot gradedqualityDmaintenanceEnables LLMs to search and retrieve information from large technical documentation (OpenAPI specs, markdown) via intelligent chunking and semantic search.MIT
- AlicenseNot gradedqualityCmaintenanceEvaluates RAG outputs on faithfulness, answer relevancy, and context precision using an LLM-as-a-Judge backend. Exposes tools for running evaluations, scoring individual samples, and checking thresholds, enabling CI gating and on-demand assessment via MCP.MIT
Related MCP Connectors
Multi-LLM entity enrichment: schemas, single/batch enrichment, fusion, model benchmarks.
Bounded tools for rendering, extraction, RAG, enrichment, local discovery and review analysis.
Machine-readable utilities and datasets for AI agents.
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/shantanu-deshmukh/chunktuner'
If you have feedback or need assistance with the MCP directory API, please join our Discord server