enterprise-knowledge-integrator
🧠 Enterprise Knowledge Integrator
Подключайте корпоративные приватные данные (PDF, Excel, Word, SQL) к LLM и AI-агентам со встроенной санитизацией PII, гибридным поиском и MCP-сервером.
Живая панель • Быстрый старт • Настройка MCP-сервера • Архитектура • Справочник API
🌟 Зачем нужен Enterprise Knowledge Integrator?
Предприятия имеют разрозненные знания в PDF-документах политик, финансовых моделях Excel/CSV, контрактах и заметках ERP. Прямая подача этих данных в LLM часто приводит к утечке PII, галлюцинациям на числах и потере контекста.
Enterprise Knowledge Integrator — это открытое, легковесное, подключаемое промежуточное ПО, которое превращает необработанные файлы вашей компании в чистый, цитируемый и безопасный контекст для любой LLM или AI-агента.
Related MCP server: doc-intel MCP server
✨ Ключевые возможности
📄 ETL с учётом таблиц (Excel и CSV): Преобразует строки электронных таблиц в markdown-таблицы и семантические группы строк, чтобы LLM никогда не галлюцинировали номера строк или формулы.
🛡️ Встроенный санитайзер PII и секретов: Автоматически обнаруживает и маскирует TCKN, IBAN, кредитные карты, налоговые номера (VKN), телефонные номера и API-ключи перед эмбеддингом или инъекцией в промпт.
⚡ Гибридный поиск (Vector + Okapi BM25 + RRF): Сочетает плотные эмбеддинги с разреженным сопоставлением по ключевым словам с использованием Reciprocal Rank Fusion (RRF) для 100% точности по финансовым кодам и числам.
👥 Управление доступом на основе ролей (RBAC): Обеспечивает уровни допуска к документам (
Public,Internal,Confidential,Restricted) и фильтрацию по отделам.🔍 Валидатор цитирования и галлюцинаций: Автоматически проверяет сгенерированные ответы LLM на соответствие исходным документам и вычисляет оценку уверенности.
🔄 Автоматический наблюдатель за каталогами: Отслеживает ваши папки/подключённые облачные диски и автоматически переиндексирует добавленные или изменённые файлы.
🔌 Универсальные шлюзы:
Model Context Protocol (MCP) для Cursor, Claude Desktop, Antigravity.
FastAPI REST API с Swagger UI.
Интерактивная веб-панель (не требует дополнительных зависимостей).
Адаптер инструментов LangChain / LangGraph.
🏛️ Системная архитектура
graph TD
subgraph Ingestion ["1. Multi-Source Ingestion & ETL"]
F1["📄 Documents (PDF, Word, Markdown)"]
F2["📊 Tabular (Excel, CSV)"]
F3["🗄️ Notes & Text Snippets"]
F1 & F2 & F3 --> PII["🛡️ PII Masker (TCKN, IBAN, Cards)"]
PII --> Chunk["✂️ Semantic & Parent-Child Chunker"]
end
subgraph Storage ["2. Storage & Hybrid Search Engine"]
Chunk --> V["V-Store: Cosine Dense Embeddings"]
Chunk --> B["BM25: Sparse Keyword Index"]
V & B --> RRF["🎯 Reciprocal Rank Fusion (RRF)"]
end
subgraph Governance ["3. Security & Governance"]
RRF --> RBAC["👥 RBAC & Clearance Filter"]
RBAC --> Val["🔍 Citation & Grounding Validator"]
end
subgraph Interfaces ["4. LLM & Agent Gateways"]
Val --> MCP["⚡ MCP Server (Claude Desktop / Cursor)"]
Val --> API["🌐 FastAPI REST API (/api/v1/context)"]
Val --> UI["🖥️ Modern Web Dashboard (/dashboard)"]
Val --> SDK["💼 LangChain / LangGraph Adapter"]
end⚡ Быстрый старт за 60 секунд
1. Установка
git clone https://github.com/your-username/enterprise-knowledge-integrator.git
cd enterprise-knowledge-integrator
pip install -r requirements.txt2. Запуск веб-панели и API
python -m knowledge_integrator.interfaces.api.appОткройте браузер по адресу http://localhost:8088/dashboard, чтобы получить доступ к визуальной панели управления.
💻 Использование CLI
Загрузка текста / заметки политики:
python -m knowledge_integrator.interfaces.cli.main ingest-text \
--title "2025 Travel Policy" \
--content "Daily travel allowance is 2,500 TL. Stays above 5,000 TL require CFO approval." \
--category "policy"Загрузка файлов или каталогов (PDF, Excel, CSV, Word, Markdown):
python -m knowledge_integrator.interfaces.cli.main ingest ./company_docs/ --category "finance"Поиск по базе знаний:
python -m knowledge_integrator.interfaces.cli.main query "What is the travel budget limit?"Список проиндексированных документов:
python -m knowledge_integrator.interfaces.cli.main list⚡ Сервер Model Context Protocol (MCP)
Подключайте корпоративные знания напрямую к Claude Desktop, Cursor IDE или Antigravity.
Добавьте это в ваш claude_desktop_config.json или cursor settings:
{
"mcpServers": {
"company-knowledge": {
"command": "python",
"args": ["-m", "knowledge_integrator.interfaces.cli.main", "serve-mcp"]
}
}
}Доступные MCP-инструменты:
search_company_knowledge: Выполняет гибридный поиск по приватным документам компании.get_company_context: Возвращает чистый, цитируемый контекст, готовый для инъекции в промпт.list_company_documents: Перечисляет все проиндексированные источники и метаданные.ingest_company_note: Динамически сохраняет новую политику или фрагмент знаний.
🌐 Справочник REST API
Метод | Конечная точка | Описание |
|
| Загрузка и индексация файла (PDF, Excel, CSV, Word, MD) |
|
| Загрузка необработанной корпоративной заметки или правила |
|
| Получение цитируемого блока контекста, готового для LLM |
|
| Поиск ранжированных фрагментов (гибридный) |
|
| Список всех проиндексированных документов |
|
| Удаление документа и всех связанных эмбеддингов |
Интерактивная документация Swagger доступна по адресу: http://localhost:8088/docs
🤖 Интеграция с Python и LangChain / LangGraph
from knowledge_integrator import KnowledgeEngine
from knowledge_integrator.agentic_cfo_adapter import AgenticCFOKnowledgeAdapter
# 1. Initialize engine
engine = KnowledgeEngine()
# 2. Ingest document
engine.ingest_file("budget_2025.xlsx", category="finance")
# 3. Retrieve LLM context
ctx = engine.get_context_for_llm("What was the Q3 software budget?")
print(ctx.context_text)
# 4. Use as a LangChain / LangGraph Tool for AI Agents
adapter = AgenticCFOKnowledgeAdapter(engine)
agent_tool = adapter.as_langchain_tool()🐳 Развёртывание в Docker
docker-compose up -d🧪 Запуск тестов
python -m pytest knowledge_integrator/tests/ -v📄 Лицензия
Этот проект распространяется под лицензией MIT — подробности см. в файле LICENSE.
This server cannot be installed
Maintenance
Resources
Unclaimed servers have limited discoverability.
Looking for Admin?
If you are the server author, to access and configure the admin panel.
Related MCP Servers
- AlicenseNot gradedqualityBmaintenanceEnables querying enterprise documents (DOCX, PDF, PPTX) using natural language, with hybrid search and MCP integration for Claude Desktop and other agents.MIT
- FlicenseNot gradedqualityCmaintenanceEnables AI agents to extract structured data from PDFs with confidence scores and provenance, and to search, review, and correct documents via MCP tools, resources, and prompts.
- AlicenseNot gradedqualityCmaintenanceEnables document ingestion, semantic search, and retrieval-augmented generation via MCP tools and REST API, using vector embeddings and intelligent chunking.MIT
- AlicenseNot gradedqualityAmaintenanceProvides a self-hosted knowledge index with document-level permissions, enabling AI agents to retrieve exactly the documents they are authorized to see via MCP. Supports OAuth 2.1, custom embedding models, and runs inside your network.41Apache 2.0
Related MCP Connectors
Multi-engine search for AI agents. Trust scoring, local corpus, MCP-native. Self-hostable, BYOK.
Your memory, everywhere AI goes. Build knowledge once, access it via MCP anywhere.
OCR, transcription, file extraction, and image generation for AI agents via MCP.
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/Enesp4rl4k/enterprise-knowledge-integrator'
If you have feedback or need assistance with the MCP directory API, please join our Discord server