file-analysis
File Analysis MCP
Личный MCP-сервер для чтения неструктурированных документов (PDF, DOCX, PPTX, SVG, PNG, JPG) в указанной папке и извлечения их структуры/содержимого. Резюмирование выполняет не этот сервер, а LLM Claude Code/Codex, который вызывает этот сервер. Этот сервер отвечает только за извлечение текста/изображений и определение структуры папок.
Предварительные требования
1. Python
python и pip должны работать корректно. Если в Windows python показывает подсказку об установке из Microsoft Store, проверьте следующее:
Установите Python 3.11 или новее (64-bit) с python.org, во время установки отметьте «Add python.exe to PATH».
Если
pythonпо-прежнему указывает на заглушку Store: Параметры → Приложения → Дополнительные параметры приложений → Псевдонимы выполнения приложений, отключите пункты python.exe/python3.exe в App Installer.
2. Tesseract-OCR (требуется для OCR PNG, опционально)
Установите через UB-Mannheim Tesseract installer, затем укажите в .mcp.json значение TESSERACT_CMD, соответствующее фактическому пути установки. Без установки сервер продолжит работать корректно: при анализе PNG будет возвращено само изображение (мультимодально), а текст OCR будет заменён сообщением «unavailable».
Related MCP server: ReadPDFx - OCR PDF MCP Server
Установка
cd C:\Users\20229\Desktop\MCP
python -m venv .venv
.venv\Scripts\pip install -r requirements.txtПроверка
# 1. 샘플 파일 생성 (pdf/docx/pptx/svg/png/txt 각 1개)
.venv\Scripts\python scripts\generate_fixtures.py
# 2. MCP 없이 extractor만 직접 테스트
.venv\Scripts\python scripts\smoke_test.pyРегистрация в Claude Code
.mcp.json в этой папке уже регистрирует сервер в области проекта. Убедитесь, что путь command соответствует фактическому расположению .venv\Scripts\python.exe, затем перезапустите Claude Code или проверьте командой /mcp, что сервер file-analysis находится в состоянии connected.
Предоставляемые инструменты
scan_folder(folder_path, max_depth=3, max_files=200): возвращает только дерево папок и количество файлов по расширениям (содержимое не читается).analyze_file(file_path, max_chars=None): извлекает содержимое одного файла в соответствии с его расширением.pdf/docx/pptx/svg → текст/информация о структуре
png/jpg/jpeg → изображение (мультимодально) + текст OCR
Ограничения
SVG парсится только по XML-структуре (текстовые узлы, количество фигур, viewBox). По чисто векторному рисунку без текста невозможно понять, что на нём изображено визуально — при необходимости конвертируйте его в PNG и проанализируйте заново.
Объём извлечения ограничен: PDF — 50 страниц/50 000 символов, PPTX — 100 слайдов/50 000 символов, OCR PNG — 20 000 символов и т.д. При превышении в результат включаются
truncated: trueи поясняющее сообщение.
This server cannot be installed
Maintenance
Resources
Unclaimed servers have limited discoverability.
Looking for Admin?
If you are the server author, to access and configure the admin panel.
Related MCP Servers
- AlicenseNot gradedqualityDmaintenanceEnables reading and processing various document formats including Word, PDF, RTF, and text files. Supports extracting media elements like images and links, with features for PDF page range selection and automatic text encoding detection.8MIT
- AlicenseNot gradedqualityDmaintenanceProvides intelligent OCR and PDF processing capabilities that automatically detect whether PDFs contain digital text or scanned images and apply appropriate extraction methods. Supports text extraction, OCR processing, structure analysis, and batch operations.MIT
- AlicenseNot gradedqualityFmaintenanceEnables PDF document processing including text, image, and table extraction, as well as intelligent classification and similarity analysis across multiple languages.49MIT
- FlicenseNot gradedqualityCmaintenanceEnables local, read-only extraction of text and structure from PDF, DOCX, PPTX, SVG, and PNG files, including OCR for images, directory tree and metadata reporting, with strict path isolation and audit logging.
Related MCP Connectors
Read PDFs and images as markdown or text, with exact costs and hard spend caps. $0.75/1k pages.
Turn any PDF into structured JSON via AI + OCR: invoices, bank statements, contracts.
Tag, rename, and enrich PDFs and images. Free tier: 1,500 tags/month, no credit card.
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/JAEJOONYOO/YJJ_MCP'
If you have feedback or need assistance with the MCP directory API, please join our Discord server