Skip to main content
Glama

File Analysis MCP

Личный MCP-сервер для чтения неструктурированных документов (PDF, DOCX, PPTX, SVG, PNG, JPG) в указанной папке и извлечения их структуры/содержимого. Резюмирование выполняет не этот сервер, а LLM Claude Code/Codex, который вызывает этот сервер. Этот сервер отвечает только за извлечение текста/изображений и определение структуры папок.

Предварительные требования

1. Python

python и pip должны работать корректно. Если в Windows python показывает подсказку об установке из Microsoft Store, проверьте следующее:

  1. Установите Python 3.11 или новее (64-bit) с python.org, во время установки отметьте «Add python.exe to PATH».

  2. Если python по-прежнему указывает на заглушку Store: Параметры → Приложения → Дополнительные параметры приложений → Псевдонимы выполнения приложений, отключите пункты python.exe/python3.exe в App Installer.

2. Tesseract-OCR (требуется для OCR PNG, опционально)

Установите через UB-Mannheim Tesseract installer, затем укажите в .mcp.json значение TESSERACT_CMD, соответствующее фактическому пути установки. Без установки сервер продолжит работать корректно: при анализе PNG будет возвращено само изображение (мультимодально), а текст OCR будет заменён сообщением «unavailable».

Related MCP server: ReadPDFx - OCR PDF MCP Server

Установка

cd C:\Users\20229\Desktop\MCP
python -m venv .venv
.venv\Scripts\pip install -r requirements.txt

Проверка

# 1. 샘플 파일 생성 (pdf/docx/pptx/svg/png/txt 각 1개)
.venv\Scripts\python scripts\generate_fixtures.py

# 2. MCP 없이 extractor만 직접 테스트
.venv\Scripts\python scripts\smoke_test.py

Регистрация в Claude Code

.mcp.json в этой папке уже регистрирует сервер в области проекта. Убедитесь, что путь command соответствует фактическому расположению .venv\Scripts\python.exe, затем перезапустите Claude Code или проверьте командой /mcp, что сервер file-analysis находится в состоянии connected.

Предоставляемые инструменты

  • scan_folder(folder_path, max_depth=3, max_files=200): возвращает только дерево папок и количество файлов по расширениям (содержимое не читается).

  • analyze_file(file_path, max_chars=None): извлекает содержимое одного файла в соответствии с его расширением.

    • pdf/docx/pptx/svg → текст/информация о структуре

    • png/jpg/jpeg → изображение (мультимодально) + текст OCR

Ограничения

  • SVG парсится только по XML-структуре (текстовые узлы, количество фигур, viewBox). По чисто векторному рисунку без текста невозможно понять, что на нём изображено визуально — при необходимости конвертируйте его в PNG и проанализируйте заново.

  • Объём извлечения ограничен: PDF — 50 страниц/50 000 символов, PPTX — 100 слайдов/50 000 символов, OCR PNG — 20 000 символов и т.д. При превышении в результат включаются truncated: true и поясняющее сообщение.

F
license - not found
Not graded
quality - not tested
C
maintenance

Maintenance

Maintainers
Response time
Release cycle
Releases (12mo)
Commit activity

Resources

Unclaimed servers have limited discoverability.

Looking for Admin?

If you are the server author, to access and configure the admin panel.

Related MCP Servers

  • A
    license
    Not graded
    quality
    D
    maintenance
    Enables reading and processing various document formats including Word, PDF, RTF, and text files. Supports extracting media elements like images and links, with features for PDF page range selection and automatic text encoding detection.
    8
    MIT
  • A
    license
    Not graded
    quality
    D
    maintenance
    Provides intelligent OCR and PDF processing capabilities that automatically detect whether PDFs contain digital text or scanned images and apply appropriate extraction methods. Supports text extraction, OCR processing, structure analysis, and batch operations.
    MIT
  • A
    license
    Not graded
    quality
    F
    maintenance
    Enables PDF document processing including text, image, and table extraction, as well as intelligent classification and similarity analysis across multiple languages.
    49
    MIT
  • F
    license
    Not graded
    quality
    C
    maintenance
    Enables local, read-only extraction of text and structure from PDF, DOCX, PPTX, SVG, and PNG files, including OCR for images, directory tree and metadata reporting, with strict path isolation and audit logging.

View all related MCP servers

Related MCP Connectors

View all MCP Connectors

Latest Blog Posts

MCP directory API

We provide all the information about MCP servers via our MCP API.

curl -X GET 'https://glama.ai/api/mcp/v1/servers/JAEJOONYOO/YJJ_MCP'

If you have feedback or need assistance with the MCP directory API, please join our Discord server