gpu-transcription-mcp
GPU Queue
Сервис транскрибации на базе faster-whisper со встроенной очередью заданий, позволяющий нескольким агентам использовать один GPU без конфликтов. Ядро «очередь/воркер/движок» не привязано к транспорту и доступно через два взаимозаменяемых сервера — выбирайте тот, который поддерживают ваши клиенты:
Сервер | Точка входа | Порт по умолчанию | Клиенты |
MCP |
| 8000 | Агенты с поддержкой MCP (FastMCP) |
Flask |
| 8001 | Любой HTTP/JSON-клиент |
Оба сервера оборачивают один и тот же QueueManager, поэтому задания по-прежнему выполняются по одному, а тела ответов идентичны (общий app/service.py).
Как это работает
submit ─► ┌──────────────┐ one worker, one GPU ┌───────────────┐
│ job queue │ ──────────────────────► │ WhisperEngine │
poll ◄─ └──────────────┘ processed serially └───────────────┘Задание попадает в очередь и немедленно возвращает job_id; затем вы опрашиваете его статус, пока он не станет done (или error). Единственный воркер разбирает очередь по одному заданию за раз, поэтому общий GPU никогда не выполняет две транскрибации одновременно.
Related MCP server: AssemblyAI MCP Server
Установка
pip install -e . # or: uv syncЭта команда подтягивает fastmcp (MCP-транспорт), flask + waitress (HTTP-транспорт) и faster-whisper (движок).
Запуск сервера
Выберите один сервер (они независимы — ни один не импортирует другой):
# MCP transport (streamable-http on :8000)
python server.py
python server.py --port 9000
python server.py --transport stdio # for stdio MCP clients
# Flask transport (HTTP/JSON on :8001)
python flask_server.py
python flask_server.py --port 9001
python flask_server.py --debug # Flask dev server with auto-reloadЗапускайте только один процесс — очередь и реестр заданий хранятся в памяти. Несколько потоков допустимы (waitress использует пул потоков); несколько воркер-процессов — нет, поскольку каждый из них имел бы собственную отдельную неразделяемую очередь.
Flask-сервер (включая продакшн-вариант на waitress) печатает стартовый баннер и логирует в stdout одну строку на каждый запрос, например GET /queue -> 200 (1.2ms).
Конфигурация движка (оба сервера)
Читается из переменных окружения:
WHISPER_MODEL(по умолчаниюdistil-large-v3.5)WHISPER_DEVICE(по умолчаниюauto)WHISPER_COMPUTE_TYPE(по умолчаниюauto)WHISPER_MODEL_DIR
HTTP API (Flask-транспорт)
Метод и путь | Описание |
| Проверка состояния → |
| Проверка живости → |
| Отправить задание: |
| Опрос статуса; |
| Отменить задание, стоящее в очереди или выполняющееся |
| Выполняющееся задание, задания в очереди, количество завершённых |
Пример сессии:
curl localhost:8001/ping
# submit
curl -X POST localhost:8001/transcriptions \
-H 'Content-Type: application/json' \
-d '{"audio_path":"/abs/path/audio.mp3","args":"--format text"}'
# → {"job_id":"j_ab12cd34","position":1, ...}
# poll until "status":"done"
curl localhost:8001/transcriptions/j_ab12cd34
# inspect the queue / cancel
curl localhost:8001/queue
curl -X POST localhost:8001/transcriptions/j_ab12cd34/cancelMCP API (MCP-транспорт)
Предоставляет те же операции в виде пяти инструментов FastMCP:
Инструмент | Описание |
| Проверка живости |
| Поставить задание в очередь; возвращает |
| Опрос задания; |
| Отменить задание, стоящее в очереди или выполняющееся |
| Выполняющееся задание, задания в очереди, количество завершённых |
Быстрые проверки работающего MCP-сервера (с использованием клиента fastmcp):
python test_ping.py # ping the server
python test_live.py --audio /path/audio.mp3 # full submit → poll → print transcriptФлаги args (оба транспорта)
Строка args принимает те же CLI-флаги faster-whisper на каждом транспорте, например --format srt, --model large-v3, --language en, --diarize, --word-timestamps, --beam-size 5. Полный список см. в _ARG_MAP в app/queue_manager.py.
📖 Полный HTTP-справочник: см. docs/HTTP_API.md — схемы запросов и ответов, коды статусов, жизненный цикл задания и флаги args.
Структура проекта
app/
queue_manager.py queue, worker, engine lifecycle, CLI-arg → kwargs bridge
whisper/engine.py faster-whisper wrapper (model stays loaded between jobs)
models.py JobRecord dataclass
service.py payload-shaping shared by both transports
main.py / tools.py MCP transport (create_mcp_app + tool definitions)
flask_app.py Flask transport (create_flask_app + routes)
server.py run the MCP server (:8000)
flask_server.py run the Flask server (:8001)Docker
Входящие в репозиторий Dockerfile / docker-compose.yml запускают MCP-сервер (CMD ["python", "server.py"], порт 8000) с зарезервированным NVIDIA GPU. Чтобы, наоборот, развернуть в контейнере Flask-транспорт, переопределите команду, например:
command: python flask_server.py --port 8000Тесты
pytest -m "not integration" # unit tests (engine mocked) — covers core, MCP, and Flask
pytest -m integration # requires faster-whisper + a real model/audio filetests/test_queue_manager.py— логика очереди/воркера/отменыtests/test_service.py— общий модуль формирования тел ответовtests/test_tools.py— сквозной тест MCP-транспорта (движок замокан)tests/test_flask_app.py— сквозной тест Flask-маршрутов через тестовый клиент
This server cannot be installed
Maintenance
Resources
Unclaimed servers have limited discoverability.
Looking for Admin?
If you are the server author, to access and configure the admin panel.
Related MCP Servers
- FlicenseNot gradedqualityCmaintenanceEnables high-performance audio transcription using Faster Whisper with CUDA acceleration, supporting single and batch audio file processing with multiple output formats (VTT, SRT, JSON).
- AlicenseAqualityFmaintenanceEnables AI assistants to transcribe audio files from URLs or local paths using AssemblyAI's services, with support for speaker diarization, language detection, and asynchronous job management through a standardized MCP interface.4132MIT
- FlicenseAqualityDmaintenanceEnables high-quality transcription and subtitle generation from local media files or URLs using Faster Whisper on local hardware. It supports automatic language detection and integration with MCP clients for seamless speech-to-text workflows.3
- AlicenseAqualityFmaintenanceProvides local audio transcription using whisper.cpp, supporting multiple models and audio formats. Enables transcription of audio files via MCP tools with optional timestamps.3673MIT
Related MCP Connectors
OCR, transcription, file extraction, and image generation for AI agents via MCP.
MCP server for Clipkit — gives AI agents a video toolbox via the Clipkit schema.
YouTube transcripts, search, channels, playlists and bulk transcript jobs for AI agents. 14 tools.
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/ollayf/gpu-transcription-mcp'
If you have feedback or need assistance with the MCP directory API, please join our Discord server