mcp-salutespeech
Click on "Deploy Server".
Wait a few minutes for the server to deploy. Once ready, it will show a "Started" state.
In the chat, type
@followed by the MCP server name and your instructions, e.g., "@mcp-salutespeechRecord my voice and transcribe it"
That's it! The server will respond to your query, and you can continue using it as needed.
Here is a step-by-step guide with screenshots.
MCP SaluteSpeech
MCP SaluteSpeech - это реализация MCP (Model Context Protocol) сервера, предоставляющего инструменты для работы с голосовыми API SaluteSpeech от Сбера. Позволяет AI ассистентам записывать речь пользователя с микрофона, распознавать её с помощью и синтезировать речь из текста.
Сервер предоставляет доступ агентам на основе LLM к голосовому интерфейсу, значительно расширяя возможности взаимодействия с пользователем.
Из чего состоит MCP SaluteSpeech?
MCP SaluteSpeech предоставляет два основных инструмента:
sber_stt_record_and_recognize - записывает аудио с микрофона до появления 3-секундной паузы, отправляет запись на API распознавания речи SaluteSpeech и возвращает распознанный текст.
synthesize_speech - синтезирует речь из текста с помощью API SaluteSpeech и воспроизводит её через аудиоустройство компьютера.
Эти инструменты особенно полезны для:
Создания голосовых интерфейсов для AI ассистентов
Разработки приложений с поддержкой голосового управления
Интеграции голосовых возможностей в агентные системы на базе LLM
Related MCP server: @theyahia/yandex-speechkit-mcp
Возможности
Реализация голосовых инструментов для MCP (Model Context Protocol)
Полная интеграция с API SaluteSpeech от Сбера
Готовность к работе с такими ассистетами как Cursor, Windsurf и другими
Поддержка распознавания и синтеза русской речи
Возможные проблемы с аудиоустройствами и дополнительные зависимости
Если запись или воспроизведение аудио не работает "из коробки", возможно, потребуется установить дополнительные зависимости для вашей операционной системы:
Linux: убедитесь, что установлен пакет
portaudioи соответствующие dev-заголовки. Например, для Ubuntu/Debian:sudo apt-get install portaudio19-devТакже может понадобиться установить
alsa-utils:sudo apt-get install alsa-utilsmacOS: обычно всё работает из коробки, но убедитесь, что приложению даны разрешения на доступ к микрофону и динамикам (Системные настройки → Конфиденциальность → Микрофон/Звук).
Windows: убедитесь, что установлены последние драйверы для вашей звуковой карты. Для работы некоторых библиотек может понадобиться Microsoft Visual C++ Redistributable.
Если после установки зависимостей проблема не решена, проверьте сообщения об ошибках в консоли — они могут подсказать, какой компонент отсутствует или требует настройки.
Настройка MCP сервера
Добавьте этот MCP сервер к вашему агенту.
"mcpServers": {
"mcp-salutespeech": {
"command": "uvx",
"args": [
"--from", "mcp_voice_salute", "mcp-salutespeech"
],
"enabled": true,
"env": {
"SALUTE_SPEECH": "ВАШ_ТОКЕН_SALUTESPEECH"
}
}
}Описание инструментов
sber_stt_record_and_recognize
Записывает аудио с микрофона до появления 3-секундной паузы, затем отправляет запись на API распознавания речи SaluteSpeech и возвращает распознанный текст.
Вход: Не требует параметров Поведение: Выполняет запись с микрофона, распознавание и возвращает текст Выход: Строка с распознанным текстом
synthesize_speech
Синтезирует речь из текста с помощью API SaluteSpeech и воспроизводит её через аудиоустройство компьютера.
Вход:
text(string) — Текст для преобразования в речьformat(string, опционально) — Формат аудио (по умолчанию "wav16")voice(string, опционально) — Голос для синтеза (по умолчанию "Bys_24000")
Поведение: Преобразует текст в речь и воспроизводит через динамики Выход: Подтверждение успешного воспроизведения
Как добавить этот MCP сервер в Cursor
Есть два способа добавить MCP сервер в Cursor:
Глобально - добавить сервер в файл
~/.cursor/mcp.jsonДля проекта - добавить сервер в файл
.cursor/mcp.jsonв вашем проекте
Требования к окружению
Для работы с API требуется установить переменную окружения:
SALUTE_SPEECH - токен Basic авторизации для доступа к API SaluteSpeechЛицензия
MIT License
This server cannot be deployed
Maintenance
Related MCP Connectors
Speech, transcription, voice agents, Trace, Recap, dubbing and narration with browser OAuth.
Audio for your agent: transcribe, speak, translate, summarise, plus sound effects and music.
Pronunciation assessment, phoneme scoring, speaker voice ID, audio transcription, speech synthesis.
- ChamadeOAuthio.chamade
Voice and chat for AI agents — Discord, Teams, Meet, Slack, Zoom, Telegram, WhatsApp, NC Talk, SIP
Related MCP Servers
- AlicenseAqualityBmaintenanceProvides speech recognition (STT) and synthesis (TTS) tools via the Sber SaluteSpeech API, enabling audio transcription and voice generation through natural language.547 npm1MIT
- AlicenseBqualityFmaintenanceEnables speech recognition, synthesis, and voice listing via Yandex SpeechKit API through 5 tools.552 npmMIT

leanvox-mcpofficial
AlicenseNot gradedqualityDmaintenanceEnables text-to-speech generation, voice cloning, dialogue creation, and other TTS operations through natural language in MCP-compatible AI assistants.7 npmMIT- AlicenseNot gradedqualityCmaintenanceEnables AI agents to generate high-quality speech with 54+ voices in multiple languages via MCP tools.19Apache 2.0