wesioiot-mcp
wesioiot-mcp
MCP server para mídia MiniMax (TTS, imagem, vídeo, música) roteada pelo proxy wesioiot (api.wesioiot.top).
Tools disponíveis (7)
Tool | Função | Custo aprox. |
| TTS (vozes PT-BR, áudio hex) | $0.10 / 1k chars |
| Lista 8 vozes PT-BR disponíveis | grátis |
| Geração de imagem (image-01) | $0.02 / imagem |
| Geração de vídeo (Hailuo 2.3, async) | $0.20–0.50 / vídeo |
| Polling de job de vídeo | grátis |
| Geração de música ( | US$ 0,15 / faixa de até 5 min, conforme tabela oficial MiniMax |
| Polling de job legado de música | grátis |
Disponibilidade: desde 2026-08-20, a MiniMax não habilita a Music API hosted para novos usuários; somente clientes pagantes elegíveis preexistentes podem continuar. Se o upstream responder HTTP 410, a tool mostra o diagnóstico, não repete a chamada e não cria áudio/task. Não há fallback automático para a API direta.
Related MCP server: mmxomni
O que é o proxy wesioiot
api.wesioiot.top é um proxy OpenAI-compatible que faz frente à API da MiniMax. Ele autentica clientes com tokens mmx-… (em vez das chaves diretas sk-cp-… da MiniMax), permitindo rate-limit por cliente, log de auditoria e controle de cota. Este MCP usa o proxy para todas as chamadas de mídia, então o mesmo token que o chat usa funciona aqui.
Instalação
1. Instalar dependências
npm installRequer Node.js 20+.
2. Obter um token do proxy
Você precisa de uma chave mmx-… emitida pelo proxy wesioiot. Se você roda o proxy, crie a chave pelo dashboard ou direto no SQLite:
node -e "
const Database = require('better-sqlite3');
const db = new Database('/caminho/para/proxy/data/proxy.sqlite');
const k = db.prepare('SELECT key FROM api_keys WHERE label=?').get('seu-label');
console.log(k.key);
"3. Configurar o MCP
Opção A — hermes mcp add (Hermes Agent)
printf "y\ny\n" | hermes mcp add wesioiot-mcp \
--command node \
--env WESIOIOT_API_KEY=mmx-... \
--env WESIOIOT_API_HOST=https://api.wesioiot.top \
--env WESIOIOT_MCP_BASE_PATH=/caminho/para/output \
--args /caminho/absoluto/para/wesioiot-mcp/build/index.js
# Bug conhecido: o `hermes mcp add --env` só salva a última env var.
# Patchear as outras com:
hermes config set mcp_servers.wesioiot-mcp.env.WESIOIOT_API_KEY mmx-... --force
hermes config set mcp_servers.wesioiot-mcp.env.WESIOIOT_API_HOST https://api.wesioiot.top --force
hermes config set mcp_servers.wesioiot-mcp.enabled true --forceOpção B — Cliente MCP genérico (stdio)
Configure seu cliente para executar:
node /caminho/absoluto/para/wesioiot-mcp/build/index.jsCom as variáveis de ambiente:
Variável | Obrigatório | Padrão | Exemplo |
| ✅ | — |
|
| ❌ |
| URL custom do proxy |
| ❌ |
|
|
4. Validar
hermes mcp test wesioiot-mcp
# Esperado: ✓ Connected (~20s) + 7 toolsParâmetros das tools
text_to_audio
text(string, obrigatório) — texto a sintetizarvoiceId(string) — ID da voz (padrão:Portuguese_FascinatingBoy)model(string) —speech-02-hd,speech-02-turbo,speech-2.6-hd,speech-2.8-turbospeed(number 0.5–2.0) — velocidade da falavol(number 0.1–10.0) — volumepitch(number -12 a 12) — deslocamento de tomoutputDirectory(string) — onde salvar o MP3 (padrão:WESIOIOT_MCP_BASE_PATH)
text_to_image
prompt(string, obrigatório) — descrição da imagemaspectRatio(string) —1:1,16:9,9:16, etc.n(number) — quantidade de imagens (padrão 1)outputDirectory(string) — onde salvar
generate_video
prompt(string, obrigatório) — descrição do vídeoRetorna um
taskId. Usequery_video_generationpara checar.
music_generation
lyrics(string, obrigatório) — letra da músicaprompt(string) — descrição de gênero, instrumentos, clima e andamentomodel—music-3.0padrão recomendado;music-2.6legadotitleestyle(opcionais) — incorporados aoprompt; não são enviados como campos não documentadosoutputDirectory(string) — onde salvarEnvia
audio_settingMP3/44.1 kHz/256 kbps e salvadata.audiohexadecimal; mantém retorno assíncrono legado se houvertask_id.Se HTTP 410: mostra diagnóstico, não repete chamada e não cria arquivo nem inventa
task_id.
Vozes PT-BR disponíveis
Portuguese_FascinatingBoy (padrão)
Portuguese_SmartYoungGirl
Portuguese_ConfidentWoman
Portuguese_Wiselady
Portuguese_Deep-VoicedGentleman
Portuguese_Jovialman
Portuguese_ThoughtfulMan
Portuguese_Strong-WilledBoyArquitetura
┌──────────────┐ stdio ┌──────────────────┐ HTTPS ┌──────────────────┐
│ MCP client │ ─────────▶ │ wesioiot-mcp │ ─────────▶ │ api.wesioiot.top │
│ (Hermes AI) │ JSON-RPC │ (Node.js stdio) │ Bearer │ (proxy) │
└──────────────┘ └──────────────────┘ mmx-... └────────┬─────────┘
│ upstream
▼
┌──────────────────┐
│ api.minimax.io │
│ (MiniMax) │
└──────────────────┘O proxy audita cada chamada, aplica rate-limit por chave e repassa para a API upstream da MiniMax. O token mmx-… só é válido contra o proxy.
Por que um MCP separado
O pacote oficial minimax-mcp da MiniMax conecta direto no api.minimax.io com chave pessoal sk-cp-…. Este server:
Usa seu token do proxy (
mmx-…) — mídia passa pelo mesmo pipeline de billing/auditoria do chatRemove
voice_clone,voice_designeplay_audio(não expostos pelo proxy)Mantém a mesma interface JSON-RPC / stdio, então qualquer cliente MCP-compatível funciona
Você pode rodar os dois MCPs em paralelo: minimax-mcp para clonar vozes, wesioiot-mcp para tudo que deve ser cobrado do proxy.
Licença
MIT
This server cannot be deployed
Maintenance
Related MCP Connectors
MCP server for Hailuo (MiniMax) AI video generation
MCP server for MiniMax H3 multimodal video generation
MCP server for Wan AI video generation
MCP server for Google Veo AI video generation
Related MCP Servers
- AlicenseAqualityNot gradedmaintenanceEnables interaction with MiniMax AI APIs for text-to-speech, voice cloning, video generation, image generation, and music creation through MCP clients like Claude Desktop and Cursor.9MIT
- AlicenseNot gradedqualityDmaintenanceModel Context Protocol server exposing MiniMax's image, speech, music, and video generation APIs as MCP tools for use with any MCP-aware host.5,444 npmMIT
- AlicenseNot gradedqualityCmaintenanceMCP server for MiniMax's multimodal generation models, enabling text-to-speech, voice cloning, image, video, and music creation through natural language.MIT
- AlicenseAqualityCmaintenanceMulti-provider media generation MCP server that generates images, videos, audio, and transcriptions from text prompts using OpenAI, xAI, Gemini, ElevenLabs, and BFL through a single unified interface.683 npm2MIT