opencode-eyes-nvidia
opencode-eyes-nvidia 👁️
Servidor MCP que proporciona capacidad de descripción de imágenes utilizando la API alojada de NVIDIA NIM
(https://integrate.api.nvidia.com/v1) con el modelo multimodal MiniMax-M3.
Proporciona "ojos" a modelos que no tienen capacidad multimodal. Introduce una imagen y obtén una descripción textual detallada de la misma.
Funciones
Herramienta | Descripción |
| Describe el contenido de una imagen; por defecto usa el modelo multimodal MiniMax-M3 |
| Lista los modelos multimodales (visión) disponibles en la API de NVIDIA NIM |
Related MCP server: vision-mcp
Modelos multimodales
El modelo predeterminado es minimaxai/minimax-m3 (entrada de texto/imagen/video → salida de texto, contexto de 1M, compatible con razonamiento).
Se puede cambiar mediante NVIDIA_MODEL o el parámetro model de describe_image:
ID del modelo | Descripción |
| MiniMax-M3 VLM multimodal MoE (predeterminado, compatible con imagen/video) |
| Meta Llama 3.2 11B Vision |
| Meta Llama 3.2 90B Vision |
| NVIDIA Nemotron Nano VL 8B |
| Google Gemma 3 27B IT |
| NVIDIA Nemotron Nano 12B v2 VL |
| Qwen 3.5 397B A17B VLM |
Variables de entorno
Variable | Obligatoria | Valor predeterminado | Descripción |
| No* | — | Clave API individual de NVIDIA (obtenerla en https://build.nvidia.com, |
| No* | — | Varias claves, separadas por coma / punto y coma / espacio / salto de línea |
| No* | — | Claves numeradas, se leen secuencialmente desde |
| No |
| Dirección base de la API |
| No |
| Modelo multimodal utilizado por defecto |
| No |
| Tiempo de espera de la solicitud a la API (segundos) |
| No |
| Escala el lado más largo de la imagen a ese número de píxeles antes de enviarla; 0 significa sin escalado |
| No |
| Calidad de compresión JPEG antes del envío (0-100) |
| No | (vacío) | Modo de razonamiento de MiniMax-M3: |
| No | Número de claves | Intentos totales de rotación (entre todas las claves) |
| No |
| Segundos de espera tras cada fallo (esperando a que se renueve la cuota) |
* Se requiere al menos una clave: basta con NVIDIA_API_KEY, NVIDIA_API_KEYS o NVIDIA_API_KEY_1..N; se pueden configurar varias a la vez (se combinan eliminando duplicados).
Rotación de claves (cambio automático entre múltiples claves)
Se admite configurar varias claves API: las solicitudes se usan en orden y, ante un error, se cambia automáticamente a la siguiente clave. La clave original no se elimina, simplemente se coloca al final de la cola, esperando a que se renueve su cuota. Todo el proceso es automático y no requiere intervención manual.
Cómo funciona:
Al iniciar, todas las claves se combinan en una cola (sin duplicados, en el orden
NVIDIA_API_KEY→NVIDIA_API_KEYS→NVIDIA_API_KEY_1..N).Las solicitudes usan por defecto la clave al frente de la cola.
Ante un error reintentable (HTTP
401 / 403 / 404 / 408 / 429 / 5xx, o tiempo de espera de conexión): la clave del frente se mueve al final, se esperaNVIDIA_ROTATION_BACKOFFsegundos y se reintenta con la siguiente clave.Solo si todas las claves se han rotado (un total de
NVIDIA_ROTATION_MAX_RETRIESintentos) sin éxito, se lanza el último error.El estado de la cola se conserva entre llamadas: las claves limitadas quedan al final y, cuando les toque de nuevo, la cuota suele haberse renovado.
Ejemplo:
# 方式一:逗号分隔多个 Key
set NVIDIA_API_KEYS=nvapi-key-1,nvapi-key-2,nvapi-key-3
# 方式二:编号 Key
set NVIDIA_API_KEY_1=nvapi-key-1
set NVIDIA_API_KEY_2=nvapi-key-2
# 方式三:单个 Key(向后兼容)
set NVIDIA_API_KEY=nvapi-key-1En la configuración de OpenCode, pasa las variables de entorno al servicio MCP:
{
"mcp": {
"opencode-eyes-nvidia": {
"type": "local",
"command": ["python", "-m", "opencode_eyes_nvidia"],
"enabled": true,
"timeout": 120000,
"environment": {
"NVIDIA_API_KEYS": "{env:NVIDIA_API_KEYS}"
}
}
}
}Instalación
pip install -r requirements.txtO instalar como paquete:
pip install .Ejecución
# 设置环境变量(Windows,至少一种)
set NVIDIA_API_KEY=nvapi-你的key
# 或 set NVIDIA_API_KEYS=nvapi-key-1,nvapi-key-2
# 启动服务
python -m opencode_eyes_nvidiaConfiguración en OpenCode
{
"mcp": {
"opencode-eyes-nvidia": {
"type": "local",
"command": ["python", "-m", "opencode_eyes_nvidia"],
"enabled": true,
"timeout": 120000,
"environment": {
"NVIDIA_API_KEYS": "{env:NVIDIA_API_KEYS}",
"NVIDIA_API_KEY": "{env:NVIDIA_API_KEY}"
}
}
}
}Prueba manual
Sin iniciar opencode, verifica directamente a través de stdio:
$env:NVIDIA_API_KEY = "nvapi-xxx"
python -m opencode_eyes_nvidiaLuego, en otra terminal, envía un mensaje JSON-RPC de MCP, por ejemplo:
{"jsonrpc":"2.0","id":1,"method":"initialize","params":{"protocolVersion":"2024-11-05","capabilities":{},"clientInfo":{"name":"test","version":"0.0.0"}}}
{"jsonrpc":"2.0","id":2,"method":"tools/list"}
{"jsonrpc":"2.0","id":3,"method":"tools/call","params":{"name":"describe_image","arguments":{"image_path":"C:/path/to/photo.jpg"}}}Diferencias con opencode-eyes
La API cambia de StepFun a NVIDIA NIM (
https://integrate.api.nvidia.com/v1)El modelo predeterminado cambia de
step-3.7-flasha MiniMax-M3 (minimaxai/minimax-m3)Se añaden la herramienta
list_vision_modelsy la capacidad de cambiar entre varios modelosCompatibilidad con el control de razonamiento
thinking_modede MiniMax-M3Compatibilidad con rotación de múltiples claves API: ante un error, cambia automáticamente a la siguiente clave; la clave original pasa al final de la cola esperando a que se renueve su cuota
Licencia
MIT
This server cannot be installed
Maintenance
Resources
Unclaimed servers have limited discoverability.
Looking for Admin?
If you are the server author, to access and configure the admin panel.
Related MCP Servers
- FlicenseNot gradedqualityBmaintenanceA versatile MCP server that adds vision capabilities (image analysis, OCR, image/video generation) to AI models lacking native vision, with support for multiple providers and automatic task routing.1
- AlicenseNot gradedqualityCmaintenanceMCP server for analyzing images using multiple vision LLM providers (OpenCode, OpenAI, Anthropic, Google, and custom OpenAI-compatible endpoints). Provides tools to analyze single or multiple images, list providers, and test vision capabilities.MIT
- AlicenseAqualityAmaintenanceMCP server that gives text-only AI agents the ability to understand images via vision tools, including multi-image analysis, OCR, comparison, and structured extraction. It uses providers like OpenAI, Anthropic, Gemini, and OpenRouter to return plain text descriptions.410121MIT
- AlicenseNot gradedqualityCmaintenanceMCP server that provides visual question answering, image description, object detection, OCR, and image manipulation tools using OpenAI-compatible vision models.GPL 2.0
Related MCP Connectors
MCP server for MiniMax H3 multimodal video generation
MCP server providing access to the Scorecard API to evaluate and optimize LLM systems.
MCP server for Google Veo AI video generation
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/bauerelizabeth07139/opencode-eyes-nvidia'
If you have feedback or need assistance with the MCP directory API, please join our Discord server