Skip to main content
Glama

opencode-eyes-nvidia 👁️

Servidor MCP que proporciona capacidad de descripción de imágenes utilizando la API alojada de NVIDIA NIM (https://integrate.api.nvidia.com/v1) con el modelo multimodal MiniMax-M3.

Proporciona "ojos" a modelos que no tienen capacidad multimodal. Introduce una imagen y obtén una descripción textual detallada de la misma.

Funciones

Herramienta

Descripción

describe_image

Describe el contenido de una imagen; por defecto usa el modelo multimodal MiniMax-M3

list_vision_models

Lista los modelos multimodales (visión) disponibles en la API de NVIDIA NIM

Related MCP server: vision-mcp

Modelos multimodales

El modelo predeterminado es minimaxai/minimax-m3 (entrada de texto/imagen/video → salida de texto, contexto de 1M, compatible con razonamiento). Se puede cambiar mediante NVIDIA_MODEL o el parámetro model de describe_image:

ID del modelo

Descripción

minimaxai/minimax-m3

MiniMax-M3 VLM multimodal MoE (predeterminado, compatible con imagen/video)

meta/llama-3.2-11b-vision-instruct

Meta Llama 3.2 11B Vision

meta/llama-3.2-90b-vision-instruct

Meta Llama 3.2 90B Vision

nvidia/llama-3.1-nemotron-nano-vl-8b-v1

NVIDIA Nemotron Nano VL 8B

google/gemma-3-27b-it

Google Gemma 3 27B IT

nvidia/nemotron-nano-12b-v2-vl

NVIDIA Nemotron Nano 12B v2 VL

qwen/qwen3.5-397b-a17b

Qwen 3.5 397B A17B VLM

Variables de entorno

Variable

Obligatoria

Valor predeterminado

Descripción

NVIDIA_API_KEY

No*

—

Clave API individual de NVIDIA (obtenerla en https://build.nvidia.com, nvapi-...)

NVIDIA_API_KEYS

No*

—

Varias claves, separadas por coma / punto y coma / espacio / salto de línea

NVIDIA_API_KEY_1 … NVIDIA_API_KEY_N

No*

—

Claves numeradas, se leen secuencialmente desde NVIDIA_API_KEY_1

NVIDIA_BASE_URL

No

https://integrate.api.nvidia.com/v1

Dirección base de la API

NVIDIA_MODEL

No

minimaxai/minimax-m3

Modelo multimodal utilizado por defecto

NVIDIA_TIMEOUT

No

120

Tiempo de espera de la solicitud a la API (segundos)

NVIDIA_MAX_DIMENSION

No

2048

Escala el lado más largo de la imagen a ese número de píxeles antes de enviarla; 0 significa sin escalado

NVIDIA_JPEG_QUALITY

No

85

Calidad de compresión JPEG antes del envío (0-100)

NVIDIA_THINKING_MODE

No

(vacío)

Modo de razonamiento de MiniMax-M3: enabled / disabled / adaptive

NVIDIA_ROTATION_MAX_RETRIES

No

Número de claves

Intentos totales de rotación (entre todas las claves)

NVIDIA_ROTATION_BACKOFF

No

2

Segundos de espera tras cada fallo (esperando a que se renueve la cuota)

* Se requiere al menos una clave: basta con NVIDIA_API_KEY, NVIDIA_API_KEYS o NVIDIA_API_KEY_1..N; se pueden configurar varias a la vez (se combinan eliminando duplicados).

Rotación de claves (cambio automático entre múltiples claves)

Se admite configurar varias claves API: las solicitudes se usan en orden y, ante un error, se cambia automáticamente a la siguiente clave. La clave original no se elimina, simplemente se coloca al final de la cola, esperando a que se renueve su cuota. Todo el proceso es automático y no requiere intervención manual.

Cómo funciona:

  1. Al iniciar, todas las claves se combinan en una cola (sin duplicados, en el orden NVIDIA_API_KEY → NVIDIA_API_KEYS → NVIDIA_API_KEY_1..N).

  2. Las solicitudes usan por defecto la clave al frente de la cola.

  3. Ante un error reintentable (HTTP 401 / 403 / 404 / 408 / 429 / 5xx, o tiempo de espera de conexión): la clave del frente se mueve al final, se espera NVIDIA_ROTATION_BACKOFF segundos y se reintenta con la siguiente clave.

  4. Solo si todas las claves se han rotado (un total de NVIDIA_ROTATION_MAX_RETRIES intentos) sin éxito, se lanza el último error.

  5. El estado de la cola se conserva entre llamadas: las claves limitadas quedan al final y, cuando les toque de nuevo, la cuota suele haberse renovado.

Ejemplo:

# 方式一:逗号分隔多个 Key
set NVIDIA_API_KEYS=nvapi-key-1,nvapi-key-2,nvapi-key-3

# 方式二:编号 Key
set NVIDIA_API_KEY_1=nvapi-key-1
set NVIDIA_API_KEY_2=nvapi-key-2

# 方式三:单个 Key(向后兼容)
set NVIDIA_API_KEY=nvapi-key-1

En la configuración de OpenCode, pasa las variables de entorno al servicio MCP:

{
  "mcp": {
    "opencode-eyes-nvidia": {
      "type": "local",
      "command": ["python", "-m", "opencode_eyes_nvidia"],
      "enabled": true,
      "timeout": 120000,
      "environment": {
        "NVIDIA_API_KEYS": "{env:NVIDIA_API_KEYS}"
      }
    }
  }
}

Instalación

pip install -r requirements.txt

O instalar como paquete:

pip install .

Ejecución

# 设置环境变量(Windows,至少一种)
set NVIDIA_API_KEY=nvapi-你的key
# 或 set NVIDIA_API_KEYS=nvapi-key-1,nvapi-key-2

# 启动服务
python -m opencode_eyes_nvidia

Configuración en OpenCode

{
  "mcp": {
    "opencode-eyes-nvidia": {
      "type": "local",
      "command": ["python", "-m", "opencode_eyes_nvidia"],
      "enabled": true,
      "timeout": 120000,
      "environment": {
        "NVIDIA_API_KEYS": "{env:NVIDIA_API_KEYS}",
        "NVIDIA_API_KEY": "{env:NVIDIA_API_KEY}"
      }
    }
  }
}

Prueba manual

Sin iniciar opencode, verifica directamente a través de stdio:

$env:NVIDIA_API_KEY = "nvapi-xxx"
python -m opencode_eyes_nvidia

Luego, en otra terminal, envía un mensaje JSON-RPC de MCP, por ejemplo:

{"jsonrpc":"2.0","id":1,"method":"initialize","params":{"protocolVersion":"2024-11-05","capabilities":{},"clientInfo":{"name":"test","version":"0.0.0"}}}
{"jsonrpc":"2.0","id":2,"method":"tools/list"}
{"jsonrpc":"2.0","id":3,"method":"tools/call","params":{"name":"describe_image","arguments":{"image_path":"C:/path/to/photo.jpg"}}}

Diferencias con opencode-eyes

  • La API cambia de StepFun a NVIDIA NIM (https://integrate.api.nvidia.com/v1)

  • El modelo predeterminado cambia de step-3.7-flash a MiniMax-M3 (minimaxai/minimax-m3)

  • Se añaden la herramienta list_vision_models y la capacidad de cambiar entre varios modelos

  • Compatibilidad con el control de razonamiento thinking_mode de MiniMax-M3

  • Compatibilidad con rotación de múltiples claves API: ante un error, cambia automáticamente a la siguiente clave; la clave original pasa al final de la cola esperando a que se renueve su cuota

Licencia

MIT

Related MCP Connectors

Related MCP Servers

  • A
    license
    Not graded
    quality
    C
    maintenance
    MCP server for analyzing images using multiple vision LLM providers (OpenCode, OpenAI, Anthropic, Google, and custom OpenAI-compatible endpoints). Provides tools to analyze single or multiple images, list providers, and test vision capabilities.
    MIT
  • A
    license
    A
    quality
    A
    maintenance
    MCP server that gives text-only AI agents the ability to understand images via vision tools, including multi-image analysis, OCR, comparison, and structured extraction. It uses providers like OpenAI, Anthropic, Gemini, and OpenRouter to return plain text descriptions.
    10
    7 npm
    MIT