Skip to main content
Glama

opencode-eyes-nvidia 👁️

MCP-Server, der Bildbeschreibungsfunktionen über die gehostete NVIDIA-NIM-API (https://integrate.api.nvidia.com/v1) mit dem multimodalen Modell MiniMax-M3 bereitstellt.

Bietet Modellen ohne multimodale Fähigkeiten „Augen". Gib ein Bild ein und erhalte eine detaillierte textuelle Beschreibung des Bildes.

Funktionen

Werkzeug

Beschreibung

describe_image

Beschreibt den Inhalt eines Bildes, standardmäßig mit dem multimodalen Modell MiniMax-M3

list_vision_models

Listet die auf der NVIDIA-NIM-API verfügbaren multimodalen (visuellen) Modelle auf

Related MCP server: vision-mcp

Multimodale Modelle

Das Standardmodell ist minimaxai/minimax-m3 (Text/Bild/Video-Eingabe → Text-Ausgabe, 1M Kontext, unterstützt Reasoning). Es kann über NVIDIA_MODEL oder den Parameter model von describe_image gewechselt werden:

Modell-ID

Beschreibung

minimaxai/minimax-m3

MiniMax-M3 multimodales MoE-VLM (Standard, unterstützt Bild/Video)

meta/llama-3.2-11b-vision-instruct

Meta Llama 3.2 11B Vision

meta/llama-3.2-90b-vision-instruct

Meta Llama 3.2 90B Vision

nvidia/llama-3.1-nemotron-nano-vl-8b-v1

NVIDIA Nemotron Nano VL 8B

google/gemma-3-27b-it

Google Gemma 3 27B IT

nvidia/nemotron-nano-12b-v2-vl

NVIDIA Nemotron Nano 12B v2 VL

qwen/qwen3.5-397b-a17b

Qwen 3.5 397B A17B VLM

Umgebungsvariablen

Variable

Erforderlich

Standardwert

Beschreibung

NVIDIA_API_KEY

Nein*

—

Ein einzelner NVIDIA-API-Key (erhältlich unter https://build.nvidia.com, nvapi-...)

NVIDIA_API_KEYS

Nein*

—

Mehrere Keys, getrennt durch Komma / Semikolon / Leerzeichen / Zeilenumbruch

NVIDIA_API_KEY_1 … NVIDIA_API_KEY_N

Nein*

—

Nummerierte Keys, werden ab NVIDIA_API_KEY_1 der Reihe nach gelesen

NVIDIA_BASE_URL

Nein

https://integrate.api.nvidia.com/v1

Basis-URL der API

NVIDIA_MODEL

Nein

minimaxai/minimax-m3

Standardmäßig verwendetes multimodales Modell

NVIDIA_TIMEOUT

Nein

120

API-Request-Timeout (Sekunden)

NVIDIA_MAX_DIMENSION

Nein

2048

Die längste Seite des Bildes wird vor dem Senden auf diese Pixelzahl skaliert, 0 bedeutet keine Skalierung

NVIDIA_JPEG_QUALITY

Nein

85

JPEG-Komprimierungsqualität vor dem Senden (0-100)

NVIDIA_THINKING_MODE

Nein

(leer)

MiniMax-M3-Reasoning-Modus: enabled / disabled / adaptive

NVIDIA_ROTATION_MAX_RETRIES

Nein

Anzahl der Keys

Gesamtzahl der Rotationsversuche (über alle Keys hinweg)

NVIDIA_ROTATION_BACKOFF

Nein

2

Sekunden, die nach jedem Fehler gewartet werden (Warten auf Quoten-Refresh)

* Es muss mindestens ein Key konfiguriert sein: NVIDIA_API_KEY, NVIDIA_API_KEYS oder NVIDIA_API_KEY_1..N – einer davon genügt, mehrere können gleichzeitig konfiguriert werden (dedupliziert zusammengeführt).

Key-Rotation (automatischer Wechsel zwischen mehreren Keys)

Unterstützt die Konfiguration mehrerer API-Keys: Requests werden der Reihe nach verarbeitet, bei Fehlern wird automatisch zum nächsten Key gewechselt, der ursprüngliche Key wird nicht gelöscht, sondern nur ans Ende der Warteschlange gestellt, bis sein Quotenlimit sich erneuert hat. Automatische Wiederholungsversuche während des gesamten Prozesses, kein manueller Eingriff erforderlich.

So funktioniert es:

  1. Beim Start werden alle Keys in einer Warteschlange zusammengeführt (dedupliziert, in der Reihenfolge NVIDIA_API_KEY → NVIDIA_API_KEYS → NVIDIA_API_KEY_1..N).

  2. Requests verwenden standardmäßig den Key am Anfang der Warteschlange.

  3. Bei wiederholbaren Fehlern (HTTP 401 / 403 / 404 / 408 / 429 / 5xx oder Verbindungs-Timeout): Der Key am Anfang wird ans Ende verschoben, nach NVIDIA_ROTATION_BACKOFF Sekunden wird mit dem nächsten Key erneut versucht.

  4. Erst wenn alle Keys durchlaufen wurden (insgesamt NVIDIA_ROTATION_MAX_RETRIES Versuche) und immer noch kein Erfolg erzielt wurde, wird der letzte Fehler ausgelöst.

  5. Der Warteschlangenstatus bleibt über mehrere Aufrufe hinweg erhalten – gedrosselte Keys stehen weiter hinten und ihre Quote ist beim nächsten Durchlauf meist bereits erneuert.

Beispiel:

# 方式一:逗号分隔多个 Key
set NVIDIA_API_KEYS=nvapi-key-1,nvapi-key-2,nvapi-key-3

# 方式二:编号 Key
set NVIDIA_API_KEY_1=nvapi-key-1
set NVIDIA_API_KEY_2=nvapi-key-2

# 方式三:单个 Key(向后兼容)
set NVIDIA_API_KEY=nvapi-key-1

Übergib die Umgebungsvariablen in der OpenCode-Konfiguration an den MCP-Dienst:

{
  "mcp": {
    "opencode-eyes-nvidia": {
      "type": "local",
      "command": ["python", "-m", "opencode_eyes_nvidia"],
      "enabled": true,
      "timeout": 120000,
      "environment": {
        "NVIDIA_API_KEYS": "{env:NVIDIA_API_KEYS}"
      }
    }
  }
}

Installation

pip install -r requirements.txt

Oder als Paket installieren:

pip install .

Ausführen

# 设置环境变量(Windows,至少一种)
set NVIDIA_API_KEY=nvapi-你的key
# 或 set NVIDIA_API_KEYS=nvapi-key-1,nvapi-key-2

# 启动服务
python -m opencode_eyes_nvidia

In OpenCode konfigurieren

{
  "mcp": {
    "opencode-eyes-nvidia": {
      "type": "local",
      "command": ["python", "-m", "opencode_eyes_nvidia"],
      "enabled": true,
      "timeout": 120000,
      "environment": {
        "NVIDIA_API_KEYS": "{env:NVIDIA_API_KEYS}",
        "NVIDIA_API_KEY": "{env:NVIDIA_API_KEY}"
      }
    }
  }
}

Manueller Test

Ohne opencode zu starten, direkt über stdio verifizieren:

$env:NVIDIA_API_KEY = "nvapi-xxx"
python -m opencode_eyes_nvidia

Dann in einem anderen Terminal eine MCP-JSON-RPC-Nachricht senden, zum Beispiel:

{"jsonrpc":"2.0","id":1,"method":"initialize","params":{"protocolVersion":"2024-11-05","capabilities":{},"clientInfo":{"name":"test","version":"0.0.0"}}}
{"jsonrpc":"2.0","id":2,"method":"tools/list"}
{"jsonrpc":"2.0","id":3,"method":"tools/call","params":{"name":"describe_image","arguments":{"image_path":"C:/path/to/photo.jpg"}}}

Unterschiede zu opencode-eyes

  • API von StepFun auf NVIDIA NIM umgestellt (https://integrate.api.nvidia.com/v1)

  • Standardmodell von step-3.7-flash auf MiniMax-M3 umgestellt (minimaxai/minimax-m3)

  • Neues Tool list_vision_models und Fähigkeit zum Wechseln zwischen mehreren Modellen hinzugefügt

  • Unterstützt die thinking_mode-Reasoning-Steuerung von MiniMax-M3

  • Unterstützt Rotation über mehrere API-Keys: Bei Fehlern wird automatisch zum nächsten Key gewechselt, der ursprüngliche Key wird ans Ende der Warteschlange gestellt und wartet auf die Quoten-Erneuerung

Lizenz

MIT

Related MCP Connectors

Related MCP Servers

  • A
    license
    Not graded
    quality
    C
    maintenance
    MCP server for analyzing images using multiple vision LLM providers (OpenCode, OpenAI, Anthropic, Google, and custom OpenAI-compatible endpoints). Provides tools to analyze single or multiple images, list providers, and test vision capabilities.
    MIT
  • A
    license
    A
    quality
    A
    maintenance
    MCP server that gives text-only AI agents the ability to understand images via vision tools, including multi-image analysis, OCR, comparison, and structured extraction. It uses providers like OpenAI, Anthropic, Gemini, and OpenRouter to return plain text descriptions.
    10
    7 npm
    MIT