Skip to main content
Glama

opencode-eyes-nvidia 👁️

MCP server that provides image description capability using NVIDIA NIM hosted API (https://integrate.api.nvidia.com/v1) with the MiniMax-M3 multimodal model.

マルチモーダル機能を持たないモデルに**「目」**を提供します。画像を入力すると、詳細な画像のテキスト説明が得られます。

機能

ツール

説明

describe_image

画像の内容を説明します。デフォルトで MiniMax-M3 マルチモーダル大モデルを使用

list_vision_models

NVIDIA NIM API で利用可能なマルチモーダル(ビジョン)モデルを一覧表示

Related MCP server: vision-mcp

マルチモーダルモデル

デフォルトモデルは minimaxai/minimax-m3(テキスト/画像/動画入力 → テキスト出力、1M コンテキスト、推論対応)です。 NVIDIA_MODEL または describe_image の model パラメータで切り替えられます:

モデル ID

説明

minimaxai/minimax-m3

MiniMax-M3 マルチモーダル MoE VLM(デフォルト、画像/動画対応)

meta/llama-3.2-11b-vision-instruct

Meta Llama 3.2 11B Vision

meta/llama-3.2-90b-vision-instruct

Meta Llama 3.2 90B Vision

nvidia/llama-3.1-nemotron-nano-vl-8b-v1

NVIDIA Nemotron Nano VL 8B

google/gemma-3-27b-it

Google Gemma 3 27B IT

nvidia/nemotron-nano-12b-v2-vl

NVIDIA Nemotron Nano 12B v2 VL

qwen/qwen3.5-397b-a17b

Qwen 3.5 397B A17B VLM

環境変数

変数

必須

デフォルト値

説明

NVIDIA_API_KEY

いいえ*

—

単一の NVIDIA API Key(https://build.nvidia.com で取得、nvapi-...)

NVIDIA_API_KEYS

いいえ*

—

複数の Key。カンマ / セミコロン / スペース / 改行で区切り

NVIDIA_API_KEY_1 … NVIDIA_API_KEY_N

いいえ*

—

番号付き Key。NVIDIA_API_KEY_1 から順に読み取り

NVIDIA_BASE_URL

いいえ

https://integrate.api.nvidia.com/v1

API の基本アドレス

NVIDIA_MODEL

いいえ

minimaxai/minimax-m3

デフォルトで使用するマルチモーダルモデル

NVIDIA_TIMEOUT

いいえ

120

API リクエストのタイムアウト(秒)

NVIDIA_MAX_DIMENSION

いいえ

2048

送信前に画像の最長辺をこのピクセルに縮小。0 は縮小しない

NVIDIA_JPEG_QUALITY

いいえ

85

送信前の JPEG 圧縮品質(0-100)

NVIDIA_THINKING_MODE

いいえ

(空)

MiniMax-M3 推論モード:enabled / disabled / adaptive

NVIDIA_ROTATION_MAX_RETRIES

いいえ

Key 数

ローテーションの総試行回数(全 Key にわたる)

NVIDIA_ROTATION_BACKOFF

いいえ

2

失敗ごとの待機秒数(クォータのリフレッシュ待ち)

* 少なくとも1つの Key の設定が必要です:NVIDIA_API_KEY、NVIDIA_API_KEYS、NVIDIA_API_KEY_1..N のいずれかでOK。同時に設定も可能です(重複はマージ)。

Key ローテーション(複数 Key の自動切り替え)

複数の API Key を設定できます:リクエストは順番に使用され、エラーが発生すると自動的に次の Key に切り替わります。元の Key は削除されず、 キュー末尾に移動され、クォータがリフレッシュされるのを待ってから再利用されます。全プロセス自動リトライで、手動での介入は不要です。

動作方式:

  1. 起動時にすべての Key を1つのキューに統合します(重複排除、NVIDIA_API_KEY → NVIDIA_API_KEYS → NVIDIA_API_KEY_1..N の順)。

  2. リクエストはデフォルトでキューの先頭の Key を使用します。

  3. リトライ可能なエラー(HTTP 401 / 403 / 404 / 408 / 429 / 5xx、または接続タイムアウト)が発生した場合: キューの先頭の Key を末尾に移動し、NVIDIA_ROTATION_BACKOFF 秒待ってから次の Key でリトライします。

  4. すべての Key をローテーションした後(合計 NVIDIA_ROTATION_MAX_RETRIES 回の試行)も成功しない場合にのみ、最後のエラーをスローします。

  5. キューの状態は複数回の呼び出し間で保持されます——レート制限された Key は後方に並び、次に回ってきた頃にはクォータがリフレッシュされていることが多いです。

例:

# 方式一:逗号分隔多个 Key
set NVIDIA_API_KEYS=nvapi-key-1,nvapi-key-2,nvapi-key-3

# 方式二:编号 Key
set NVIDIA_API_KEY_1=nvapi-key-1
set NVIDIA_API_KEY_2=nvapi-key-2

# 方式三:单个 Key(向后兼容)
set NVIDIA_API_KEY=nvapi-key-1

OpenCode 設定で環境変数を MCP サービスに渡します:

{
  "mcp": {
    "opencode-eyes-nvidia": {
      "type": "local",
      "command": ["python", "-m", "opencode_eyes_nvidia"],
      "enabled": true,
      "timeout": 120000,
      "environment": {
        "NVIDIA_API_KEYS": "{env:NVIDIA_API_KEYS}"
      }
    }
  }
}

インストール

pip install -r requirements.txt

またはパッケージとしてインストール:

pip install .

実行

# 设置环境变量(Windows,至少一种)
set NVIDIA_API_KEY=nvapi-你的key
# 或 set NVIDIA_API_KEYS=nvapi-key-1,nvapi-key-2

# 启动服务
python -m opencode_eyes_nvidia

OpenCode での設定

{
  "mcp": {
    "opencode-eyes-nvidia": {
      "type": "local",
      "command": ["python", "-m", "opencode_eyes_nvidia"],
      "enabled": true,
      "timeout": 120000,
      "environment": {
        "NVIDIA_API_KEYS": "{env:NVIDIA_API_KEYS}",
        "NVIDIA_API_KEY": "{env:NVIDIA_API_KEY}"
      }
    }
  }
}

手動テスト

opencode を起動せず、stdio 経由で直接検証します:

$env:NVIDIA_API_KEY = "nvapi-xxx"
python -m opencode_eyes_nvidia

その後、別のターミナルで MCP JSON-RPC メッセージを送信します。例:

{"jsonrpc":"2.0","id":1,"method":"initialize","params":{"protocolVersion":"2024-11-05","capabilities":{},"clientInfo":{"name":"test","version":"0.0.0"}}}
{"jsonrpc":"2.0","id":2,"method":"tools/list"}
{"jsonrpc":"2.0","id":3,"method":"tools/call","params":{"name":"describe_image","arguments":{"image_path":"C:/path/to/photo.jpg"}}}

opencode-eyes との違い

  • API を StepFun から NVIDIA NIM(https://integrate.api.nvidia.com/v1)に変更

  • デフォルトモデルを step-3.7-flash から MiniMax-M3(minimaxai/minimax-m3)に変更

  • list_vision_models ツールと複数モデル切り替え機能を追加

  • MiniMax-M3 の thinking_mode 推論制御をサポート

  • 複数 API Key のローテーションをサポート:エラー時に自動で次の Key に切り替え、元の Key はキュー末尾に移動してクォータのリフレッシュを待機

License

MIT

Related MCP Connectors

Related MCP Servers

  • A
    license
    Not graded
    quality
    C
    maintenance
    MCP server for analyzing images using multiple vision LLM providers (OpenCode, OpenAI, Anthropic, Google, and custom OpenAI-compatible endpoints). Provides tools to analyze single or multiple images, list providers, and test vision capabilities.
    MIT
  • A
    license
    A
    quality
    A
    maintenance
    MCP server that gives text-only AI agents the ability to understand images via vision tools, including multi-image analysis, OCR, comparison, and structured extraction. It uses providers like OpenAI, Anthropic, Gemini, and OpenRouter to return plain text descriptions.
    10
    7 npm
    MIT