Skip to main content
Glama

Gemini Image MCP

Gemini Image MCP Banner

Un servidor MCP para generar y editar imágenes con los modelos de imagen Gemini de Google (Nano Banana, Nano Banana 2, Nano Banana Pro). Expone una herramienta, generate_image, que herramientas de IA como Claude, Codex y Cline pueden llamar usando tu propia clave API.

Qué hace

  • generate_image maneja texto a imagen, además de edición y composición cuando le pasas imágenes de referencia (rutas de archivo locales o base64).

  • Cada parámetro de generación se expone por llamada: temperature (1), topP (0.95), topK, maxOutputTokens (65536 para flash/lite, 32768 para pro), seed, stopSequences, presencePenalty, frequencyPenalty, systemInstruction, thinkingLevel (minimal/high), thinkingBudget, enableGoogleSearch (por defecto true), imageSize (512/1K/2K/4K), aspectRatio ("auto" por defecto + relaciones estándar), personGeneration.

  • Incluye un bloque instructions y descripciones por parámetro, para que los clientes MCP sepan cómo usar la herramienta sin necesidad de indicaciones adicionales.

  • Guarda las imágenes en disco y devuelve las rutas de archivo. Sin base64 en la respuesta, así que una imagen 4K no consumirá la ventana de contexto del cliente.

  • Los errores llegan con pistas (clave incorrecta, límite de velocidad, bloqueo de seguridad, modelo desconocido) en lugar de un volcado de API sin procesar.

  • Transporte stdio, la configuración habitual para servidores MCP locales.

Requisitos

Instalar

bun install

Configuración

Tres variables de entorno, normalmente establecidas en la configuración del cliente MCP:

Variable

Obligatoria

Por defecto

Qué hace

GEMINI_API_KEY

Sí (o GOOGLE_API_KEY)

Tu clave API de Gemini. Si ambas están configuradas, GEMINI_API_KEY gana.

GEMINI_IMAGE_MODEL

No

gemini-3.1-flash-image

Modelo utilizado cuando una llamada no especifica uno.

GEMINI_IMAGE_OUTPUT_DIR

No

<cwd>/generated-images

Donde se guardan las imágenes. Se crea si no existe.

Modelos que puedes elegir:

Modelo

Máximo de tokens de salida

Nivel de pensamiento

Búsqueda de Google

Tamaño máximo

Notas

gemini-3.1-flash-image

65536

minimal / high

Compatible

2K

Nano Banana 2. Rápido, económico, de uso general. El predeterminado.

gemini-3.1-flash-lite-image

65536

minimal / high

Compatible

2K

Modelo ligero y de alto rendimiento.

gemini-3-pro-image

32768

(ninguno)

Compatible

4K

Nano Banana Pro. Mejor calidad y texto en imagen, y el único que hace 4K.

Los modelos también se pueden especificar con el prefijo models/ (por ejemplo, models/gemini-3.1-flash-image).

Configuración del cliente

Claude Desktop

Añade esto a ~/Library/Application Support/Claude/claude_desktop_config.json:

{
  "mcpServers": {
    "gemini-image": {
      "command": "bun",
      "args": ["run", "/absolute/path/to/gemini-image-mcp/index.ts"],
      "env": {
        "GEMINI_API_KEY": "YOUR_KEY_HERE"
      }
    }
  }
}

Cline (VS Code)

cline_mcp_settings.json:

{
  "mcpServers": {
    "gemini-image": {
      "command": "bun",
      "args": ["run", "/absolute/path/to/gemini-image-mcp/index.ts"],
      "env": {
        "GEMINI_API_KEY": "YOUR_KEY_HERE"
      }
    }
  }
}

Codex

~/.codex/config.toml:

[mcp_servers.gemini-image]
command = "bun"
args = ["run", "/absolute/path/to/gemini-image-mcp/index.ts"]
env = { GEMINI_API_KEY = "YOUR_KEY_HERE" }

Desde npm (bunx/npx)

Una vez que el paquete esté publicado, apunta tu cliente a bunx en su lugar:

{
  "mcpServers": {
    "gemini-image": {
      "command": "bunx",
      "args": ["gemini-image-mcp"],
      "env": { "GEMINI_API_KEY": "YOUR_KEY_HERE" }
    }
  }
}

Parámetros de generate_image

Solo prompt es obligatorio. Todo lo demás se predetermina a algo sensato para la generación de imágenes.

Parámetro

Tipo

Por defecto

Descripción

prompt

string

(obligatorio)

Descripción narrativa de la imagen, o de la edición cuando se proporcionan referenceImages.

model

string

env / gemini-3.1-flash-image

Modelo de imagen Gemini (ver tabla arriba). Acepta el prefijo models/.

referenceImages

array (≤14)

Imágenes de origen para edición/composición: { path } o { base64, mimeType }.

imageSize

"512" | "1K" | "2K" | "4K"

"1K"

Resolución de salida: 512 (más rápida, ligera), 1K (predeterminada), 2K, 4K (requiere gemini-3-pro-image).

aspectRatio

enum

"auto"

"auto" (predeterminado, deduce de la prompt o coincide con las imágenes de referencia) o explícito: 1:1, 2:3, 3:2, 3:4, 4:3, 4:5, 5:4, 9:16, 16:9, 21:9, 1:4, 4:1, 1:8, 8:1.

personGeneration

enum

allow_all

allow_all / allow_adult / allow_none.

thinkingLevel

enum

"minimal" (en modelos flash)

"minimal" / "high". Compatible en gemini-3.1-flash-image y gemini-3.1-flash-lite-image. No compatible en Pro.

enableGoogleSearch

boolean

true

Habilita la herramienta de fundamentación de Búsqueda de Google para conocimiento web en tiempo real y precisión en todos los modelos.

thinkingBudget

int

Presupuesto de pensamiento explícito (0 = desactivado, -1 = automático).

temperature

number 0–2

1

Aleatoriedad del muestreo.

topP

number 0–1

0.95

Muestreo de núcleo.

topK

int

Muestreo top-k.

maxOutputTokens

int 1–65536

65536 (flash) / 32768 (pro)

Límite de tokens de salida.

seed

int

Reproducibilidad de mejor esfuerzo.

stopSequences

string( ≤5)

Secuencias de parada para la parte de texto.

presencePenalty / frequencyPenalty

number -2..2

Penalizaciones de tokens.

systemInstruction

string

Dirección de estilo/comportamiento, por ejemplo, "estilo vectorial plano".

outputDir

string

env / <cwd>/generated-images

Donde guardar.

fileName

string

gemini-image-<timestamp>

Nombre base del archivo (extensión automática según el tipo MIME).

La herramienta devuelve un resumen de texto con las rutas de archivo guardadas, el modelo, la configuración efectiva y el uso de tokens. Nunca devuelve datos de imagen en línea; abre el archivo para ver el resultado.

Cosas que puedes pedirle a tu IA

  • "Genera una imagen heroica 16:9 de una calle lluviosa de Tokio por la noche, con iluminación neón cinematográfica."

  • "Edita /tmp/product.png: ponlo sobre una mesa de mármol con luz suave de la mañana" (esto usa referenceImages).

  • "Genera un póster 4K con el título exacto 'LAUNCH DAY' usando gemini-3-pro-image."

Desarrollo

bun test              # unit tests (config, schema, request/response parsing)
bun run typecheck     # tsc --noEmit
bun run inspector     # interactive MCP inspector (needs GEMINI_API_KEY)
bun run start         # run the server on stdio

Solución de problemas

  • "Falta la clave API de Gemini": pon GEMINI_API_KEY en el bloque env de la configuración MCP del cliente. Configurarla en tu shell no es suficiente para aplicaciones GUI como Claude Desktop, ya que no leen tu entorno de shell.

  • Bloqueos de seguridad: reformula la prompt. Si hay personas involucradas, comprueba personGeneration.

  • 429 / cuota excedida: espera y vuelve a intentarlo, o quédate con gemini-3.1-flash-image, que tiene la cuota más alta.

  • Registros: el servidor escribe registros solo en stderr. stdout transporta el protocolo MCP, así que no añadas console.log en ningún lugar.

Autor

Thomi Jasir dev@venobi.com

Licencia

MIT

-
license - not tested
-
quality - not tested
C
maintenance

Maintenance

Maintainers
Response time
Release cycle
Releases (12mo)
Commit activity

Resources

Unclaimed servers have limited discoverability.

Looking for Admin?

If you are the server author, to access and configure the admin panel.

Related MCP Connectors

View all MCP Connectors

Latest Blog Posts

MCP directory API

We provide all the information about MCP servers via our MCP API.

curl -X GET 'https://glama.ai/api/mcp/v1/servers/thomijasir/gemini-image-mcp'

If you have feedback or need assistance with the MCP directory API, please join our Discord server