vision-gemma
VisionGemma - Reconocimiento local de imágenes + mascota de escritorio con IA
Una herramienta de reconocimiento de imágenes lista para usar que se ejecuta en un PC Windows totalmente local, más una divertida mascota de escritorio con IA. Todo el reconocimiento de imágenes se realiza en el equipo, sin subir ningún dato.
Demostración del producto
🤖 El agente activa el reconocimiento automáticamente
Cuando tu asistente de IA se encuentra con una imagen y no admite la entrada de imágenes, VisionGemma se activa automáticamente como herramienta MCP y le transfiere sin problemas la «capacidad de ver imágenes»:

🔌 Conexión con tu asistente de IA con un solo clic
No necesitas escribir archivos de configuración a mano. El software incluye una guía de conexión incorporada: copia un texto y pégalo en tu asistente de IA, o copia directamente el JSON de configuración, y la conexión MCP estará lista:

🖼️ Reconocimiento local preciso
Selecciona una imagen → reconoce → obtén una descripción estructurada, todo sin conexión. Entiende fotos de producto, capturas de pantalla y gráficos:

🐾 Divertida mascota de escritorio con IA
Una pequeña mascota de compañía en el escritorio, con conversación natural y reconocimiento de pantalla e imágenes:

Related MCP server: media-context-mcp
Características
Despliegue sin complicaciones: descarga, descomprime, haz doble clic para ejecutar; el modelo se descarga automáticamente y se configura solo. Sin línea de comandos ni configuración de entorno
Conexión con agentes MCP: puede conectarse como servidor MCP a cualquier herramienta de IA (herramienta \ision_analyze), lo que le da a la IA capacidad para ver imágenes
Reconocimiento local de imágenes: análisis de imágenes, extracción de texto OCR, interpretación de gráficos y descripción de escenas, todo se realiza en el equipo
Aceleración Vulkan: compatible con aceleración por hardware en GPU NVIDIA / AMD / Intel; sin GPU dedicada, vuelve automáticamente a CPU
Divertida mascota de escritorio con IA: inicia desde la bandeja una adorable mascota, que puede conversar y reconocer pantalla/imágenes, para acompañarte de forma interactiva
Privacidad y seguridad: todo el reconocimiento se realiza completamente offline y en local; no se sube ningún dato a la nube
Un solo archivo, sin instalación: un único exe es suficiente para ejecutarlo todo, con el motor Vulkan y la mascota integrados
Requisitos del sistema
Windows 10/11 x64
GPU compatible con Vulkan (NVIDIA / AMD / Intel; se recomienda aceleración por hardware)
Si no hay GPU dedicada, vuelve automáticamente a CPU
Espacio libre en disco >= 5GB (el modelo ocupa unos 3.2GB)
Descarga
GitHub Release (recomendado)
Ir a la página de Releases para descargar v1.0.0
Paquete de instalación: VisionGemma-Vulkan.zip SHA256: \1DC26CB187923764C4CA03A8A852493081D123C9680B803FAE73CF560B640967
Espejo de 夸克网盘 (aceleración para usuarios en China)
Descargar VisionGemma-Vulkan.zip desde 夸克网盘
Inicio rápido
Descomprime el archivo comprimido, haz doble clic en VisionGemma-Vulkan.exe; la primera ejecución abrirá automáticamente el asistente de configuración
El asistente te guía para descargar el modelo automáticamente (unos 3.2GB, compatible con reanudación de descarga)
Cuando termine la descarga, ya puedes empezar a usarlo
Mascota de escritorio
Haz clic derecho en el icono de la bandeja → «Mascota de escritorio» para iniciarla rápidamente; el motor de reconocimiento local se activa automáticamente
La mascota admite funciones como conversar y elegir tema
Puedes configurar el inicio automático con el sistema desde el menú de la bandeja
Uso como servidor MCP (conexión con herramientas de IA)
Añade lo siguiente a la configuración MCP de la herramienta de IA:
\\\json { "mcpServers": { "vision-gemma": { "command": "VisionGemma-Vulkan.exe 完整路径", "args": ["--mcp"], "type": "stdio" } } } \\
A continuación, puedes llamar a la herramienta \ision_analyze\ para reconocer imágenes. Una forma aún más sencilla: abre la «Guía de conexión» del software, copia el texto y pégalo en el asistente de IA.
Descripción de archivos
VisionGemma-Vulkan.exe: programa principal (incluye el motor Vulkan + la mascota, un solo archivo sin instalación)
Los modelos se guardan en %LOCALAPPDATA%\VisionGemma\models
Aviso de privacidad
Todo el reconocimiento de imágenes se realiza completamente en local; no se sube ningún dato.
Soporte posventa
QQ: 1023884985
微信: 13147295520
Correo electrónico: 1023884985@qq.com
Enlaces de interés
This server cannot be installed
Maintenance
Resources
Unclaimed servers have limited discoverability.
Looking for Admin?
If you are the server author, to access and configure the admin panel.
Related MCP Servers
- AlicenseNot gradedqualityDmaintenanceEnables AI-powered vision analysis using local Ollama models. Supports screenshot analysis, OCR, text detection, and health monitoring via MCP protocol.563MIT
- AlicenseAqualityAmaintenanceGive your AI assistant eyes and ears — analyze any video, audio, or image, entirely on your machine.2612Apache 2.0
- FlicenseNot gradedqualityCmaintenanceEnables AI clients like Claude to understand, analyze, and describe local images via VL models through the MCP protocol.
- AlicenseNot gradedqualityAmaintenanceProvides local image understanding for text-only LLMs with tools for image analysis, OCR, object detection, and cropping, all processed on-device.2MIT
Related MCP Connectors
OCR, transcription, file extraction, and image generation for AI agents via MCP.
A comprehensive Model Context Protocol (MCP) server that enables AI assistants to interact with yo…
Free OpenAI-compatible inference with signed provenance receipts and 3 focused MCP tools.
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/q1023884985/visiongemma'
If you have feedback or need assistance with the MCP directory API, please join our Discord server