uitars-mcp
uitars-mcp
Servidor MCP que proporciona a los agentes de codificación de IA conexión a tierra de GUI local: la capacidad de encontrar cualquier elemento de la interfaz de usuario en la pantalla y devolver sus coordenadas de píxeles exactas.
Desarrollado por UI-TARS-2B, el modelo de conexión a tierra de GUI de 2B parámetros de ByteDance.
Por qué
El uso de computadora integrado de Claude Code envía cada captura de pantalla a la nube para su análisis. Este servidor MCP ejecuta un modelo de visión local en su lugar:
~1,2 s por búsqueda de elemento (frente a la latencia de ida y vuelta de la nube)
4,1 GB de VRAM (se ejecuta en cualquier GPU moderna)
Totalmente sin conexión: sin claves API, sin dependencia de la nube
90,7 % de precisión en el punto de referencia de texto de escritorio ScreenSpot
Coordenadas de píxeles nativas: devuelve objetivos de clic exactos
Related MCP server: servo-mcp
Configuración
1. Descargar UI-TARS-2B
# Requires ~4.5GB disk space
huggingface-cli download bytedance-research/UI-TARS-2B-SFT --local-dir ./ui-tars-2b2. Instalar PyTorch con CUDA
# Install CUDA-enabled PyTorch first (adjust cu126 to your CUDA version)
pip install torch torchvision --index-url https://download.pytorch.org/whl/cu1263. Instalar uitars-mcp
pip install uitars-mcp
# or from source:
pip install -e .4. Configurar Claude Code
Agréguelo a su configuración de MCP de Claude Code (~/.claude/settings.json):
{
"mcpServers": {
"uitars-mcp": {
"command": "uitars-mcp",
"env": {
"UITARS_MODEL": "/path/to/ui-tars-2b"
}
}
}
}Si está instalado en un venv, use la ruta completa al ejecutable:
{
"mcpServers": {
"uitars-mcp": {
"command": "/path/to/venv/bin/uitars-mcp",
"env": {
"UITARS_MODEL": "/path/to/ui-tars-2b"
}
}
}
}Herramientas
Herramienta | Qué hace | Latencia |
| Encuentra un elemento de la interfaz de usuario por descripción, devuelve las coordenadas de clic | ~1,2 s |
| Describe todo lo visible en la pantalla | ~2 s |
| OCR: lee todo el texto en la pantalla | ~3 s |
| Comprueba el estado del elemento (habilitado, valor, etc.) | ~1 s |
| Verifica que una acción funcionó comprobando el estado de la pantalla | ~1,5 s |
| Sugiere la siguiente acción para lograr un objetivo | ~1,5 s |
| Mide la latencia de extremo a extremo | varía |
Cómo funciona
Toma una captura de pantalla a través de
mss(rápido, multiplataforma)Cambia el tamaño a 1344 px de ancho (recuento óptimo de tokens de visión)
Ejecuta la inferencia de UI-TARS-2B en la GPU
Convierte las coordenadas normalizadas de 0-1000 del modelo a píxeles de pantalla nativos
Devuelve las coordenadas listas para las herramientas de clic de
computer-use
El modelo se carga de forma diferida en la primera llamada (~3 s), luego permanece en VRAM para llamadas posteriores.
Variables de entorno
Variable | Predeterminado | Descripción |
| (requerido) | Ruta al directorio del modelo UI-TARS-2B |
Requisitos
Python 3.10+
GPU NVIDIA con 4,1 GB+ de VRAM
PyTorch habilitado para CUDA
Windows o Linux (macOS no probado)
This server cannot be installed
Maintenance
Related MCP Connectors
UI design from prompts, screenshots, and URLs for AI coding agents and theme tokens.
Codebase intelligence for agents: 152 structured artifacts across 21 programs, one call.
- openhelmOAuthai.openhelm
Autonomous cloud agent tasks: real browser + your tools, structured evidence-backed results.
E2LLM gives your AI eyes and hands in a real browser: structured perception (SiFR) plus action.
Related MCP Servers
- AlicenseNot gradedqualityBmaintenanceA local autonomous AI agent that watches your screen, understands the visual layout, and executes native OS commands (clicking, typing) without cloud APIs.2MIT
- AlicenseNot gradedqualityDmaintenanceEnables AI agents to see and control your desktop with tools for screenshots, clicks, typing, and more, all locally on macOS and Windows.80MIT
- AlicenseNot gradedqualityCmaintenanceEnables LLMs to control Windows desktops via local OCR, optional YOLO icon detection, and mouse/keyboard actions.PolyForm Noncommercial 1.0.0
- AlicenseNot gradedqualityBmaintenanceEyes for text-only LLMs: decodes screenshots into exact structured text (words, coordinates, sizes, colors) using pure-code CV and OCR. Enables text-only models to reason about UI layouts without vision models or VRAM usage.2MIT