Skip to main content
Glama

🖥️ screen-use

browser-use, pero para todo el escritorio.

Dale ojos 👀 y manos 🖐️ a cualquier agente de IA en Windows: permite que Claude, Kimi, Cursor o tu propio agente vea la pantalla, encuentre elementos de la interfaz y opere cualquier aplicación de escritorio mediante lenguaje natural. Sin selectores. Sin scripts que se rompan cuando la interfaz cambia.

License: MIT Python 3.10+ Platform: Windows MCP

demo

👆 Un agente de IA calculando 123 + 456 en Calculadora y luego pegando el resultado en Bloc de notas: dos aplicaciones, cero selectores codificados, totalmente autónomo.

calculator demo

Por qué

El RPA tradicional graba selectores y se rompe en cuanto cambia una página. browser-use (32k⭐) resolvió esto para navegadores. screen-use lleva la misma idea a todo el escritorio: Excel, clientes SAP, software ERP, incluso programas Win32 heredados.

RPA tradicional

screen-use

Localización de elementos

Selectores grabados, se rompen fácilmente

Entiende la interfaz mediante árbol de accesibilidad + modelos de visión

Alcance

Solo navegador o aplicaciones específicas

Cualquier aplicación de escritorio

Creación

Desarrolladores profesionales

Lenguaje natural

Coste

Software empresarial caro

Código abierto, compatible con modelos locales

Cómo funciona

Your Agent (Claude / Kimi / Cursor / custom)   ← does the planning
        │  MCP or Python SDK
        ▼
┌─────────────────────────────────────────────┐
│ screen-use                                  │
│  Visual Loop ──► observe→think→act→verify   │
│  Introspection──► difficulty playbook        │
│  Meta-learning──► experience & vocab memory  │
│  Perception ──► UIA tree + screenshots (SoM)│
│  Locating   ──► strategy chain:             │
│                 ⓪ learned vocab mapping     │
│                 ① UIA text match (0 cost)   │
│                 ② Set-of-Mark + VLM         │
│  Action     ──► mouse / keyboard            │
└─────────────────────────────────────────────┘

El VLM es opcional, no es obligatorio. La cadena de estrategia de localización alcanza la mayoría de los objetivos con coincidencia de texto pura del árbol de accesibilidad: cero llamadas al modelo, latencia de milisegundos. Un modelo de visión (en la nube o local mediante Ollama) solo interviene para interfaces ciegas a UIA.

Inicio rápido

git clone https://github.com/tongriyaotxt/screen-use.git
cd screen-use
pip install -r requirements.txt

Como servidor MCP (recomendado)

Añade a claude_desktop_config.json (o a la configuración de cualquier agente compatible con MCP):

{
  "mcpServers": {
    "screen-use": {
      "command": "python",
      "args": ["-m", "screen_use.mcp_server"],
      "cwd": "path/to/screen-use"
    }
  }
}

Luego solo dile a tu agente: "Abre Calculadora y calcula 123 × 456."

Como SDK de Python

from screen_use import ScreenUse

tools = ScreenUse()

tools.click_element("Save")            # locate + click, one call
tools.type_text("Hello, 你好")          # Unicode-safe (clipboard paste)
tools.hotkey("ctrl", "s")

# Atomic tools for vision-capable agents:
elements = tools.list_ui_elements()    # id, name, type, bbox — no model needed
shot = tools.screenshot(annotate=True) # Set-of-Mark annotated screenshot
tools.click(500, 300)

Bucle de tareas autónomo

Una sola llamada, autonomía total: el agente ve, decide, actúa y se autocorrige:

tools.run_task("打开计算器,算 25 乘以 4")   # observe → think → act → verify

Introspección (困难分类反思): cuando el bucle se atasca, clasifica la dificultad — sin efecto / bucle repetido / fallos consecutivos / elementos faltantes / ventana emergente inesperada — y reflexiona con un manual de indicaciones específico, luego ajusta la estrategia.

Meta-aprendizaje (元学习): las ejecuciones exitosas se recuerdan. Tareas similares pasadas se recuperan como pistas de experiencia, y los mapeos de vocabulario aprendidos (p. ej. "乘号" → Multiply by) se convierten en el nuevo primer nivel de la cadena de estrategia. Literalmente mejora cuanto más lo usas. La memoria vive en ~/.screen_use/.

Herramientas (14)

Atómicas (cero dependencia de modelos): screenshot · list_ui_elements · click · double_click · right_click · click_element_id · type_text · hotkey · press · scroll

De alto nivel: find_element (localización por cadena de estrategia) · click_element (localizar + hacer clic) · read_screen (Q&A de pantalla con VLM) · run_task (bucle visual autónomo)

Modelo de visión (opcional)

Solo es necesario cuando tu agente no tiene visión Y la aplicación objetivo es ciega a UIA. Copia .env.example a .env:

Preajuste

Configuración

Modelos

Local (gratuito, privado)

VISION_PROVIDER=ollama

qwen3-vl, qwen2.5vl, llama3.2-vision

OpenAI

VISION_PROVIDER=openai + clave

gpt-4o

Qwen

VISION_PROVIDER=qwen + clave

qwen-vl-max

Sin ningún VLM configurado, las herramientas atómicas y la coincidencia UIA siguen funcionando por completo.

Seguridad

  • 🚨 A prueba de fallos: mueve bruscamente el ratón a la esquina superior izquierda para abortar al instante

  • ✅ Hook confirm_callback para aprobar cada acción (SDK)

  • 🧪 ScreenUse(dry_run=True) registra acciones sin ejecutarlas

Hoja de ruta

  • Cadena de estrategia de localización UIA + SoM

  • Servidor MCP (14 herramientas)

  • Soporte de VLM local (Ollama)

  • Bucle visual autónomo (run_task)

  • Manual de introspección y memoria de meta-aprendizaje

  • Primitivas wait_for_element / auto-verificación

  • Arrastrar y soltar

  • Respaldo de coordenadas brutas con VLM + coincidencia de plantillas OpenCV (aplicaciones ciegas a UIA)

  • Soporte para macOS (API de accesibilidad) y Linux

  • Publicación en PyPI

Las contribuciones son bienvenidas: consulta los issues para buenas primeras tareas.

Desarrollo

pytest tests -q                        # 61 unit tests, no desktop/VLM needed
python examples/demo_calculator.py     # end-to-end demo (real clicks!)
python examples/mcp_client_demo.py     # MCP handshake + tool list

Licencia

MIT


screen-use = 桌面版 browser-use:让任何 AI Agent 获得看屏幕、操作桌面应用的能力。

  • 不是传统 RPA:不录制 selector,通过无障碍树 + 视觉模型理解 UI,界面变了也不怕

  • 跨一切桌面应用:Excel、SAP、ERP 客户端、老旧 Win32 程序

  • 自然语言驱动click_element("保存按钮") 一句话搞定

  • VLM 可选:策略链第一级是纯 UIA 文本匹配(零模型、毫秒级),视觉模型只在盲区兜底,支持本地 Ollama 保护隐私

接入方式、工具列表、安全配置与上文英文版一致。

-
license - not tested
Not graded
quality - not tested
B
maintenance

Maintenance

Maintainers
Response time
Release cycle
Releases (12mo)
Commit activity

Resources

Unclaimed servers have limited discoverability.

Looking for Admin?

If you are the server author, to access and configure the admin panel.

Related MCP Connectors

  • Turns any agent into a full agentic application — branded, interactive screens generated at runtime.

  • Eyes and hands on real Windows PCs — observe, click, type via Glasswarp API.

  • Let ChatGPT, Claude & Cursor use your Mac: email, calendar, iMessage, Teams, files. Local, free.

View all MCP Connectors

Latest Blog Posts

MCP directory API

We provide all the information about MCP servers via our MCP API.

curl -X GET 'https://glama.ai/api/mcp/v1/servers/tongriyaotxt/screen-use'

If you have feedback or need assistance with the MCP directory API, please join our Discord server