Skip to main content
Glama

🖥️ screen-use

browser-use, aber für den gesamten Desktop.

Gib jedem KI-Agenten Augen 👀 und Hände 🖐️ unter Windows – lass Claude, Kimi, Cursor oder deinen eigenen Agenten den Bildschirm sehen, UI-Elemente finden und jede Desktop-App über natürliche Sprache bedienen. Keine Selektoren. Keine Skripte, die brechen, wenn sich die UI ändert.

License: MIT Python 3.10+ Platform: Windows MCP

demo

👆 Ein KI-Agent berechnet 123 + 456 im Taschenrechner und fügt das Ergebnis dann in Notepad ein – zwei Apps, null hartcodierte Selektoren, vollständig autonom.

calculator demo

Warum

Traditionelle RPA zeichnet Selektoren auf – und bricht, sobald sich eine Seite ändert. browser-use (32k⭐) hat das für Browser gelöst. screen-use bringt dieselbe Idee auf den gesamten Desktop: Excel, SAP-Clients, ERP-Software, sogar alte Win32-Programme.

Traditionelle RPA

screen-use

Elemente lokalisieren

Aufgezeichnete Selektoren, brechen leicht

Versteht UI über Accessibility-Baum + Vision-Modelle

Umfang

Nur Browser oder bestimmte Apps

Jede Desktop-App

Erstellung

Professionelle Entwickler

Natürliche Sprache

Kosten

Teure Unternehmenssoftware

Open Source, lokal-modellfreundlich

So funktioniert es

Your Agent (Claude / Kimi / Cursor / custom)   ← does the planning
        │  MCP or Python SDK
        ▼
┌─────────────────────────────────────────────┐
│ screen-use                                  │
│  Visual Loop ──► observe→think→act→verify   │
│  Introspection──► difficulty playbook        │
│  Meta-learning──► experience & vocab memory  │
│  Perception ──► UIA tree + screenshots (SoM)│
│  Locating   ──► strategy chain:             │
│                 ⓪ learned vocab mapping     │
│                 ① UIA text match (0 cost)   │
│                 ② Set-of-Mark + VLM         │
│  Action     ──► mouse / keyboard            │
└─────────────────────────────────────────────┘

VLM ist optional, nicht erforderlich. Die Lokalisierungs-Strategiekette trifft die meisten Ziele mit reinem Accessibility-Baum-Textabgleich – null Modellaufrufe, Millisekunden-Latenz. Ein Vision-Modell (Cloud oder lokal über Ollama) greift nur bei UIA-blinden UIs ein.

Schnellstart

git clone https://github.com/tongriyaotxt/screen-use.git
cd screen-use
pip install -r requirements.txt

Als MCP-Server (empfohlen)

Füge zu claude_desktop_config.json hinzu (oder zur Konfiguration eines beliebigen MCP-kompatiblen Agenten):

{
  "mcpServers": {
    "screen-use": {
      "command": "python",
      "args": ["-m", "screen_use.mcp_server"],
      "cwd": "path/to/screen-use"
    }
  }
}

Dann sag einfach zu deinem Agenten: „Öffne Calculator und berechne 123 × 456."

Als Python-SDK

from screen_use import ScreenUse

tools = ScreenUse()

tools.click_element("Save")            # locate + click, one call
tools.type_text("Hello, 你好")          # Unicode-safe (clipboard paste)
tools.hotkey("ctrl", "s")

# Atomic tools for vision-capable agents:
elements = tools.list_ui_elements()    # id, name, type, bbox — no model needed
shot = tools.screenshot(annotate=True) # Set-of-Mark annotated screenshot
tools.click(500, 300)

Autonome Aufgaben-Schleife

Ein Aufruf, volle Autonomie – der Agent sieht, entscheidet, handelt und korrigiert sich selbst:

tools.run_task("打开计算器,算 25 乘以 4")   # observe → think → act → verify

Introspection (困难分类反思): Wenn die Schleife hängen bleibt, klassifiziert sie die Schwierigkeit – keine Wirkung / Wiederholungsschleife / aufeinanderfolgende Fehler / fehlende Elemente / unerwartetes Popup – und reflektiert mit einem gezielten Prompt-Playbook, dann passt sie die Strategie an.

Meta-Lernen (元学习): Erfolgreiche Läufe werden gespeichert. Ähnliche frühere Aufgaben werden als Erfahrungshinweise abgerufen, und gelernte Vokabelzuordnungen (z. B. „乘号" → Multiply by) werden zur neuen ersten Ebene der Strategiekette. Es wird buchstäblich besser, je mehr man es nutzt. Der Speicher liegt in ~/.screen_use/.

Tools (14)

Atomar (keine Modellabhängigkeit): screenshot · list_ui_elements · click · double_click · right_click · click_element_id · type_text · hotkey · press · scroll

High-level: find_element (Strategiekette-Lokalisierung) · click_element (Lokalisieren + Klicken) · read_screen (VLM-Bildschirm-Fragen & Antworten) · run_task (autonome visuelle Schleife)

Vision-Modell (optional)

Nur nötig, wenn dein Agent keine Vision hat UND die Ziel-App UIA-blind ist. Kopiere .env.example zu .env:

Voreinstellung

Konfiguration

Modelle

Lokal (kostenlos, privat)

VISION_PROVIDER=ollama

qwen3-vl, qwen2.5vl, llama3.2-vision

OpenAI

VISION_PROVIDER=openai + Schlüssel

gpt-4o

Qwen

VISION_PROVIDER=qwen + Schlüssel

qwen-vl-max

Ohne konfiguriertes VLM funktionieren atomare Werkzeuge und UIA-Abgleich weiterhin vollständig.

Sicherheit

  • 🚨 Failsafe: Bewege deine Maus blitzschnell in die obere linke Ecke, um sofort abzubrechen

  • confirm_callback-Hook, um jede Aktion zu genehmigen (SDK)

  • 🧪 ScreenUse(dry_run=True) zeichnet Aktionen auf, ohne sie auszuführen

Roadmap

  • UIA + SoM-Lokalisierungs-Strategiekette

  • MCP-Server (14 Werkzeuge)

  • Lokale VLM-Unterstützung (Ollama)

  • Autonome visuelle Schleife (run_task)

  • Introspection-Playbook & Meta-Lern-Speicher

  • wait_for_element / Auto-Verifizierungs-Primitive

  • Drag & Drop

  • VLM-Rohkoordinaten-Fallback + OpenCV-Template-Matching (UIA-blinde Apps)

  • macOS (Accessibility-API) & Linux-Unterstützung

  • PyPI-Veröffentlichung

Beiträge willkommen – siehe Issues für gute erste Aufgaben.

Entwicklung

pytest tests -q                        # 61 unit tests, no desktop/VLM needed
python examples/demo_calculator.py     # end-to-end demo (real clicks!)
python examples/mcp_client_demo.py     # MCP handshake + tool list

Lizenz

MIT


screen-use = 桌面版 browser-use:让任何 AI Agent 获得看屏幕、操作桌面应用的能力。

  • 不是传统 RPA:不录制 selector,通过无障碍树 + 视觉模型理解 UI,界面变了也不怕

  • 跨一切桌面应用:Excel、SAP、ERP 客户端、老旧 Win32 程序

  • 自然语言驱动click_element("保存按钮") 一句话搞定

  • VLM 可选:策略链第一级是纯 UIA 文本匹配(零模型、毫秒级),视觉模型只在盲区兜底,支持本地 Ollama 保护隐私

接入方式、工具列表、安全配置与上文英文版一致。

-
license - not tested
Not graded
quality - not tested
B
maintenance

Maintenance

Maintainers
Response time
Release cycle
Releases (12mo)
Commit activity

Resources

Unclaimed servers have limited discoverability.

Looking for Admin?

If you are the server author, to access and configure the admin panel.

Related MCP Connectors

  • Turns any agent into a full agentic application — branded, interactive screens generated at runtime.

  • Eyes and hands on real Windows PCs — observe, click, type via Glasswarp API.

  • Let ChatGPT, Claude & Cursor use your Mac: email, calendar, iMessage, Teams, files. Local, free.

View all MCP Connectors

Latest Blog Posts

MCP directory API

We provide all the information about MCP servers via our MCP API.

curl -X GET 'https://glama.ai/api/mcp/v1/servers/tongriyaotxt/screen-use'

If you have feedback or need assistance with the MCP directory API, please join our Discord server