screen-use
🖥️ screen-use
browser-use, aber für den gesamten Desktop.
Gib jedem KI-Agenten Augen 👀 und Hände 🖐️ unter Windows – lass Claude, Kimi, Cursor oder deinen eigenen Agenten den Bildschirm sehen, UI-Elemente finden und jede Desktop-App über natürliche Sprache bedienen. Keine Selektoren. Keine Skripte, die brechen, wenn sich die UI ändert.

👆 Ein KI-Agent berechnet 123 + 456 im Taschenrechner und fügt das Ergebnis dann in Notepad ein – zwei Apps, null hartcodierte Selektoren, vollständig autonom.

Warum
Traditionelle RPA zeichnet Selektoren auf – und bricht, sobald sich eine Seite ändert. browser-use (32k⭐) hat das für Browser gelöst. screen-use bringt dieselbe Idee auf den gesamten Desktop: Excel, SAP-Clients, ERP-Software, sogar alte Win32-Programme.
Traditionelle RPA | screen-use | |
Elemente lokalisieren | Aufgezeichnete Selektoren, brechen leicht | Versteht UI über Accessibility-Baum + Vision-Modelle |
Umfang | Nur Browser oder bestimmte Apps | Jede Desktop-App |
Erstellung | Professionelle Entwickler | Natürliche Sprache |
Kosten | Teure Unternehmenssoftware | Open Source, lokal-modellfreundlich |
So funktioniert es
Your Agent (Claude / Kimi / Cursor / custom) ← does the planning
│ MCP or Python SDK
▼
┌─────────────────────────────────────────────┐
│ screen-use │
│ Visual Loop ──► observe→think→act→verify │
│ Introspection──► difficulty playbook │
│ Meta-learning──► experience & vocab memory │
│ Perception ──► UIA tree + screenshots (SoM)│
│ Locating ──► strategy chain: │
│ ⓪ learned vocab mapping │
│ ① UIA text match (0 cost) │
│ ② Set-of-Mark + VLM │
│ Action ──► mouse / keyboard │
└─────────────────────────────────────────────┘VLM ist optional, nicht erforderlich. Die Lokalisierungs-Strategiekette trifft die meisten Ziele mit reinem Accessibility-Baum-Textabgleich – null Modellaufrufe, Millisekunden-Latenz. Ein Vision-Modell (Cloud oder lokal über Ollama) greift nur bei UIA-blinden UIs ein.
Schnellstart
git clone https://github.com/tongriyaotxt/screen-use.git
cd screen-use
pip install -r requirements.txtAls MCP-Server (empfohlen)
Füge zu claude_desktop_config.json hinzu (oder zur Konfiguration eines beliebigen MCP-kompatiblen Agenten):
{
"mcpServers": {
"screen-use": {
"command": "python",
"args": ["-m", "screen_use.mcp_server"],
"cwd": "path/to/screen-use"
}
}
}Dann sag einfach zu deinem Agenten: „Öffne Calculator und berechne 123 × 456."
Als Python-SDK
from screen_use import ScreenUse
tools = ScreenUse()
tools.click_element("Save") # locate + click, one call
tools.type_text("Hello, 你好") # Unicode-safe (clipboard paste)
tools.hotkey("ctrl", "s")
# Atomic tools for vision-capable agents:
elements = tools.list_ui_elements() # id, name, type, bbox — no model needed
shot = tools.screenshot(annotate=True) # Set-of-Mark annotated screenshot
tools.click(500, 300)Autonome Aufgaben-Schleife
Ein Aufruf, volle Autonomie – der Agent sieht, entscheidet, handelt und korrigiert sich selbst:
tools.run_task("打开计算器,算 25 乘以 4") # observe → think → act → verifyIntrospection (困难分类反思): Wenn die Schleife hängen bleibt, klassifiziert sie die Schwierigkeit – keine Wirkung / Wiederholungsschleife / aufeinanderfolgende Fehler / fehlende Elemente / unerwartetes Popup – und reflektiert mit einem gezielten Prompt-Playbook, dann passt sie die Strategie an.
Meta-Lernen (元学习): Erfolgreiche Läufe werden gespeichert. Ähnliche frühere Aufgaben werden als Erfahrungshinweise abgerufen, und gelernte Vokabelzuordnungen (z. B. „乘号" → Multiply by) werden zur neuen ersten Ebene der Strategiekette. Es wird buchstäblich besser, je mehr man es nutzt. Der Speicher liegt in ~/.screen_use/.
Tools (14)
Atomar (keine Modellabhängigkeit): screenshot · list_ui_elements · click · double_click · right_click · click_element_id · type_text · hotkey · press · scroll
High-level: find_element (Strategiekette-Lokalisierung) · click_element (Lokalisieren + Klicken) · read_screen (VLM-Bildschirm-Fragen & Antworten) · run_task (autonome visuelle Schleife)
Vision-Modell (optional)
Nur nötig, wenn dein Agent keine Vision hat UND die Ziel-App UIA-blind ist. Kopiere .env.example zu .env:
Voreinstellung | Konfiguration | Modelle |
Lokal (kostenlos, privat) |
| qwen3-vl, qwen2.5vl, llama3.2-vision |
OpenAI |
| gpt-4o |
Qwen |
| qwen-vl-max |
Ohne konfiguriertes VLM funktionieren atomare Werkzeuge und UIA-Abgleich weiterhin vollständig.
Sicherheit
🚨 Failsafe: Bewege deine Maus blitzschnell in die obere linke Ecke, um sofort abzubrechen
✅
confirm_callback-Hook, um jede Aktion zu genehmigen (SDK)🧪
ScreenUse(dry_run=True)zeichnet Aktionen auf, ohne sie auszuführen
Roadmap
UIA + SoM-Lokalisierungs-Strategiekette
MCP-Server (14 Werkzeuge)
Lokale VLM-Unterstützung (Ollama)
Autonome visuelle Schleife (
run_task)Introspection-Playbook & Meta-Lern-Speicher
wait_for_element/ Auto-Verifizierungs-PrimitiveDrag & Drop
VLM-Rohkoordinaten-Fallback + OpenCV-Template-Matching (UIA-blinde Apps)
macOS (Accessibility-API) & Linux-Unterstützung
PyPI-Veröffentlichung
Beiträge willkommen – siehe Issues für gute erste Aufgaben.
Entwicklung
pytest tests -q # 61 unit tests, no desktop/VLM needed
python examples/demo_calculator.py # end-to-end demo (real clicks!)
python examples/mcp_client_demo.py # MCP handshake + tool listLizenz
MIT
screen-use = 桌面版 browser-use:让任何 AI Agent 获得看屏幕、操作桌面应用的能力。
不是传统 RPA:不录制 selector,通过无障碍树 + 视觉模型理解 UI,界面变了也不怕
跨一切桌面应用:Excel、SAP、ERP 客户端、老旧 Win32 程序
自然语言驱动:
click_element("保存按钮")一句话搞定VLM 可选:策略链第一级是纯 UIA 文本匹配(零模型、毫秒级),视觉模型只在盲区兜底,支持本地 Ollama 保护隐私
接入方式、工具列表、安全配置与上文英文版一致。
This server cannot be installed
Maintenance
Resources
Unclaimed servers have limited discoverability.
Looking for Admin?
If you are the server author, to access and configure the admin panel.
Related MCP Connectors
Turns any agent into a full agentic application — branded, interactive screens generated at runtime.
Eyes and hands on real Windows PCs — observe, click, type via Glasswarp API.
Let ChatGPT, Claude & Cursor use your Mac: email, calendar, iMessage, Teams, files. Local, free.
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/tongriyaotxt/screen-use'
If you have feedback or need assistance with the MCP directory API, please join our Discord server