Skip to main content
Glama

🖥️ screen-use

browser-use, но для всего рабочего стола.

Дайте любому ИИ-агенту глаза 👀 и руки 🖐️ в Windows — позвольте Claude, Kimi, Cursor или вашему собственному агенту видеть экран, находить элементы интерфейса и управлять любым настольным приложением с помощью естественного языка. Никаких селекторов. Никаких скриптов, которые ломаются при изменении интерфейса.

License: MIT Python 3.10+ Platform: Windows MCP

demo

👆 ИИ-агент вычисляет 123 + 456 в Калькуляторе, затем вставляет результат в Блокнот — два приложения, ноль жестко заданных селекторов, полностью автономно.

calculator demo

Зачем

Традиционный RPA записывает селекторы — и ломается в тот момент, когда страница меняется. browser-use (32k⭐) решил эту проблему для браузеров. screen-use привносит ту же идею на весь рабочий стол: Excel, SAP-клиенты, ERP-системы, даже устаревшие Win32-программы.

Традиционный RPA

screen-use

Поиск элементов

Записанные селекторы, легко ломаются

Понимает интерфейс через дерево доступности + модели зрения

Область применения

Только браузер или конкретные приложения

Любое настольное приложение

Создание

Профессиональные разработчики

Естественный язык

Стоимость

Дорогое корпоративное ПО

Открытый исходный код, дружелюбен к локальным моделям

Как это работает

Your Agent (Claude / Kimi / Cursor / custom)   ← does the planning
        │  MCP or Python SDK
        ▼
┌─────────────────────────────────────────────┐
│ screen-use                                  │
│  Visual Loop ──► observe→think→act→verify   │
│  Introspection──► difficulty playbook        │
│  Meta-learning──► experience & vocab memory  │
│  Perception ──► UIA tree + screenshots (SoM)│
│  Locating   ──► strategy chain:             │
│                 ⓪ learned vocab mapping     │
│                 ① UIA text match (0 cost)   │
│                 ② Set-of-Mark + VLM         │
│  Action     ──► mouse / keyboard            │
└─────────────────────────────────────────────┘

VLM необязателен, не требуется. Цепочка стратегий поиска попадает в большинство целей с помощью чистого сопоставления текста по дереву доступности — ноль вызовов моделей, миллисекундная задержка. Модель зрения (облачная или локальная через Ollama) подключается только для интерфейсов, невидимых для UIA.

Быстрый старт

git clone https://github.com/tongriyaotxt/screen-use.git
cd screen-use
pip install -r requirements.txt

В качестве MCP-сервера (рекомендуется)

Добавьте в claude_desktop_config.json (или конфиг любого MCP-совместимого агента):

{
  "mcpServers": {
    "screen-use": {
      "command": "python",
      "args": ["-m", "screen_use.mcp_server"],
      "cwd": "path/to/screen-use"
    }
  }
}

Затем просто скажите агенту: «Открой Калькулятор и вычисли 123 × 456».

В качестве Python SDK

from screen_use import ScreenUse

tools = ScreenUse()

tools.click_element("Save")            # locate + click, one call
tools.type_text("Hello, 你好")          # Unicode-safe (clipboard paste)
tools.hotkey("ctrl", "s")

# Atomic tools for vision-capable agents:
elements = tools.list_ui_elements()    # id, name, type, bbox — no model needed
shot = tools.screenshot(annotate=True) # Set-of-Mark annotated screenshot
tools.click(500, 300)

Автономный цикл задач

Один вызов, полная автономия — агент видит, решает, действует и сам исправляется:

tools.run_task("打开计算器,算 25 乘以 4")   # observe → think → act → verify

Интроспекция (рефлексия классификации трудностей): когда цикл застревает, он классифицирует сложность — нет эффекта / повторный цикл / последовательные сбои / отсутствующие элементы / неожиданное всплывающее окно — и размышляет с помощью целевого сборника подсказок, затем корректирует стратегию.

Мета-обучение (мета-обучение): успешные запуски запоминаются. Похожие прошлые задачи вспоминаются как подсказки из опыта, а выученные словарные соответствия (например, «знак умножения» → Multiply by) становятся новым первым уровнем цепочки стратегий. Буквально становится лучше, чем больше вы им пользуетесь. Память хранится в ~/.screen_use/.

Инструменты (14)

Атомарные (без зависимости от моделей): screenshot · list_ui_elements · click · double_click · right_click · click_element_id · type_text · hotkey · press · scroll

Высокоуровневые: find_element (поиск по цепочке стратегий) · click_element (найти + клик) · read_screen (VLM вопросы и ответы по экрану) · run_task (автономный визуальный цикл)

Модель зрения (необязательно)

Нужна только когда у вашего агента нет зрения И целевое приложение невидимо для UIA. Скопируйте .env.example в .env:

Пресет

Конфигурация

Модели

Локальная (бесплатно, приватно)

VISION_PROVIDER=ollama

qwen3-vl, qwen2.5vl, llama3.2-vision

OpenAI

VISION_PROVIDER=openai + ключ

gpt-4o

Qwen

VISION_PROVIDER=qwen + ключ

qwen-vl-max

Без настройки какого-либо VLM атомарные инструменты и сопоставление UIA по-прежнему работают полностью.

Безопасность

  • 🚨 Аварийный предохранитель: резко переместите мышь в верхний левый угол, чтобы мгновенно прервать

  • ✅ хук confirm_callback для подтверждения каждого действия (SDK)

  • 🧪 ScreenUse(dry_run=True) записывает действия без выполнения

Дорожная карта

  • Цепочка стратегий поиска UIA + SoM

  • MCP-сервер (14 инструментов)

  • Поддержка локального VLM (Ollama)

  • Автономный визуальный цикл (run_task)

  • Сборник интроспекции и память мета-обучения

  • wait_for_element / примитивы автоматической проверки

  • Drag & drop

  • Запасной вариант VLM по сырым координатам + сопоставление шаблонов OpenCV (приложения, невидимые для UIA)

  • Поддержка macOS (Accessibility API) и Linux

  • Релиз на PyPI

Приветствуются вклады — смотрите issues для хороших первых задач.

Разработка

pytest tests -q                        # 61 unit tests, no desktop/VLM needed
python examples/demo_calculator.py     # end-to-end demo (real clicks!)
python examples/mcp_client_demo.py     # MCP handshake + tool list

Лицензия

MIT


screen-use = настольная версия browser-use: даёт любому ИИ-агенту возможность видеть экран и управлять настольными приложениями.

  • Не традиционный RPA: не записывает селекторы, понимает UI через дерево доступности + модели зрения, не боится изменений интерфейса

  • Работает со всеми настольными приложениями: Excel, SAP, ERP-клиенты, старые Win32-программы

  • Управление естественным языком: click_element("保存按钮") — всё решается одной фразой

  • VLM необязателен: первый уровень цепочки стратегий — чистое сопоставление текста UIA (ноль моделей, миллисекунды), модель зрения подключается только в слепых зонах, поддерживается локальный Ollama для защиты конфиденциальности

Способы подключения, список инструментов и настройки безопасности совпадают с английской версией выше.

-
license - not tested
Not graded
quality - not tested
C
maintenance

Maintenance

Maintainers
Response time
Release cycle
Releases (12mo)
Commit activity

Resources

Unclaimed servers have limited discoverability.

Looking for Admin?

If you are the server author, to access and configure the admin panel.

Related MCP Connectors

  • Turns any agent into a full agentic application — branded, interactive screens generated at runtime.

  • Eyes and hands on real Windows PCs — observe, click, type via Glasswarp API.

  • Let ChatGPT, Claude & Cursor use your Mac: email, calendar, iMessage, Teams, files. Local, free.

View all MCP Connectors

Latest Blog Posts

MCP directory API

We provide all the information about MCP servers via our MCP API.

curl -X GET 'https://glama.ai/api/mcp/v1/servers/tongriyaotxt/screen-use'

If you have feedback or need assistance with the MCP directory API, please join our Discord server