Skip to main content
Glama

🖥️ screen-use

browser-use、ただしデスクトップ全体向け。

あらゆるAIエージェントにWindows上で目👀と手🖐️を与える — Claude、Kimi、Cursor、または自作エージェントに画面を見せ、UI要素を特定させ、自然言語であらゆるデスクトップアプリを操作させます。セレクター不要。UIが変わると壊れるスクリプトも不要。

License: MIT Python 3.10+ Platform: Windows MCP

demo

👆 AIエージェントが電卓で123 + 456を計算し、その結果をメモ帳に貼り付ける — 2つのアプリ、ハードコードされたセレクターはゼロ、完全自律動作。

calculator demo

なぜ

従来のRPAはセレクターを記録します — そしてページが変わった瞬間に壊れます。browser-use(32k⭐)はこれをブラウザ向けに解決しました。screen-useは同じアイデアをデスクトップ全体に広げます: Excel、SAPクライアント、ERPソフトウェア、さらにはレガシーなWin32プログラムまで。

従来のRPA

screen-use

要素の特定

記録したセレクター、壊れやすい

アクセシビリティツリー+ビジョンモデルでUIを理解

対象範囲

ブラウザまたは特定アプリのみ

あらゆるデスクトップアプリ

作成方法

プロの開発者

自然言語

コスト

高価なエンタープライズソフトウェア

オープンソース、ローカルモデル対応

仕組み

Your Agent (Claude / Kimi / Cursor / custom)   ← does the planning
        │  MCP or Python SDK
        ▼
┌─────────────────────────────────────────────┐
│ screen-use                                  │
│  Visual Loop ──► observe→think→act→verify   │
│  Introspection──► difficulty playbook        │
│  Meta-learning──► experience & vocab memory  │
│  Perception ──► UIA tree + screenshots (SoM)│
│  Locating   ──► strategy chain:             │
│                 ⓪ learned vocab mapping     │
│                 ① UIA text match (0 cost)   │
│                 ② Set-of-Mark + VLM         │
│  Action     ──► mouse / keyboard            │
└─────────────────────────────────────────────┘

VLMはオプションであり、必須ではありません。 要素特定のストラテジーチェーンは、ほとんどのターゲットを純粋なアクセシビリティツリーのテキストマッチングで解決します — モデル呼び出しゼロ、ミリ秒レベルのレイテンシ。ビジョンモデル(クラウドまたはOllama経由のローカル)は、UIA非対応のUIの場合のみ起動します。

クイックスタート

git clone https://github.com/tongriyaotxt/screen-use.git
cd screen-use
pip install -r requirements.txt

MCPサーバーとして(推奨)

claude_desktop_config.json(またはMCP互換エージェントの設定)に追加:

{
  "mcpServers": {
    "screen-use": {
      "command": "python",
      "args": ["-m", "screen_use.mcp_server"],
      "cwd": "path/to/screen-use"
    }
  }
}

あとはエージェントにこう伝えるだけ: "電卓を開いて123 × 456を計算して。"

Python SDKとして

from screen_use import ScreenUse

tools = ScreenUse()

tools.click_element("Save")            # locate + click, one call
tools.type_text("Hello, 你好")          # Unicode-safe (clipboard paste)
tools.hotkey("ctrl", "s")

# Atomic tools for vision-capable agents:
elements = tools.list_ui_elements()    # id, name, type, bbox — no model needed
shot = tools.screenshot(annotate=True) # Set-of-Mark annotated screenshot
tools.click(500, 300)

自律タスクループ

1回の呼び出しで完全自律 — エージェントは見て、判断し、行動し、自己修正します:

tools.run_task("打开计算器,算 25 乘以 4")   # observe → think → act → verify

内省(困難分類の振り返り): ループが行き詰まったとき、困難度を分類します — 効果なし / ループ反復 / 連続失敗 / 要素欠落 / 予期しないポップアップ — そしてターゲットを絞ったプロンプトプレイブックで振り返り、戦略を調整します。

メタ学習: 成功した実行は記憶されます。類似の過去タスクは経験ヒントとして呼び出され、学習された語彙マッピング(例: "乗算記号" → Multiply by)はストラテジーチェーンの新しい第1レベルになります。使えば使うほど実際に良くなります。メモリは~/.screen_use/に保存されます。

ツール(14)

アトミック(モデル依存ゼロ): screenshot · list_ui_elements · click · double_click · right_click · click_element_id · type_text · hotkey · press · scroll

高レベル: find_element(ストラテジーチェーンによる特定) · click_element(特定+クリック) · read_screen(VLM画面Q&A) · run_task(自律ビジュアルループ)

ビジョンモデル(オプション)

エージェントにビジョンがなく、かつ対象アプリがUIA非対応の場合のみ必要です。.env.example.envにコピー:

プリセット

設定

モデル

ローカル(無料・プライベート)

VISION_PROVIDER=ollama

qwen3-vl, qwen2.5vl, llama3.2-vision

OpenAI

VISION_PROVIDER=openai + キー

gpt-4o

Qwen

VISION_PROVIDER=qwen + キー

qwen-vl-max

VLMを設定しなくても、アトミックツールとUIAマッチングは完全に動作します。

安全性

  • 🚨 フェイルセーフ: マウスを左上隅に叩きつけると即座に中止

  • confirm_callbackフックで全アクションを承認(SDK)

  • 🧪 ScreenUse(dry_run=True)で実行せずにアクションを記録

ロードマップ

  • UIA + SoMストラテジーチェーン

  • MCPサーバー(14ツール)

  • ローカルVLM対応(Ollama)

  • 自律ビジュアルループ(run_task

  • 内省プレイブックとメタ学習メモリ

  • wait_for_element / 自動検証プリミティブ

  • ドラッグ&ドロップ

  • VLM生座標フォールバック + OpenCVテンプレートマッチング(UIA非対応アプリ)

  • macOS(アクセシビリティAPI)とLinux対応

  • PyPIリリース

貢献歓迎 — 最初のタスクに適したissueを参照してください。

開発

pytest tests -q                        # 61 unit tests, no desktop/VLM needed
python examples/demo_calculator.py     # end-to-end demo (real clicks!)
python examples/mcp_client_demo.py     # MCP handshake + tool list

ライセンス

MIT


screen-use = デスクトップ版browser-use: あらゆるAIエージェントに画面を見てデスクトップアプリを操作する能力を与えます。

  • 従来のRPAではない: セレクターを記録せず、アクセシビリティツリー+ビジョンモデルでUIを理解するため、インターフェースが変わっても心配なし

  • あらゆるデスクトップアプリに対応: Excel、SAP、ERPクライアント、レガシーなWin32プログラム

  • 自然言語駆動: click_element("保存ボタン") の一言で完了

  • VLMはオプション: ストラテジーチェーンの第1レベルは純粋なUIAテキストマッチング(モデルゼロ、ミリ秒レベル)、ビジョンモデルは盲区間のみのフォールバック、プライバシー保護のためローカルOllamaをサポート

接続方法、ツールリスト、安全設定は上記の英語版と同じです。

-
license - not tested
Not graded
quality - not tested
B
maintenance

Maintenance

Maintainers
Response time
Release cycle
Releases (12mo)
Commit activity

Resources

Unclaimed servers have limited discoverability.

Looking for Admin?

If you are the server author, to access and configure the admin panel.

Related MCP Connectors

  • Turns any agent into a full agentic application — branded, interactive screens generated at runtime.

  • Eyes and hands on real Windows PCs — observe, click, type via Glasswarp API.

  • Let ChatGPT, Claude & Cursor use your Mac: email, calendar, iMessage, Teams, files. Local, free.

View all MCP Connectors

Latest Blog Posts

MCP directory API

We provide all the information about MCP servers via our MCP API.

curl -X GET 'https://glama.ai/api/mcp/v1/servers/tongriyaotxt/screen-use'

If you have feedback or need assistance with the MCP directory API, please join our Discord server