Skip to main content
Glama

browsegrab

한국어 문서 · llms.txt

Токено-эффективный браузерный агент для локальных LLM — Playwright + дерево доступности + MarkGrab, нативная поддержка MCP.

browsegrab — это легковесная библиотека для автоматизации браузера, разработанная для локальных LLM (8B-35B параметров). Она объединяет дерево доступности Playwright с преобразованием HTML в markdown от MarkGrab, что позволяет достичь в 5-8 раз меньшего количества токенов на шаг по сравнению с альтернативами, такими как browser-use.

Возможности

  • Токено-эффективность: ~500-1 500 токенов/шаг (против 4 000-10 000 у browser-use)

  • Приоритет локальных LLM: Оптимизировано для vLLM, Ollama и OpenAI-совместимых эндпоинтов

  • Нативная поддержка MCP: Встроенный MCP-сервер с 8 инструментами автоматизации браузера

  • Интеграция с MarkGrab: HTML → чистый markdown для извлечения контента

  • Дерево доступности + система ссылок: Стабильные ссылки на элементы (e1, e2, ...) без использования моделей компьютерного зрения

  • Кэширование успешных паттернов: Нулевое количество вызовов LLM при повторении рабочих процессов

  • 5-этапный JSON-парсер: Надежный парсинг действий для вывода локальных LLM

  • Минимальные зависимости: Только playwright + httpx в ядре

Related MCP server: Playwright MCP

Установка

pip install browsegrab
playwright install chromium

С дополнительными функциями:

pip install browsegrab[mcp]      # MCP server support
pip install browsegrab[content]  # MarkGrab content extraction
pip install browsegrab[cli]      # CLI with rich output
pip install browsegrab[all]      # Everything

Быстрый старт

Python API

from browsegrab import BrowseSession

async with BrowseSession() as session:
    # Navigate and get accessibility tree snapshot
    await session.navigate("https://example.com")
    snap = await session.snapshot()
    print(snap.tree_text)
    # - heading "Example Domain" [level=1]
    # - link "Learn more": [ref=e1]

    # Click using ref ID
    result = await session.click("e1")
    print(result.url)  # https://www.iana.org/help/example-domains

    # Type into search box
    await session.navigate("https://en.wikipedia.org")
    snap = await session.snapshot()
    await session.type("e4", "Python programming", submit=True)

    # Extract compressed content (AX tree + markdown)
    content = await session.extract_content()

CLI

# Accessibility tree snapshot
browsegrab snapshot https://example.com

# JSON output
browsegrab snapshot https://example.com -f json

# Extract content (AX tree + markdown)
browsegrab extract https://en.wikipedia.org/wiki/Python

# Agentic browse (requires LLM endpoint)
browsegrab browse https://example.com "Find the about page"

MCP-сервер

browsegrab-mcp  # Start MCP server (stdio)

Конфигурация для Claude Desktop / Cursor / VS Code:

{
  "mcpServers": {
    "browsegrab": {
      "command": "browsegrab-mcp"
    }
  }
}

8 инструментов MCP: browser_navigate, browser_click, browser_type, browser_snapshot, browser_scroll, browser_extract_content, browser_go_back, browser_wait

Как это работает

Цикл навигации агента

flowchart LR
    A["🌐 URL + Goal"] --> B["Navigate"]
    B --> C["AX Tree Snapshot\n~200–500 tokens"]
    C --> D{"LLM\nDecision"}
    D -->|"click / type / scroll"| E["Execute Action"]
    E --> C
    D -->|"goal reached"| F["Extract Content\n(MarkGrab)"]
    F --> G["✅ Result"]

Токено-эффективность

browsegrab разделяет структуру (дерево доступности) и контент (markdown от MarkGrab), отправляя только то, что необходимо LLM:

flowchart TD
    A["Raw HTML"] --> B["Accessibility Tree"]
    A --> C["MarkGrab Markdown"]
    B --> D["Structure: ~200–500 tokens\nInteractive elements with ref IDs"]
    C --> E["Content: ~300–800 tokens\nClean markdown · on-demand"]
    D --> F["Combined: ~500–1,300 tokens/step\n⚡ 5–8× fewer than browser-use"]
    E --> F

Токено-эффективность (измеренная)

Страница

Интерактивные элементы

Токены

Эквивалент browser-use

example.com

1

~60

~500+

Статья Wikipedia

452

~1 254

~10 000+

Архитектура

browsegrab/
├── config.py                 # Dataclass configs (env var loading)
├── result.py                 # Result types (ActionResult, BrowseResult, ...)
├── session.py                # BrowseSession orchestrator
├── browser/
│   ├── manager.py            # Playwright lifecycle (async context manager)
│   ├── snapshot.py           # Accessibility tree + ref system
│   ├── selectors.py          # 4-strategy selector resolver
│   └── actions.py            # navigate, click, type, scroll, go_back, wait
├── dom/
│   ├── ref_map.py            # ref ID ↔ element bidirectional mapping
│   └── compress.py           # AX tree + MarkGrab → compressed context
├── llm/
│   ├── base.py               # LLMProvider ABC
│   ├── provider.py           # vLLM, Ollama, OpenAI-compatible
│   ├── prompt.py             # System prompts (~400 tokens)
│   └── parse.py              # 5-stage JSON fallback parser
├── agent/
│   ├── history.py            # Sliding window history compression
│   ├── cache.py              # Domain-based success pattern cache
│   └── loop_guard.py         # Duplicate action detection
├── __main__.py               # CLI (click)
└── mcp_server.py             # FastMCP server (8 tools)

Конфигурация

Все настройки через переменные окружения (префикс BROWSEGRAB_*):

# Browser
BROWSEGRAB_BROWSER_HEADLESS=true
BROWSEGRAB_BROWSER_TIMEOUT_MS=30000

# LLM (for agentic browse)
BROWSEGRAB_LLM_PROVIDER=vllm          # vllm | ollama | openai
BROWSEGRAB_LLM_BASE_URL=http://localhost:8000/v1
BROWSEGRAB_LLM_MODEL=Qwen/Qwen3.5-32B-AWQ

# Agent
BROWSEGRAB_AGENT_MAX_STEPS=10
BROWSEGRAB_AGENT_ENABLE_CACHE=true

Часть экосистемы QuartzUnit

Библиотека

Роль

markgrab

Пассивное извлечение (URL → markdown)

snapgrab

Пассивный захват (URL → скриншот)

docpick

OCR документов → структурированный JSON

browsegrab

Активная автоматизация (цель → действия в браузере → результаты)

Разработка

git clone https://github.com/QuartzUnit/browsegrab.git
cd browsegrab
python -m venv .venv && source .venv/bin/activate
pip install -e ".[dev]"
playwright install chromium

# Unit tests (no browser needed)
pytest tests/ -m "not e2e"

# Full suite including E2E
pytest tests/ -v

Лицензия

MIT


Часть экосистемы QuartzUnit — компонуемые библиотеки Python для сбора данных, извлечения, поиска и обеспечения безопасности ИИ-агентов.

A
license - permissive license
-
quality - not tested
D
maintenance

Maintenance

Maintainers
Response time
Release cycle
Releases (12mo)
Commit activity

Resources

Unclaimed servers have limited discoverability.

Looking for Admin?

If you are the server author, to access and configure the admin panel.

Related MCP Servers

  • A
    license
    -
    quality
    F
    maintenance
    This server provides browser automation capabilities using Playwright, allowing LLMs to interact with web pages through structured accessibility snapshots. It enables tasks like web navigation, form filling, and data extraction without the need for screenshots or vision-tuned models.
    7,623
    4
    Apache 2.0
  • A
    license
    -
    quality
    D
    maintenance
    A Model Context Protocol server that provides browser automation capabilities by allowing LLMs to interact with web pages through structured accessibility snapshots. It enables fast, lightweight interaction with web content without the need for vision-tuned models or visual processing.
    Apache 2.0

View all related MCP servers

Related MCP Connectors

  • AI-powered browser automation — navigate, click, fill forms, and extract data from any website.

  • E2LLM gives your AI eyes and hands in a real browser: structured perception (SiFR) plus action.

  • Reliable web access for AI agents: smart HTTP, rotating proxies, and full-browser rendering.

View all MCP Connectors

Latest Blog Posts

MCP directory API

We provide all the information about MCP servers via our MCP API.

curl -X GET 'https://glama.ai/api/mcp/v1/servers/QuartzUnit/browsegrab'

If you have feedback or need assistance with the MCP directory API, please join our Discord server