Skip to main content
Glama

HyperCrawl

Selbstgehostete, cookie-bewusste Web-Automatisierungs-Engine. Verwandelt jede Website in aufrufbare MCP-Tools (DOM-Selektor-basiert), führt sie headless mit Stealth auf unseren eigenen Servern aus und zieht bei Bedarf Live-Auth-Cookies aus einem echten eingeloggten Browser. Internes NEB-Tool — funktioniert neben Apify.

Status: Produktion auf der hypercrawl-vm GCE-VM (Caddy auto-TLS + Firebase-Auth-Gate, hypercrawl.service). Fähigkeiten: die acquire()-Fähigkeitsleiter (hypercrawl_acquire — API-Replay/Hydration → gelerntes Tool → DOM-Agent → Set-of-Marks → Vision → Spezialist), mehrseitige Entdeckung (hypercrawl_map, hypercrawl_crawl_site), Cross-Crawl-Änderungsverfolgung (zustandslose previousHashes- oder DB-gestützte track-Streams, beide Intents), Websuche (hypercrawl_search), plus HTTP-MCP-Transport, ProxyPool und der Apify-Fallback-Adapter. Siehe docs/USAGE.md (Tools) und deploy/gcp/README.md (Bereitstellung/Update — enthält die erforderlichen Schritte npm install + npx playwright install).

Browser-Sitzungen

Über die einmalige Erfassung hinaus bietet HyperCrawl eine zustandsbehaftete Browser-Oberfläche: 15 hypercrawl_browser_*-MCP-Tools, die eine einzelne Live-Seite über viele Aufrufe hinweg steuern, sodass ein Agent eine Seite lesen, hineinklicken, ein Formular ausfüllen und absenden kann — wobei jeder Schritt auf demselben Tab landet. hypercrawl_browser_open gibt eine sessionId zurück, die jedes andere Tool entgegennimmt.

Sitzungen sind eine begrenzte Ressource: Jede bindet einen echten Chromium-Kontext, daher begrenzt der Server die Parallelität (HYPERCRAWL_MAX_SESSIONS, Standardwert 4) und räumt Sitzungen auf, die länger als fünf Minuten inaktiv sind. Schließen Sie Ihre, wenn Sie fertig sind. Eine unbekannte sessionId ist ein deutlicher Fehler, niemals eine stillschweigend neue Seite.

Daneben: hypercrawl_analyze / hypercrawl_quality (Seitenstruktur und ob die Selektoren einer gespeicherten Vorlage weiterhin gegen die Live-Seite aufgelöst werden — das Signal, dass ein Redesign sie zerstört hat), hypercrawl_auth_save / _auth_list sowie hypercrawl_metrics / _events / _speed / _setup für die In-Process-Beobachtbarkeit. Tool-Referenz und alle Umgebungsvariablen: docs/USAGE.md.

Zwei Funktionen sind nur integriert, wenn der Server über hypercrawl serve gestartet wird — das Auth-Paar und hypercrawl_setup —, weil ihre Implementierungen im CLI-Paket liegen. Wenn sie nicht integriert sind, melden sie dies, anstatt ein leeres Ergebnis zurückzugeben, das wie „nichts konfiguriert“ aussehen würde.

Bereitstellung auf GCP

Um die vollständige Engine (einschließlich authentifiziertem Cookie-Pull-Scraping) auf einer dedizierten GCE-VM mit Caddy auto-TLS und einem Firebase-Auth-Token-Gate auszuführen, verwenden Sie die idempotenten Provisioning-Skripte und das Operator-Runbook in deploy/gcp/README.md. Design: docs/superpowers/specs/2026-05-29-hypercrawl-gcp-deploy-design.md.

-
license - not tested
-
quality - not tested
-
maintenance - not tested

Resources

Unclaimed servers have limited discoverability.

Looking for Admin?

If you are the server author, to access and configure the admin panel.

Related MCP Connectors

  • AI-powered browser automation — navigate, click, fill forms, and extract data from any website.

  • Hosted real Google Chrome MCP with per-user persistent state. Navigate, click, type, screenshot.

  • Self-hosted MCP gateway: turn any API, database or MCP server into AI connectors — no code.

View all MCP Connectors

Latest Blog Posts

MCP directory API

We provide all the information about MCP servers via our MCP API.

curl -X GET 'https://glama.ai/api/mcp/v1/servers/JoinSyndicate/hypercrawl'

If you have feedback or need assistance with the MCP directory API, please join our Discord server