HyperCrawl
HyperCrawl
Selbstgehostete, cookie-bewusste Web-Automatisierungs-Engine. Verwandelt jede Website in aufrufbare MCP-Tools (DOM-Selektor-basiert), führt sie headless mit Stealth auf unseren eigenen Servern aus und zieht bei Bedarf Live-Auth-Cookies aus einem echten eingeloggten Browser. Internes NEB-Tool — funktioniert neben Apify.
Status: Produktion auf der hypercrawl-vm GCE-VM (Caddy auto-TLS + Firebase-Auth-Gate, hypercrawl.service). Fähigkeiten: die acquire()-Fähigkeitsleiter (hypercrawl_acquire — API-Replay/Hydration → gelerntes Tool → DOM-Agent → Set-of-Marks → Vision → Spezialist), mehrseitige Entdeckung (hypercrawl_map, hypercrawl_crawl_site), Cross-Crawl-Änderungsverfolgung (zustandslose previousHashes- oder DB-gestützte track-Streams, beide Intents), Websuche (hypercrawl_search), plus HTTP-MCP-Transport, ProxyPool und der Apify-Fallback-Adapter. Siehe docs/USAGE.md (Tools) und deploy/gcp/README.md (Bereitstellung/Update — enthält die erforderlichen Schritte npm install + npx playwright install).
Browser-Sitzungen
Über die einmalige Erfassung hinaus bietet HyperCrawl eine zustandsbehaftete Browser-Oberfläche: 15 hypercrawl_browser_*-MCP-Tools, die eine einzelne Live-Seite über viele Aufrufe hinweg steuern, sodass ein Agent eine Seite lesen, hineinklicken, ein Formular ausfüllen und absenden kann — wobei jeder Schritt auf demselben Tab landet. hypercrawl_browser_open gibt eine sessionId zurück, die jedes andere Tool entgegennimmt.
Sitzungen sind eine begrenzte Ressource: Jede bindet einen echten Chromium-Kontext, daher begrenzt der Server die Parallelität (HYPERCRAWL_MAX_SESSIONS, Standardwert 4) und räumt Sitzungen auf, die länger als fünf Minuten inaktiv sind. Schließen Sie Ihre, wenn Sie fertig sind. Eine unbekannte sessionId ist ein deutlicher Fehler, niemals eine stillschweigend neue Seite.
Daneben: hypercrawl_analyze / hypercrawl_quality (Seitenstruktur und ob die Selektoren einer gespeicherten Vorlage weiterhin gegen die Live-Seite aufgelöst werden — das Signal, dass ein Redesign sie zerstört hat), hypercrawl_auth_save / _auth_list sowie hypercrawl_metrics / _events / _speed / _setup für die In-Process-Beobachtbarkeit. Tool-Referenz und alle Umgebungsvariablen: docs/USAGE.md.
Zwei Funktionen sind nur integriert, wenn der Server über hypercrawl serve gestartet wird — das Auth-Paar und hypercrawl_setup —, weil ihre Implementierungen im CLI-Paket liegen. Wenn sie nicht integriert sind, melden sie dies, anstatt ein leeres Ergebnis zurückzugeben, das wie „nichts konfiguriert“ aussehen würde.
Bereitstellung auf GCP
Um die vollständige Engine (einschließlich authentifiziertem Cookie-Pull-Scraping) auf einer dedizierten GCE-VM mit Caddy auto-TLS und einem Firebase-Auth-Token-Gate auszuführen, verwenden Sie die idempotenten Provisioning-Skripte und das Operator-Runbook in deploy/gcp/README.md. Design: docs/superpowers/specs/2026-05-29-hypercrawl-gcp-deploy-design.md.
This server cannot be installed
Resources
Unclaimed servers have limited discoverability.
Looking for Admin?
If you are the server author, to access and configure the admin panel.
Related MCP Connectors
AI-powered browser automation — navigate, click, fill forms, and extract data from any website.
Hosted real Google Chrome MCP with per-user persistent state. Navigate, click, type, screenshot.
Self-hosted MCP gateway: turn any API, database or MCP server into AI connectors — no code.
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/JoinSyndicate/hypercrawl'
If you have feedback or need assistance with the MCP directory API, please join our Discord server