InfinityScrape MCP
🌐 InfinityScrape MCP: Weltklasse-Webscraping & Deep OSINT-Intelligence-Suite
InfinityScrape MCP ist ein eigenständiger, produktionsreifer Model-Context-Protocol-Server (MCP), der KI-Modellen (LM Studio, Claude Desktop, Cursor, Open WebUI, Antigravity AI) unbegrenztes, Hochgeschwindigkeits- und Anti-Bot-resistentes Webscraping, dynamisches SPA-Rendering, sofortige YouTube-Transkription sowie präzise OSINT-/GEOINT-Standortermittlung bietet.
📑 Inhaltsverzeichnis
Related MCP server: FineData MCP Server
🌟 Warum InfinityScrape MCP?
Standard-Webscraper scheitern bei modernen Websites oft an Cloudflare-Herausforderungen, starker clientseitiger JavaScript-Renderung, aufdringlichen Cookie-Consent-Modals und Rate Limits. InfinityScrape löst diese Probleme sofort einsatzbereit:
Zwei-Engine-Architektur:
Schnelle TLS-Engine (
primp+httpx): Imitiert echte Chrome/Safari-Browser-TLS/JA3-Fingerprints und HTTP/2-Header, um Cloudflare- und Akamai-Herausforderungen in<100mszu umgehen.Dynamischer Headless-Browser (
Playwright Chromium): Rendert komplexe SPAs (React, Vue, Next.js, Angular), führt unendliches Scrollen aus, klickt Elemente an und führt benutzerdefiniertes JavaScript aus.
Netzwerkebenen-Werbungs- & Tracker-Entfernung:
Fängt Netzwerkaufrufe an 35+ Werbenetzwerke und Tracking-Skripte ab und bricht sie ab (
doubleclick,criteo,outbrain,google-analytics), bevor sie heruntergeladen werden. Dadurch verkürzt sich die Seitenladezeit um ~300% und der Speicherverbrauch sinkt um 70%.Erkennt und zerlegt automatisch OneTrust-, Cookiebot- und Sticky-Overlay-Popups.
Zero-GPU-YouTube-Transkriptor:
Extrahiert vollständige Video-/Shorts-/Live-Transkripte mit Zeitstempeln (
[MM:SS]) in<300msdirekt über HTTP-Streams, ohne Video herunterzuladen oder lokale GPU-Whisper-Modelle zu benötigen.
Tiefgreifender rekursiver Dokumentations-Crawler:
Asynchroner Breitensuche-Crawler (BFS) mit Domain-Sperrung und Pfadpräfix-Filterung, um vollständige Dokumentationsbäume in einheitliches Markdown zu aggregieren.
Moderne öffentliche OSINT- & GEOINT-Aufklärung:
Multi-Signal-Konfidenzbewertung (0% - 100%): Bewertet die Korrelation von Name + Stadt + Straße + PLZ + Organisation + Rolle, um entdeckte Dossiers zu ranken.
25+ globale Plattform-Scanner: Scannt GitHub, GitLab, StackOverflow, Kaggle, HuggingFace, LeetCode, Codeforces, Dev.to, Medium, Substack, Google Scholar, ResearchGate, Reddit usw.
OpenStreetMap-GEOINT: Löst globale Adressen bis auf Straßen-/Postleitzahlebene mit GPS-Koordinaten und Verwaltungsgrenzen auf.
SQLite-persistente Caching-Schicht:
In-Memory- und SQLite-gestützter lokaler Cache für sofortige
0ms-Antworten bei wiederholten Abfragen mit konfigurierbarer TTL.
⚡ Wettbewerbsvergleich
Funktion / Fähigkeit | Standard-MCP-Scraper | Cloud-Scraping-APIs | InfinityScrape MCP |
Kosten & API-Schlüssel | Kostenlos (Basis) | Kostenpflichtig (20 - 200 $/Monat) | 100% kostenlos / keine API-Schlüssel |
Cloudflare / Akamai TLS-Bypass | ❌ Scheitert / 403 | ✅ Ja | ✅ Integriert ( |
Dynamische SPAs & unendliches Scrollen | ❌ Eingeschränkt | ✅ Ja | ✅ Integriert ( |
Netzwerkebenen-Werbe- & Popup-Entfernung | ❌ Nein | ⚠️ Teilweise | ✅ Integriert (35+ Domains) |
Zero-GPU-YouTube-Transkripte | ❌ Nein | ❌ Nein | ✅ Integriert (<300ms) |
Online-PDF-Seitenweiser-Parser | ❌ Nein | ⚠️ Zusatzkosten | ✅ Integriert ( |
Tiefgreifender Dokumentations-Crawler | ❌ Nein | ⚠️ Zusatzkosten | ✅ Integriert (Async BFS) |
25+ Plattform-OSINT & Geokodierung | ❌ Nein | ❌ Nein | ✅ Integriert (0-100% Konfidenz) |
Lokales SQLite-0ms-Caching | ❌ Nein | ❌ Nein | ✅ Integriert (Auto-TTL) |
🏗️ Architekturübersicht
┌────────────────────────────────────────────────┐
│ AI Client (LM Studio / Claude / Cursor) │
└───────────────────────┬────────────────────────┘
│ JSON-RPC 2.0 (Stdio)
▼
┌────────────────────────────────────────────────┐
│ InfinityScrape MCP Server │
│ (server.py) │
└───────┬────────────────┬───────────────┬───────┘
│ │ │
┌─────────────────┴─┐ ┌────────┴────────┐ ┌─┴────────────────┐
▼ ▼ ▼ ▼ ▼ ▼
[Fast TLS Engine] [Playwright Engine] [OSINT / GEOINT] [Media & PDF Engines]
• primp JA3/TLS • Stealth Chromium • 25+ Platform • YouTube (<300ms)
• HTTP/2 Stealth • Network Ad Blocker Scanners • Remote PDF Stream
• <100ms Execution • Infinite Scroll • OpenStreetMap • Table Markdownify
• Auto-Dismiss CMPs • Match Confidence
│
▼
┌────────────────────────────────┐
│ SQLite Caching Layer (0ms TTL) │
└────────────────────────────────┘🚀 Schnellstart & 1-Klick-Installation
Voraussetzungen
Python 3.10, 3.11 oder 3.12+ installiert.
Windows, macOS oder Linux.
1-Klick-Setup:
Auf Windows:
Doppelklicken Sie auf install.bat oder führen Sie in PowerShell aus:
.\install.batAuf Linux / macOS:
chmod +x install.sh
./install.shManuelles Setup (jede Plattform):
# 1. Create virtual environment
python -m venv .venv
# 2. Activate virtual environment
# Windows: .venv\Scripts\activate | Linux/Mac: source .venv/bin/activate
# 3. Install requirements & Playwright browser
pip install -r requirements.txt
playwright install chromium🔌 KI-Client-Integration
1. LM Studio (v0.3+)
Gehen Sie zu Einstellungen ➔ Entwickler ➔ MCP-Server ➔ Konfiguration bearbeiten und fügen Sie hinzu:
{
"mcpServers": {
"infinity-scraper": {
"command": "C:/path/to/infinity-scraper/.venv/Scripts/python.exe",
"args": [
"-m",
"infinity_scraper.server"
],
"cwd": "C:/path/to/infinity-scraper",
"env": {
"PYTHONUNBUFFERED": "1"
}
}
}
}2. Claude Desktop
Bearbeiten Sie %APPDATA%\Claude\claude_desktop_config.json (Windows) oder ~/Library/Application Support/Claude/claude_desktop_config.json (macOS):
{
"mcpServers": {
"infinity-scraper": {
"command": "C:/path/to/infinity-scraper/.venv/Scripts/python.exe",
"args": [
"-m",
"infinity_scraper.server"
]
}
}
}3. Cursor IDE
In den Cursor-Einstellungen ➔ Features ➔ MCP-Server ➔ Neuen MCP-Server hinzufügen:
Name:
infinity-scraperTyp:
commandBefehl:
C:/path/to/infinity-scraper/.venv/Scripts/python.exe -m infinity_scraper.server
🛠️ Vollständiges 23-Tool-Referenzhandbuch
1. Webscraping & Content-Crawling
Tool | Zweck | Wichtige Parameter |
| Universelles Scraping mit automatisch aufrüstender TLS-Browser-Engine. |
|
| Headless-Browser für SPAs, unendliches Scrollen und Klickaktionen. |
|
| Echtzeit-Internetsuche über DuckDuckGo. |
|
| Sucht im Web und scrapet automatisch die besten Ergebnisse in einen Bericht mit Quellenangaben. |
|
| Rekursiver asynchroner BFS-Site-Crawler für vollständige Dokumentationsbäume. |
|
| Gleichzeitiges Scraping mehrerer URLs parallel. |
|
| Extrahiert gezielte Felder mithilfe einer CSS-Selektor-Zuordnung in JSON. |
|
| Extrahiert JSON-LD, OpenGraph-Metadaten und HTML-Tabellen. |
|
| Semantischer RAG-Chunker & Token-Optimierer für riesige Seiten. |
|
2. Medien-, Social-, Video- & Dokument-Parser
Tool | Zweck | Wichtige Parameter |
| Zero-GPU-YouTube-Videotranskript-Extraktion mit Zeitstempeln. |
|
| Streamt und extrahiert entfernte Online-PDF-Dokumente seitenweise. |
|
| Extrahiert Kameradaten, Zeitstempel und GPS-Geotags aus Fotos. |
|
| Erfasst Reddit-Beiträge, Bewertungen und verschachtelte Kommentardialoge. |
|
| Echtzeit-RSS/Atom-Feed-Parser für Blogs, Substack und Nachrichten. |
|
3. Deep Public OSINT & Entitäts-Aufklärung
Tool | Zweck | Wichtige Parameter |
| Multi-Domain-Open-Web-Profil-Scraper & Konfidenz-gerankter Dossier-Ersteller. |
|
| Globale OpenStreetMap-Forward-Geokodierung & Verwaltungsaufschlüsselung. |
|
| Hierarchische Standort-Drill-down-Suchmatrix mit Negativfiltern. |
|
| Scannt das Vorhandensein eines Benutzernamens in 26 Coding-, akademischen und kreativen Netzwerken. |
|
| Präzisionssuch-Dorking ( |
|
4. Technische, Domain- & Netzwerk-Intelligenz
Tool | Zweck | Wichtige Parameter |
| Prüfung der Gültigkeit von Domain-SSL/TLS-Zertifikaten, DNS und RDAP/WHOIS. |
|
| Erkennung von Frontend-Frameworks (React, Next.js, Vue), CMS, CDN und Servern. |
|
| Geolokalisierung öffentiicher IPs sowie ASN-, ISP- und Organisations-Informationen. |
|
| Scraper für historische Zeiteise und Snapsots gelöschter Webseiten. |
|
| Erkennung von Subdomains per Certificate Transparency in <1 Sek. |
|
| Tiefgehende Prüfung der DNS-Infrastruktur (IPv4, IPv6, MX). |
|
Playbook für autonome KI-Agenten
InfinityScraper enthäat ein fortschrittliches Cogitive Reasining Framework (skils/infinity-scraper/SKILL.md) , das autonomen KI-Agenten beibringt, wie sie:
Benutzeranfragen dynamisch in Such- und Standort-Hinweise zerlegen.
ools über Muti-Tool-Ketten verknüpfen (z. B.
Search ➔ Filter ➔ Batch ScrapeoderGeocode ➔ Locality Dork ➔ Profile Extration).ei dynamischen React-Single-Page-Apps automatisch vom schnellen TLS-Modus auf den Playwright-Headles-Browser hochstufen.
👉 Lies das volständige Agent-Playbook: skils/infinity-scraper/SKILL.md
💻 Befehlszeilenschnittstelle (CLI)
Du kannst InfinityScraper auch direkt üer dein Terminal nutzen:
# Scrape a URL to Markdown
python -m infinity_scraper.cli scrape "https://example.com"
# Scrape dynamic SPA with infinite scroll
python -m infinity_scraper.cli scrape "https://news.ycombinator.com" --browser --scroll 3
# Live search and auto-scrape top results
python -m infinity_scraper.cli search "Quantum computing breakthroughs" --scrape --max 4
# Crawl documentation tree
python -m infinity_scraper.cli crawl "https://docs.python.org/3/library/asyncio.html" --pages 5 --depth 2
# Extract remote PDF
python -m infinity_scraper.cli pdf "https://example.com/report.pdf" --pages 10Automatisierte ests ausführen
Führe die umfassende Suite aus Unit- und Integrationstests aus:
python -m tests.test_scraperestabdeckung:
✅ ast TLS Impesonator
✅ Playwright Dynamic Browser
✅ DuckDuckGo Live Search
✅ HMTL Table to Markdown Converter
✅ Recursive BFS Documentation Crawler
✅ Zero-GPU YoTube Transcript Extration
✅ OSINT SSL, IP Intel & 25+ Platform Presence Check
📄 Lizenz & Urheberechtsschutz
Dieses Projek ist unter der MIT-Lizenz (mit verpflichtender Namennennung & DMCA-Durchsetzung) lizenziet.
[!IMPORTANT] Hinweis zur verpflichtenden Namennennung:
Du kannst dieses Projek für kommerzielle oder persöniche Zwecke frei verwenden, modifizieren und integrieren.
Die ursprüngiche Autoren-Namennennung und der Copyright-Hinweis MÜSSEN jedoch in allen Kopien, orks oder abgeleiteten Distributionen erhalten bleiben.
Das Entfernen des Autorennamens/der redits und das erneute Hochladen/Pushen auf GitHub als eigene Arbeit ist strengstens untersagt und stelit eine Urheberechtsverletzung dar. Jedes rechstverletzende Repository unterliegt der sofortigen GitHub-DMCA-Takedown & Repository-Löschung sowie rechtichen Maßnamen.
Autor / Ersteler: VirajVerse
Repository: https://github.com/virajverse/infinity-scraper-mcp
Siehe
LICENSEfür die volständigen rechtichen edingungen.
This server cannot be installed
Maintenance
Resources
Unclaimed servers have limited discoverability.
Looking for Admin?
If you are the server author, to access and configure the admin panel.
Related MCP Servers
- AlicenseNot gradedqualityAmaintenanceEnables AI agents to perform undetectable browser automation that bypasses Cloudflare, antibots, and social media blocks. Provides 105 tools for element extraction, network debugging, and real-world web scraping with a 98.7% success rate on protected sites.1,589MIT
- AlicenseAqualityBmaintenanceEnables AI agents to scrape any website by providing tools for JavaScript rendering, antibot bypass, and automatic captcha solving. It supports synchronous, asynchronous, and batch scraping operations with built-in proxy rotation.5207MIT

ScrapeLab MCPofficial
AlicenseNot gradedqualityDmaintenanceEnables undetectable web scraping and browser automation for AI agents with 84 tools including stealth navigation, element extraction, network interception, and auto cookie consent dismissal. Bypasses anti-bot systems like Cloudflare and DataDome while providing LLM-ready markdown output and full Chrome DevTools Protocol access.MIT
HasData MCP Serverofficial
AlicenseAqualityAmaintenanceDirect access to 40+ scraping and search tools. Extract structured data from Google (Search, Maps, Trends), Amazon, Airbnb, Social Media, and any web page directly into your AI agent.2424MIT
Related MCP Connectors
Give your agent live data from Twitter, Reddit, the web and GitHub. No API keys, no scraping stack.
Reliable web access for AI agents: smart HTTP, rotating proxies, and full-browser rendering.
Enable language models to perform advanced AI-powered web scraping with enterprise-grade reliabili…
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/virajverse/infinity-scraper'
If you have feedback or need assistance with the MCP directory API, please join our Discord server