Skip to main content
Glama

🌐 InfinityScrape MCP: Weltklasse-Webscraping & Deep OSINT-Intelligence-Suite

License: MIT Python 3.10+ Protocol: MCP Zero-Cloud-API Zero-GPU

InfinityScrape MCP ist ein eigenständiger, produktionsreifer Model-Context-Protocol-Server (MCP), der KI-Modellen (LM Studio, Claude Desktop, Cursor, Open WebUI, Antigravity AI) unbegrenztes, Hochgeschwindigkeits- und Anti-Bot-resistentes Webscraping, dynamisches SPA-Rendering, sofortige YouTube-Transkription sowie präzise OSINT-/GEOINT-Standortermittlung bietet.


📑 Inhaltsverzeichnis


Related MCP server: FineData MCP Server

🌟 Warum InfinityScrape MCP?

Standard-Webscraper scheitern bei modernen Websites oft an Cloudflare-Herausforderungen, starker clientseitiger JavaScript-Renderung, aufdringlichen Cookie-Consent-Modals und Rate Limits. InfinityScrape löst diese Probleme sofort einsatzbereit:

  1. Zwei-Engine-Architektur:

    • Schnelle TLS-Engine (primp + httpx): Imitiert echte Chrome/Safari-Browser-TLS/JA3-Fingerprints und HTTP/2-Header, um Cloudflare- und Akamai-Herausforderungen in <100ms zu umgehen.

    • Dynamischer Headless-Browser (Playwright Chromium): Rendert komplexe SPAs (React, Vue, Next.js, Angular), führt unendliches Scrollen aus, klickt Elemente an und führt benutzerdefiniertes JavaScript aus.

  2. Netzwerkebenen-Werbungs- & Tracker-Entfernung:

    • Fängt Netzwerkaufrufe an 35+ Werbenetzwerke und Tracking-Skripte ab und bricht sie ab (doubleclick, criteo, outbrain, google-analytics), bevor sie heruntergeladen werden. Dadurch verkürzt sich die Seitenladezeit um ~300% und der Speicherverbrauch sinkt um 70%.

    • Erkennt und zerlegt automatisch OneTrust-, Cookiebot- und Sticky-Overlay-Popups.

  3. Zero-GPU-YouTube-Transkriptor:

    • Extrahiert vollständige Video-/Shorts-/Live-Transkripte mit Zeitstempeln ([MM:SS]) in <300ms direkt über HTTP-Streams, ohne Video herunterzuladen oder lokale GPU-Whisper-Modelle zu benötigen.

  4. Tiefgreifender rekursiver Dokumentations-Crawler:

    • Asynchroner Breitensuche-Crawler (BFS) mit Domain-Sperrung und Pfadpräfix-Filterung, um vollständige Dokumentationsbäume in einheitliches Markdown zu aggregieren.

  5. Moderne öffentliche OSINT- & GEOINT-Aufklärung:

    • Multi-Signal-Konfidenzbewertung (0% - 100%): Bewertet die Korrelation von Name + Stadt + Straße + PLZ + Organisation + Rolle, um entdeckte Dossiers zu ranken.

    • 25+ globale Plattform-Scanner: Scannt GitHub, GitLab, StackOverflow, Kaggle, HuggingFace, LeetCode, Codeforces, Dev.to, Medium, Substack, Google Scholar, ResearchGate, Reddit usw.

    • OpenStreetMap-GEOINT: Löst globale Adressen bis auf Straßen-/Postleitzahlebene mit GPS-Koordinaten und Verwaltungsgrenzen auf.

  6. SQLite-persistente Caching-Schicht:

    • In-Memory- und SQLite-gestützter lokaler Cache für sofortige 0ms-Antworten bei wiederholten Abfragen mit konfigurierbarer TTL.


⚡ Wettbewerbsvergleich

Funktion / Fähigkeit

Standard-MCP-Scraper

Cloud-Scraping-APIs

InfinityScrape MCP

Kosten & API-Schlüssel

Kostenlos (Basis)

Kostenpflichtig (20 - 200 $/Monat)

100% kostenlos / keine API-Schlüssel

Cloudflare / Akamai TLS-Bypass

❌ Scheitert / 403

✅ Ja

✅ Integriert (primp JA3)

Dynamische SPAs & unendliches Scrollen

❌ Eingeschränkt

✅ Ja

✅ Integriert (playwright)

Netzwerkebenen-Werbe- & Popup-Entfernung

❌ Nein

⚠️ Teilweise

✅ Integriert (35+ Domains)

Zero-GPU-YouTube-Transkripte

❌ Nein

❌ Nein

✅ Integriert (<300ms)

Online-PDF-Seitenweiser-Parser

❌ Nein

⚠️ Zusatzkosten

✅ Integriert (pypdf)

Tiefgreifender Dokumentations-Crawler

❌ Nein

⚠️ Zusatzkosten

✅ Integriert (Async BFS)

25+ Plattform-OSINT & Geokodierung

❌ Nein

❌ Nein

✅ Integriert (0-100% Konfidenz)

Lokales SQLite-0ms-Caching

❌ Nein

❌ Nein

✅ Integriert (Auto-TTL)


🏗️ Architekturübersicht

                      ┌────────────────────────────────────────────────┐
                      │    AI Client (LM Studio / Claude / Cursor)     │
                      └───────────────────────┬────────────────────────┘
                                              │ JSON-RPC 2.0 (Stdio)
                                              ▼
                      ┌────────────────────────────────────────────────┐
                      │          InfinityScrape MCP Server             │
                      │                  (server.py)                   │
                      └───────┬────────────────┬───────────────┬───────┘
                              │                │               │
            ┌─────────────────┴─┐     ┌────────┴────────┐    ┌─┴────────────────┐
            ▼                   ▼     ▼                 ▼    ▼                  ▼
     [Fast TLS Engine]     [Playwright Engine]   [OSINT / GEOINT]   [Media & PDF Engines]
     • primp JA3/TLS       • Stealth Chromium    • 25+ Platform     • YouTube (<300ms)
     • HTTP/2 Stealth      • Network Ad Blocker    Scanners         • Remote PDF Stream
     • <100ms Execution    • Infinite Scroll     • OpenStreetMap    • Table Markdownify
                           • Auto-Dismiss CMPs   • Match Confidence
                                    │
                                    ▼
                      ┌────────────────────────────────┐
                      │ SQLite Caching Layer (0ms TTL) │
                      └────────────────────────────────┘

🚀 Schnellstart & 1-Klick-Installation

Voraussetzungen

  • Python 3.10, 3.11 oder 3.12+ installiert.

  • Windows, macOS oder Linux.

1-Klick-Setup:

Auf Windows:

Doppelklicken Sie auf install.bat oder führen Sie in PowerShell aus:

.\install.bat

Auf Linux / macOS:

chmod +x install.sh
./install.sh

Manuelles Setup (jede Plattform):

# 1. Create virtual environment
python -m venv .venv

# 2. Activate virtual environment
# Windows: .venv\Scripts\activate | Linux/Mac: source .venv/bin/activate

# 3. Install requirements & Playwright browser
pip install -r requirements.txt
playwright install chromium

🔌 KI-Client-Integration

1. LM Studio (v0.3+)

Gehen Sie zu Einstellungen ➔ Entwickler ➔ MCP-Server ➔ Konfiguration bearbeiten und fügen Sie hinzu:

{
  "mcpServers": {
    "infinity-scraper": {
      "command": "C:/path/to/infinity-scraper/.venv/Scripts/python.exe",
      "args": [
        "-m",
        "infinity_scraper.server"
      ],
      "cwd": "C:/path/to/infinity-scraper",
      "env": {
        "PYTHONUNBUFFERED": "1"
      }
    }
  }
}

2. Claude Desktop

Bearbeiten Sie %APPDATA%\Claude\claude_desktop_config.json (Windows) oder ~/Library/Application Support/Claude/claude_desktop_config.json (macOS):

{
  "mcpServers": {
    "infinity-scraper": {
      "command": "C:/path/to/infinity-scraper/.venv/Scripts/python.exe",
      "args": [
        "-m",
        "infinity_scraper.server"
      ]
    }
  }
}

3. Cursor IDE

In den Cursor-Einstellungen ➔ Features ➔ MCP-Server ➔ Neuen MCP-Server hinzufügen:

  • Name: infinity-scraper

  • Typ: command

  • Befehl: C:/path/to/infinity-scraper/.venv/Scripts/python.exe -m infinity_scraper.server


🛠️ Vollständiges 23-Tool-Referenzhandbuch

1. Webscraping & Content-Crawling

Tool

Zweck

Wichtige Parameter

scrape_url

Universelles Scraping mit automatisch aufrüstender TLS-Browser-Engine.

url, engine='auto', strip_ads=True, use_cache=True

scrape_dynamic

Headless-Browser für SPAs, unendliches Scrollen und Klickaktionen.

url, scroll_depth=3, click_selector, wait_seconds

search_web

Echtzeit-Internetsuche über DuckDuckGo.

query, max_results=5, search_type='text'

search_and_scrape

Sucht im Web und scrapet automatisch die besten Ergebnisse in einen Bericht mit Quellenangaben.

query, max_results=4

deep_crawl

Rekursiver asynchroner BFS-Site-Crawler für vollständige Dokumentationsbäume.

start_url, max_pages=10, max_depth=2, path_prefix

scrape_batch

Gleichzeitiges Scraping mehrerer URLs parallel.

urls (Liste), concurrency=4

extract_schema

Extrahiert gezielte Felder mithilfe einer CSS-Selektor-Zuordnung in JSON.

url, schema={"title": "h1", "price": ".price"}

extract_structured

Extrahiert JSON-LD, OpenGraph-Metadaten und HTML-Tabellen.

url, extract_tables=True

optimize_rag_chunks

Semantischer RAG-Chunker & Token-Optimierer für riesige Seiten.

text_or_markdown, max_chunk_chars=2000


2. Medien-, Social-, Video- & Dokument-Parser

Tool

Zweck

Wichtige Parameter

get_youtube_transcript

Zero-GPU-YouTube-Videotranskript-Extraktion mit Zeitstempeln.

url, with_timestamps=True, languages

extract_pdf

Streamt und extrahiert entfernte Online-PDF-Dokumente seitenweise.

url, max_pages=20

extract_image_exif

Extrahiert Kameradaten, Zeitstempel und GPS-Geotags aus Fotos.

image_url

extract_reddit_thread_tool

Erfasst Reddit-Beiträge, Bewertungen und verschachtelte Kommentardialoge.

url, max_comments=25

extract_rss_feed_tool

Echtzeit-RSS/Atom-Feed-Parser für Blogs, Substack und Nachrichten.

feed_url, max_items=10


3. Deep Public OSINT & Entitäts-Aufklärung

Tool

Zweck

Wichtige Parameter

osint_deep_public_recon

Multi-Domain-Open-Web-Profil-Scraper & Konfidenz-gerankter Dossier-Ersteller.

name, location, street_or_locality, postal_code, organization, role_or_keywords, exclude_terms, time_range

osint_geoint_lookup

Globale OpenStreetMap-Forward-Geokodierung & Verwaltungsaufschlüsselung.

location_query, country_code

osint_location_entity_search

Hierarchische Standort-Drill-down-Suchmatrix mit Negativfiltern.

entity_name, country, city, street_or_landmark, postal_code

osint_username_check

Scannt das Vorhandensein eines Benutzernamens in 26 Coding-, akademischen und kreativen Netzwerken.

username

osint_search

Präzisionssuch-Dorking (site:, filetype:pdf, intitle:, -exclude).

query, site, filetype, exclude_terms


4. Technische, Domain- & Netzwerk-Intelligenz

Tool

Zweck

Wichtige Parameter

osint_domain_recon

Prüfung der Gültigkeit von Domain-SSL/TLS-Zertifikaten, DNS und RDAP/WHOIS.

domain_or_url

osint_tech_stack

Erkennung von Frontend-Frameworks (React, Next.js, Vue), CMS, CDN und Servern.

url

osint_ip_lookup

Geolokalisierung öffentiicher IPs sowie ASN-, ISP- und Organisations-Informationen.

ip_or_host

osint_wayback_time_machine

Scraper für historische Zeiteise und Snapsots gelöschter Webseiten.

url, timestamp, list_snapshots

osint_subdomain_enmeration

Erkennung von Subdomains per Certificate Transparency in <1 Sek.

domain, limit=50

osint_dns_audit

Tiefgehende Prüfung der DNS-Infrastruktur (IPv4, IPv6, MX).

domain


Playbook für autonome KI-Agenten

InfinityScraper enthäat ein fortschrittliches Cogitive Reasining Framework (skils/infinity-scraper/SKILL.md) , das autonomen KI-Agenten beibringt, wie sie:

  • Benutzeranfragen dynamisch in Such- und Standort-Hinweise zerlegen.

  • ools über Muti-Tool-Ketten verknüpfen (z. B. Search ➔ Filter ➔ Batch Scrape oder Geocode ➔ Locality Dork ➔ Profile Extration).

  • ei dynamischen React-Single-Page-Apps automatisch vom schnellen TLS-Modus auf den Playwright-Headles-Browser hochstufen.

👉 Lies das volständige Agent-Playbook: skils/infinity-scraper/SKILL.md


💻 Befehlszeilenschnittstelle (CLI)

Du kannst InfinityScraper auch direkt üer dein Terminal nutzen:

# Scrape a URL to Markdown
python -m infinity_scraper.cli scrape "https://example.com"

# Scrape dynamic SPA with infinite scroll
python -m infinity_scraper.cli scrape "https://news.ycombinator.com" --browser --scroll 3

# Live search and auto-scrape top results
python -m infinity_scraper.cli search "Quantum computing breakthroughs" --scrape --max 4

# Crawl documentation tree
python -m infinity_scraper.cli crawl "https://docs.python.org/3/library/asyncio.html" --pages 5 --depth 2

# Extract remote PDF
python -m infinity_scraper.cli pdf "https://example.com/report.pdf" --pages 10

Automatisierte ests ausführen

Führe die umfassende Suite aus Unit- und Integrationstests aus:

python -m tests.test_scraper

estabdeckung:

  • ✅ ast TLS Impesonator

  • ✅ Playwright Dynamic Browser

  • ✅ DuckDuckGo Live Search

  • ✅ HMTL Table to Markdown Converter

  • ✅ Recursive BFS Documentation Crawler

  • ✅ Zero-GPU YoTube Transcript Extration

  • ✅ OSINT SSL, IP Intel & 25+ Platform Presence Check


📄 Lizenz & Urheberechtsschutz

Dieses Projek ist unter der MIT-Lizenz (mit verpflichtender Namennennung & DMCA-Durchsetzung) lizenziet.

[!IMPORTANT] Hinweis zur verpflichtenden Namennennung:

  • Du kannst dieses Projek für kommerzielle oder persöniche Zwecke frei verwenden, modifizieren und integrieren.

  • Die ursprüngiche Autoren-Namennennung und der Copyright-Hinweis MÜSSEN jedoch in allen Kopien, orks oder abgeleiteten Distributionen erhalten bleiben.

  • Das Entfernen des Autorennamens/der redits und das erneute Hochladen/Pushen auf GitHub als eigene Arbeit ist strengstens untersagt und stelit eine Urheberechtsverletzung dar. Jedes rechstverletzende Repository unterliegt der sofortigen GitHub-DMCA-Takedown & Repository-Löschung sowie rechtichen Maßnamen.

F
license - not found
Not graded
quality - not tested
C
maintenance

Maintenance

Maintainers
Response time
Release cycle
Releases (12mo)
Commit activity

Resources

Unclaimed servers have limited discoverability.

Looking for Admin?

If you are the server author, to access and configure the admin panel.

Related MCP Servers

  • A
    license
    Not graded
    quality
    A
    maintenance
    Enables AI agents to perform undetectable browser automation that bypasses Cloudflare, antibots, and social media blocks. Provides 105 tools for element extraction, network debugging, and real-world web scraping with a 98.7% success rate on protected sites.
    1,589
    MIT
  • A
    license
    Not graded
    quality
    D
    maintenance
    Enables undetectable web scraping and browser automation for AI agents with 84 tools including stealth navigation, element extraction, network interception, and auto cookie consent dismissal. Bypasses anti-bot systems like Cloudflare and DataDome while providing LLM-ready markdown output and full Chrome DevTools Protocol access.
    MIT
  • A
    license
    A
    quality
    A
    maintenance
    Direct access to 40+ scraping and search tools. Extract structured data from Google (Search, Maps, Trends), Amazon, Airbnb, Social Media, and any web page directly into your AI agent.
    2
    42
    4
    MIT

View all related MCP servers

Related MCP Connectors

  • Give your agent live data from Twitter, Reddit, the web and GitHub. No API keys, no scraping stack.

  • Reliable web access for AI agents: smart HTTP, rotating proxies, and full-browser rendering.

  • Enable language models to perform advanced AI-powered web scraping with enterprise-grade reliabili…

View all MCP Connectors

Latest Blog Posts

MCP directory API

We provide all the information about MCP servers via our MCP API.

curl -X GET 'https://glama.ai/api/mcp/v1/servers/virajverse/infinity-scraper'

If you have feedback or need assistance with the MCP directory API, please join our Discord server