Skip to main content
Glama

🌐 InfinityScrape MCP: Suite de scraping web y OSINT profundo de clase mundial

License: MIT Python 3.10+ Protocol: MCP Zero-Cloud-API Zero-GPU

InfinityScrape MCP es un servidor Model Context Protocol (MCP) independiente y de nivel de producción, diseñado para ofrecer a los modelos de IA (LM Studio, Claude Desktop, Cursor, Open WebUI, Antigravity AI) scraping web ilimitado, de alta velocidad y resistente a bots, renderizado dinámico de SPA, transcripción instantánea de YouTube e inteligencia de localización OSINT / GEOINT de precisión.


📑 Índice


Related MCP server: FineData MCP Server

🌟 ¿Por qué InfinityScrape MCP?

Los scrapers web estándar suelen fallar con los sitios web modernos debido a los retos de Cloudflare, el renderizado intensivo de JavaScript del lado del cliente, los modales intrusivos de consentimiento de cookies y los límites de velocidad. InfinityScrape resuelve estos problemas de serie:

  1. Arquitectura de doble motor:

    • Motor TLS rápido (primp + httpx): Imita las huellas TLS/JA3 y las cabeceras HTTP/2 de los navegadores reales Chrome/Safari para superar los retos de Cloudflare y Akamai en <100ms.

    • Navegador headless dinámico (Playwright Chromium): Renderiza SPA complejas (React, Vue, Next.js, Angular), realiza scroll infinito, hace clic en elementos y ejecuta JavaScript personalizado.

  2. Eliminación de anuncios y rastreadores a nivel de red:

    • Intercepta y aborta las llamadas de red a más de 35 redes de anuncios y scripts de rastreo (doubleclick, criteo, outbrain, google-analytics) antes de que se descarguen, reduciendo el tiempo de carga de la página en un ~300% y el uso de memoria en un 70%.

    • Detecta y elimina automáticamente los popups de OneTrust, Cookiebot y los overlays fijos.

  3. Transcripción instantánea de YouTube sin GPU:

    • Extrae transcripciones completas de vídeos, shorts y directos con marcas de tiempo ([MM:SS]) en <300ms directamente a través de flujos HTTP, sin descargar el vídeo ni requerir modelos Whisper de GPU locales.

  4. Rastreador profundo y recursivo de documentación:

    • Rastreador asíncrono de búsqueda en anchura (BFS) con bloqueo de dominio y filtrado por prefijo de ruta para consolidar árboles de documentación completos en Markdown unificado.

  5. Reconocimiento OSINT y GEOINT público de última generación:

    • Puntuación de confianza multiseñal (0% - 100%): Evalúa la correlación entre Nombre + Ciudad + Calle + Código Postal + Organización + Rol para clasificar los dossiers descubiertos.

    • Escáneres de más de 25 plataformas globales: Escanea GitHub, GitLab, StackOverflow, Kaggle, HuggingFace, LeetCode, Codeforces, Dev.to, Medium, Substack, Google Scholar, ResearchGate, Reddit, etc.

    • GEOINT de OpenStreetMap: Resuelve direcciones globales hasta el nivel de calle/código postal con coordenadas GPS y límites administrativos.

  6. Capa de caché persistente SQLite:

    • Caché local en memoria y respaldada por SQLite para respuestas instantáneas de 0ms en búsquedas repetidas, con TTL configurable.


⚡ Comparativa competitiva

Característica / Capacidad

Scrapers MCP estándar

APIs de scraping en la nube

InfinityScrape MCP

Coste y claves API

Gratuito (básico)

De pago ($20 - $200/mes)

100% gratuito / cero claves API

Omisión de TLS de Cloudflare / Akamai

❌ Fallo / 403

✅ Sí

✅ Integrado (primp JA3)

SPA dinámicas y scroll infinito

❌ Limitado

✅ Sí

✅ Integrado (playwright)

Eliminación de anuncios y popups a nivel de red

❌ No

⚠️ Parcial

✅ Integrado (más de 35 dominios)

Transcripciones de YouTube sin GPU

❌ No

❌ No

✅ Integrado (<300ms)

Analizador de PDF en línea página a página

❌ No

⚠️ Coste adicional

✅ Integrado (pypdf)

Rastreador profundo de documentación

❌ No

⚠️ Coste adicional

✅ Integrado (BFS asíncrono)

OSINT en más de 25 plataformas y geocodificación

❌ No

❌ No

✅ Integrado (confianza 0-100%)

Caché local SQLite de 0ms

❌ No

❌ No

✅ Integrado (TTL automático)


🏗️ Visión general de la arquitectura

                      ┌────────────────────────────────────────────────┐
                      │    AI Client (LM Studio / Claude / Cursor)     │
                      └───────────────────────┬────────────────────────┘
                                              │ JSON-RPC 2.0 (Stdio)
                                              ▼
                      ┌────────────────────────────────────────────────┐
                      │          InfinityScrape MCP Server             │
                      │                  (server.py)                   │
                      └───────┬────────────────┬───────────────┬───────┘
                              │                │               │
            ┌─────────────────┴─┐     ┌────────┴────────┐    ┌─┴────────────────┐
            ▼                   ▼     ▼                 ▼    ▼                  ▼
     [Fast TLS Engine]     [Playwright Engine]   [OSINT / GEOINT]   [Media & PDF Engines]
     • primp JA3/TLS       • Stealth Chromium    • 25+ Platform     • YouTube (<300ms)
     • HTTP/2 Stealth      • Network Ad Blocker    Scanners         • Remote PDF Stream
     • <100ms Execution    • Infinite Scroll     • OpenStreetMap    • Table Markdownify
                           • Auto-Dismiss CMPs   • Match Confidence
                                    │
                                    ▼
                      ┌────────────────────────────────┐
                      │ SQLite Caching Layer (0ms TTL) │
                      └────────────────────────────────┘

🚀 Inicio rápido e instalación con 1 clic

Requisitos previos

  • Tener instalado Python 3.10, 3.11 o 3.12+.

  • Windows, macOS o Linux.

Configuración con 1 clic:

En Windows:

Haga doble clic en install.bat o ejecute en PowerShell:

.\install.bat

En Linux / macOS:

chmod +x install.sh
./install.sh

Configuración manual (cualquier plataforma):

# 1. Create virtual environment
python -m venv .venv

# 2. Activate virtual environment
# Windows: .venv\Scripts\activate | Linux/Mac: source .venv/bin/activate

# 3. Install requirements & Playwright browser
pip install -r requirements.txt
playwright install chromium

🔌 Integración con clientes de IA

1. LM Studio (v0.3+)

Vaya a Settings ➔ Developer ➔ MCP Servers ➔ Edit Config y añada:

{
  "mcpServers": {
    "infinity-scraper": {
      "command": "C:/path/to/infinity-scraper/.venv/Scripts/python.exe",
      "args": [
        "-m",
        "infinity_scraper.server"
      ],
      "cwd": "C:/path/to/infinity-scraper",
      "env": {
        "PYTHONUNBUFFERED": "1"
      }
    }
  }
}

2. Claude Desktop

Edite %APPDATA%\Claude\claude_desktop_config.json (Windows) o ~/Library/Application Support/Claude/claude_desktop_config.json (macOS):

{
  "mcpServers": {
    "infinity-scraper": {
      "command": "C:/path/to/infinity-scraper/.venv/Scripts/python.exe",
      "args": [
        "-m",
        "infinity_scraper.server"
      ]
    }
  }
}

3. Cursor IDE

En Cursor Settings ➔ Features ➔ MCP Servers ➔ Add New MCP Server:

  • Nombre: infinity-scraper

  • Tipo: command

  • Comando: C:/path/to/infinity-scraper/.venv/Scripts/python.exe -m infinity_scraper.server


🛠️ Guía de referencia completa de las 23 herramientas

1. Scraping web y rastreo de contenido

Herramienta

Propósito

Parámetros clave

scrape_url

Scraping universal con motor de actualización automática de TLS a navegador.

url, engine='auto', strip_ads=True, use_cache=True

scrape_dynamic

Navegador headless para SPA, scroll infinito y acciones de clic.

url, scroll_depth=3, click_selector, wait_seconds

search_web

Búsqueda en internet en tiempo real a través de DuckDuckGo.

query, max_results=5, search_type='text'

search_and_scrape

Busca en la web y hace scraping automáticamente de los mejores resultados para generar un informe con citas.

query, max_results=4

deep_crawl

Rastreador de sitios BFS asíncrono y recursivo para árboles de documentación completos.

start_url, max_pages=10, max_depth=2, path_prefix

scrape_batch

Hacer scraping de múltiples URLs en paralelo de forma concurrente.

urls (list), concurrency=4

extract_schema

Extraer campos específicos mediante un mapa de selectores CSS a JSON.

url, schema={"title": "h1", "price": ".price"}

extract_structured

Extraer JSON-LD, metadatos de OpenGraph y tablas HTML.

url, extract_tables=True

optimize_rag_chunks

Segmentador semántico para RAG y optimizador de tokens para páginas masivas.

text_or_markdown, max_chunk_chars=2000

2. Analizadores de medios, redes sociales, vídeo y documentos

Herramienta

Propósito

Parámetros clave

get_youtube_transcript

Extracción de transcripciones de vídeo de YouTube sin GPU y con marcas de tiempo.

url, with_timestamps=True, languages

extract_pdf

Transmite y extrae documentos PDF en línea remotos página a página.

url, max_pages=20

extract_image_exif

Extrae especificaciones de la cámara, marcas de tiempo y geotags GPS de las fotografías.

image_url

extract_reddit_thread_tool

Ingiere publicaciones de Reddit, puntuaciones y diálogos de comentarios anidados.

url, max_comments=25

extract_rss_feed_tool

Analizador de feeds RSS/Atom en tiempo real para blogs, Substack y noticias.

feed_url, max_items=10

3. OSINT público profundo y reconocimiento de entidades

Herramienta

Propósito

Parámetros clave

osint_deep_public_recon

Recopilador de perfiles de la web abierta multidominio y generador de dossiers clasificados por nivel de confianza.

name, location, street_or_locality, postal_code, organization, role_or_keywords, exclude_terms, time_range

osint_geoint_lookup

Geocodificación directa global de OpenStreetMap y desglose administrativo.

location_query, country_code

osint_location_entity_search

Matriz de búsqueda de ubicaciones con desglose jerárquico y filtros negativos.

entity_name, country, city, street_or_landmark, postal_code

osint_username_check

Escanea la presencia de un nombre de usuario en 26 redes de programación, académicas y creativas.

username

osint_search

Búsqueda de precisión con dorks (site:, filetype:pdf, intitle:, -exclude).

query, site, filetype, exclude_terms

4. Inteligencia técnica, de dominios y de red

Herramienta

Propósito

Parámetros clave

osint_domain_recon

Inspecciona la validez de los certificados SSL/TLS del dominio, DNS y RDAP/WHOIS.

domain_or_url

osint_tech_stack

Detecta frameworks de frontend (React, Next.js, Vue), CMS, CDN y servidores.

url

osint_ip_lookup

Geolocalización de IP pública, ASN, ISP e inteligencia de organización.

ip_or_host

osint_wayback_time_machine

Scraper de viaje en el tiempo histórico e instantáneas de páginas web eliminadas.

url, timestamp, list_snapshots

osint_subdomain_enumeration

Descubrimiento de subdominios mediante Certificate Transparency en <1 segundo.

domain, limit=50

osint_dns_audit

Auditoría de infraestructura de registros DNS profundos (IPv4, IPv6, MX).

domain


🧠 Manual del agente de IA autónomo

InfinityScrape incluye un avanzado Marco de Razonamiento Cognitivo (skills/infinity-scraper/SKILL.md) que enseña a los agentes de IA autónomos cómo:

  • Descomponer dinámicamente las solicitudes del usuario en pistas de búsqueda y ubicación.

  • Encadenar múltiples herramientas (p. ej., Search ➔ Filter ➔ Batch Scrape o Geocode ➔ Locality Dork ➔ Profile Extraction).

  • Escalar automáticamente desde TLS rápido hasta el navegador headless de Playwright al encontrar aplicaciones dinámicas de una sola página en React.

👉 Lee el manual completo del agente: skills/infinity-scraper/SKILL.md


💻 Interfaz de línea de comandos (CLI)

También puedes usar InfinityScrape directamente desde tu terminal:

# Scrape a URL to Markdown
python -m infinity_scraper.cli scrape "https://example.com"

# Scrape dynamic SPA with infinite scroll
python -m infinity_scraper.cli scrape "https://news.ycombinator.com" --browser --scroll 3

# Live search and auto-scrape top results
python -m infinity_scraper.cli search "Quantum computing breakthroughs" --scrape --max 4

# Crawl documentation tree
python -m infinity_scraper.cli crawl "https://docs.python.org/3/library/asyncio.html" --pages 5 --depth 2

# Extract remote PDF
python -m infinity_scraper.cli pdf "https://example.com/report.pdf" --pages 10

🧪 Ejecución de pruebas automatizadas

Ejecuta la completa suite de pruebas unitarias y de integración:

python -m tests.test_scraper

Cobertura de pruebas:

  • ✅ Fast TLS Impersonator

  • ✅ Playwright Dynamic Browser

  • ✅ DuckDuckGo Live Search

  • ✅ HTML Table to Markdown Converter

  • ✅ Recursive BFS Documentation Crawler

  • ✅ Zero-GPU YouTube Transcript Extraction

  • ✅ OSINT SSL, IP Intel & 25+ Platform Presence Check


📄 Licencia y protección de derechos de autor

Este proyecto está bajo la Licencia MIT (con Atribución Obligatoria y Cumplimiento de la DMCA).

[!IMPORTANT] Aviso de atribución obligatoria:

  • Eres libre de usar, modificar e integrar este proyecto para uso comercial o personal.

  • Sin embargo, el aviso original de atribución de autor y de derechos de autor DEBE conservarse en todas las copias, forks o distribuciones derivadas.

  • Eliminar el nombre/créditos del autor y volver a subir/hacer push a GitHub como trabajo propio está estrictamente prohibido y constituye una infracción de los derechos de autor. Cualquier repositorio infractor está sujeto a una retirada inmediata por DMCA de GitHub y eliminación del repositorio y a acciones legales.

F
license - not found
Not graded
quality - not tested
C
maintenance

Maintenance

Maintainers
Response time
Release cycle
Releases (12mo)
Commit activity

Resources

Unclaimed servers have limited discoverability.

Looking for Admin?

If you are the server author, to access and configure the admin panel.

Related MCP Servers

  • A
    license
    Not graded
    quality
    A
    maintenance
    Enables AI agents to perform undetectable browser automation that bypasses Cloudflare, antibots, and social media blocks. Provides 105 tools for element extraction, network debugging, and real-world web scraping with a 98.7% success rate on protected sites.
    1,589
    MIT
  • A
    license
    Not graded
    quality
    D
    maintenance
    Enables undetectable web scraping and browser automation for AI agents with 84 tools including stealth navigation, element extraction, network interception, and auto cookie consent dismissal. Bypasses anti-bot systems like Cloudflare and DataDome while providing LLM-ready markdown output and full Chrome DevTools Protocol access.
    MIT
  • A
    license
    A
    quality
    A
    maintenance
    Direct access to 40+ scraping and search tools. Extract structured data from Google (Search, Maps, Trends), Amazon, Airbnb, Social Media, and any web page directly into your AI agent.
    2
    42
    4
    MIT

View all related MCP servers

Related MCP Connectors

  • Give your agent live data from Twitter, Reddit, the web and GitHub. No API keys, no scraping stack.

  • Reliable web access for AI agents: smart HTTP, rotating proxies, and full-browser rendering.

  • Enable language models to perform advanced AI-powered web scraping with enterprise-grade reliabili…

View all MCP Connectors

Latest Blog Posts

MCP directory API

We provide all the information about MCP servers via our MCP API.

curl -X GET 'https://glama.ai/api/mcp/v1/servers/virajverse/infinity-scraper'

If you have feedback or need assistance with the MCP directory API, please join our Discord server