InfinityScrape MCP
🌐 InfinityScrape MCP: Suite de scraping web y OSINT profundo de clase mundial
InfinityScrape MCP es un servidor Model Context Protocol (MCP) independiente y de nivel de producción, diseñado para ofrecer a los modelos de IA (LM Studio, Claude Desktop, Cursor, Open WebUI, Antigravity AI) scraping web ilimitado, de alta velocidad y resistente a bots, renderizado dinámico de SPA, transcripción instantánea de YouTube e inteligencia de localización OSINT / GEOINT de precisión.
📑 Índice
Related MCP server: FineData MCP Server
🌟 ¿Por qué InfinityScrape MCP?
Los scrapers web estándar suelen fallar con los sitios web modernos debido a los retos de Cloudflare, el renderizado intensivo de JavaScript del lado del cliente, los modales intrusivos de consentimiento de cookies y los límites de velocidad. InfinityScrape resuelve estos problemas de serie:
Arquitectura de doble motor:
Motor TLS rápido (
primp+httpx): Imita las huellas TLS/JA3 y las cabeceras HTTP/2 de los navegadores reales Chrome/Safari para superar los retos de Cloudflare y Akamai en<100ms.Navegador headless dinámico (
Playwright Chromium): Renderiza SPA complejas (React, Vue, Next.js, Angular), realiza scroll infinito, hace clic en elementos y ejecuta JavaScript personalizado.
Eliminación de anuncios y rastreadores a nivel de red:
Intercepta y aborta las llamadas de red a más de 35 redes de anuncios y scripts de rastreo (
doubleclick,criteo,outbrain,google-analytics) antes de que se descarguen, reduciendo el tiempo de carga de la página en un ~300% y el uso de memoria en un 70%.Detecta y elimina automáticamente los popups de OneTrust, Cookiebot y los overlays fijos.
Transcripción instantánea de YouTube sin GPU:
Extrae transcripciones completas de vídeos, shorts y directos con marcas de tiempo (
[MM:SS]) en<300msdirectamente a través de flujos HTTP, sin descargar el vídeo ni requerir modelos Whisper de GPU locales.
Rastreador profundo y recursivo de documentación:
Rastreador asíncrono de búsqueda en anchura (BFS) con bloqueo de dominio y filtrado por prefijo de ruta para consolidar árboles de documentación completos en Markdown unificado.
Reconocimiento OSINT y GEOINT público de última generación:
Puntuación de confianza multiseñal (0% - 100%): Evalúa la correlación entre Nombre + Ciudad + Calle + Código Postal + Organización + Rol para clasificar los dossiers descubiertos.
Escáneres de más de 25 plataformas globales: Escanea GitHub, GitLab, StackOverflow, Kaggle, HuggingFace, LeetCode, Codeforces, Dev.to, Medium, Substack, Google Scholar, ResearchGate, Reddit, etc.
GEOINT de OpenStreetMap: Resuelve direcciones globales hasta el nivel de calle/código postal con coordenadas GPS y límites administrativos.
Capa de caché persistente SQLite:
Caché local en memoria y respaldada por SQLite para respuestas instantáneas de
0msen búsquedas repetidas, con TTL configurable.
⚡ Comparativa competitiva
Característica / Capacidad | Scrapers MCP estándar | APIs de scraping en la nube | InfinityScrape MCP |
Coste y claves API | Gratuito (básico) | De pago ($20 - $200/mes) | 100% gratuito / cero claves API |
Omisión de TLS de Cloudflare / Akamai | ❌ Fallo / 403 | ✅ Sí | ✅ Integrado ( |
SPA dinámicas y scroll infinito | ❌ Limitado | ✅ Sí | ✅ Integrado ( |
Eliminación de anuncios y popups a nivel de red | ❌ No | ⚠️ Parcial | ✅ Integrado (más de 35 dominios) |
Transcripciones de YouTube sin GPU | ❌ No | ❌ No | ✅ Integrado (<300ms) |
Analizador de PDF en línea página a página | ❌ No | ⚠️ Coste adicional | ✅ Integrado ( |
Rastreador profundo de documentación | ❌ No | ⚠️ Coste adicional | ✅ Integrado (BFS asíncrono) |
OSINT en más de 25 plataformas y geocodificación | ❌ No | ❌ No | ✅ Integrado (confianza 0-100%) |
Caché local SQLite de 0ms | ❌ No | ❌ No | ✅ Integrado (TTL automático) |
🏗️ Visión general de la arquitectura
┌────────────────────────────────────────────────┐
│ AI Client (LM Studio / Claude / Cursor) │
└───────────────────────┬────────────────────────┘
│ JSON-RPC 2.0 (Stdio)
▼
┌────────────────────────────────────────────────┐
│ InfinityScrape MCP Server │
│ (server.py) │
└───────┬────────────────┬───────────────┬───────┘
│ │ │
┌─────────────────┴─┐ ┌────────┴────────┐ ┌─┴────────────────┐
▼ ▼ ▼ ▼ ▼ ▼
[Fast TLS Engine] [Playwright Engine] [OSINT / GEOINT] [Media & PDF Engines]
• primp JA3/TLS • Stealth Chromium • 25+ Platform • YouTube (<300ms)
• HTTP/2 Stealth • Network Ad Blocker Scanners • Remote PDF Stream
• <100ms Execution • Infinite Scroll • OpenStreetMap • Table Markdownify
• Auto-Dismiss CMPs • Match Confidence
│
▼
┌────────────────────────────────┐
│ SQLite Caching Layer (0ms TTL) │
└────────────────────────────────┘🚀 Inicio rápido e instalación con 1 clic
Requisitos previos
Tener instalado Python 3.10, 3.11 o 3.12+.
Windows, macOS o Linux.
Configuración con 1 clic:
En Windows:
Haga doble clic en install.bat o ejecute en PowerShell:
.\install.batEn Linux / macOS:
chmod +x install.sh
./install.shConfiguración manual (cualquier plataforma):
# 1. Create virtual environment
python -m venv .venv
# 2. Activate virtual environment
# Windows: .venv\Scripts\activate | Linux/Mac: source .venv/bin/activate
# 3. Install requirements & Playwright browser
pip install -r requirements.txt
playwright install chromium🔌 Integración con clientes de IA
1. LM Studio (v0.3+)
Vaya a Settings ➔ Developer ➔ MCP Servers ➔ Edit Config y añada:
{
"mcpServers": {
"infinity-scraper": {
"command": "C:/path/to/infinity-scraper/.venv/Scripts/python.exe",
"args": [
"-m",
"infinity_scraper.server"
],
"cwd": "C:/path/to/infinity-scraper",
"env": {
"PYTHONUNBUFFERED": "1"
}
}
}
}2. Claude Desktop
Edite %APPDATA%\Claude\claude_desktop_config.json (Windows) o ~/Library/Application Support/Claude/claude_desktop_config.json (macOS):
{
"mcpServers": {
"infinity-scraper": {
"command": "C:/path/to/infinity-scraper/.venv/Scripts/python.exe",
"args": [
"-m",
"infinity_scraper.server"
]
}
}
}3. Cursor IDE
En Cursor Settings ➔ Features ➔ MCP Servers ➔ Add New MCP Server:
Nombre:
infinity-scraperTipo:
commandComando:
C:/path/to/infinity-scraper/.venv/Scripts/python.exe -m infinity_scraper.server
🛠️ Guía de referencia completa de las 23 herramientas
1. Scraping web y rastreo de contenido
Herramienta | Propósito | Parámetros clave |
| Scraping universal con motor de actualización automática de TLS a navegador. |
|
| Navegador headless para SPA, scroll infinito y acciones de clic. |
|
| Búsqueda en internet en tiempo real a través de DuckDuckGo. |
|
| Busca en la web y hace scraping automáticamente de los mejores resultados para generar un informe con citas. |
|
| Rastreador de sitios BFS asíncrono y recursivo para árboles de documentación completos. |
|
| Hacer scraping de múltiples URLs en paralelo de forma concurrente. |
|
| Extraer campos específicos mediante un mapa de selectores CSS a JSON. |
|
| Extraer JSON-LD, metadatos de OpenGraph y tablas HTML. |
|
| Segmentador semántico para RAG y optimizador de tokens para páginas masivas. |
|
2. Analizadores de medios, redes sociales, vídeo y documentos
Herramienta | Propósito | Parámetros clave |
| Extracción de transcripciones de vídeo de YouTube sin GPU y con marcas de tiempo. |
|
| Transmite y extrae documentos PDF en línea remotos página a página. |
|
| Extrae especificaciones de la cámara, marcas de tiempo y geotags GPS de las fotografías. |
|
| Ingiere publicaciones de Reddit, puntuaciones y diálogos de comentarios anidados. |
|
| Analizador de feeds RSS/Atom en tiempo real para blogs, Substack y noticias. |
|
3. OSINT público profundo y reconocimiento de entidades
Herramienta | Propósito | Parámetros clave |
| Recopilador de perfiles de la web abierta multidominio y generador de dossiers clasificados por nivel de confianza. |
|
| Geocodificación directa global de OpenStreetMap y desglose administrativo. |
|
| Matriz de búsqueda de ubicaciones con desglose jerárquico y filtros negativos. |
|
| Escanea la presencia de un nombre de usuario en 26 redes de programación, académicas y creativas. |
|
| Búsqueda de precisión con dorks ( |
|
4. Inteligencia técnica, de dominios y de red
Herramienta | Propósito | Parámetros clave |
| Inspecciona la validez de los certificados SSL/TLS del dominio, DNS y RDAP/WHOIS. |
|
| Detecta frameworks de frontend (React, Next.js, Vue), CMS, CDN y servidores. |
|
| Geolocalización de IP pública, ASN, ISP e inteligencia de organización. |
|
| Scraper de viaje en el tiempo histórico e instantáneas de páginas web eliminadas. |
|
| Descubrimiento de subdominios mediante Certificate Transparency en <1 segundo. |
|
| Auditoría de infraestructura de registros DNS profundos (IPv4, IPv6, MX). |
|
🧠 Manual del agente de IA autónomo
InfinityScrape incluye un avanzado Marco de Razonamiento Cognitivo (skills/infinity-scraper/SKILL.md) que enseña a los agentes de IA autónomos cómo:
Descomponer dinámicamente las solicitudes del usuario en pistas de búsqueda y ubicación.
Encadenar múltiples herramientas (p. ej.,
Search ➔ Filter ➔ Batch ScrapeoGeocode ➔ Locality Dork ➔ Profile Extraction).Escalar automáticamente desde TLS rápido hasta el navegador headless de Playwright al encontrar aplicaciones dinámicas de una sola página en React.
👉 Lee el manual completo del agente: skills/infinity-scraper/SKILL.md
💻 Interfaz de línea de comandos (CLI)
También puedes usar InfinityScrape directamente desde tu terminal:
# Scrape a URL to Markdown
python -m infinity_scraper.cli scrape "https://example.com"
# Scrape dynamic SPA with infinite scroll
python -m infinity_scraper.cli scrape "https://news.ycombinator.com" --browser --scroll 3
# Live search and auto-scrape top results
python -m infinity_scraper.cli search "Quantum computing breakthroughs" --scrape --max 4
# Crawl documentation tree
python -m infinity_scraper.cli crawl "https://docs.python.org/3/library/asyncio.html" --pages 5 --depth 2
# Extract remote PDF
python -m infinity_scraper.cli pdf "https://example.com/report.pdf" --pages 10🧪 Ejecución de pruebas automatizadas
Ejecuta la completa suite de pruebas unitarias y de integración:
python -m tests.test_scraperCobertura de pruebas:
✅ Fast TLS Impersonator
✅ Playwright Dynamic Browser
✅ DuckDuckGo Live Search
✅ HTML Table to Markdown Converter
✅ Recursive BFS Documentation Crawler
✅ Zero-GPU YouTube Transcript Extraction
✅ OSINT SSL, IP Intel & 25+ Platform Presence Check
📄 Licencia y protección de derechos de autor
Este proyecto está bajo la Licencia MIT (con Atribución Obligatoria y Cumplimiento de la DMCA).
[!IMPORTANT] Aviso de atribución obligatoria:
Eres libre de usar, modificar e integrar este proyecto para uso comercial o personal.
Sin embargo, el aviso original de atribución de autor y de derechos de autor DEBE conservarse en todas las copias, forks o distribuciones derivadas.
Eliminar el nombre/créditos del autor y volver a subir/hacer push a GitHub como trabajo propio está estrictamente prohibido y constituye una infracción de los derechos de autor. Cualquier repositorio infractor está sujeto a una retirada inmediata por DMCA de GitHub y eliminación del repositorio y a acciones legales.
Autor / Creador: VirajVerse
Repositorio: https://github.com/virajverse/infinity-scraper-mcp
Consulta
LICENSEpara conocer los términos legales completos.
This server cannot be installed
Maintenance
Resources
Unclaimed servers have limited discoverability.
Looking for Admin?
If you are the server author, to access and configure the admin panel.
Related MCP Servers
- AlicenseNot gradedqualityAmaintenanceEnables AI agents to perform undetectable browser automation that bypasses Cloudflare, antibots, and social media blocks. Provides 105 tools for element extraction, network debugging, and real-world web scraping with a 98.7% success rate on protected sites.1,589MIT
- AlicenseAqualityBmaintenanceEnables AI agents to scrape any website by providing tools for JavaScript rendering, antibot bypass, and automatic captcha solving. It supports synchronous, asynchronous, and batch scraping operations with built-in proxy rotation.5207MIT

ScrapeLab MCPofficial
AlicenseNot gradedqualityDmaintenanceEnables undetectable web scraping and browser automation for AI agents with 84 tools including stealth navigation, element extraction, network interception, and auto cookie consent dismissal. Bypasses anti-bot systems like Cloudflare and DataDome while providing LLM-ready markdown output and full Chrome DevTools Protocol access.MIT
HasData MCP Serverofficial
AlicenseAqualityAmaintenanceDirect access to 40+ scraping and search tools. Extract structured data from Google (Search, Maps, Trends), Amazon, Airbnb, Social Media, and any web page directly into your AI agent.2424MIT
Related MCP Connectors
Give your agent live data from Twitter, Reddit, the web and GitHub. No API keys, no scraping stack.
Reliable web access for AI agents: smart HTTP, rotating proxies, and full-browser rendering.
Enable language models to perform advanced AI-powered web scraping with enterprise-grade reliabili…
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/virajverse/infinity-scraper'
If you have feedback or need assistance with the MCP directory API, please join our Discord server