InfinityScrape MCP
🌐 InfinityScrape MCP: веб-скрапинг мирового уровня и комплекс глубокой OSINT-разведки
InfinityScrape MCP — это автономный MCP-сервер (Model Context Protocol) промышленного уровня, разработанный для предоставления AI-моделям (LM Studio, Claude Desktop, Cursor, Open WebUI, Antigravity AI) неограниченного высокоскоростного веб-скрапинга, устойчивого к антибот-защите, динамического рендеринга SPA, мгновенной транскрипции YouTube и точной геолокационной разведки OSINT / GEOINT.
📑 Оглавление
Related MCP server: FineData MCP Server
🌟 Почему InfinityScrape MCP?
Стандартные веб-скраперы часто не справляются с современными сайтами из-за Cloudflare-челленджей, интенсивного клиентского рендеринга JavaScript, навязчивых модальных окон согласия на использование cookie и ограничений частоты запросов. InfinityScrape решает эти проблемы из коробки:
Двухдвижковая архитектура:
Быстрый TLS-движок (
primp+httpx): имитирует реальные TLS/JA3-отпечатки браузеров Chrome/Safari и HTTP/2-заголовки, обходя Cloudflare- и Akamai-челленджи менее чем за<100ms.Динамический headless-браузер (
Playwright Chromium): рендерит сложные SPA (React, Vue, Next.js, Angular), выполняет бесконечную прокрутку, кликает по элементам и исполняет пользовательский JavaScript.
Устранение рекламы и трекеров на сетевом уровне:
Перехватывает и прерывает сетевые запросы к 35+ рекламным сетям и скриптам отслеживания (
doubleclick,criteo,outbrain,google-analytics) до их загрузки, сокращая время загрузки страницы на ~300% и потребление памяти на 70%.Автоматически обнаруживает и устраняет всплывающие окна OneTrust, Cookiebot и липкие оверлеи.
Мгновенный транскрайбер YouTube без GPU:
Извлекает полные транскрипты видео/shorts/трансляций с временными метками (
[MM:SS]) менее чем за<300msнапрямую через HTTP-потоки, без скачивания видео и без необходимости в локальных GPU-моделях Whisper.
Глубокий рекурсивный краулер документации:
Асинхронный краулер на основе поиска в ширину (BFS) с привязкой к домену и фильтрацией по префиксу пути, агрегирующий целые деревья документации в единый Markdown.
Современная публичная OSINT- и GEOINT-разведка:
Многосигнальная оценка уверенности (0%–100%): оценивает корреляцию Имя + Город + Улица + Индекс + Организация + Роль для ранжирования найденных досье.
Сканеры 25+ глобальных платформ: сканирует GitHub, GitLab, StackOverflow, Kaggle, HuggingFace, LeetCode, Codeforces, Dev.to, Medium, Substack, Google Scholar, ResearchGate, Reddit и др.
Георазведка OpenStreetMap: определяет глобальные адреса вплоть до уровня улицы/почтового индекса с GPS-координатами и административными границами.
Постоянный слой кэширования на SQLite:
Локальный кэш в памяти и на базе SQLite для мгновенных ответов за
0msпри повторных запросах с настраиваемым TTL.
⚡ Сравнение с конкурентами
Возможность / Характеристика | Стандартные MCP-скраперы | Облачные scraping API | InfinityScrape MCP |
Стоимость и API-ключи | Бесплатно (базово) | Платно ($20–$200/мес) | 100% бесплатно / ноль API-ключей |
Обход TLS Cloudflare / Akamai | ❌ Сбои / 403 | ✅ Да | ✅ Встроено ( |
Динамические SPA и бесконечная прокрутка | ❌ Ограниченно | ✅ Да | ✅ Встроено ( |
Блокировка рекламы и попапов на сетевом уровне | ❌ Нет | ⚠️ Частично | ✅ Встроено (35+ доменов) |
Транскрипты YouTube без GPU | ❌ Нет | ❌ Нет | ✅ Встроено (<300ms) |
Онлайн-парсер PDF постранично | ❌ Нет | ⚠️ Дополнительная плата | ✅ Встроено ( |
Глубокий краулер документации | ❌ Нет | ⚠️ Дополнительная плата | ✅ Встроено (Async BFS) |
OSINT по 25+ платформам и геокодирование | ❌ Нет | ❌ Нет | ✅ Встроено (уверенность 0–100%) |
Локальное кэширование SQLite за 0ms | ❌ Нет | ❌ Нет | ✅ Встроено (авто TTL) |
🏗️ Обзор архитектуры
┌────────────────────────────────────────────────┐
│ AI Client (LM Studio / Claude / Cursor) │
└───────────────────────┬────────────────────────┘
│ JSON-RPC 2.0 (Stdio)
▼
┌────────────────────────────────────────────────┐
│ InfinityScrape MCP Server │
│ (server.py) │
└───────┬────────────────┬───────────────┬───────┘
│ │ │
┌─────────────────┴─┐ ┌────────┴────────┐ ┌─┴────────────────┐
▼ ▼ ▼ ▼ ▼ ▼
[Fast TLS Engine] [Playwright Engine] [OSINT / GEOINT] [Media & PDF Engines]
• primp JA3/TLS • Stealth Chromium • 25+ Platform • YouTube (<300ms)
• HTTP/2 Stealth • Network Ad Blocker Scanners • Remote PDF Stream
• <100ms Execution • Infinite Scroll • OpenStreetMap • Table Markdownify
• Auto-Dismiss CMPs • Match Confidence
│
▼
┌────────────────────────────────┐
│ SQLite Caching Layer (0ms TTL) │
└────────────────────────────────┘🚀 Быстрый старт и установка в один клик
Предварительные требования
Установлен Python 3.10, 3.11 или 3.12+.
Windows, macOS или Linux.
Настройка в один клик:
На Windows:
Дважды щёлкните install.bat или выполните в PowerShell:
.\install.batНа Linux / macOS:
chmod +x install.sh
./install.shРучная настройка (любая платформа):
# 1. Create virtual environment
python -m venv .venv
# 2. Activate virtual environment
# Windows: .venv\Scripts\activate | Linux/Mac: source .venv/bin/activate
# 3. Install requirements & Playwright browser
pip install -r requirements.txt
playwright install chromium🔌 Интеграция с AI-клиентами
1. LM Studio (v0.3+)
Перейдите в Настройки ➔ Разработчик ➔ MCP-серверы ➔ Изменить конфигурацию и добавьте:
{
"mcpServers": {
"infinity-scraper": {
"command": "C:/path/to/infinity-scraper/.venv/Scripts/python.exe",
"args": [
"-m",
"infinity_scraper.server"
],
"cwd": "C:/path/to/infinity-scraper",
"env": {
"PYTHONUNBUFFERED": "1"
}
}
}
}2. Claude Desktop
Отредактируйте %APPDATA%\Claude\claude_desktop_config.json (Windows) или ~/Library/Application Support/Claude/claude_desktop_config.json (macOS):
{
"mcpServers": {
"infinity-scraper": {
"command": "C:/path/to/infinity-scraper/.venv/Scripts/python.exe",
"args": [
"-m",
"infinity_scraper.server"
]
}
}
}3. Cursor IDE
В настройках Cursor ➔ Возможности ➔ MCP-серверы ➔ Добавить новый MCP-сервер:
Имя:
infinity-scraperТип:
commandКоманда:
C:/path/to/infinity-scraper/.venv/Scripts/python.exe -m infinity_scraper.server
🛠️ Полное справочное руководство по 23 инструментам
1. Веб-скрапинг и обход контента
Инструмент | Назначение | Ключевые параметры |
| Универсальный скрапинг с движком, автоматически переключающимся с TLS на браузер. |
|
| Headless-браузер для SPA, бесконечной прокрутки и кликов по элементам. |
|
| Поиск в интернете в реальном времени через DuckDuckGo. |
|
| Ищет в вебе и автоматически собирает лучшие результаты в отчёт с цитатами. |
|
| Рекурсивный асинхронный BFS-краулер сайтов для полных деревьев документации. |
|
| Одновременный параллельный скрапинг нескольких URL. |
|
| Извлекает целевые поля по карте CSS-селекторов в JSON. |
|
| Извлекает JSON-LD, метаданные OpenGraph и HTML-таблицы. |
|
| Семантический разделитель RAG-чанков и оптимизатор токенов для больших страниц. |
|
2. Парсеры медиа, соцсетей, видео и документов
Инструмент | Назначение | Ключевые параметры |
| Извлечение транскрипта YouTube-видео без GPU с временными метками. |
|
| Потоково извлекает удалённые онлайн-PDF-документы постранично. |
|
| Извлекает характеристики камеры, временные метки и GPS-геотеги из фотографий. |
|
| Загружает посты Reddit, оценки и вложенные диалоги комментариев. |
|
| Парсер RSS/Atom-лент в реальном времени для блогов, Substack и новостей. |
|
3. Глубокая публичная OSINT и разведка по объектам
Инструмент | Назначение | Ключевые параметры |
| Многодоменный скрапер открытых веб-профилей и конструктор досье с ранжированием по уровню уверенности. |
|
| Глобальное прямое геокодирование OpenStreetMap и разбивка по административным единицам. |
|
| Иерархическая матрица поиска с детализацией по местоположению и отрицательными фильтрами. |
|
| Проверяет наличие имени пользователя в 26 сетях для разработчиков, научных и творческих сообществ. |
|
| Точный поисковый доркинг ( |
|
4. Техническая, доменная и сетевая разведка
Инструмент | Назначение | Ключевые параметры |
| Проверяет действительность SSL/TLS-сертификатов домена, DNS и RDAP/WHOIS. |
|
| Определяет фронтенд-фреймворки (React, Next.js, Vue), CMS, CDN и серверы. |
|
| Геолокация публичного IP, данные об ASN, интернет-провайдере и организации. |
|
| Историческая «машина времени» и сборщик снимков удалённых веб-страниц. |
|
| Обнаружение субдоменов через Certificate Transparency менее чем за 1 сек. |
|
| Глубокий аудит инфраструктуры DNS-записей (IPv4, IPv6, MX). |
|
🧠 Плейбук для автономных AI-агентов
InfinityScrape включает расширенный Cognitive Reasoning Framework (skills/infinity-scraper/SKILL.md), который обучает автономных AI-агентов:
Динамически разбирать пользовательские запросы на поисковые и геолокационные подсказки.
Выстраивать цепочки вызовов нескольких инструментов (например,
Search ➔ Filter ➔ Batch ScrapeилиGeocode ➔ Locality Dork ➔ Profile Extraction).Автоматически переходить с быстрого TLS на headless-браузер Playwright при обнаружении динамических одностраничных приложений на React.
👉 Читайте полный плейбук агента: skills/infinity-scraper/SKILL.md
💻 Интерфейс командной строки (CLI)
Вы также можете использовать InfinityScrape напрямую из терминала:
# Scrape a URL to Markdown
python -m infinity_scraper.cli scrape "https://example.com"
# Scrape dynamic SPA with infinite scroll
python -m infinity_scraper.cli scrape "https://news.ycombinator.com" --browser --scroll 3
# Live search and auto-scrape top results
python -m infinity_scraper.cli search "Quantum computing breakthroughs" --scrape --max 4
# Crawl documentation tree
python -m infinity_scraper.cli crawl "https://docs.python.org/3/library/asyncio.html" --pages 5 --depth 2
# Extract remote PDF
python -m infinity_scraper.cli pdf "https://example.com/report.pdf" --pages 10🧪 Запуск автоматизированных тестов
Запустите полный набор модульных и интеграционных тестов:
python -m tests.test_scraperПокрытие тестами:
✅ Fast TLS Impersonator
✅ Playwright Dynamic Browser
✅ DuckDuckGo Live Search
✅ HTML Table to Markdown Converter
✅ Recursive BFS Documentation Crawler
✅ Zero-GPU YouTube Transcript Extraction
✅ OSINT SSL, IP Intel & 25+ Platform Presence Check
📄 Лицензия и защита авторских прав
Этот проект распространяется под лицензией MIT (с обязательным указанием авторства и правоприменением DMCA).
[!IMPORTANT] Уведомление об обязательном указании авторства:
Вы можете свободно использовать, изменять и интегрировать этот проект в коммерческих или личных целях.
Однако оригинальное указание автора и уведомление об авторских правах ОБЯЗАТЕЛЬНО должны сохраняться во всех копиях, форках или производных дистрибутивах.
Удаление имени/упоминания автора и повторная загрузка/публикация на GitHub от своего имени строго запрещены и являются нарушением авторских прав. Любой репозиторий-нарушитель подлежит немедленному удалению по DMCA и блокировке на GitHub, а также правовому преследованию.
Автор / Создатель: VirajVerse
Репозиторий: https://github.com/virajverse/infinity-scraper-mcp
Полные юридические условия см. в
LICENSE.
This server cannot be installed
Maintenance
Resources
Unclaimed servers have limited discoverability.
Looking for Admin?
If you are the server author, to access and configure the admin panel.
Related MCP Servers
- AlicenseNot gradedqualityAmaintenanceEnables AI agents to perform undetectable browser automation that bypasses Cloudflare, antibots, and social media blocks. Provides 105 tools for element extraction, network debugging, and real-world web scraping with a 98.7% success rate on protected sites.1,589MIT
- AlicenseAqualityBmaintenanceEnables AI agents to scrape any website by providing tools for JavaScript rendering, antibot bypass, and automatic captcha solving. It supports synchronous, asynchronous, and batch scraping operations with built-in proxy rotation.5207MIT

ScrapeLab MCPofficial
AlicenseNot gradedqualityDmaintenanceEnables undetectable web scraping and browser automation for AI agents with 84 tools including stealth navigation, element extraction, network interception, and auto cookie consent dismissal. Bypasses anti-bot systems like Cloudflare and DataDome while providing LLM-ready markdown output and full Chrome DevTools Protocol access.MIT
HasData MCP Serverofficial
AlicenseAqualityAmaintenanceDirect access to 40+ scraping and search tools. Extract structured data from Google (Search, Maps, Trends), Amazon, Airbnb, Social Media, and any web page directly into your AI agent.2424MIT
Related MCP Connectors
Give your agent live data from Twitter, Reddit, the web and GitHub. No API keys, no scraping stack.
Reliable web access for AI agents: smart HTTP, rotating proxies, and full-browser rendering.
Enable language models to perform advanced AI-powered web scraping with enterprise-grade reliabili…
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/virajverse/infinity-scraper'
If you have feedback or need assistance with the MCP directory API, please join our Discord server