Skip to main content
Glama

🌐 InfinityScrape MCP: веб-скрапинг мирового уровня и комплекс глубокой OSINT-разведки

License: MIT Python 3.10+ Protocol: MCP Zero-Cloud-API Zero-GPU

InfinityScrape MCP — это автономный MCP-сервер (Model Context Protocol) промышленного уровня, разработанный для предоставления AI-моделям (LM Studio, Claude Desktop, Cursor, Open WebUI, Antigravity AI) неограниченного высокоскоростного веб-скрапинга, устойчивого к антибот-защите, динамического рендеринга SPA, мгновенной транскрипции YouTube и точной геолокационной разведки OSINT / GEOINT.


📑 Оглавление


Related MCP server: FineData MCP Server

🌟 Почему InfinityScrape MCP?

Стандартные веб-скраперы часто не справляются с современными сайтами из-за Cloudflare-челленджей, интенсивного клиентского рендеринга JavaScript, навязчивых модальных окон согласия на использование cookie и ограничений частоты запросов. InfinityScrape решает эти проблемы из коробки:

  1. Двухдвижковая архитектура:

    • Быстрый TLS-движок (primp + httpx): имитирует реальные TLS/JA3-отпечатки браузеров Chrome/Safari и HTTP/2-заголовки, обходя Cloudflare- и Akamai-челленджи менее чем за <100ms.

    • Динамический headless-браузер (Playwright Chromium): рендерит сложные SPA (React, Vue, Next.js, Angular), выполняет бесконечную прокрутку, кликает по элементам и исполняет пользовательский JavaScript.

  2. Устранение рекламы и трекеров на сетевом уровне:

    • Перехватывает и прерывает сетевые запросы к 35+ рекламным сетям и скриптам отслеживания (doubleclick, criteo, outbrain, google-analytics) до их загрузки, сокращая время загрузки страницы на ~300% и потребление памяти на 70%.

    • Автоматически обнаруживает и устраняет всплывающие окна OneTrust, Cookiebot и липкие оверлеи.

  3. Мгновенный транскрайбер YouTube без GPU:

    • Извлекает полные транскрипты видео/shorts/трансляций с временными метками ([MM:SS]) менее чем за <300ms напрямую через HTTP-потоки, без скачивания видео и без необходимости в локальных GPU-моделях Whisper.

  4. Глубокий рекурсивный краулер документации:

    • Асинхронный краулер на основе поиска в ширину (BFS) с привязкой к домену и фильтрацией по префиксу пути, агрегирующий целые деревья документации в единый Markdown.

  5. Современная публичная OSINT- и GEOINT-разведка:

    • Многосигнальная оценка уверенности (0%–100%): оценивает корреляцию Имя + Город + Улица + Индекс + Организация + Роль для ранжирования найденных досье.

    • Сканеры 25+ глобальных платформ: сканирует GitHub, GitLab, StackOverflow, Kaggle, HuggingFace, LeetCode, Codeforces, Dev.to, Medium, Substack, Google Scholar, ResearchGate, Reddit и др.

    • Георазведка OpenStreetMap: определяет глобальные адреса вплоть до уровня улицы/почтового индекса с GPS-координатами и административными границами.

  6. Постоянный слой кэширования на SQLite:

    • Локальный кэш в памяти и на базе SQLite для мгновенных ответов за 0ms при повторных запросах с настраиваемым TTL.


⚡ Сравнение с конкурентами

Возможность / Характеристика

Стандартные MCP-скраперы

Облачные scraping API

InfinityScrape MCP

Стоимость и API-ключи

Бесплатно (базово)

Платно ($20–$200/мес)

100% бесплатно / ноль API-ключей

Обход TLS Cloudflare / Akamai

❌ Сбои / 403

✅ Да

✅ Встроено (primp JA3)

Динамические SPA и бесконечная прокрутка

❌ Ограниченно

✅ Да

✅ Встроено (playwright)

Блокировка рекламы и попапов на сетевом уровне

❌ Нет

⚠️ Частично

✅ Встроено (35+ доменов)

Транскрипты YouTube без GPU

❌ Нет

❌ Нет

✅ Встроено (<300ms)

Онлайн-парсер PDF постранично

❌ Нет

⚠️ Дополнительная плата

✅ Встроено (pypdf)

Глубокий краулер документации

❌ Нет

⚠️ Дополнительная плата

✅ Встроено (Async BFS)

OSINT по 25+ платформам и геокодирование

❌ Нет

❌ Нет

✅ Встроено (уверенность 0–100%)

Локальное кэширование SQLite за 0ms

❌ Нет

❌ Нет

✅ Встроено (авто TTL)


🏗️ Обзор архитектуры

                      ┌────────────────────────────────────────────────┐
                      │    AI Client (LM Studio / Claude / Cursor)     │
                      └───────────────────────┬────────────────────────┘
                                              │ JSON-RPC 2.0 (Stdio)
                                              ▼
                      ┌────────────────────────────────────────────────┐
                      │          InfinityScrape MCP Server             │
                      │                  (server.py)                   │
                      └───────┬────────────────┬───────────────┬───────┘
                              │                │               │
            ┌─────────────────┴─┐     ┌────────┴────────┐    ┌─┴────────────────┐
            ▼                   ▼     ▼                 ▼    ▼                  ▼
     [Fast TLS Engine]     [Playwright Engine]   [OSINT / GEOINT]   [Media & PDF Engines]
     • primp JA3/TLS       • Stealth Chromium    • 25+ Platform     • YouTube (<300ms)
     • HTTP/2 Stealth      • Network Ad Blocker    Scanners         • Remote PDF Stream
     • <100ms Execution    • Infinite Scroll     • OpenStreetMap    • Table Markdownify
                           • Auto-Dismiss CMPs   • Match Confidence
                                    │
                                    ▼
                      ┌────────────────────────────────┐
                      │ SQLite Caching Layer (0ms TTL) │
                      └────────────────────────────────┘

🚀 Быстрый старт и установка в один клик

Предварительные требования

  • Установлен Python 3.10, 3.11 или 3.12+.

  • Windows, macOS или Linux.

Настройка в один клик:

На Windows:

Дважды щёлкните install.bat или выполните в PowerShell:

.\install.bat

На Linux / macOS:

chmod +x install.sh
./install.sh

Ручная настройка (любая платформа):

# 1. Create virtual environment
python -m venv .venv

# 2. Activate virtual environment
# Windows: .venv\Scripts\activate | Linux/Mac: source .venv/bin/activate

# 3. Install requirements & Playwright browser
pip install -r requirements.txt
playwright install chromium

🔌 Интеграция с AI-клиентами

1. LM Studio (v0.3+)

Перейдите в Настройки ➔ Разработчик ➔ MCP-серверы ➔ Изменить конфигурацию и добавьте:

{
  "mcpServers": {
    "infinity-scraper": {
      "command": "C:/path/to/infinity-scraper/.venv/Scripts/python.exe",
      "args": [
        "-m",
        "infinity_scraper.server"
      ],
      "cwd": "C:/path/to/infinity-scraper",
      "env": {
        "PYTHONUNBUFFERED": "1"
      }
    }
  }
}

2. Claude Desktop

Отредактируйте %APPDATA%\Claude\claude_desktop_config.json (Windows) или ~/Library/Application Support/Claude/claude_desktop_config.json (macOS):

{
  "mcpServers": {
    "infinity-scraper": {
      "command": "C:/path/to/infinity-scraper/.venv/Scripts/python.exe",
      "args": [
        "-m",
        "infinity_scraper.server"
      ]
    }
  }
}

3. Cursor IDE

В настройках Cursor ➔ Возможности ➔ MCP-серверы ➔ Добавить новый MCP-сервер:

  • Имя: infinity-scraper

  • Тип: command

  • Команда: C:/path/to/infinity-scraper/.venv/Scripts/python.exe -m infinity_scraper.server


🛠️ Полное справочное руководство по 23 инструментам

1. Веб-скрапинг и обход контента

Инструмент

Назначение

Ключевые параметры

scrape_url

Универсальный скрапинг с движком, автоматически переключающимся с TLS на браузер.

url, engine='auto', strip_ads=True, use_cache=True

scrape_dynamic

Headless-браузер для SPA, бесконечной прокрутки и кликов по элементам.

url, scroll_depth=3, click_selector, wait_seconds

search_web

Поиск в интернете в реальном времени через DuckDuckGo.

query, max_results=5, search_type='text'

search_and_scrape

Ищет в вебе и автоматически собирает лучшие результаты в отчёт с цитатами.

query, max_results=4

deep_crawl

Рекурсивный асинхронный BFS-краулер сайтов для полных деревьев документации.

start_url, max_pages=10, max_depth=2, path_prefix

scrape_batch

Одновременный параллельный скрапинг нескольких URL.

urls (список), concurrency=4

extract_schema

Извлекает целевые поля по карте CSS-селекторов в JSON.

url, schema={"title": "h1", "price": ".price"}

extract_structured

Извлекает JSON-LD, метаданные OpenGraph и HTML-таблицы.

url, extract_tables=True

optimize_rag_chunks

Семантический разделитель RAG-чанков и оптимизатор токенов для больших страниц.

text_or_markdown, max_chunk_chars=2000


2. Парсеры медиа, соцсетей, видео и документов

Инструмент

Назначение

Ключевые параметры

get_youtube_transcript

Извлечение транскрипта YouTube-видео без GPU с временными метками.

url, with_timestamps=True, languages

extract_pdf

Потоково извлекает удалённые онлайн-PDF-документы постранично.

url, max_pages=20

extract_image_exif

Извлекает характеристики камеры, временные метки и GPS-геотеги из фотографий.

image_url

extract_reddit_thread_tool

Загружает посты Reddit, оценки и вложенные диалоги комментариев.

url, max_comments=25

extract_rss_feed_tool

Парсер RSS/Atom-лент в реальном времени для блогов, Substack и новостей.

feed_url, max_items=10


3. Глубокая публичная OSINT и разведка по объектам

Инструмент

Назначение

Ключевые параметры

osint_deep_public_recon

Многодоменный скрапер открытых веб-профилей и конструктор досье с ранжированием по уровню уверенности.

name, location, street_or_locality, postal_code, organization, role_or_keywords, exclude_terms, time_range

osint_geoint_lookup

Глобальное прямое геокодирование OpenStreetMap и разбивка по административным единицам.

location_query, country_code

osint_location_entity_search

Иерархическая матрица поиска с детализацией по местоположению и отрицательными фильтрами.

entity_name, country, city, street_or_landmark, postal_code

osint_username_check

Проверяет наличие имени пользователя в 26 сетях для разработчиков, научных и творческих сообществ.

username

osint_search

Точный поисковый доркинг (site:, filetype:pdf, intitle:, -exclude).

query, site, filetype, exclude_terms


4. Техническая, доменная и сетевая разведка

Инструмент

Назначение

Ключевые параметры

osint_domain_recon

Проверяет действительность SSL/TLS-сертификатов домена, DNS и RDAP/WHOIS.

domain_or_url

osint_tech_stack

Определяет фронтенд-фреймворки (React, Next.js, Vue), CMS, CDN и серверы.

url

osint_ip_lookup

Геолокация публичного IP, данные об ASN, интернет-провайдере и организации.

ip_or_host

osint_wayback_time_machine

Историческая «машина времени» и сборщик снимков удалённых веб-страниц.

url, timestamp, list_snapshots

osint_subdomain_enumeration

Обнаружение субдоменов через Certificate Transparency менее чем за 1 сек.

domain, limit=50

osint_dns_audit

Глубокий аудит инфраструктуры DNS-записей (IPv4, IPv6, MX).

domain


🧠 Плейбук для автономных AI-агентов

InfinityScrape включает расширенный Cognitive Reasoning Framework (skills/infinity-scraper/SKILL.md), который обучает автономных AI-агентов:

  • Динамически разбирать пользовательские запросы на поисковые и геолокационные подсказки.

  • Выстраивать цепочки вызовов нескольких инструментов (например, Search ➔ Filter ➔ Batch Scrape или Geocode ➔ Locality Dork ➔ Profile Extraction).

  • Автоматически переходить с быстрого TLS на headless-браузер Playwright при обнаружении динамических одностраничных приложений на React.

👉 Читайте полный плейбук агента: skills/infinity-scraper/SKILL.md


💻 Интерфейс командной строки (CLI)

Вы также можете использовать InfinityScrape напрямую из терминала:

# Scrape a URL to Markdown
python -m infinity_scraper.cli scrape "https://example.com"

# Scrape dynamic SPA with infinite scroll
python -m infinity_scraper.cli scrape "https://news.ycombinator.com" --browser --scroll 3

# Live search and auto-scrape top results
python -m infinity_scraper.cli search "Quantum computing breakthroughs" --scrape --max 4

# Crawl documentation tree
python -m infinity_scraper.cli crawl "https://docs.python.org/3/library/asyncio.html" --pages 5 --depth 2

# Extract remote PDF
python -m infinity_scraper.cli pdf "https://example.com/report.pdf" --pages 10

🧪 Запуск автоматизированных тестов

Запустите полный набор модульных и интеграционных тестов:

python -m tests.test_scraper

Покрытие тестами:

  • ✅ Fast TLS Impersonator

  • ✅ Playwright Dynamic Browser

  • ✅ DuckDuckGo Live Search

  • ✅ HTML Table to Markdown Converter

  • ✅ Recursive BFS Documentation Crawler

  • ✅ Zero-GPU YouTube Transcript Extraction

  • ✅ OSINT SSL, IP Intel & 25+ Platform Presence Check


📄 Лицензия и защита авторских прав

Этот проект распространяется под лицензией MIT (с обязательным указанием авторства и правоприменением DMCA).

[!IMPORTANT] Уведомление об обязательном указании авторства:

  • Вы можете свободно использовать, изменять и интегрировать этот проект в коммерческих или личных целях.

  • Однако оригинальное указание автора и уведомление об авторских правах ОБЯЗАТЕЛЬНО должны сохраняться во всех копиях, форках или производных дистрибутивах.

  • Удаление имени/упоминания автора и повторная загрузка/публикация на GitHub от своего имени строго запрещены и являются нарушением авторских прав. Любой репозиторий-нарушитель подлежит немедленному удалению по DMCA и блокировке на GitHub, а также правовому преследованию.

F
license - not found
Not graded
quality - not tested
C
maintenance

Maintenance

Maintainers
Response time
Release cycle
Releases (12mo)
Commit activity

Resources

Unclaimed servers have limited discoverability.

Looking for Admin?

If you are the server author, to access and configure the admin panel.

Related MCP Servers

  • A
    license
    Not graded
    quality
    A
    maintenance
    Enables AI agents to perform undetectable browser automation that bypasses Cloudflare, antibots, and social media blocks. Provides 105 tools for element extraction, network debugging, and real-world web scraping with a 98.7% success rate on protected sites.
    1,589
    MIT
  • A
    license
    Not graded
    quality
    D
    maintenance
    Enables undetectable web scraping and browser automation for AI agents with 84 tools including stealth navigation, element extraction, network interception, and auto cookie consent dismissal. Bypasses anti-bot systems like Cloudflare and DataDome while providing LLM-ready markdown output and full Chrome DevTools Protocol access.
    MIT
  • A
    license
    A
    quality
    A
    maintenance
    Direct access to 40+ scraping and search tools. Extract structured data from Google (Search, Maps, Trends), Amazon, Airbnb, Social Media, and any web page directly into your AI agent.
    2
    42
    4
    MIT

View all related MCP servers

Related MCP Connectors

  • Give your agent live data from Twitter, Reddit, the web and GitHub. No API keys, no scraping stack.

  • Reliable web access for AI agents: smart HTTP, rotating proxies, and full-browser rendering.

  • Enable language models to perform advanced AI-powered web scraping with enterprise-grade reliabili…

View all MCP Connectors

Latest Blog Posts

MCP directory API

We provide all the information about MCP servers via our MCP API.

curl -X GET 'https://glama.ai/api/mcp/v1/servers/virajverse/infinity-scraper'

If you have feedback or need assistance with the MCP directory API, please join our Discord server