Skip to main content
Glama

🌐 InfinityScrape MCP: 세계 최고 수준의 웹 스크래핑 및 딥 OSINT 인텔리전스 제품군

License: MIT Python 3.10+ Protocol: MCP Zero-Cloud-API Zero-GPU

InfinityScrape MCP는 AI 모델(LM Studio, Claude Desktop, Cursor, Open WebUI, Antigravity AI)에 무제한의 초고속, 안티봇 내성 웹 스크래핑, 동적 SPA 렌더링, 즉석 YouTube 전사, 정밀 OSINT / GEOINT 위치 인텔리전스를 제공하도록 설계된 독립형 프로덕션급 Model Context Protocol (MCP) 서버입니다.


📑 목차


Related MCP server: FineData MCP Server

🌟 왜 InfinityScrape MCP인가?

일반적인 웹 스크래퍼는 Cloudflare 챌린지, 과도한 클라이언트 사이드 JavaScript 렌더링, 방해가 되는 쿠키 동의 모달, 속도 제한 때문에 현대 웹사이트에서 자주 실패합니다. InfinityScrape는 이러한 문제를 기본 제공 기능으로 해결합니다:

  1. 듀얼 엔진 아키텍처:

    • Fast TLS Engine (primp + httpx): 실제 Chrome/Safari 브라우저의 TLS/JA3 지문과 HTTP/2 헤더를 모방하여 Cloudflare 및 Akamai 챌린지를 <100ms 안에 우회합니다.

    • Dynamic Headless Browser (Playwright Chromium): 복잡한 SPA(React, Vue, Next.js, Angular)를 렌더링하고, 무한 스크롤을 수행하며, 요소를 클릭하고, 커스텀 JavaScript를 실행합니다.

  2. 네트워크 레벨 광고 및 추적기 차단:

    • 다운로드되기 전에 35개 이상의 광고 네트워크 및 추적 스크립트(doubleclick, criteo, outbrain, google-analytics)에 대한 네트워크 호출을 가로채 중단하여 페이지 로드 시간을 ~300% 단축하고 메모리 사용량을 70% 절감합니다.

    • OneTrust, Cookiebot 및 스티키 오버레이 팝업을 자동으로 감지하고 제거합니다.

  3. Zero-GPU 즉석 YouTube 전사 도구:

    • 비디오를 다운로드하거나 로컬 GPU Whisper 모델을 요구하지 않고 HTTP 스트림을 통해 타임스탬프([MM:SS])가 포함된 전체 비디오/쇼츠/라이브 전사본을 <300ms 안에 직접 추출합니다.

  4. 딥 재귀 문서 크롤러:

    • 도메인 잠금 및 경로 접두사 필터링을 갖춘 비동기 Breadth-First-Search (BFS) 크롤러로 전체 문서 트리를 통합 Markdown으로 집계합니다.

  5. 최첨단 공개 OSINT 및 GEOINT 정찰:

    • 다중 신호 신뢰도 점수(0% - 100%): 이름 + 도시 + 거리 + PIN + 조직 + 역할의 상관관계를 평가하여 발견된 신상 기록의 순위를 매깁니다.

    • 25개 이상의 글로벌 플랫폼 스캐너: GitHub, GitLab, StackOverflow, Kaggle, HuggingFace, LeetCode, Codeforces, Dev.to, Medium, Substack, Google Scholar, ResearchGate, Reddit 등을 스캔합니다.

    • OpenStreetMap GEOINT: GPS 좌표와 행정 경계를 포함하여 전 세계 주소를 거리/우편번호 수준까지 해석합니다.

  6. SQLite 영구 캐싱 계층:

    • 구성 가능한 TTL로 반복 조회 시 즉각적인 0ms 응답을 제공하는 인메모리 및 SQLite 기반 로컬 캐시.


⚡ 경쟁 제품 비교

기능 / 역량

일반 MCP 스크래퍼

클라우드 스크래핑 API

InfinityScrape MCP

비용 및 API 키

무료 (기본)

유료 ($20 - $200/월)

100% 무료 / API 키 불필요

Cloudflare / Akamai TLS 우회

❌ 실패 / 403

✅ 가능

✅ 기본 내장 (primp JA3)

동적 SPA 및 무한 스크롤

❌ 제한적

✅ 가능

✅ 기본 내장 (playwright)

네트워크 레벨 광고 및 팝업 제거

❌ 불가

⚠️ 부분적

✅ 기본 내장 (35+ 도메인)

Zero-GPU YouTube 전사

❌ 불가

❌ 불가

✅ 기본 내장 (<300ms)

온라인 PDF 페이지별 파서

❌ 불가

⚠️ 추가 비용

✅ 기본 내장 (pypdf)

딥 문서 크롤러

❌ 불가

⚠️ 추가 비용

✅ 기본 내장 (Async BFS)

25+ 플랫폼 OSINT 및 지오코딩

❌ 불가

❌ 불가

✅ 기본 내장 (0-100% 신뢰도)

로컬 SQLite 0ms 캐싱

❌ 불가

❌ 불가

✅ 기본 내장 (자동 TTL)


🏗️ 아키텍처 개요

                      ┌────────────────────────────────────────────────┐
                      │    AI Client (LM Studio / Claude / Cursor)     │
                      └───────────────────────┬────────────────────────┘
                                              │ JSON-RPC 2.0 (Stdio)
                                              ▼
                      ┌────────────────────────────────────────────────┐
                      │          InfinityScrape MCP Server             │
                      │                  (server.py)                   │
                      └───────┬────────────────┬───────────────┬───────┘
                              │                │               │
            ┌─────────────────┴─┐     ┌────────┴────────┐    ┌─┴────────────────┐
            ▼                   ▼     ▼                 ▼    ▼                  ▼
     [Fast TLS Engine]     [Playwright Engine]   [OSINT / GEOINT]   [Media & PDF Engines]
     • primp JA3/TLS       • Stealth Chromium    • 25+ Platform     • YouTube (<300ms)
     • HTTP/2 Stealth      • Network Ad Blocker    Scanners         • Remote PDF Stream
     • <100ms Execution    • Infinite Scroll     • OpenStreetMap    • Table Markdownify
                           • Auto-Dismiss CMPs   • Match Confidence
                                    │
                                    ▼
                      ┌────────────────────────────────┐
                      │ SQLite Caching Layer (0ms TTL) │
                      └────────────────────────────────┘

🚀 빠른 시작 및 1-Click 설치

필수 조건

  • Python 3.10, 3.11 또는 3.12+ 설치 필요.

  • Windows, macOS 또는 Linux.

1-Click 설정:

Windows에서:

install.bat을 더블클릭하거나 PowerShell에서 실행:

.\install.bat

Linux / macOS에서:

chmod +x install.sh
./install.sh

수동 설정 (모든 플랫폼):

# 1. Create virtual environment
python -m venv .venv

# 2. Activate virtual environment
# Windows: .venv\Scripts\activate | Linux/Mac: source .venv/bin/activate

# 3. Install requirements & Playwright browser
pip install -r requirements.txt
playwright install chromium

🔌 AI 클라이언트 연동

1. LM Studio (v0.3+)

Settings ➔ Developer ➔ MCP Servers ➔ Edit Config로 이동하여 다음을 추가:

{
  "mcpServers": {
    "infinity-scraper": {
      "command": "C:/path/to/infinity-scraper/.venv/Scripts/python.exe",
      "args": [
        "-m",
        "infinity_scraper.server"
      ],
      "cwd": "C:/path/to/infinity-scraper",
      "env": {
        "PYTHONUNBUFFERED": "1"
      }
    }
  }
}

2. Claude Desktop

%APPDATA%\Claude\claude_desktop_config.json(Windows) 또는 ~/Library/Application Support/Claude/claude_desktop_config.json(macOS)을 편집:

{
  "mcpServers": {
    "infinity-scraper": {
      "command": "C:/path/to/infinity-scraper/.venv/Scripts/python.exe",
      "args": [
        "-m",
        "infinity_scraper.server"
      ]
    }
  }
}

3. Cursor IDE

Cursor Settings ➔ Features ➔ MCP Servers ➔ Add New MCP Server에서:

  • 이름: infinity-scraper

  • 유형: command

  • 명령어: C:/path/to/infinity-scraper/.venv/Scripts/python.exe -m infinity_scraper.server


🛠️ 전체 23-Tool 참조 가이드

1. 웹 스크래핑 및 콘텐츠 크롤링

도구

용도

주요 매개변수

scrape_url

TLS에서 브라우저 엔진으로 자동 업그레이드되는 범용 스크래핑.

url, engine='auto', strip_ads=True, use_cache=True

scrape_dynamic

SPA, 무한 스크롤 및 클릭 액션을 위한 헤드리스 브라우저.

url, scroll_depth=3, click_selector, wait_seconds

search_web

DuckDuckGo를 통한 실시간 인터넷 검색.

query, max_results=5, search_type='text'

search_and_scrape

웹을 검색하고 상위 결과를 자동 스크래핑하여 인용 보고서로 생성.

query, max_results=4

deep_crawl

전체 문서 트리를 위한 재귀 비동기 BFS 사이트 크롤러.

start_url, max_pages=10, max_depth=2, path_prefix

scrape_batch

여러 URL을 병렬로 동시 스크래핑.

urls (list), concurrency=4

extract_schema

CSS 선택자 맵을 사용하여 대상 필드를 JSON으로 추출.

url, schema={"title": "h1", "price": ".price"}

extract_structured

JSON-LD, OpenGraph 메타데이터 및 HTML 테이블 추출.

url, extract_tables=True

optimize_rag_chunks

대용량 페이지를 위한 의미론적 RAG 청커 및 토큰 최적화 도구.

text_or_markdown, max_chunk_chars=2000


2. 미디어, 소셜, 비디오 및 문서 파서

도구

용도

주요 매개변수

get_youtube_transcript

타임스탬프가 포함된 Zero-GPU YouTube 비디오 전사본 추출.

url, with_timestamps=True, languages

extract_pdf

원격 온라인 PDF 문서를 페이지별로 스트리밍하여 추출.

url, max_pages=20

extract_image_exif

사진에서 카메라 사양, 타임스탬프 및 GPS 지오태그 추출.

image_url

extract_reddit_thread_tool

Reddit 게시물, 점수 및 중첩 댓글 대화 수집.

url, max_comments=25

extract_rss_feed_tool

블로그, Substack 및 뉴스를 위한 실시간 RSS/Atom 피드 파서.

feed_url, max_items=10


3. 딥 공개 OSINT 및 개체 정찰

도구

용도

주요 매개변수

osint_deep_public_recon

다중 도메인 공개 웹 프로필 스크래퍼 및 신뢰도 순위 신상 기록 빌더.

name, location, street_or_locality, postal_code, organization, role_or_keywords, exclude_terms, time_range

osint_geoint_lookup

글로벌 OpenStreetMap 전방 지오코딩 및 행정 구역 세분화.

location_query, country_code

osint_location_entity_search

음수 필터가 포함된 계층적 위치 드릴다운 검색 매트릭스.

entity_name, country, city, street_or_landmark, postal_code

osint_username_check

26개 코딩, 학술 및 창작 네트워크에서 사용자 이름 존재 여부 스캔.

username

osint_search

정밀 검색 도킹(site:, filetype:pdf, intitle:, -exclude).

query, site, filetype, exclude_terms


4. 기술, 도메인 및 네트워크 인텔리전스

Tool

Purpose

Key Parameters

osint_domain_recon

도메인 SSL/TLS 인증서 유효성, DNS, RDAP/WHOIS를 검사합니다.

domain_or_url

osint_tech_stack

프런트엔드 프레임워크(React, Next.js, Vue), CMS, CDN, 서버를 탐지합니다.

url

osint_ip_lookup

공용 IP 지리적 위치, ASN, ISP, 조직 정보를 제공합니다.

ip_or_host

osint_wayback_time_machine

과거 시점 이동 및 삭제된 웹페이지 스냅샷 스크레이퍼입니다.

url, timestamp, list_snapshots

osint_subdomain_enumeration

1초 이내 인증서 투명성(CT) 기반 서브도메인 검색.

domain, limit=50

osint_dns_audit

상세 DNS 레코드(IPv4, IPv6, MX) 인프라 감사.

domain


🧠 자율 AI 에이전트 플레이북

InfinityScrape에는 자율 AI 에이전트에게 다음 방법을 가르치는 고급 인지 추론 프레임워크(skills/infinity-scraper/SKILL.md) 가 포함되어 있습니다:

  • 사용자 프롬프트를 검색 및 위치 단서로 동적으로 분해합니다.

  • 도구 간 멀티 툴 체인(예: Search ➔ Filter ➔ Batch Scrape 또는 Geocode ➔ Locality Dork ➔ Profile Extraction)을 구성합니다.

  • 동적 React 단일 페이지 앱을 만나면 빠른 TLS에서 Playwright 헤드리스 브라우저로 자동 전환합니다.

👉 전체 에이전트 플레이북 읽기: skills/infinity-scraper/SKILL.md


💻 명령줄 인터페이스 (CLI)

터미널에서 InfinityScrape를 직접 사용할 수도 있습니다:

# Scrape a URL to Markdown
python -m infinity_scraper.cli scrape "https://example.com"

# Scrape dynamic SPA with infinite scroll
python -m infinity_scraper.cli scrape "https://news.ycombinator.com" --browser --scroll 3

# Live search and auto-scrape top results
python -m infinity_scraper.cli search "Quantum computing breakthroughs" --scrape --max 4

# Crawl documentation tree
python -m infinity_scraper.cli crawl "https://docs.python.org/3/library/asyncio.html" --pages 5 --depth 2

# Extract remote PDF
python -m infinity_scraper.cli pdf "https://example.com/report.pdf" --pages 10

🧪 자동화 테스트 실행

포괄적인 단위 및 통합 테스트 스위트를 실행하세요:

python -m tests.test_scraper

테스트 범위:

  • ✅ Fast TLS Impersonator

  • ✅ Playwright Dynamic Browser

  • ✅ DuckDuckGo Live Search

  • ✅ HTML Table to Markdown Converter

  • ✅ Recursive BFS Documentation Crawler

  • ✅ Zero-GPU YouTube Transcript Extraction

  • ✅ OSINT SSL, IP Intel & 25+ Platform Presence Check


📄 라이선스 & 저작권 보호

이 프로젝트는 MIT 라이선스(필수 저작자 표시 및 DMCA 집행 포함) 하에 라이선스가 부여됩니다.

[!IMPORTANT] 필수 저작자 표시 고지:

  • 이 프로젝트는 상업적 또는 개인적 용도로 자유롭게 사용, 수정, 통합할 수 있습니다.

  • 단, 모든 사본, 포크 또는 파생 배포본에는 원본 저작자 표시 및 저작권 고지가 반드시 보존되어야 합니다.

  • 저자의 이름/크레딧을 제거하고 본인 작업으로 GitHub에 재업로드/푸시하는 것은 엄격히 금지되며 저작권 침해에 해당합니다. 침해하는 저장소는 즉시 GitHub DMCA 테이크다운 및 저장소 삭제 및 법적 조치의 대상이 됩니다.

F
license - not found
Not graded
quality - not tested
C
maintenance

Maintenance

Maintainers
Response time
Release cycle
Releases (12mo)
Commit activity

Resources

Unclaimed servers have limited discoverability.

Looking for Admin?

If you are the server author, to access and configure the admin panel.

Related MCP Servers

  • A
    license
    Not graded
    quality
    A
    maintenance
    Enables AI agents to perform undetectable browser automation that bypasses Cloudflare, antibots, and social media blocks. Provides 105 tools for element extraction, network debugging, and real-world web scraping with a 98.7% success rate on protected sites.
    1,589
    MIT
  • A
    license
    Not graded
    quality
    D
    maintenance
    Enables undetectable web scraping and browser automation for AI agents with 84 tools including stealth navigation, element extraction, network interception, and auto cookie consent dismissal. Bypasses anti-bot systems like Cloudflare and DataDome while providing LLM-ready markdown output and full Chrome DevTools Protocol access.
    MIT
  • A
    license
    A
    quality
    A
    maintenance
    Direct access to 40+ scraping and search tools. Extract structured data from Google (Search, Maps, Trends), Amazon, Airbnb, Social Media, and any web page directly into your AI agent.
    2
    42
    4
    MIT

View all related MCP servers

Related MCP Connectors

  • Give your agent live data from Twitter, Reddit, the web and GitHub. No API keys, no scraping stack.

  • Reliable web access for AI agents: smart HTTP, rotating proxies, and full-browser rendering.

  • Enable language models to perform advanced AI-powered web scraping with enterprise-grade reliabili…

View all MCP Connectors

Latest Blog Posts

MCP directory API

We provide all the information about MCP servers via our MCP API.

curl -X GET 'https://glama.ai/api/mcp/v1/servers/virajverse/infinity-scraper'

If you have feedback or need assistance with the MCP directory API, please join our Discord server