Skip to main content
Glama
Santhosh-p653

Scrapling MCP Server

AWS Lightsail의 Scrapling MCP 서버

라이브 웹 콘텐츠를 LLM에 바로 사용할 수 있는 Markdown으로 변환하는 고성능 웹 추출 MCP 서버 — 한 번 배포하면 AI IDE, 에이전트, RAG 파이프라인, 자동화 워크플로우에 연결할 수 있습니다.

AWS MCP Python Docker Scrapling

개요

현대 AI 애플리케이션은 점점 더 신선하고 구조화된 외부 지식에 대한 접근이 필요해지고 있습니다. 모든 RAG 시스템이나 AI 에이전트 내부에서 웹 스크래핑을 개별적으로 구현하는 대신, 이 프로젝트는 Scrapling의 웹 추출 기능을 Model Context Protocol (MCP)을 통해 노출합니다.

배포가 완료되면 MCP 호환 AI 클라이언트는 서버에 연결하여 재사용 가능한 웹 데이터 수집 구성 요소로 사용할 수 있습니다.

┌──────────────────────┐
│   AI IDE / AI Agent   │
│ Claude / MCP Client   │
└──────────┬────────────┘
           │ MCP
           ▼
┌──────────────────────┐
│   Scrapling MCP       │
│      Server           │
└──────────┬────────────┘
           ▼
┌──────────────────────┐
│        Web            │
│  Dynamic / Static      │
│     Content            │
└──────────┬────────────┘
           ▼
┌──────────────────────┐
│      Markdown          │
│   LLM-ready Data       │
└──────────┬────────────┘
           ▼
┌─────────────────────────────────┐
│ RAG / Embeddings / Vector DB /   │
│ Knowledge Base / Agent Memory    │
└─────────────────────────────────┘

Related MCP server: Anybrowse

웹 추출에 MCP를 사용하는 이유

전통적으로 웹 데이터가 필요한 모든 AI 애플리케이션은 자체적으로 다음을 구현합니다:

  • HTTP 요청

  • HTML 파싱

  • 브라우저 자동화

  • 동적 페이지 처리

  • 추출 로직

  • 재시도 메커니즘

  • 콘텐츠 정규화

이는 중복된 인프라를 만듭니다. MCP를 사용하면 웹 추출이 공유 기능이 됩니다.

이전 — 여러 구현:

RAG App        ──────► Scraper
Agent          ──────► Scraper
Research Tool  ──────► Scraper
AI IDE         ──────► Scraper

이후 — 하나의 기능, 여러 클라이언트:

RAG App    ──┐
Agent      ──┼──► Scrapling MCP Server
AI IDE     ──┤
Research   ──┘

서버를 한 번 배포하고 MCP 호환 워크플로우 전반에 걸쳐 재사용하세요.

단순한 웹 스크래퍼가 아닌

이 프로젝트의 핵심 아이디어는 스크래핑보다 더 넓습니다. 많은 LLM 애플리케이션에서 외부 정보는 궁극적으로 파싱, 정리, 구조화, 청킹, 임베딩, 인덱싱, 검색이 가능한 표현이 되어야 합니다.

Markdown은 유용한 문서 계층 구조를 보존하기 때문에 이 파이프라인에서 특히 유용합니다:

Web Page → Scrapling → Markdown
                          ├── Heading
                          ├── Subheading
                          ├── Paragraph
                          ├── List
                          ├── Table
                          └── Links
                          │
                          ▼
                      Chunking → Embeddings → Vector Database → RAG / Agent

이로 인해 MCP 서버는 단순한 스크래핑 유틸리티가 아닌 LLM 데이터 삽입/수집 계층으로 유용합니다.

기능

  • MCP 호환 웹 추출

  • Scrapling 기반

  • AI 에이전트 및 AI IDE용으로 설계

  • Markdown 중심 출력

  • RAG 수집 파이프라인에 적합

  • Docker로 컨테이너화

  • AWS Lightsail에 배포 가능

  • 여러 AI 애플리케이션에서 재사용 가능

  • 데이터 획득을 AI 애플리케이션 자체와 분리

  • 에이전트 워크플로우에 통합 가능

아키텍처

                    Internet
                       │
                       ▼
                ┌───────────────┐
                │      Web       │
                └───────┬───────┘
                        ▼
              ┌───────────────────┐
              │     Scrapling      │
              │  Extraction Layer  │
              └─────────┬─────────┘
                        ▼
              ┌───────────────────┐
              │    MCP Server      │
              │   Tool Interface   │
              └─────────┬─────────┘
                        │
                   MCP Protocol
                        │
          ┌─────────────┼─────────────┐
          ▼             ▼             ▼
       AI IDE         Agent          RAG
          │             │             │
          └─────────────┼─────────────┘
                        ▼
                Markdown / Data
                        ▼
              ┌────────────────────┐
              │ LLM Data Pipeline   │
              └──────────┬─────────┘
                        ▼
              ┌────────────────────┐
              │  Embeddings / DB    │
              └──────────┬─────────┘
                        ▼
                     LLM / RAG

기술 스택

구성 요소

기술

웹 추출

Scrapling

프로토콜

Model Context Protocol (MCP)

언어

Python

컨테이너화

Docker

클라우드

AWS Lightsail

CI/CD

GitHub Actions

출력

Markdown / 구조화된 콘텐츠

AI 통합

MCP 호환 클라이언트

프로젝트 구조

.
├── src/
│   └── ...
├── Dockerfile
├── requirements.txt
├── .dockerignore
├── .gitignore
├── docker-compose.yml
└── README.md

저장소가 다른 소스 레이아웃을 사용하는 경우 위 구조를 조정하세요.

로컬에서 실행

1. 저장소 클론

git clone https://github.com/Santhosh-p653/aws-mcp-test.git
cd aws-mcp-test

2. 의존성 설치

가상 환경을 생성하고 활성화합니다:

python -m venv .venv

# Linux / macOS
source .venv/bin/activate

# Windows
.venv\Scripts\activate

의존성을 설치합니다:

pip install -r requirements.txt

Docker로 실행

이미지를 빌드합니다:

docker build -t scrapling-mcp .

컨테이너를 실행합니다:

docker run -d \
  --name scrapling-mcp \
  -p 8000:8000 \
  scrapling-mcp

컨테이너가 실행 중인지 확인합니다:

docker ps

AWS Lightsail에 배포

이 프로젝트는 AWS Lightsail에서 컨테이너화된 서비스로 실행되도록 설계되었습니다.

대략적인 배포 흐름:

GitHub → Push → GitHub Actions → Build → Docker Image → Deploy → AWS Lightsail
                                                                      │
                                                                      ▼
                                                          Scrapling MCP Server
                                                                      │
                                                                      ▼
                                                      MCP-Compatible AI Clients

배포 단계

  1. AWS Lightsail 컨테이너 서비스 생성 — AWS 콘솔 또는 AWS CLI에서 생성합니다.

  2. Docker 이미지 빌드

    docker build -t scrapling-mcp .
  3. 컨테이너 푸시/배포 — CI/CD 워크플로우에서 생성된 이미지를 사용하여 Lightsail 컨테이너 배포를 구성합니다.

  4. 환경 변수 구성 — 자격 증명과 배포 구성은 저장소 외부에 유지합니다:

    AWS_REGION=
    LIGHTSAIL_SERVICE=
    CONTAINER_NAME=

⚠️ 비밀번호나 자격 증명을 Git에 커밋하지 마세요.

GitHub Actions

저장소는 GitHub Actions를 사용하여 배포를 자동화할 수 있습니다:

git push → GitHub Actions
             ├── Checkout
             ├── Configure AWS credentials
             ├── Build container
             ├── Push/deploy
             └── Update Lightsail

배포는 간단한 워크플로우를 따릅니다:

git add .
git commit -m "update scraper"
git push origin main

워크플로우가 완료되면 업데이트된 MCP 서버가 배포됩니다.

MCP 서버 사용

서버가 배포되면 MCP 엔드포인트를 MCP 호환 AI 클라이언트에 연결합니다:

AI Client → MCP → https://your-mcp-server.example.com → Scrapling → Web Content

AI 클라이언트는 워크플로우의 일부로 노출된 도구를 호출할 수 있습니다 — 서버는 AI 애플리케이션용 플러그인처럼 동작하여 모든 프로젝트의 맞춤형 스크래핑 코드를 대체합니다:

AI Application
      ├── RAG
      ├── Agents
      ├── Research
      └── Automation
             │
             ▼
        MCP Server → Scrapling

RAG 통합

일반적인 RAG 파이프라인은 이 서버를 수집 계층으로 사용할 수 있습니다:

Web Sources → Scrapling MCP → Markdown → Document Parser → Chunking
    → Embeddings → Vector Store → Retriever → LLM

가능한 다운스트림 구성 요소는 다음과 같습니다:

  • Qdrant

  • PostgreSQL + pgvector

  • Elasticsearch

  • OpenSearch

  • Chroma

  • FAISS

  • 맞춤형 지식 저장소

MCP 서버는 다운스트림 저장소 계층과 독립적으로 유지됩니다.

에이전트 워크플로우

서버는 AI 에이전트가 사용할 수 있는 도구가 될 수도 있습니다:

User → AI Agent
         ├── Decide what information is required
         ├── Call Scrapling MCP
         ├── Extract relevant content
         ├── Transform/use Markdown
         ├── Store information
         └── Generate final response

이를 통해 에이전트는 정적 학습 데이터나 이전에 인덱싱된 문서에만 의존하지 않고 동적으로 정보를 획득할 수 있습니다.

왜 Markdown인가?

Markdown은 의미 구조를 보존하기 때문에 LLM 파이프라인에 유용한 중간 표현을 제공합니다.

Markdown:

# AWS Lambda

## Overview
AWS Lambda is a serverless compute service.

## Features
- Event-driven execution
- Automatic scaling
- Pay-per-use pricing

## Architecture
### Invocation
Lambda functions can be invoked through multiple AWS services.

원시 HTML과 비교:

<div>
    <h1>AWS Lambda</h1>
    <div>
        <h2>Overview</h2>
        ...
    </div>
</div>

Markdown은 일반적으로 검사, 정리, 청킹, 처리, 저장, LLM 파이프라인 전달이 더 쉽습니다.

따라서 목표는 단순히 "웹페이지를 스크래핑"하는 것이 아니라 LLM 데이터 파이프라인에 자연스럽게 들어갈 수 있는 형태로 외부 지식을 획득하는 것입니다.

사용 사례

사용 사례

설명

RAG 시스템

인덱싱 전에 신선한 웹 정보를 자동으로 획득합니다.

AI 리서치 에이전트

에이전트가 라이브 웹사이트에서 정보를 검색하고 분석할 수 있게 합니다.

지식 베이스

지속적으로 업데이트되는 지식 저장소를 구축합니다.

AI IDE

MCP를 통해 코딩 어시스턴트에 외부 웹 추출 기능을 제공합니다.

문서 수집

온라인 문서를 다운스트림 처리에 적합한 Markdown으로 변환합니다.

에이전트 자동화

자율 워크플로우에서 웹 추출을 여러 도구 중 하나로 사용합니다.

성능 중심 설계

아키텍처는 웹 획득 계층을 AI 애플리케이션과 분리합니다.

모든 AI 애플리케이션이 맞춤형 스크래퍼를 유지하는 대신, 접근 방식은 다음과 같습니다:

                ┌───────────────┐
                │ Scrapling MCP  │
                └───────┬───────┘
                        │
          ┌─────────────┼─────────────┐
          ▼             ▼             ▼
        RAG          Agent          AI IDE

이를 통해 스크래핑 인프라를 한 번 배포하고 여러 워크플로우에서 재사용할 수 있습니다.

보안 고려 사항

서버를 공개적으로 배포할 때:

  • 컨테이너에 AWS 자격 증명을 노출하지 마세요

  • 프로덕션에서 HTTPS를 사용하세요

  • 적절한 경우 네트워크 접근을 제한하세요

  • 요청된 URL을 검증하세요

  • 필요한 경우 속도 제한을 적용하세요

  • 리소스 사용량을 모니터링하세요

  • 웹사이트의 이용 약관이나 관련 법률을 위반하는 스크래핑을 피하세요

  • 비밀번호는 환경 변수나 전용 비밀 관리자에 보관하세요

프로덕션 권장 사항

프로덕션 배포를 위해 다음을 추가하는 것을 고려하세요:

  • 인증

  • API/MCP 접근 제어

  • HTTPS

  • 속도 제한

  • 요청 로깅

  • 관찰 가능성

  • 재시도 정책

  • 캐싱

  • URL 허용 목록

  • 리소스 제한

  • 상태 확인

  • 모니터링 및 알림

향후 개선 사항

  • MCP 클라이언트 인증

  • URL/도메인 허용 목록

  • 콘텐츠 캐싱

  • 분산 크롤링

  • 큐 기반 수집

  • 자동 문서 청킹

  • 벡터 데이터베이스 직접 통합

  • S3 기반 문서 저장

  • 크롤링 스케줄링

  • 관찰 가능성 대시보드

  • 다중 사용자 접근 제어

엔드투엔드 워크플로우 예시

User / Agent → MCP-Compatible IDE → Scrapling MCP Server → Website
    → Markdown → Document Processing → Chunking → Embeddings
    → Vector DB → Retriever → LLM → Final Response

저장소

GitHub: github.com/Santhosh-p653/aws-mcp-test

기술 문서

이 프로젝트의 아키텍처, 배포, 동기는 AWS Builder Center에 문서화되어 있습니다:

Scrapling, MCP, AWS Lightsail을 사용한 에이전트 AI 고속 웹 스크래핑 강화

기여

기여, 아이디어, 개선, 실험을 환영합니다. 이 MCP 서버를 사용하여 무언가를 구축했다면 이슈나 풀 리퀘스트를 열어 워크플로우를 공유해 주세요.

저자

Santhosh P

다음 분야의 시스템 구축:

  • AI 에이전트

  • RAG

  • MCP

  • 클라우드 인프라

  • 웹 데이터 파이프라인

  • AI/ML

GitHub: @Santhosh-p653


핵심 아이디어: 스크래핑 기능을 한 번 배포하세요. 신선하고 구조화된 웹 데이터가 필요할 때마다 AI 워크플로우에 연결하세요.

Scrapling + MCP는 웹 추출을 현대 LLM 스택을 위한 재사용 가능한 인프라 구성 요소로 만듭니다.

F
license - not found
Not graded
quality - not tested
B
maintenance

Maintenance

Maintainers
Response time
Release cycle
Releases (12mo)
Commit activity

Resources

Unclaimed servers have limited discoverability.

Looking for Admin?

If you are the server author, to access and configure the admin panel.

Related MCP Servers

  • A
    license
    Not graded
    quality
    Not graded
    maintenance
    An MCP server that extracts clean, structured Markdown content from web page URLs using the WebforAI library. It simplifies feeding web content into AI models by removing HTML noise and intelligently processing tables and links.
  • A
    license
    A
    quality
    C
    maintenance
    MCP-native web scraping and search API for AI agents. Converts any URL to clean Markdown with 90% success rate, including Cloudflare-protected sites and JS SPAs. Real-time web search via Brave Search API. CAPTCHA solving built-in. 10 free scrapes/day.
    5
    8
    4
    MIT
  • A
    license
    Not graded
    quality
    C
    maintenance
    MCP server for AI agents -- fetch any URL with full JavaScript rendering (Playwright/Chromium) and convert to clean, token-efficient markdown. Works on React, Vue, Angular, and any JS-heavy page. Includes web search, batch fetching, binary file download, LRU cache, SSRF protection, and structured output.
    13
    MIT

View all related MCP servers

Related MCP Connectors

  • Web scraping for AI agents. Converts URLs to clean, LLM-ready Markdown with anti-bot bypass.

  • Jina AI Reader/Search MCP — turn any URL into clean LLM-ready markdown, plus web search.

  • Converts any URL to clean, LLM-ready Markdown using real Chrome browsers

View all MCP Connectors

Latest Blog Posts

MCP directory API

We provide all the information about MCP servers via our MCP API.

curl -X GET 'https://glama.ai/api/mcp/v1/servers/Santhosh-p653/aws-mcp-test'

If you have feedback or need assistance with the MCP directory API, please join our Discord server