Scrapling MCP Server
AWS Lightsail의 Scrapling MCP 서버
라이브 웹 콘텐츠를 LLM에 바로 사용할 수 있는 Markdown으로 변환하는 고성능 웹 추출 MCP 서버 — 한 번 배포하면 AI IDE, 에이전트, RAG 파이프라인, 자동화 워크플로우에 연결할 수 있습니다.
개요
현대 AI 애플리케이션은 점점 더 신선하고 구조화된 외부 지식에 대한 접근이 필요해지고 있습니다. 모든 RAG 시스템이나 AI 에이전트 내부에서 웹 스크래핑을 개별적으로 구현하는 대신, 이 프로젝트는 Scrapling의 웹 추출 기능을 Model Context Protocol (MCP)을 통해 노출합니다.
배포가 완료되면 MCP 호환 AI 클라이언트는 서버에 연결하여 재사용 가능한 웹 데이터 수집 구성 요소로 사용할 수 있습니다.
┌──────────────────────┐
│ AI IDE / AI Agent │
│ Claude / MCP Client │
└──────────┬────────────┘
│ MCP
▼
┌──────────────────────┐
│ Scrapling MCP │
│ Server │
└──────────┬────────────┘
▼
┌──────────────────────┐
│ Web │
│ Dynamic / Static │
│ Content │
└──────────┬────────────┘
▼
┌──────────────────────┐
│ Markdown │
│ LLM-ready Data │
└──────────┬────────────┘
▼
┌─────────────────────────────────┐
│ RAG / Embeddings / Vector DB / │
│ Knowledge Base / Agent Memory │
└─────────────────────────────────┘Related MCP server: Anybrowse
웹 추출에 MCP를 사용하는 이유
전통적으로 웹 데이터가 필요한 모든 AI 애플리케이션은 자체적으로 다음을 구현합니다:
HTTP 요청
HTML 파싱
브라우저 자동화
동적 페이지 처리
추출 로직
재시도 메커니즘
콘텐츠 정규화
이는 중복된 인프라를 만듭니다. MCP를 사용하면 웹 추출이 공유 기능이 됩니다.
이전 — 여러 구현:
RAG App ──────► Scraper
Agent ──────► Scraper
Research Tool ──────► Scraper
AI IDE ──────► Scraper이후 — 하나의 기능, 여러 클라이언트:
RAG App ──┐
Agent ──┼──► Scrapling MCP Server
AI IDE ──┤
Research ──┘서버를 한 번 배포하고 MCP 호환 워크플로우 전반에 걸쳐 재사용하세요.
단순한 웹 스크래퍼가 아닌
이 프로젝트의 핵심 아이디어는 스크래핑보다 더 넓습니다. 많은 LLM 애플리케이션에서 외부 정보는 궁극적으로 파싱, 정리, 구조화, 청킹, 임베딩, 인덱싱, 검색이 가능한 표현이 되어야 합니다.
Markdown은 유용한 문서 계층 구조를 보존하기 때문에 이 파이프라인에서 특히 유용합니다:
Web Page → Scrapling → Markdown
├── Heading
├── Subheading
├── Paragraph
├── List
├── Table
└── Links
│
▼
Chunking → Embeddings → Vector Database → RAG / Agent이로 인해 MCP 서버는 단순한 스크래핑 유틸리티가 아닌 LLM 데이터 삽입/수집 계층으로 유용합니다.
기능
MCP 호환 웹 추출
Scrapling 기반
AI 에이전트 및 AI IDE용으로 설계
Markdown 중심 출력
RAG 수집 파이프라인에 적합
Docker로 컨테이너화
AWS Lightsail에 배포 가능
여러 AI 애플리케이션에서 재사용 가능
데이터 획득을 AI 애플리케이션 자체와 분리
에이전트 워크플로우에 통합 가능
아키텍처
Internet
│
▼
┌───────────────┐
│ Web │
└───────┬───────┘
▼
┌───────────────────┐
│ Scrapling │
│ Extraction Layer │
└─────────┬─────────┘
▼
┌───────────────────┐
│ MCP Server │
│ Tool Interface │
└─────────┬─────────┘
│
MCP Protocol
│
┌─────────────┼─────────────┐
▼ ▼ ▼
AI IDE Agent RAG
│ │ │
└─────────────┼─────────────┘
▼
Markdown / Data
▼
┌────────────────────┐
│ LLM Data Pipeline │
└──────────┬─────────┘
▼
┌────────────────────┐
│ Embeddings / DB │
└──────────┬─────────┘
▼
LLM / RAG기술 스택
구성 요소 | 기술 |
웹 추출 | Scrapling |
프로토콜 | Model Context Protocol (MCP) |
언어 | Python |
컨테이너화 | Docker |
클라우드 | AWS Lightsail |
CI/CD | GitHub Actions |
출력 | Markdown / 구조화된 콘텐츠 |
AI 통합 | MCP 호환 클라이언트 |
프로젝트 구조
.
├── src/
│ └── ...
├── Dockerfile
├── requirements.txt
├── .dockerignore
├── .gitignore
├── docker-compose.yml
└── README.md저장소가 다른 소스 레이아웃을 사용하는 경우 위 구조를 조정하세요.
로컬에서 실행
1. 저장소 클론
git clone https://github.com/Santhosh-p653/aws-mcp-test.git
cd aws-mcp-test2. 의존성 설치
가상 환경을 생성하고 활성화합니다:
python -m venv .venv
# Linux / macOS
source .venv/bin/activate
# Windows
.venv\Scripts\activate의존성을 설치합니다:
pip install -r requirements.txtDocker로 실행
이미지를 빌드합니다:
docker build -t scrapling-mcp .컨테이너를 실행합니다:
docker run -d \
--name scrapling-mcp \
-p 8000:8000 \
scrapling-mcp컨테이너가 실행 중인지 확인합니다:
docker psAWS Lightsail에 배포
이 프로젝트는 AWS Lightsail에서 컨테이너화된 서비스로 실행되도록 설계되었습니다.
대략적인 배포 흐름:
GitHub → Push → GitHub Actions → Build → Docker Image → Deploy → AWS Lightsail
│
▼
Scrapling MCP Server
│
▼
MCP-Compatible AI Clients배포 단계
AWS Lightsail 컨테이너 서비스 생성 — AWS 콘솔 또는 AWS CLI에서 생성합니다.
Docker 이미지 빌드
docker build -t scrapling-mcp .컨테이너 푸시/배포 — CI/CD 워크플로우에서 생성된 이미지를 사용하여 Lightsail 컨테이너 배포를 구성합니다.
환경 변수 구성 — 자격 증명과 배포 구성은 저장소 외부에 유지합니다:
AWS_REGION= LIGHTSAIL_SERVICE= CONTAINER_NAME=
⚠️ 비밀번호나 자격 증명을 Git에 커밋하지 마세요.
GitHub Actions
저장소는 GitHub Actions를 사용하여 배포를 자동화할 수 있습니다:
git push → GitHub Actions
├── Checkout
├── Configure AWS credentials
├── Build container
├── Push/deploy
└── Update Lightsail배포는 간단한 워크플로우를 따릅니다:
git add .
git commit -m "update scraper"
git push origin main워크플로우가 완료되면 업데이트된 MCP 서버가 배포됩니다.
MCP 서버 사용
서버가 배포되면 MCP 엔드포인트를 MCP 호환 AI 클라이언트에 연결합니다:
AI Client → MCP → https://your-mcp-server.example.com → Scrapling → Web ContentAI 클라이언트는 워크플로우의 일부로 노출된 도구를 호출할 수 있습니다 — 서버는 AI 애플리케이션용 플러그인처럼 동작하여 모든 프로젝트의 맞춤형 스크래핑 코드를 대체합니다:
AI Application
├── RAG
├── Agents
├── Research
└── Automation
│
▼
MCP Server → ScraplingRAG 통합
일반적인 RAG 파이프라인은 이 서버를 수집 계층으로 사용할 수 있습니다:
Web Sources → Scrapling MCP → Markdown → Document Parser → Chunking
→ Embeddings → Vector Store → Retriever → LLM가능한 다운스트림 구성 요소는 다음과 같습니다:
Qdrant
PostgreSQL + pgvector
Elasticsearch
OpenSearch
Chroma
FAISS
맞춤형 지식 저장소
MCP 서버는 다운스트림 저장소 계층과 독립적으로 유지됩니다.
에이전트 워크플로우
서버는 AI 에이전트가 사용할 수 있는 도구가 될 수도 있습니다:
User → AI Agent
├── Decide what information is required
├── Call Scrapling MCP
├── Extract relevant content
├── Transform/use Markdown
├── Store information
└── Generate final response이를 통해 에이전트는 정적 학습 데이터나 이전에 인덱싱된 문서에만 의존하지 않고 동적으로 정보를 획득할 수 있습니다.
왜 Markdown인가?
Markdown은 의미 구조를 보존하기 때문에 LLM 파이프라인에 유용한 중간 표현을 제공합니다.
Markdown:
# AWS Lambda
## Overview
AWS Lambda is a serverless compute service.
## Features
- Event-driven execution
- Automatic scaling
- Pay-per-use pricing
## Architecture
### Invocation
Lambda functions can be invoked through multiple AWS services.원시 HTML과 비교:
<div>
<h1>AWS Lambda</h1>
<div>
<h2>Overview</h2>
...
</div>
</div>Markdown은 일반적으로 검사, 정리, 청킹, 처리, 저장, LLM 파이프라인 전달이 더 쉽습니다.
따라서 목표는 단순히 "웹페이지를 스크래핑"하는 것이 아니라 LLM 데이터 파이프라인에 자연스럽게 들어갈 수 있는 형태로 외부 지식을 획득하는 것입니다.
사용 사례
사용 사례 | 설명 |
RAG 시스템 | 인덱싱 전에 신선한 웹 정보를 자동으로 획득합니다. |
AI 리서치 에이전트 | 에이전트가 라이브 웹사이트에서 정보를 검색하고 분석할 수 있게 합니다. |
지식 베이스 | 지속적으로 업데이트되는 지식 저장소를 구축합니다. |
AI IDE | MCP를 통해 코딩 어시스턴트에 외부 웹 추출 기능을 제공합니다. |
문서 수집 | 온라인 문서를 다운스트림 처리에 적합한 Markdown으로 변환합니다. |
에이전트 자동화 | 자율 워크플로우에서 웹 추출을 여러 도구 중 하나로 사용합니다. |
성능 중심 설계
아키텍처는 웹 획득 계층을 AI 애플리케이션과 분리합니다.
모든 AI 애플리케이션이 맞춤형 스크래퍼를 유지하는 대신, 접근 방식은 다음과 같습니다:
┌───────────────┐
│ Scrapling MCP │
└───────┬───────┘
│
┌─────────────┼─────────────┐
▼ ▼ ▼
RAG Agent AI IDE이를 통해 스크래핑 인프라를 한 번 배포하고 여러 워크플로우에서 재사용할 수 있습니다.
보안 고려 사항
서버를 공개적으로 배포할 때:
컨테이너에 AWS 자격 증명을 노출하지 마세요
프로덕션에서 HTTPS를 사용하세요
적절한 경우 네트워크 접근을 제한하세요
요청된 URL을 검증하세요
필요한 경우 속도 제한을 적용하세요
리소스 사용량을 모니터링하세요
웹사이트의 이용 약관이나 관련 법률을 위반하는 스크래핑을 피하세요
비밀번호는 환경 변수나 전용 비밀 관리자에 보관하세요
프로덕션 권장 사항
프로덕션 배포를 위해 다음을 추가하는 것을 고려하세요:
인증
API/MCP 접근 제어
HTTPS
속도 제한
요청 로깅
관찰 가능성
재시도 정책
캐싱
URL 허용 목록
리소스 제한
상태 확인
모니터링 및 알림
향후 개선 사항
MCP 클라이언트 인증
URL/도메인 허용 목록
콘텐츠 캐싱
분산 크롤링
큐 기반 수집
자동 문서 청킹
벡터 데이터베이스 직접 통합
S3 기반 문서 저장
크롤링 스케줄링
관찰 가능성 대시보드
다중 사용자 접근 제어
엔드투엔드 워크플로우 예시
User / Agent → MCP-Compatible IDE → Scrapling MCP Server → Website
→ Markdown → Document Processing → Chunking → Embeddings
→ Vector DB → Retriever → LLM → Final Response저장소
GitHub: github.com/Santhosh-p653/aws-mcp-test
기술 문서
이 프로젝트의 아키텍처, 배포, 동기는 AWS Builder Center에 문서화되어 있습니다:
Scrapling, MCP, AWS Lightsail을 사용한 에이전트 AI 고속 웹 스크래핑 강화
기여
기여, 아이디어, 개선, 실험을 환영합니다. 이 MCP 서버를 사용하여 무언가를 구축했다면 이슈나 풀 리퀘스트를 열어 워크플로우를 공유해 주세요.
저자
Santhosh P
다음 분야의 시스템 구축:
AI 에이전트
RAG
MCP
클라우드 인프라
웹 데이터 파이프라인
AI/ML
GitHub: @Santhosh-p653
핵심 아이디어: 스크래핑 기능을 한 번 배포하세요. 신선하고 구조화된 웹 데이터가 필요할 때마다 AI 워크플로우에 연결하세요.
Scrapling + MCP는 웹 추출을 현대 LLM 스택을 위한 재사용 가능한 인프라 구성 요소로 만듭니다.
This server cannot be installed
Maintenance
Resources
Unclaimed servers have limited discoverability.
Looking for Admin?
If you are the server author, to access and configure the admin panel.
Related MCP Servers
- AlicenseNot gradedqualityNot gradedmaintenanceAn MCP server that extracts clean, structured Markdown content from web page URLs using the WebforAI library. It simplifies feeding web content into AI models by removing HTML noise and intelligently processing tables and links.
- AlicenseAqualityCmaintenanceMCP-native web scraping and search API for AI agents. Converts any URL to clean Markdown with 90% success rate, including Cloudflare-protected sites and JS SPAs. Real-time web search via Brave Search API. CAPTCHA solving built-in. 10 free scrapes/day.584MIT
- AlicenseNot gradedqualityCmaintenanceMCP server for AI agents -- fetch any URL with full JavaScript rendering (Playwright/Chromium) and convert to clean, token-efficient markdown. Works on React, Vue, Angular, and any JS-heavy page. Includes web search, batch fetching, binary file download, LRU cache, SSRF protection, and structured output.13MIT
- AlicenseAqualityDmaintenanceConverts URLs and raw HTML to clean Markdown, enabling AI assistants to read web pages for summarization, analysis, or ingestion.2171MIT
Related MCP Connectors
Web scraping for AI agents. Converts URLs to clean, LLM-ready Markdown with anti-bot bypass.
Jina AI Reader/Search MCP — turn any URL into clean LLM-ready markdown, plus web search.
Converts any URL to clean, LLM-ready Markdown using real Chrome browsers
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/Santhosh-p653/aws-mcp-test'
If you have feedback or need assistance with the MCP directory API, please join our Discord server