Scrapling MCP Server
Scrapling MCP Server auf AWS Lightsail
Ein leistungsstarker MCP-Server für Web-Extraktion, der Live-Webinhalte in LLM-fähiges Markdown verwandelt – einmal bereitstellen, dann in Ihre KI-IDEs, Agenten, RAG-Pipelines und Automatisierungsworkflows einbinden.
Überblick
Moderne KI-Anwendungen benötigen zunehmend Zugriff auf aktuelle, strukturierte, externe Informationen. Anstatt Web-Scraping separat in jedem RAG-System oder KI-Agenten zu implementieren, stellt dieses Projekt die Web-Extraktionsfunktionen von Scrapling über das Model Context Protocol (MCP) bereit.
Nach der Bereitstellung kann jeder MCP-kompatible KI-Client eine Verbindung zum Server herstellen und ihn als wiederverwendbare Komponente für die Web-Datenerfassung nutzen.
┌──────────────────────┐
│ AI IDE / AI Agent │
│ Claude / MCP Client │
└──────────┬────────────┘
│ MCP
▼
┌──────────────────────┐
│ Scrapling MCP │
│ Server │
└──────────┬────────────┘
▼
┌──────────────────────┐
│ Web │
│ Dynamic / Static │
│ Content │
└──────────┬────────────┘
▼
┌──────────────────────┐
│ Markdown │
│ LLM-ready Data │
└──────────┬────────────┘
▼
┌─────────────────────────────────┐
│ RAG / Embeddings / Vector DB / │
│ Knowledge Base / Agent Memory │
└─────────────────────────────────┘Related MCP server: Anybrowse
Warum MCP für Web-Extraktion?
Traditionell implementiert jede KI-Anwendung, die Webdaten benötigt, ihre eigene:
HTTP-Anfragen
HTML-Parsing
Browser-Automatisierung
Verarbeitung dynamischer Seiten
Extraktionslogik
Wiederholungsmechanismen
Inhaltsnormalisierung
Das erzeugt doppelte Infrastruktur. Mit MCP wird Web-Extraktion zu einer gemeinsamen Fähigkeit.
Vorher – mehrere Implementierungen:
RAG App ──────► Scraper
Agent ──────► Scraper
Research Tool ──────► Scraper
AI IDE ──────► ScraperNachher – eine Fähigkeit, mehrere Clients:
RAG App ──┐
Agent ──┼──► Scrapling MCP Server
AI IDE ──┤
Research ──┘Stellen Sie den Server einmal bereit und nutzen Sie ihn in allen MCP-kompatiblen Workflows.
Mehr als nur ein Web-Scraper
Die Kernidee hinter diesem Projekt geht über das Scraping hinaus. Für viele LLM-Anwendungen müssen externe Informationen letztendlich in eine Darstellung überführt werden, die geparst, bereinigt, strukturiert, in Chunks aufgeteilt, eingebettet, indiziert und abgerufen werden kann.
Markdown ist in dieser Pipeline besonders nützlich, weil es eine nützliche Dokumenthierarchie bewahrt:
Web Page → Scrapling → Markdown
├── Heading
├── Subheading
├── Paragraph
├── List
├── Table
└── Links
│
▼
Chunking → Embeddings → Vector Database → RAG / AgentDamit ist der MCP-Server als LLM-Dateneinfüge-/Erfassungsschicht nützlich und nicht nur als Scraping-Dienstprogramm.
Funktionen
MCP-kompatible Web-Extraktion
Unterstützt durch Scrapling
Entwickelt für KI-Agenten und KI-IDEs
Markdown-orientierte Ausgabe
Geeignet für RAG-Erfassungspipelines
Mit Docker containerisiert
Auf AWS Lightsail bereitstellbar
Wiederverwendbar über mehrere KI-Anwendungen hinweg
Trennt die Datenerfassung von der KI-Anwendung selbst
Kann in agentische Workflows integriert werden
Architektur
Internet
│
▼
┌───────────────┐
│ Web │
└───────┬───────┘
▼
┌───────────────────┐
│ Scrapling │
│ Extraction Layer │
└─────────┬─────────┘
▼
┌───────────────────┐
│ MCP Server │
│ Tool Interface │
└─────────┬─────────┘
│
MCP Protocol
│
┌─────────────┼─────────────┐
▼ ▼ ▼
AI IDE Agent RAG
│ │ │
└─────────────┼─────────────┘
▼
Markdown / Data
▼
┌────────────────────┐
│ LLM Data Pipeline │
└──────────┬─────────┘
▼
┌────────────────────┐
│ Embeddings / DB │
└──────────┬─────────┘
▼
LLM / RAGTechnologie-Stack
Komponente | Technologie |
Web-Extraktion | Scrapling |
Protokoll | Model Context Protocol (MCP) |
Sprache | Python |
Containerisierung | Docker |
Cloud | AWS Lightsail |
CI/CD | GitHub Actions |
Ausgabe | Markdown / Strukturierte Inhalte |
KI-Integration | MCP-kompatible Clients |
Projektstruktur
.
├── src/
│ └── ...
├── Dockerfile
├── requirements.txt
├── .dockerignore
├── .gitignore
├── docker-compose.yml
└── README.mdPassen Sie die obige Struktur an, falls Ihr Repository ein anderes Quellverzeichnis verwendet.
Lokal ausführen
1. Repository klonen
git clone https://github.com/Santhosh-p653/aws-mcp-test.git
cd aws-mcp-test2. Abhängigkeiten installieren
Erstellen und aktivieren Sie eine virtuelle Umgebung:
python -m venv .venv
# Linux / macOS
source .venv/bin/activate
# Windows
.venv\Scripts\activateAbhängigkeiten installieren:
pip install -r requirements.txtMit Docker ausführen
Image erstellen:
docker build -t scrapling-mcp .Container ausführen:
docker run -d \
--name scrapling-mcp \
-p 8000:8000 \
scrapling-mcpÜberprüfen, dass der Container läuft:
docker psAuf AWS Lightsail bereitstellen
Das Projekt ist dafür ausgelegt, als containerisierter Dienst auf AWS Lightsail zu laufen.
Bereitstellungsablauf auf hoher Ebene:
GitHub → Push → GitHub Actions → Build → Docker Image → Deploy → AWS Lightsail
│
▼
Scrapling MCP Server
│
▼
MCP-Compatible AI ClientsBereitstellungsschritte
AWS Lightsail Container-Service erstellen – über die AWS-Konsole oder die AWS CLI.
Docker-Image erstellen
docker build -t scrapling-mcp .Container pushen/bereitstellen – die Lightsail-Container-Bereitstellung mit dem von Ihrem CI/CD-Workflow erzeugten Image konfigurieren.
Umgebungsvariablen konfigurieren – Anmeldeinformationen und Bereitstellungskonfiguration außerhalb des Repositorys aufbewahren:
AWS_REGION= LIGHTSAIL_SERVICE= CONTAINER_NAME=
⚠️ Committen Sie niemals Geheimnisse oder Anmeldeinformationen in Git.
GitHub Actions
Das Repository kann GitHub Actions zur Automatisierung der Bereitstellung nutzen:
git push → GitHub Actions
├── Checkout
├── Configure AWS credentials
├── Build container
├── Push/deploy
└── Update LightsailDie Bereitstellung folgt dann einem einfachen Workflow:
git add .
git commit -m "update scraper"
git push origin mainNach Abschluss des Workflows ist der aktualisierte MCP-Server bereitgestellt.
Verwenden des MCP-Servers
Sobald der Server bereitgestellt ist, verbinden Sie seinen MCP-Endpunkt mit einem MCP-kompatiblen KI-Client:
AI Client → MCP → https://your-mcp-server.example.com → Scrapling → Web ContentDer KI-Client kann dann die bereitgestellten Tools als Teil seines Workflows aufrufen – der Server verhält sich wie ein Plugin für KI-Anwendungen und ersetzt benutzerdefinierten Scraping-Code in jedem Projekt:
AI Application
├── RAG
├── Agents
├── Research
└── Automation
│
▼
MCP Server → ScraplingRAG-Integration
Eine typische RAG-Pipeline kann diesen Server als Erfassungsschicht verwenden:
Web Sources → Scrapling MCP → Markdown → Document Parser → Chunking
→ Embeddings → Vector Store → Retriever → LLMMögliche nachgelagerte Komponenten sind:
Qdrant
PostgreSQL + pgvector
Elasticsearch
OpenSearch
Chroma
FAISS
Benutzerdefinierte Wissensspeicher
Der MCP-Server bleibt unabhängig von der nachgelagerten Speicherschicht.
Agentischer Workflow
Der Server kann auch als Tool für einen KI-Agenten verfügbar gemacht werden:
User → AI Agent
├── Decide what information is required
├── Call Scrapling MCP
├── Extract relevant content
├── Transform/use Markdown
├── Store information
└── Generate final responseDies ermöglicht dem Agenten, Informationen dynamisch zu beschaffen, anstatt sich nur auf statische Trainingsdaten oder zuvor indizierte Dokumente zu verlassen.
Warum Markdown?
Markdown bietet eine nützliche Zwischendarstellung für LLM-Pipelines, weil es die semantische Struktur erhält.
Markdown:
# AWS Lambda
## Overview
AWS Lambda is a serverless compute service.
## Features
- Event-driven execution
- Automatic scaling
- Pay-per-use pricing
## Architecture
### Invocation
Lambda functions can be invoked through multiple AWS services.Im Vergleich zu rohem HTML:
<div>
<h1>AWS Lambda</h1>
<div>
<h2>Overview</h2>
...
</div>
</div>Markdown ist im Allgemeinen einfacher zu prüfen, zu bereinigen, in Chunks zu teilen, zu verarbeiten, zu speichern und an LLM-Pipelines weiterzugeben.
Das Ziel ist daher nicht einfach, "eine Webseite zu scrapen" – es geht darum, externes Wissen in einer Form zu erwerben, die natürlich in eine LLM-Datenpipeline eingehen kann.
Anwendungsfälle
Anwendungsfall | Beschreibung |
RAG-Systeme | Automatisch frische Webinformationen erfassen, bevor sie indiziert werden. |
KI-Recherche-Agenten | Agenten ermöglichen, Informationen von Live-Websites abzurufen und zu analysieren. |
Wissensdatenbanken | Kontinuierlich aktualisierte Wissensrepositorys aufbauen. |
KI-IDEs | Coding-Assistenten eine externe Web-Extraktionsfähigkeit über MCP geben. |
Dokumentationserfassung | Online-Dokumentation in Markdown konvertieren, das für die Weiterverarbeitung geeignet ist. |
Agentische Automatisierung | Web-Extraktion als eines von vielen Tools in einem autonomen Workflow nutzen. |
Leistungsorientiertes Design
Die Architektur trennt die Web-Erfassungsschicht von der KI-Anwendung.
Statt dass jede KI-Anwendung einen eigenen Scraper pflegt, wird der Ansatz:
┌───────────────┐
│ Scrapling MCP │
└───────┬───────┘
│
┌─────────────┼─────────────┐
▼ ▼ ▼
RAG Agent AI IDEDies ermöglicht, die Scraping-Infrastruktur einmal bereitzustellen und über mehrere Workflows hinweg wiederzuverwenden.
Sicherheitsaspekte
Bei der öffentlichen Bereitstellung des Servers:
Keine AWS-Anmeldeinformationen im Container offenlegen
HTTPS in der Produktion verwenden
Netzwerkzugriff bei Bedarf einschränken
Angeforderte URLs validieren
Ratenlimits anwenden, wo erforderlich
Ressourcenverbrauch überwachen
Vermeiden Sie das Scrapen von Websites unter Verletzung ihrer Nutzungsbedingungen oder geltender Gesetze
Geheimnisse in Umgebungsvariablen oder einem dedizierten Secrets-Manager aufbewahren
Produktionsempfehlungen
Für eine Produktionsbereitstellung sollten Sie Folgendes in Betracht ziehen:
Authentifizierung
API-/MCP-Zugriffskontrolle
HTTPS
Ratenbegrenzung
Anforderungsprotokollierung
Beobachtbarkeit
Wiederholungsrichtlinien
Caching
URL-Allowlists
Ressourcenlimits
Health Checks
Überwachung und Alarmierung
Zukünftige Verbesserungen
Authentifizierung für MCP-Clients
URL-/Domain-Allowlisting
Inhalts-Caching
Verteiltes Crawling
Warteschlangenbasierte Erfassung
Automatische Dokument-Chunking
Direkte Vektor-Datenbank-Integration
S3-basierte Dokumentenspeicherung
Crawl-Planung
Beobachtbarkeits-Dashboard
Mehrbenutzer-Zugriffskontrolle
Beispiel für einen End-to-End-Workflow
User / Agent → MCP-Compatible IDE → Scrapling MCP Server → Website
→ Markdown → Document Processing → Chunking → Embeddings
→ Vector DB → Retriever → LLM → Final ResponseRepository
GitHub: github.com/Santhosh-p653/aws-mcp-test
Technischer Artikel
Die Architektur, Bereitstellung und Motivation hinter diesem Projekt ist im AWS Builder Center dokumentiert:
Supercharging Agentic AI with Fast Web Scraping using Scrapling, MCP, and AWS Lightsail
Mitwirken
Beiträge, Ideen, Verbesserungen und Experimente sind willkommen. Wenn Sie etwas mit diesem MCP-Server bauen, können Sie gerne ein Issue oder einen Pull Request eröffnen und den Workflow teilen.
Autor
Santhosh P
Baut Systeme rund um:
KI-Agenten
RAG
MCP
Cloud-Infrastruktur
Web-Datenpipelines
KI/ML
GitHub: @Santhosh-p653
Kernidee: Stellen Sie die Scraping-Fähigkeit einmal bereit. Binden Sie sie in Ihre KI-Workflows ein, wann immer Sie frische, strukturierte Webdaten benötigen.
Scrapling + MCP verwandelt Web-Extraktion in eine wiederverwendbare Infrastrukturkomponente für den modernen LLM-Stack.
This server cannot be deployed
Maintenance
Related MCP Connectors
Web scraping for AI agents. Converts URLs to clean, LLM-ready Markdown with anti-bot bypass.
Clean Markdown and AI-readability scoring for any URL. Built for AI agents.
Jina AI Reader/Search MCP — turn any URL into clean LLM-ready markdown, plus web search.
- CrawioOAuthcom.crawio
Web pages as Markdown, text or HTML, plus Google Maps places and reviews, for AI agents.
Related MCP Servers
- AlicenseNot gradedqualityNot gradedmaintenanceAn MCP server that extracts clean, structured Markdown content from web page URLs using the WebforAI library. It simplifies feeding web content into AI models by removing HTML noise and intelligently processing tables and links.-
- AlicenseAqualityDmaintenanceMCP-native web scraping and search API for AI agents. Converts any URL to clean Markdown with 90% success rate, including Cloudflare-protected sites and JS SPAs. Real-time web search via Brave Search API. CAPTCHA solving built-in. 10 free scrapes/day.56 npm5MIT
- AlicenseBqualityAmaintenanceEnables AI assistants to crawl websites, extract dynamic content, navigate links, and save structured Markdown files via the MCP protocol, with support for anti-bot bypass, CSS selectors, and custom JavaScript execution.146 PyPI45MIT
- AlicenseAqualityCmaintenanceEnables converting web pages to clean Markdown via MCP, compressing token usage by roughly 95% in under 150ms to support LLM context windows and RAG pipelines.2360 npm1MIT