Scrapling MCP Server
Scrapling MCP Server auf AWS Lightsail
Ein leistungsstarker MCP-Server für Web-Extraktion, der Live-Webinhalte in LLM-fähiges Markdown verwandelt – einmal bereitstellen, dann in Ihre KI-IDEs, Agenten, RAG-Pipelines und Automatisierungsworkflows einbinden.
Überblick
Moderne KI-Anwendungen benötigen zunehmend Zugriff auf aktuelle, strukturierte, externe Informationen. Anstatt Web-Scraping separat in jedem RAG-System oder KI-Agenten zu implementieren, stellt dieses Projekt die Web-Extraktionsfunktionen von Scrapling über das Model Context Protocol (MCP) bereit.
Nach der Bereitstellung kann jeder MCP-kompatible KI-Client eine Verbindung zum Server herstellen und ihn als wiederverwendbare Komponente für die Web-Datenerfassung nutzen.
┌──────────────────────┐
│ AI IDE / AI Agent │
│ Claude / MCP Client │
└──────────┬────────────┘
│ MCP
▼
┌──────────────────────┐
│ Scrapling MCP │
│ Server │
└──────────┬────────────┘
▼
┌──────────────────────┐
│ Web │
│ Dynamic / Static │
│ Content │
└──────────┬────────────┘
▼
┌──────────────────────┐
│ Markdown │
│ LLM-ready Data │
└──────────┬────────────┘
▼
┌─────────────────────────────────┐
│ RAG / Embeddings / Vector DB / │
│ Knowledge Base / Agent Memory │
└─────────────────────────────────┘Related MCP server: Anybrowse
Warum MCP für Web-Extraktion?
Traditionell implementiert jede KI-Anwendung, die Webdaten benötigt, ihre eigene:
HTTP-Anfragen
HTML-Parsing
Browser-Automatisierung
Verarbeitung dynamischer Seiten
Extraktionslogik
Wiederholungsmechanismen
Inhaltsnormalisierung
Das erzeugt doppelte Infrastruktur. Mit MCP wird Web-Extraktion zu einer gemeinsamen Fähigkeit.
Vorher – mehrere Implementierungen:
RAG App ──────► Scraper
Agent ──────► Scraper
Research Tool ──────► Scraper
AI IDE ──────► ScraperNachher – eine Fähigkeit, mehrere Clients:
RAG App ──┐
Agent ──┼──► Scrapling MCP Server
AI IDE ──┤
Research ──┘Stellen Sie den Server einmal bereit und nutzen Sie ihn in allen MCP-kompatiblen Workflows.
Mehr als nur ein Web-Scraper
Die Kernidee hinter diesem Projekt geht über das Scraping hinaus. Für viele LLM-Anwendungen müssen externe Informationen letztendlich in eine Darstellung überführt werden, die geparst, bereinigt, strukturiert, in Chunks aufgeteilt, eingebettet, indiziert und abgerufen werden kann.
Markdown ist in dieser Pipeline besonders nützlich, weil es eine nützliche Dokumenthierarchie bewahrt:
Web Page → Scrapling → Markdown
├── Heading
├── Subheading
├── Paragraph
├── List
├── Table
└── Links
│
▼
Chunking → Embeddings → Vector Database → RAG / AgentDamit ist der MCP-Server als LLM-Dateneinfüge-/Erfassungsschicht nützlich und nicht nur als Scraping-Dienstprogramm.
Funktionen
MCP-kompatible Web-Extraktion
Unterstützt durch Scrapling
Entwickelt für KI-Agenten und KI-IDEs
Markdown-orientierte Ausgabe
Geeignet für RAG-Erfassungspipelines
Mit Docker containerisiert
Auf AWS Lightsail bereitstellbar
Wiederverwendbar über mehrere KI-Anwendungen hinweg
Trennt die Datenerfassung von der KI-Anwendung selbst
Kann in agentische Workflows integriert werden
Architektur
Internet
│
▼
┌───────────────┐
│ Web │
└───────┬───────┘
▼
┌───────────────────┐
│ Scrapling │
│ Extraction Layer │
└─────────┬─────────┘
▼
┌───────────────────┐
│ MCP Server │
│ Tool Interface │
└─────────┬─────────┘
│
MCP Protocol
│
┌─────────────┼─────────────┐
▼ ▼ ▼
AI IDE Agent RAG
│ │ │
└─────────────┼─────────────┘
▼
Markdown / Data
▼
┌────────────────────┐
│ LLM Data Pipeline │
└──────────┬─────────┘
▼
┌────────────────────┐
│ Embeddings / DB │
└──────────┬─────────┘
▼
LLM / RAGTechnologie-Stack
Komponente | Technologie |
Web-Extraktion | Scrapling |
Protokoll | Model Context Protocol (MCP) |
Sprache | Python |
Containerisierung | Docker |
Cloud | AWS Lightsail |
CI/CD | GitHub Actions |
Ausgabe | Markdown / Strukturierte Inhalte |
KI-Integration | MCP-kompatible Clients |
Projektstruktur
.
├── src/
│ └── ...
├── Dockerfile
├── requirements.txt
├── .dockerignore
├── .gitignore
├── docker-compose.yml
└── README.mdPassen Sie die obige Struktur an, falls Ihr Repository ein anderes Quellverzeichnis verwendet.
Lokal ausführen
1. Repository klonen
git clone https://github.com/Santhosh-p653/aws-mcp-test.git
cd aws-mcp-test2. Abhängigkeiten installieren
Erstellen und aktivieren Sie eine virtuelle Umgebung:
python -m venv .venv
# Linux / macOS
source .venv/bin/activate
# Windows
.venv\Scripts\activateAbhängigkeiten installieren:
pip install -r requirements.txtMit Docker ausführen
Image erstellen:
docker build -t scrapling-mcp .Container ausführen:
docker run -d \
--name scrapling-mcp \
-p 8000:8000 \
scrapling-mcpÜberprüfen, dass der Container läuft:
docker psAuf AWS Lightsail bereitstellen
Das Projekt ist dafür ausgelegt, als containerisierter Dienst auf AWS Lightsail zu laufen.
Bereitstellungsablauf auf hoher Ebene:
GitHub → Push → GitHub Actions → Build → Docker Image → Deploy → AWS Lightsail
│
▼
Scrapling MCP Server
│
▼
MCP-Compatible AI ClientsBereitstellungsschritte
AWS Lightsail Container-Service erstellen – über die AWS-Konsole oder die AWS CLI.
Docker-Image erstellen
docker build -t scrapling-mcp .Container pushen/bereitstellen – die Lightsail-Container-Bereitstellung mit dem von Ihrem CI/CD-Workflow erzeugten Image konfigurieren.
Umgebungsvariablen konfigurieren – Anmeldeinformationen und Bereitstellungskonfiguration außerhalb des Repositorys aufbewahren:
AWS_REGION= LIGHTSAIL_SERVICE= CONTAINER_NAME=
⚠️ Committen Sie niemals Geheimnisse oder Anmeldeinformationen in Git.
GitHub Actions
Das Repository kann GitHub Actions zur Automatisierung der Bereitstellung nutzen:
git push → GitHub Actions
├── Checkout
├── Configure AWS credentials
├── Build container
├── Push/deploy
└── Update LightsailDie Bereitstellung folgt dann einem einfachen Workflow:
git add .
git commit -m "update scraper"
git push origin mainNach Abschluss des Workflows ist der aktualisierte MCP-Server bereitgestellt.
Verwenden des MCP-Servers
Sobald der Server bereitgestellt ist, verbinden Sie seinen MCP-Endpunkt mit einem MCP-kompatiblen KI-Client:
AI Client → MCP → https://your-mcp-server.example.com → Scrapling → Web ContentDer KI-Client kann dann die bereitgestellten Tools als Teil seines Workflows aufrufen – der Server verhält sich wie ein Plugin für KI-Anwendungen und ersetzt benutzerdefinierten Scraping-Code in jedem Projekt:
AI Application
├── RAG
├── Agents
├── Research
└── Automation
│
▼
MCP Server → ScraplingRAG-Integration
Eine typische RAG-Pipeline kann diesen Server als Erfassungsschicht verwenden:
Web Sources → Scrapling MCP → Markdown → Document Parser → Chunking
→ Embeddings → Vector Store → Retriever → LLMMögliche nachgelagerte Komponenten sind:
Qdrant
PostgreSQL + pgvector
Elasticsearch
OpenSearch
Chroma
FAISS
Benutzerdefinierte Wissensspeicher
Der MCP-Server bleibt unabhängig von der nachgelagerten Speicherschicht.
Agentischer Workflow
Der Server kann auch als Tool für einen KI-Agenten verfügbar gemacht werden:
User → AI Agent
├── Decide what information is required
├── Call Scrapling MCP
├── Extract relevant content
├── Transform/use Markdown
├── Store information
└── Generate final responseDies ermöglicht dem Agenten, Informationen dynamisch zu beschaffen, anstatt sich nur auf statische Trainingsdaten oder zuvor indizierte Dokumente zu verlassen.
Warum Markdown?
Markdown bietet eine nützliche Zwischendarstellung für LLM-Pipelines, weil es die semantische Struktur erhält.
Markdown:
# AWS Lambda
## Overview
AWS Lambda is a serverless compute service.
## Features
- Event-driven execution
- Automatic scaling
- Pay-per-use pricing
## Architecture
### Invocation
Lambda functions can be invoked through multiple AWS services.Im Vergleich zu rohem HTML:
<div>
<h1>AWS Lambda</h1>
<div>
<h2>Overview</h2>
...
</div>
</div>Markdown ist im Allgemeinen einfacher zu prüfen, zu bereinigen, in Chunks zu teilen, zu verarbeiten, zu speichern und an LLM-Pipelines weiterzugeben.
Das Ziel ist daher nicht einfach, "eine Webseite zu scrapen" – es geht darum, externes Wissen in einer Form zu erwerben, die natürlich in eine LLM-Datenpipeline eingehen kann.
Anwendungsfälle
Anwendungsfall | Beschreibung |
RAG-Systeme | Automatisch frische Webinformationen erfassen, bevor sie indiziert werden. |
KI-Recherche-Agenten | Agenten ermöglichen, Informationen von Live-Websites abzurufen und zu analysieren. |
Wissensdatenbanken | Kontinuierlich aktualisierte Wissensrepositorys aufbauen. |
KI-IDEs | Coding-Assistenten eine externe Web-Extraktionsfähigkeit über MCP geben. |
Dokumentationserfassung | Online-Dokumentation in Markdown konvertieren, das für die Weiterverarbeitung geeignet ist. |
Agentische Automatisierung | Web-Extraktion als eines von vielen Tools in einem autonomen Workflow nutzen. |
Leistungsorientiertes Design
Die Architektur trennt die Web-Erfassungsschicht von der KI-Anwendung.
Statt dass jede KI-Anwendung einen eigenen Scraper pflegt, wird der Ansatz:
┌───────────────┐
│ Scrapling MCP │
└───────┬───────┘
│
┌─────────────┼─────────────┐
▼ ▼ ▼
RAG Agent AI IDEDies ermöglicht, die Scraping-Infrastruktur einmal bereitzustellen und über mehrere Workflows hinweg wiederzuverwenden.
Sicherheitsaspekte
Bei der öffentlichen Bereitstellung des Servers:
Keine AWS-Anmeldeinformationen im Container offenlegen
HTTPS in der Produktion verwenden
Netzwerkzugriff bei Bedarf einschränken
Angeforderte URLs validieren
Ratenlimits anwenden, wo erforderlich
Ressourcenverbrauch überwachen
Vermeiden Sie das Scrapen von Websites unter Verletzung ihrer Nutzungsbedingungen oder geltender Gesetze
Geheimnisse in Umgebungsvariablen oder einem dedizierten Secrets-Manager aufbewahren
Produktionsempfehlungen
Für eine Produktionsbereitstellung sollten Sie Folgendes in Betracht ziehen:
Authentifizierung
API-/MCP-Zugriffskontrolle
HTTPS
Ratenbegrenzung
Anforderungsprotokollierung
Beobachtbarkeit
Wiederholungsrichtlinien
Caching
URL-Allowlists
Ressourcenlimits
Health Checks
Überwachung und Alarmierung
Zukünftige Verbesserungen
Authentifizierung für MCP-Clients
URL-/Domain-Allowlisting
Inhalts-Caching
Verteiltes Crawling
Warteschlangenbasierte Erfassung
Automatische Dokument-Chunking
Direkte Vektor-Datenbank-Integration
S3-basierte Dokumentenspeicherung
Crawl-Planung
Beobachtbarkeits-Dashboard
Mehrbenutzer-Zugriffskontrolle
Beispiel für einen End-to-End-Workflow
User / Agent → MCP-Compatible IDE → Scrapling MCP Server → Website
→ Markdown → Document Processing → Chunking → Embeddings
→ Vector DB → Retriever → LLM → Final ResponseRepository
GitHub: github.com/Santhosh-p653/aws-mcp-test
Technischer Artikel
Die Architektur, Bereitstellung und Motivation hinter diesem Projekt ist im AWS Builder Center dokumentiert:
Supercharging Agentic AI with Fast Web Scraping using Scrapling, MCP, and AWS Lightsail
Mitwirken
Beiträge, Ideen, Verbesserungen und Experimente sind willkommen. Wenn Sie etwas mit diesem MCP-Server bauen, können Sie gerne ein Issue oder einen Pull Request eröffnen und den Workflow teilen.
Autor
Santhosh P
Baut Systeme rund um:
KI-Agenten
RAG
MCP
Cloud-Infrastruktur
Web-Datenpipelines
KI/ML
GitHub: @Santhosh-p653
Kernidee: Stellen Sie die Scraping-Fähigkeit einmal bereit. Binden Sie sie in Ihre KI-Workflows ein, wann immer Sie frische, strukturierte Webdaten benötigen.
Scrapling + MCP verwandelt Web-Extraktion in eine wiederverwendbare Infrastrukturkomponente für den modernen LLM-Stack.
This server cannot be installed
Maintenance
Resources
Unclaimed servers have limited discoverability.
Looking for Admin?
If you are the server author, to access and configure the admin panel.
Related MCP Servers
- AlicenseNot gradedqualityNot gradedmaintenanceAn MCP server that extracts clean, structured Markdown content from web page URLs using the WebforAI library. It simplifies feeding web content into AI models by removing HTML noise and intelligently processing tables and links.
- AlicenseAqualityCmaintenanceMCP-native web scraping and search API for AI agents. Converts any URL to clean Markdown with 90% success rate, including Cloudflare-protected sites and JS SPAs. Real-time web search via Brave Search API. CAPTCHA solving built-in. 10 free scrapes/day.584MIT
- AlicenseNot gradedqualityCmaintenanceMCP server for AI agents -- fetch any URL with full JavaScript rendering (Playwright/Chromium) and convert to clean, token-efficient markdown. Works on React, Vue, Angular, and any JS-heavy page. Includes web search, batch fetching, binary file download, LRU cache, SSRF protection, and structured output.13MIT
- AlicenseAqualityDmaintenanceConverts URLs and raw HTML to clean Markdown, enabling AI assistants to read web pages for summarization, analysis, or ingestion.2171MIT
Related MCP Connectors
Web scraping for AI agents. Converts URLs to clean, LLM-ready Markdown with anti-bot bypass.
Jina AI Reader/Search MCP — turn any URL into clean LLM-ready markdown, plus web search.
Converts any URL to clean, LLM-ready Markdown using real Chrome browsers
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/Santhosh-p653/aws-mcp-test'
If you have feedback or need assistance with the MCP directory API, please join our Discord server