Skip to main content
Glama
Santhosh-p653

Scrapling MCP Server

Scrapling MCP Server auf AWS Lightsail

Ein leistungsstarker MCP-Server für Web-Extraktion, der Live-Webinhalte in LLM-fähiges Markdown verwandelt – einmal bereitstellen, dann in Ihre KI-IDEs, Agenten, RAG-Pipelines und Automatisierungsworkflows einbinden.

AWS MCP Python Docker Scrapling

Überblick

Moderne KI-Anwendungen benötigen zunehmend Zugriff auf aktuelle, strukturierte, externe Informationen. Anstatt Web-Scraping separat in jedem RAG-System oder KI-Agenten zu implementieren, stellt dieses Projekt die Web-Extraktionsfunktionen von Scrapling über das Model Context Protocol (MCP) bereit.

Nach der Bereitstellung kann jeder MCP-kompatible KI-Client eine Verbindung zum Server herstellen und ihn als wiederverwendbare Komponente für die Web-Datenerfassung nutzen.

┌──────────────────────┐
│   AI IDE / AI Agent   │
│ Claude / MCP Client   │
└──────────┬────────────┘
           │ MCP
           ▼
┌──────────────────────┐
│   Scrapling MCP       │
│      Server           │
└──────────┬────────────┘
           ▼
┌──────────────────────┐
│        Web            │
│  Dynamic / Static      │
│     Content            │
└──────────┬────────────┘
           ▼
┌──────────────────────┐
│      Markdown          │
│   LLM-ready Data       │
└──────────┬────────────┘
           ▼
┌─────────────────────────────────┐
│ RAG / Embeddings / Vector DB /   │
│ Knowledge Base / Agent Memory    │
└─────────────────────────────────┘

Related MCP server: Anybrowse

Warum MCP für Web-Extraktion?

Traditionell implementiert jede KI-Anwendung, die Webdaten benötigt, ihre eigene:

  • HTTP-Anfragen

  • HTML-Parsing

  • Browser-Automatisierung

  • Verarbeitung dynamischer Seiten

  • Extraktionslogik

  • Wiederholungsmechanismen

  • Inhaltsnormalisierung

Das erzeugt doppelte Infrastruktur. Mit MCP wird Web-Extraktion zu einer gemeinsamen Fähigkeit.

Vorher – mehrere Implementierungen:

RAG App        ──────► Scraper
Agent          ──────► Scraper
Research Tool  ──────► Scraper
AI IDE         ──────► Scraper

Nachher – eine Fähigkeit, mehrere Clients:

RAG App    ──┐
Agent      ──┼──► Scrapling MCP Server
AI IDE     ──┤
Research   ──┘

Stellen Sie den Server einmal bereit und nutzen Sie ihn in allen MCP-kompatiblen Workflows.

Mehr als nur ein Web-Scraper

Die Kernidee hinter diesem Projekt geht über das Scraping hinaus. Für viele LLM-Anwendungen müssen externe Informationen letztendlich in eine Darstellung überführt werden, die geparst, bereinigt, strukturiert, in Chunks aufgeteilt, eingebettet, indiziert und abgerufen werden kann.

Markdown ist in dieser Pipeline besonders nützlich, weil es eine nützliche Dokumenthierarchie bewahrt:

Web Page → Scrapling → Markdown
                          ├── Heading
                          ├── Subheading
                          ├── Paragraph
                          ├── List
                          ├── Table
                          └── Links
                          │
                          ▼
                      Chunking → Embeddings → Vector Database → RAG / Agent

Damit ist der MCP-Server als LLM-Dateneinfüge-/Erfassungsschicht nützlich und nicht nur als Scraping-Dienstprogramm.

Funktionen

  • MCP-kompatible Web-Extraktion

  • Unterstützt durch Scrapling

  • Entwickelt für KI-Agenten und KI-IDEs

  • Markdown-orientierte Ausgabe

  • Geeignet für RAG-Erfassungspipelines

  • Mit Docker containerisiert

  • Auf AWS Lightsail bereitstellbar

  • Wiederverwendbar über mehrere KI-Anwendungen hinweg

  • Trennt die Datenerfassung von der KI-Anwendung selbst

  • Kann in agentische Workflows integriert werden

Architektur

                    Internet
                       │
                       ▼
                ┌───────────────┐
                │      Web       │
                └───────┬───────┘
                        ▼
              ┌───────────────────┐
              │     Scrapling      │
              │  Extraction Layer  │
              └─────────┬─────────┘
                        ▼
              ┌───────────────────┐
              │    MCP Server      │
              │   Tool Interface   │
              └─────────┬─────────┘
                        │
                   MCP Protocol
                        │
          ┌─────────────┼─────────────┐
          ▼             ▼             ▼
       AI IDE         Agent          RAG
          │             │             │
          └─────────────┼─────────────┘
                        ▼
                Markdown / Data
                        ▼
              ┌────────────────────┐
              │ LLM Data Pipeline   │
              └──────────┬─────────┘
                        ▼
              ┌────────────────────┐
              │  Embeddings / DB    │
              └──────────┬─────────┘
                        ▼
                     LLM / RAG

Technologie-Stack

Komponente

Technologie

Web-Extraktion

Scrapling

Protokoll

Model Context Protocol (MCP)

Sprache

Python

Containerisierung

Docker

Cloud

AWS Lightsail

CI/CD

GitHub Actions

Ausgabe

Markdown / Strukturierte Inhalte

KI-Integration

MCP-kompatible Clients

Projektstruktur

.
├── src/
│   └── ...
├── Dockerfile
├── requirements.txt
├── .dockerignore
├── .gitignore
├── docker-compose.yml
└── README.md

Passen Sie die obige Struktur an, falls Ihr Repository ein anderes Quellverzeichnis verwendet.

Lokal ausführen

1. Repository klonen

git clone https://github.com/Santhosh-p653/aws-mcp-test.git
cd aws-mcp-test

2. Abhängigkeiten installieren

Erstellen und aktivieren Sie eine virtuelle Umgebung:

python -m venv .venv

# Linux / macOS
source .venv/bin/activate

# Windows
.venv\Scripts\activate

Abhängigkeiten installieren:

pip install -r requirements.txt

Mit Docker ausführen

Image erstellen:

docker build -t scrapling-mcp .

Container ausführen:

docker run -d \
  --name scrapling-mcp \
  -p 8000:8000 \
  scrapling-mcp

Überprüfen, dass der Container läuft:

docker ps

Auf AWS Lightsail bereitstellen

Das Projekt ist dafür ausgelegt, als containerisierter Dienst auf AWS Lightsail zu laufen.

Bereitstellungsablauf auf hoher Ebene:

GitHub → Push → GitHub Actions → Build → Docker Image → Deploy → AWS Lightsail
                                                                      │
                                                                      ▼
                                                          Scrapling MCP Server
                                                                      │
                                                                      ▼
                                                      MCP-Compatible AI Clients

Bereitstellungsschritte

  1. AWS Lightsail Container-Service erstellen – über die AWS-Konsole oder die AWS CLI.

  2. Docker-Image erstellen

    docker build -t scrapling-mcp .
  3. Container pushen/bereitstellen – die Lightsail-Container-Bereitstellung mit dem von Ihrem CI/CD-Workflow erzeugten Image konfigurieren.

  4. Umgebungsvariablen konfigurieren – Anmeldeinformationen und Bereitstellungskonfiguration außerhalb des Repositorys aufbewahren:

    AWS_REGION=
    LIGHTSAIL_SERVICE=
    CONTAINER_NAME=

⚠️ Committen Sie niemals Geheimnisse oder Anmeldeinformationen in Git.

GitHub Actions

Das Repository kann GitHub Actions zur Automatisierung der Bereitstellung nutzen:

git push → GitHub Actions
             ├── Checkout
             ├── Configure AWS credentials
             ├── Build container
             ├── Push/deploy
             └── Update Lightsail

Die Bereitstellung folgt dann einem einfachen Workflow:

git add .
git commit -m "update scraper"
git push origin main

Nach Abschluss des Workflows ist der aktualisierte MCP-Server bereitgestellt.

Verwenden des MCP-Servers

Sobald der Server bereitgestellt ist, verbinden Sie seinen MCP-Endpunkt mit einem MCP-kompatiblen KI-Client:

AI Client → MCP → https://your-mcp-server.example.com → Scrapling → Web Content

Der KI-Client kann dann die bereitgestellten Tools als Teil seines Workflows aufrufen – der Server verhält sich wie ein Plugin für KI-Anwendungen und ersetzt benutzerdefinierten Scraping-Code in jedem Projekt:

AI Application
      ├── RAG
      ├── Agents
      ├── Research
      └── Automation
             │
             ▼
        MCP Server → Scrapling

RAG-Integration

Eine typische RAG-Pipeline kann diesen Server als Erfassungsschicht verwenden:

Web Sources → Scrapling MCP → Markdown → Document Parser → Chunking
    → Embeddings → Vector Store → Retriever → LLM

Mögliche nachgelagerte Komponenten sind:

  • Qdrant

  • PostgreSQL + pgvector

  • Elasticsearch

  • OpenSearch

  • Chroma

  • FAISS

  • Benutzerdefinierte Wissensspeicher

Der MCP-Server bleibt unabhängig von der nachgelagerten Speicherschicht.

Agentischer Workflow

Der Server kann auch als Tool für einen KI-Agenten verfügbar gemacht werden:

User → AI Agent
         ├── Decide what information is required
         ├── Call Scrapling MCP
         ├── Extract relevant content
         ├── Transform/use Markdown
         ├── Store information
         └── Generate final response

Dies ermöglicht dem Agenten, Informationen dynamisch zu beschaffen, anstatt sich nur auf statische Trainingsdaten oder zuvor indizierte Dokumente zu verlassen.

Warum Markdown?

Markdown bietet eine nützliche Zwischendarstellung für LLM-Pipelines, weil es die semantische Struktur erhält.

Markdown:

# AWS Lambda

## Overview
AWS Lambda is a serverless compute service.

## Features
- Event-driven execution
- Automatic scaling
- Pay-per-use pricing

## Architecture
### Invocation
Lambda functions can be invoked through multiple AWS services.

Im Vergleich zu rohem HTML:

<div>
    <h1>AWS Lambda</h1>
    <div>
        <h2>Overview</h2>
        ...
    </div>
</div>

Markdown ist im Allgemeinen einfacher zu prüfen, zu bereinigen, in Chunks zu teilen, zu verarbeiten, zu speichern und an LLM-Pipelines weiterzugeben.

Das Ziel ist daher nicht einfach, "eine Webseite zu scrapen" – es geht darum, externes Wissen in einer Form zu erwerben, die natürlich in eine LLM-Datenpipeline eingehen kann.

Anwendungsfälle

Anwendungsfall

Beschreibung

RAG-Systeme

Automatisch frische Webinformationen erfassen, bevor sie indiziert werden.

KI-Recherche-Agenten

Agenten ermöglichen, Informationen von Live-Websites abzurufen und zu analysieren.

Wissensdatenbanken

Kontinuierlich aktualisierte Wissensrepositorys aufbauen.

KI-IDEs

Coding-Assistenten eine externe Web-Extraktionsfähigkeit über MCP geben.

Dokumentationserfassung

Online-Dokumentation in Markdown konvertieren, das für die Weiterverarbeitung geeignet ist.

Agentische Automatisierung

Web-Extraktion als eines von vielen Tools in einem autonomen Workflow nutzen.

Leistungsorientiertes Design

Die Architektur trennt die Web-Erfassungsschicht von der KI-Anwendung.

Statt dass jede KI-Anwendung einen eigenen Scraper pflegt, wird der Ansatz:

                ┌───────────────┐
                │ Scrapling MCP  │
                └───────┬───────┘
                        │
          ┌─────────────┼─────────────┐
          ▼             ▼             ▼
        RAG          Agent          AI IDE

Dies ermöglicht, die Scraping-Infrastruktur einmal bereitzustellen und über mehrere Workflows hinweg wiederzuverwenden.

Sicherheitsaspekte

Bei der öffentlichen Bereitstellung des Servers:

  • Keine AWS-Anmeldeinformationen im Container offenlegen

  • HTTPS in der Produktion verwenden

  • Netzwerkzugriff bei Bedarf einschränken

  • Angeforderte URLs validieren

  • Ratenlimits anwenden, wo erforderlich

  • Ressourcenverbrauch überwachen

  • Vermeiden Sie das Scrapen von Websites unter Verletzung ihrer Nutzungsbedingungen oder geltender Gesetze

  • Geheimnisse in Umgebungsvariablen oder einem dedizierten Secrets-Manager aufbewahren

Produktionsempfehlungen

Für eine Produktionsbereitstellung sollten Sie Folgendes in Betracht ziehen:

  • Authentifizierung

  • API-/MCP-Zugriffskontrolle

  • HTTPS

  • Ratenbegrenzung

  • Anforderungsprotokollierung

  • Beobachtbarkeit

  • Wiederholungsrichtlinien

  • Caching

  • URL-Allowlists

  • Ressourcenlimits

  • Health Checks

  • Überwachung und Alarmierung

Zukünftige Verbesserungen

  • Authentifizierung für MCP-Clients

  • URL-/Domain-Allowlisting

  • Inhalts-Caching

  • Verteiltes Crawling

  • Warteschlangenbasierte Erfassung

  • Automatische Dokument-Chunking

  • Direkte Vektor-Datenbank-Integration

  • S3-basierte Dokumentenspeicherung

  • Crawl-Planung

  • Beobachtbarkeits-Dashboard

  • Mehrbenutzer-Zugriffskontrolle

Beispiel für einen End-to-End-Workflow

User / Agent → MCP-Compatible IDE → Scrapling MCP Server → Website
    → Markdown → Document Processing → Chunking → Embeddings
    → Vector DB → Retriever → LLM → Final Response

Repository

GitHub: github.com/Santhosh-p653/aws-mcp-test

Technischer Artikel

Die Architektur, Bereitstellung und Motivation hinter diesem Projekt ist im AWS Builder Center dokumentiert:

Supercharging Agentic AI with Fast Web Scraping using Scrapling, MCP, and AWS Lightsail

Mitwirken

Beiträge, Ideen, Verbesserungen und Experimente sind willkommen. Wenn Sie etwas mit diesem MCP-Server bauen, können Sie gerne ein Issue oder einen Pull Request eröffnen und den Workflow teilen.

Autor

Santhosh P

Baut Systeme rund um:

  • KI-Agenten

  • RAG

  • MCP

  • Cloud-Infrastruktur

  • Web-Datenpipelines

  • KI/ML

GitHub: @Santhosh-p653


Kernidee: Stellen Sie die Scraping-Fähigkeit einmal bereit. Binden Sie sie in Ihre KI-Workflows ein, wann immer Sie frische, strukturierte Webdaten benötigen.

Scrapling + MCP verwandelt Web-Extraktion in eine wiederverwendbare Infrastrukturkomponente für den modernen LLM-Stack.

F
license - not found
Not graded
quality - not tested
B
maintenance

Maintenance

Maintainers
Response time
Release cycle
Releases (12mo)
Commit activity

Resources

Unclaimed servers have limited discoverability.

Looking for Admin?

If you are the server author, to access and configure the admin panel.

Related MCP Servers

  • A
    license
    Not graded
    quality
    Not graded
    maintenance
    An MCP server that extracts clean, structured Markdown content from web page URLs using the WebforAI library. It simplifies feeding web content into AI models by removing HTML noise and intelligently processing tables and links.
  • A
    license
    A
    quality
    C
    maintenance
    MCP-native web scraping and search API for AI agents. Converts any URL to clean Markdown with 90% success rate, including Cloudflare-protected sites and JS SPAs. Real-time web search via Brave Search API. CAPTCHA solving built-in. 10 free scrapes/day.
    5
    8
    4
    MIT
  • A
    license
    Not graded
    quality
    C
    maintenance
    MCP server for AI agents -- fetch any URL with full JavaScript rendering (Playwright/Chromium) and convert to clean, token-efficient markdown. Works on React, Vue, Angular, and any JS-heavy page. Includes web search, batch fetching, binary file download, LRU cache, SSRF protection, and structured output.
    13
    MIT

View all related MCP servers

Related MCP Connectors

  • Web scraping for AI agents. Converts URLs to clean, LLM-ready Markdown with anti-bot bypass.

  • Jina AI Reader/Search MCP — turn any URL into clean LLM-ready markdown, plus web search.

  • Converts any URL to clean, LLM-ready Markdown using real Chrome browsers

View all MCP Connectors

Latest Blog Posts

MCP directory API

We provide all the information about MCP servers via our MCP API.

curl -X GET 'https://glama.ai/api/mcp/v1/servers/Santhosh-p653/aws-mcp-test'

If you have feedback or need assistance with the MCP directory API, please join our Discord server