Skip to main content
Glama
Santhosh-p653

Scrapling MCP Server

Servidor MCP de Scrapling en AWS Lightsail

Un servidor MCP de extracción web de alto rendimiento que convierte contenido web en vivo en Markdown listo para LLM: impleméntalo una vez y conéctalo a tus IDEs de IA, agentes, pipelines de RAG y flujos de automatización.

AWS MCP Python Docker Scrapling

Descripción general

Las aplicaciones de IA modernas necesitan cada vez más acceso a conocimiento externo fresco y estructurado. En lugar de implementar el raspado web por separado dentro de cada sistema RAG o agente de IA, este proyecto expone las capacidades de extracción web de Scrapling a través del Model Context Protocol (MCP).

Una vez implementado, cualquier cliente de IA compatible con MCP puede conectarse al servidor y usarlo como un componente reutilizable de ingesta de datos web.

┌──────────────────────┐
│   AI IDE / AI Agent   │
│ Claude / MCP Client   │
└──────────┬────────────┘
           │ MCP
           ▼
┌──────────────────────┐
│   Scrapling MCP       │
│      Server           │
└──────────┬────────────┘
           ▼
┌──────────────────────┐
│        Web            │
│  Dynamic / Static      │
│     Content            │
└──────────┬────────────┘
           ▼
┌──────────────────────┐
│      Markdown          │
│   LLM-ready Data       │
└──────────┬────────────┘
           ▼
┌─────────────────────────────────┐
│ RAG / Embeddings / Vector DB /   │
│ Knowledge Base / Agent Memory    │
└─────────────────────────────────┘

Related MCP server: Anybrowse

¿Por qué MCP para la extracción web?

Tradicionalmente, cada aplicación de IA que necesita datos web implementa su propio:

  • Solicitudes HTTP

  • Análisis de HTML

  • Automatización del navegador

  • Manejo de páginas dinámicas

  • Lógica de extracción

  • Mecanismos de reintento

  • Normalización de contenido

Esto crea infraestructura duplicada. Con MCP, la extracción web se convierte en una capacidad compartida.

Antes — múltiples implementaciones:

RAG App        ──────► Scraper
Agent          ──────► Scraper
Research Tool  ──────► Scraper
AI IDE         ──────► Scraper

Después — una capacidad, múltiples clientes:

RAG App    ──┐
Agent      ──┼──► Scrapling MCP Server
AI IDE     ──┤
Research   ──┘

Implementa el servidor una vez y reutilízalo en flujos de trabajo compatibles con MCP.

No es solo un raspador web

La idea central detrás de este proyecto es más amplia que el raspado. Para muchas aplicaciones de LLM, la información externa eventualmente necesita convertirse en una representación que pueda ser analizada, limpiada, estructurada, dividida en fragmentos, incrustada, indexada y recuperada.

Markdown es particularmente útil en este pipeline porque preserva una jerarquía documental útil:

Web Page → Scrapling → Markdown
                          ├── Heading
                          ├── Subheading
                          ├── Paragraph
                          ├── List
                          ├── Table
                          └── Links
                          │
                          ▼
                      Chunking → Embeddings → Vector Database → RAG / Agent

Esto hace que el servidor MCP sea útil como una capa de inserción/ingesta de datos para LLM, en lugar de solo una utilidad de scraping.

Características

  • Extracción web compatible con MCP

  • Impulsado por Scrapling

  • Diseñado para agentes de IA e IDEs de IA

  • Salida orientada a Markdown

  • Adecuado para pipelines de ingesta de RAG

  • Contenerizado con Docker

  • Implementable en AWS Lightsail

  • Reutilizable en múltiples aplicaciones de IA

  • Separa la adquisición de datos de la propia aplicación de IA

  • Puede integrarse en flujos de trabajo agénticos

Arquitectura

                    Internet
                       │
                       ▼
                ┌───────────────┐
                │      Web       │
                └───────┬───────┘
                        ▼
              ┌───────────────────┐
              │     Scrapling      │
              │  Extraction Layer  │
              └─────────┬─────────┘
                        ▼
              ┌───────────────────┐
              │    MCP Server      │
              │   Tool Interface   │
              └─────────┬─────────┘
                        │
                   MCP Protocol
                        │
          ┌─────────────┼─────────────┐
          ▼             ▼             ▼
       AI IDE         Agent          RAG
          │             │             │
          └─────────────┼─────────────┘
                        ▼
                Markdown / Data
                        ▼
              ┌────────────────────┐
              │ LLM Data Pipeline   │
              └──────────┬─────────┘
                        ▼
              ┌────────────────────┐
              │  Embeddings / DB    │
              └──────────┬─────────┘
                        ▼
                     LLM / RAG

Pila tecnológica

Componente

Tecnología

Extracción web

Scrapling

Protocolo

Model Context Protocol (MCP)

Lenguaje

Python

Contenerización

Docker

Nube

AWS Lightsail

CI/CD

GitHub Actions

Salida

Markdown / Contenido estructurado

Integración de IA

Clientes compatibles con MCP

Estructura del proyecto

.
├── src/
│   └── ...
├── Dockerfile
├── requirements.txt
├── .dockerignore
├── .gitignore
├── docker-compose.yml
└── README.md

Ajusta la estructura anterior si tu repositorio utiliza una disposición de código fuente diferente.

Ejecución local

1. Clona el repositorio

git clone https://github.com/Santhosh-p653/aws-mcp-test.git
cd aws-mcp-test

2. Instala las dependencias

Crea y activa un entorno virtual:

python -m venv .venv

# Linux / macOS
source .venv/bin/activate

# Windows
.venv\Scripts\activate

Instala las dependencias:

pip install -r requirements.txt

Ejecutar con Docker

Construye la imagen:

docker build -t scrapling-mcp .

Ejecuta el contenedor:

docker run -d \
  --name scrapling-mcp \
  -p 8000:8000 \
  scrapling-mcp

Verifica que el contenedor esté en ejecución:

docker ps

Implementar en AWS Lightsail

El proyecto está diseñado para ejecutarse como un servicio contenerizado en AWS Lightsail.

Flujo de implementación de alto nivel:

GitHub → Push → GitHub Actions → Build → Docker Image → Deploy → AWS Lightsail
                                                                      │
                                                                      ▼
                                                          Scrapling MCP Server
                                                                      │
                                                                      ▼
                                                      MCP-Compatible AI Clients

Pasos de implementación

  1. Crea un servicio de contenedores de AWS Lightsail — desde la consola de AWS o la CLI de AWS.

  2. Construye la imagen de Docker

    docker build -t scrapling-mcp .
  3. Envía/implementa el contenedor — configura la implementación del contenedor de Lightsail usando la imagen producida por tu flujo de trabajo de CI/CD.

  4. Configura las variables de entorno — mantén las credenciales y la configuración de implementación fuera del repositorio:

    AWS_REGION=
    LIGHTSAIL_SERVICE=
    CONTAINER_NAME=

⚠️ Nunca confirmes secretos ni credenciales en Git.

GitHub Actions

El repositorio puede usar GitHub Actions para automatizar la implementación:

git push → GitHub Actions
             ├── Checkout
             ├── Configure AWS credentials
             ├── Build container
             ├── Push/deploy
             └── Update Lightsail

La implementación sigue entonces un flujo de trabajo simple:

git add .
git commit -m "update scraper"
git push origin main

Después de que el flujo de trabajo se complete, el servidor MCP actualizado queda implementado.

Uso del servidor MCP

Una vez que el servidor esté implementado, conecta su endpoint MCP a un cliente de IA compatible con MCP:

AI Client → MCP → https://your-mcp-server.example.com → Scrapling → Web Content

El cliente de IA puede entonces invocar las herramientas expuestas como parte de su flujo de trabajo — el servidor se comporta como un complemento para aplicaciones de IA, reemplazando el código de scraping personalizado dentro de cada proyecto:

AI Application
      ├── RAG
      ├── Agents
      ├── Research
      └── Automation
             │
             ▼
        MCP Server → Scrapling

Integración con RAG

Un pipeline de RAG típico puede usar este servidor como la capa de ingesta:

Web Sources → Scrapling MCP → Markdown → Document Parser → Chunking
    → Embeddings → Vector Store → Retriever → LLM

Los posibles componentes posteriores incluyen:

  • Qdrant

  • PostgreSQL + pgvector

  • Elasticsearch

  • OpenSearch

  • Chroma

  • FAISS

  • Almacenes de conocimiento personalizados

El servidor MCP permanece independiente de la capa de almacenamiento posterior.

Flujo de trabajo agéntico

El servidor también puede convertirse en una herramienta disponible para un agente de IA:

User → AI Agent
         ├── Decide what information is required
         ├── Call Scrapling MCP
         ├── Extract relevant content
         ├── Transform/use Markdown
         ├── Store information
         └── Generate final response

Esto permite que el agente adquiera información dinámicamente en lugar de depender solo de datos de entrenamiento estáticos o documentos previamente indexados.

¿Por qué Markdown?

Markdown proporciona una representación intermedia útil para pipelines de LLM porque preserva la estructura semántica.

Markdown:

# AWS Lambda

## Overview
AWS Lambda is a serverless compute service.

## Features
- Event-driven execution
- Automatic scaling
- Pay-per-use pricing

## Architecture
### Invocation
Lambda functions can be invoked through multiple AWS services.

En comparación con HTML sin procesar:

<div>
    <h1>AWS Lambda</h1>
    <div>
        <h2>Overview</h2>
        ...
    </div>
</div>

Markdown es generalmente más fácil de inspeccionar, limpiar, dividir en fragmentos, procesar, almacenar y pasar a pipelines de LLM.

El objetivo, por lo tanto, no es simplemente "raspar una página web" — es adquirir conocimiento externo en una forma que pueda entrar naturalmente en un pipeline de datos de LLM.

Casos de uso

Caso de uso

Descripción

Sistemas RAG

Adquiere automáticamente información web fresca antes de indexarla.

Agentes de investigación de IA

Permite que los agentes recuperen y analicen información de sitios web en vivo.

Bases de conocimiento

Construye repositorios de conocimiento actualizados continuamente.

IDEs de IA

Proporciona a los asistentes de codificación una capacidad de extracción web externa a través de MCP.

Ingesta de documentación

Convierte documentación en línea en Markdown adecuado para procesamiento posterior.

Automatización agéntica

Usa la extracción web como una herramienta entre muchas en un flujo de trabajo autónomo.

Diseño orientado al rendimiento

La arquitectura separa la capa de adquisición web de la aplicación de IA.

En lugar de que cada aplicación de IA mantenga un scraper personalizado, el enfoque se convierte en:

                ┌───────────────┐
                │ Scrapling MCP  │
                └───────┬───────┘
                        │
          ┌─────────────┼─────────────┐
          ▼             ▼             ▼
        RAG          Agent          AI IDE

Esto permite que la infraestructura de scraping se implemente una vez y se reutilice en múltiples flujos de trabajo.

Consideraciones de seguridad

Al implementar el servidor públicamente:

  • No expongas credenciales de AWS en el contenedor

  • Usa HTTPS en producción

  • Restringe el acceso a la red cuando sea apropiado

  • Valida las URL solicitadas

  • Aplica límites de velocidad cuando sea necesario

  • Monitorea el consumo de recursos

  • Evita raspar sitios web en violación de sus términos o leyes aplicables

  • Mantén los secretos en variables de entorno o en un administrador de secretos dedicado

Recomendaciones de producción

Para una implementación de producción, considera agregar:

  • Autenticación

  • Control de acceso a API/MCP

  • HTTPS

  • Limitación de velocidad

  • Registro de solicitudes

  • Observabilidad

  • Políticas de reintento

  • Caché

  • Listas de permitidas de URL

  • Límites de recursos

  • Comprobaciones de salud

  • Monitoreo y alertas

Mejoras futuras

  • Autenticación para clientes MCP

  • Lista de permitidas de URL/dominio

  • Caché de contenido

  • Rastreo distribuido

  • Ingesta basada en colas

  • División automática de documentos en fragmentos

  • Integración directa con bases de datos vectoriales

  • Almacenamiento de documentos basado en S3

  • Programación de rastreo

  • Panel de observabilidad

  • Control de acceso multiusuario

Ejemplo de flujo de trabajo de extremo a extremo

User / Agent → MCP-Compatible IDE → Scrapling MCP Server → Website
    → Markdown → Document Processing → Chunking → Embeddings
    → Vector DB → Retriever → LLM → Final Response

Repositorio

GitHub: github.com/Santhosh-p653/aws-mcp-test

Artículo técnico

La arquitectura, la implementación y la motivación detrás de este proyecto están documentadas en AWS Builder Center:

Supercharging Agentic AI with Fast Web Scraping using Scrapling, MCP, and AWS Lightsail

Contribuciones

Las contribuciones, ideas, mejoras y experimentos son bienvenidos. Si construyes algo usando este servidor MCP, no dudes en abrir un issue o pull request y compartir el flujo de trabajo.

Autor

Santhosh P

Construyendo sistemas alrededor de:

  • Agentes de IA

  • RAG

  • MCP

  • Infraestructura en la nube

  • Pipelines de datos web

  • IA/ML

GitHub: @Santhosh-p653


Idea clave: Implementa la capacidad de scraping una sola vez. Conéctala a tus flujos de trabajo de IA siempre que necesites datos web frescos y estructurados.

Scrapling + MCP convierte la extracción web en un componente de infraestructura reutilizable para el stack moderno de LLM.

F
license - not found
Not graded
quality - not tested
B
maintenance

Maintenance

Maintainers
Response time
Release cycle
Releases (12mo)
Commit activity

Resources

Unclaimed servers have limited discoverability.

Looking for Admin?

If you are the server author, to access and configure the admin panel.

Related MCP Servers

  • A
    license
    Not graded
    quality
    Not graded
    maintenance
    An MCP server that extracts clean, structured Markdown content from web page URLs using the WebforAI library. It simplifies feeding web content into AI models by removing HTML noise and intelligently processing tables and links.
  • A
    license
    A
    quality
    C
    maintenance
    MCP-native web scraping and search API for AI agents. Converts any URL to clean Markdown with 90% success rate, including Cloudflare-protected sites and JS SPAs. Real-time web search via Brave Search API. CAPTCHA solving built-in. 10 free scrapes/day.
    5
    8
    4
    MIT
  • A
    license
    Not graded
    quality
    C
    maintenance
    MCP server for AI agents -- fetch any URL with full JavaScript rendering (Playwright/Chromium) and convert to clean, token-efficient markdown. Works on React, Vue, Angular, and any JS-heavy page. Includes web search, batch fetching, binary file download, LRU cache, SSRF protection, and structured output.
    13
    MIT

View all related MCP servers

Related MCP Connectors

  • Web scraping for AI agents. Converts URLs to clean, LLM-ready Markdown with anti-bot bypass.

  • Jina AI Reader/Search MCP — turn any URL into clean LLM-ready markdown, plus web search.

  • Converts any URL to clean, LLM-ready Markdown using real Chrome browsers

View all MCP Connectors

Latest Blog Posts

MCP directory API

We provide all the information about MCP servers via our MCP API.

curl -X GET 'https://glama.ai/api/mcp/v1/servers/Santhosh-p653/aws-mcp-test'

If you have feedback or need assistance with the MCP directory API, please join our Discord server