Scrapling MCP Server
Servidor MCP de Scrapling en AWS Lightsail
Un servidor MCP de extracción web de alto rendimiento que convierte contenido web en vivo en Markdown listo para LLM: impleméntalo una vez y conéctalo a tus IDEs de IA, agentes, pipelines de RAG y flujos de automatización.
Descripción general
Las aplicaciones de IA modernas necesitan cada vez más acceso a conocimiento externo fresco y estructurado. En lugar de implementar el raspado web por separado dentro de cada sistema RAG o agente de IA, este proyecto expone las capacidades de extracción web de Scrapling a través del Model Context Protocol (MCP).
Una vez implementado, cualquier cliente de IA compatible con MCP puede conectarse al servidor y usarlo como un componente reutilizable de ingesta de datos web.
┌──────────────────────┐
│ AI IDE / AI Agent │
│ Claude / MCP Client │
└──────────┬────────────┘
│ MCP
▼
┌──────────────────────┐
│ Scrapling MCP │
│ Server │
└──────────┬────────────┘
▼
┌──────────────────────┐
│ Web │
│ Dynamic / Static │
│ Content │
└──────────┬────────────┘
▼
┌──────────────────────┐
│ Markdown │
│ LLM-ready Data │
└──────────┬────────────┘
▼
┌─────────────────────────────────┐
│ RAG / Embeddings / Vector DB / │
│ Knowledge Base / Agent Memory │
└─────────────────────────────────┘Related MCP server: Anybrowse
¿Por qué MCP para la extracción web?
Tradicionalmente, cada aplicación de IA que necesita datos web implementa su propio:
Solicitudes HTTP
Análisis de HTML
Automatización del navegador
Manejo de páginas dinámicas
Lógica de extracción
Mecanismos de reintento
Normalización de contenido
Esto crea infraestructura duplicada. Con MCP, la extracción web se convierte en una capacidad compartida.
Antes — múltiples implementaciones:
RAG App ──────► Scraper
Agent ──────► Scraper
Research Tool ──────► Scraper
AI IDE ──────► ScraperDespués — una capacidad, múltiples clientes:
RAG App ──┐
Agent ──┼──► Scrapling MCP Server
AI IDE ──┤
Research ──┘Implementa el servidor una vez y reutilízalo en flujos de trabajo compatibles con MCP.
No es solo un raspador web
La idea central detrás de este proyecto es más amplia que el raspado. Para muchas aplicaciones de LLM, la información externa eventualmente necesita convertirse en una representación que pueda ser analizada, limpiada, estructurada, dividida en fragmentos, incrustada, indexada y recuperada.
Markdown es particularmente útil en este pipeline porque preserva una jerarquía documental útil:
Web Page → Scrapling → Markdown
├── Heading
├── Subheading
├── Paragraph
├── List
├── Table
└── Links
│
▼
Chunking → Embeddings → Vector Database → RAG / AgentEsto hace que el servidor MCP sea útil como una capa de inserción/ingesta de datos para LLM, en lugar de solo una utilidad de scraping.
Características
Extracción web compatible con MCP
Impulsado por Scrapling
Diseñado para agentes de IA e IDEs de IA
Salida orientada a Markdown
Adecuado para pipelines de ingesta de RAG
Contenerizado con Docker
Implementable en AWS Lightsail
Reutilizable en múltiples aplicaciones de IA
Separa la adquisición de datos de la propia aplicación de IA
Puede integrarse en flujos de trabajo agénticos
Arquitectura
Internet
│
▼
┌───────────────┐
│ Web │
└───────┬───────┘
▼
┌───────────────────┐
│ Scrapling │
│ Extraction Layer │
└─────────┬─────────┘
▼
┌───────────────────┐
│ MCP Server │
│ Tool Interface │
└─────────┬─────────┘
│
MCP Protocol
│
┌─────────────┼─────────────┐
▼ ▼ ▼
AI IDE Agent RAG
│ │ │
└─────────────┼─────────────┘
▼
Markdown / Data
▼
┌────────────────────┐
│ LLM Data Pipeline │
└──────────┬─────────┘
▼
┌────────────────────┐
│ Embeddings / DB │
└──────────┬─────────┘
▼
LLM / RAGPila tecnológica
Componente | Tecnología |
Extracción web | Scrapling |
Protocolo | Model Context Protocol (MCP) |
Lenguaje | Python |
Contenerización | Docker |
Nube | AWS Lightsail |
CI/CD | GitHub Actions |
Salida | Markdown / Contenido estructurado |
Integración de IA | Clientes compatibles con MCP |
Estructura del proyecto
.
├── src/
│ └── ...
├── Dockerfile
├── requirements.txt
├── .dockerignore
├── .gitignore
├── docker-compose.yml
└── README.mdAjusta la estructura anterior si tu repositorio utiliza una disposición de código fuente diferente.
Ejecución local
1. Clona el repositorio
git clone https://github.com/Santhosh-p653/aws-mcp-test.git
cd aws-mcp-test2. Instala las dependencias
Crea y activa un entorno virtual:
python -m venv .venv
# Linux / macOS
source .venv/bin/activate
# Windows
.venv\Scripts\activateInstala las dependencias:
pip install -r requirements.txtEjecutar con Docker
Construye la imagen:
docker build -t scrapling-mcp .Ejecuta el contenedor:
docker run -d \
--name scrapling-mcp \
-p 8000:8000 \
scrapling-mcpVerifica que el contenedor esté en ejecución:
docker psImplementar en AWS Lightsail
El proyecto está diseñado para ejecutarse como un servicio contenerizado en AWS Lightsail.
Flujo de implementación de alto nivel:
GitHub → Push → GitHub Actions → Build → Docker Image → Deploy → AWS Lightsail
│
▼
Scrapling MCP Server
│
▼
MCP-Compatible AI ClientsPasos de implementación
Crea un servicio de contenedores de AWS Lightsail — desde la consola de AWS o la CLI de AWS.
Construye la imagen de Docker
docker build -t scrapling-mcp .Envía/implementa el contenedor — configura la implementación del contenedor de Lightsail usando la imagen producida por tu flujo de trabajo de CI/CD.
Configura las variables de entorno — mantén las credenciales y la configuración de implementación fuera del repositorio:
AWS_REGION= LIGHTSAIL_SERVICE= CONTAINER_NAME=
⚠️ Nunca confirmes secretos ni credenciales en Git.
GitHub Actions
El repositorio puede usar GitHub Actions para automatizar la implementación:
git push → GitHub Actions
├── Checkout
├── Configure AWS credentials
├── Build container
├── Push/deploy
└── Update LightsailLa implementación sigue entonces un flujo de trabajo simple:
git add .
git commit -m "update scraper"
git push origin mainDespués de que el flujo de trabajo se complete, el servidor MCP actualizado queda implementado.
Uso del servidor MCP
Una vez que el servidor esté implementado, conecta su endpoint MCP a un cliente de IA compatible con MCP:
AI Client → MCP → https://your-mcp-server.example.com → Scrapling → Web ContentEl cliente de IA puede entonces invocar las herramientas expuestas como parte de su flujo de trabajo — el servidor se comporta como un complemento para aplicaciones de IA, reemplazando el código de scraping personalizado dentro de cada proyecto:
AI Application
├── RAG
├── Agents
├── Research
└── Automation
│
▼
MCP Server → ScraplingIntegración con RAG
Un pipeline de RAG típico puede usar este servidor como la capa de ingesta:
Web Sources → Scrapling MCP → Markdown → Document Parser → Chunking
→ Embeddings → Vector Store → Retriever → LLMLos posibles componentes posteriores incluyen:
Qdrant
PostgreSQL + pgvector
Elasticsearch
OpenSearch
Chroma
FAISS
Almacenes de conocimiento personalizados
El servidor MCP permanece independiente de la capa de almacenamiento posterior.
Flujo de trabajo agéntico
El servidor también puede convertirse en una herramienta disponible para un agente de IA:
User → AI Agent
├── Decide what information is required
├── Call Scrapling MCP
├── Extract relevant content
├── Transform/use Markdown
├── Store information
└── Generate final responseEsto permite que el agente adquiera información dinámicamente en lugar de depender solo de datos de entrenamiento estáticos o documentos previamente indexados.
¿Por qué Markdown?
Markdown proporciona una representación intermedia útil para pipelines de LLM porque preserva la estructura semántica.
Markdown:
# AWS Lambda
## Overview
AWS Lambda is a serverless compute service.
## Features
- Event-driven execution
- Automatic scaling
- Pay-per-use pricing
## Architecture
### Invocation
Lambda functions can be invoked through multiple AWS services.En comparación con HTML sin procesar:
<div>
<h1>AWS Lambda</h1>
<div>
<h2>Overview</h2>
...
</div>
</div>Markdown es generalmente más fácil de inspeccionar, limpiar, dividir en fragmentos, procesar, almacenar y pasar a pipelines de LLM.
El objetivo, por lo tanto, no es simplemente "raspar una página web" — es adquirir conocimiento externo en una forma que pueda entrar naturalmente en un pipeline de datos de LLM.
Casos de uso
Caso de uso | Descripción |
Sistemas RAG | Adquiere automáticamente información web fresca antes de indexarla. |
Agentes de investigación de IA | Permite que los agentes recuperen y analicen información de sitios web en vivo. |
Bases de conocimiento | Construye repositorios de conocimiento actualizados continuamente. |
IDEs de IA | Proporciona a los asistentes de codificación una capacidad de extracción web externa a través de MCP. |
Ingesta de documentación | Convierte documentación en línea en Markdown adecuado para procesamiento posterior. |
Automatización agéntica | Usa la extracción web como una herramienta entre muchas en un flujo de trabajo autónomo. |
Diseño orientado al rendimiento
La arquitectura separa la capa de adquisición web de la aplicación de IA.
En lugar de que cada aplicación de IA mantenga un scraper personalizado, el enfoque se convierte en:
┌───────────────┐
│ Scrapling MCP │
└───────┬───────┘
│
┌─────────────┼─────────────┐
▼ ▼ ▼
RAG Agent AI IDEEsto permite que la infraestructura de scraping se implemente una vez y se reutilice en múltiples flujos de trabajo.
Consideraciones de seguridad
Al implementar el servidor públicamente:
No expongas credenciales de AWS en el contenedor
Usa HTTPS en producción
Restringe el acceso a la red cuando sea apropiado
Valida las URL solicitadas
Aplica límites de velocidad cuando sea necesario
Monitorea el consumo de recursos
Evita raspar sitios web en violación de sus términos o leyes aplicables
Mantén los secretos en variables de entorno o en un administrador de secretos dedicado
Recomendaciones de producción
Para una implementación de producción, considera agregar:
Autenticación
Control de acceso a API/MCP
HTTPS
Limitación de velocidad
Registro de solicitudes
Observabilidad
Políticas de reintento
Caché
Listas de permitidas de URL
Límites de recursos
Comprobaciones de salud
Monitoreo y alertas
Mejoras futuras
Autenticación para clientes MCP
Lista de permitidas de URL/dominio
Caché de contenido
Rastreo distribuido
Ingesta basada en colas
División automática de documentos en fragmentos
Integración directa con bases de datos vectoriales
Almacenamiento de documentos basado en S3
Programación de rastreo
Panel de observabilidad
Control de acceso multiusuario
Ejemplo de flujo de trabajo de extremo a extremo
User / Agent → MCP-Compatible IDE → Scrapling MCP Server → Website
→ Markdown → Document Processing → Chunking → Embeddings
→ Vector DB → Retriever → LLM → Final ResponseRepositorio
GitHub: github.com/Santhosh-p653/aws-mcp-test
Artículo técnico
La arquitectura, la implementación y la motivación detrás de este proyecto están documentadas en AWS Builder Center:
Supercharging Agentic AI with Fast Web Scraping using Scrapling, MCP, and AWS Lightsail
Contribuciones
Las contribuciones, ideas, mejoras y experimentos son bienvenidos. Si construyes algo usando este servidor MCP, no dudes en abrir un issue o pull request y compartir el flujo de trabajo.
Autor
Santhosh P
Construyendo sistemas alrededor de:
Agentes de IA
RAG
MCP
Infraestructura en la nube
Pipelines de datos web
IA/ML
GitHub: @Santhosh-p653
Idea clave: Implementa la capacidad de scraping una sola vez. Conéctala a tus flujos de trabajo de IA siempre que necesites datos web frescos y estructurados.
Scrapling + MCP convierte la extracción web en un componente de infraestructura reutilizable para el stack moderno de LLM.
This server cannot be installed
Maintenance
Resources
Unclaimed servers have limited discoverability.
Looking for Admin?
If you are the server author, to access and configure the admin panel.
Related MCP Servers
- AlicenseNot gradedqualityNot gradedmaintenanceAn MCP server that extracts clean, structured Markdown content from web page URLs using the WebforAI library. It simplifies feeding web content into AI models by removing HTML noise and intelligently processing tables and links.
- AlicenseAqualityCmaintenanceMCP-native web scraping and search API for AI agents. Converts any URL to clean Markdown with 90% success rate, including Cloudflare-protected sites and JS SPAs. Real-time web search via Brave Search API. CAPTCHA solving built-in. 10 free scrapes/day.584MIT
- AlicenseNot gradedqualityCmaintenanceMCP server for AI agents -- fetch any URL with full JavaScript rendering (Playwright/Chromium) and convert to clean, token-efficient markdown. Works on React, Vue, Angular, and any JS-heavy page. Includes web search, batch fetching, binary file download, LRU cache, SSRF protection, and structured output.13MIT
- AlicenseAqualityDmaintenanceConverts URLs and raw HTML to clean Markdown, enabling AI assistants to read web pages for summarization, analysis, or ingestion.2171MIT
Related MCP Connectors
Web scraping for AI agents. Converts URLs to clean, LLM-ready Markdown with anti-bot bypass.
Jina AI Reader/Search MCP — turn any URL into clean LLM-ready markdown, plus web search.
Converts any URL to clean, LLM-ready Markdown using real Chrome browsers
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/Santhosh-p653/aws-mcp-test'
If you have feedback or need assistance with the MCP directory API, please join our Discord server