Scrapling MCP Server
Scrapling MCP Server на AWS Lightsail
Высокопроизводительный MCP-сервер для извлечения веб-данных, который превращает живой веб-контент в готовый к использованию LLM Markdown — разверните один раз, затем подключайте его к своим AI IDE, агентам, RAG-пайплайнам и сценариям автоматизации.
Обзор
Современным AI-приложениям всё чаще требуется доступ к свежим, структурированным внешним знаниям. Вместо того чтобы реализовывать веб-скрапинг отдельно внутри каждой RAG-системы или AI-агента, этот проект предоставляет возможности извлечения веб-данных Scrapling через Model Context Protocol (MCP).
После развёртывания любой MCP-совместимый AI-клиент может подключиться к серверу и использовать его как переиспользуемый компонент приёма веб-данных.
┌──────────────────────┐
│ AI IDE / AI Agent │
│ Claude / MCP Client │
└──────────┬────────────┘
│ MCP
▼
┌──────────────────────┐
│ Scrapling MCP │
│ Server │
└──────────┬────────────┘
▼
┌──────────────────────┐
│ Web │
│ Dynamic / Static │
│ Content │
└──────────┬────────────┘
▼
┌──────────────────────┐
│ Markdown │
│ LLM-ready Data │
└──────────┬────────────┘
▼
┌─────────────────────────────────┐
│ RAG / Embeddings / Vector DB / │
│ Knowledge Base / Agent Memory │
└─────────────────────────────────┘Related MCP server: Anybrowse
Зачем MCP для извлечения веб-данных?
Традиционно каждое AI-приложение, которому нужны веб-данные, реализует собственные:
HTTP-запросы
Разбор HTML
Автоматизацию браузера
Обработку динамических страниц
Логику извлечения
Механизмы повторов
Нормализацию контента
Это создаёт дублирующуюся инфраструктуру. С MCP извлечение веб-данных становится общей возможностью.
До — множественные реализации:
RAG App ──────► Scraper
Agent ──────► Scraper
Research Tool ──────► Scraper
AI IDE ──────► ScraperПосле — одна возможность, множество клиентов:
RAG App ──┐
Agent ──┼──► Scrapling MCP Server
AI IDE ──┤
Research ──┘Разверните сервер один раз и переиспользуйте его в MCP-совместимых рабочих процессах.
Не просто веб-скрапер
Основная идея этого проекта шире, чем скрапинг. Для многих LLM-приложений внешняя информация в конечном счёте должна превратиться в представление, которое можно разбирать, очищать, структурировать, разбивать на чанки, эмбеддить, индексировать и извлекать.
Markdown особенно полезен в этом пайплайне, поскольку он сохраняет полезную иерархию документа:
Web Page → Scrapling → Markdown
├── Heading
├── Subheading
├── Paragraph
├── List
├── Table
└── Links
│
▼
Chunking → Embeddings → Vector Database → RAG / AgentЭто делает MCP-сервер полезным как слой вставки/приёма данных для LLM, а не только как утилиту для скрапинга.
Возможности
MCP-совместимое извлечение веб-данных
На базе Scrapling
Разработан для AI-агентов и AI IDE
Ориентирован на вывод в Markdown
Подходит для RAG-пайплайнов приёма данных
Контейнеризирован с помощью Docker
Разворачивается на AWS Lightsail
Переиспользуется в нескольких AI-приложениях
Отделяет получение данных от самого AI-приложения
Может быть интегрирован в агентные рабочие процессы
Архитектура
Internet
│
▼
┌───────────────┐
│ Web │
└───────┬───────┘
▼
┌───────────────────┐
│ Scrapling │
│ Extraction Layer │
└─────────┬─────────┘
▼
┌───────────────────┐
│ MCP Server │
│ Tool Interface │
└─────────┬─────────┘
│
MCP Protocol
│
┌─────────────┼─────────────┐
▼ ▼ ▼
AI IDE Agent RAG
│ │ │
└─────────────┼─────────────┘
▼
Markdown / Data
▼
┌────────────────────┐
│ LLM Data Pipeline │
└──────────┬─────────┘
▼
┌────────────────────┐
│ Embeddings / DB │
└──────────┬─────────┘
▼
LLM / RAGТехнологический стек
Компонент | Технология |
Извлечение веб-данных | Scrapling |
Протокол | Model Context Protocol (MCP) |
Язык | Python |
Контейнеризация | Docker |
Облако | AWS Lightsail |
CI/CD | GitHub Actions |
Вывод | Markdown / Структурированный контент |
AI-интеграция | MCP-совместимые клиенты |
Структура проекта
.
├── src/
│ └── ...
├── Dockerfile
├── requirements.txt
├── .dockerignore
├── .gitignore
├── docker-compose.yml
└── README.mdСкорректируйте структуру выше, если ваш репозиторий использует другую раскладку исходников.
Локальный запуск
1. Клонируйте репозиторий
git clone https://github.com/Santhosh-p653/aws-mcp-test.git
cd aws-mcp-test2. Установите зависимости
Создайте и активируйте виртуальное окружение:
python -m venv .venv
# Linux / macOS
source .venv/bin/activate
# Windows
.venv\Scripts\activateУстановите зависимости:
pip install -r requirements.txtЗапуск с Docker
Соберите образ:
docker build -t scrapling-mcp .Запустите контейнер:
docker run -d \
--name scrapling-mcp \
-p 8000:8000 \
scrapling-mcpПроверьте, что контейнер работает:
docker psРазвёртывание на AWS Lightsail
Проект спроектирован для работы как контейнеризированный сервис на AWS Lightsail.
Общий поток развёртывания:
GitHub → Push → GitHub Actions → Build → Docker Image → Deploy → AWS Lightsail
│
▼
Scrapling MCP Server
│
▼
MCP-Compatible AI ClientsШаги развёртывания
Создайте контейнерный сервис AWS Lightsail — через консоль AWS или AWS CLI.
Соберите Docker-образ
docker build -t scrapling-mcp .Запушьте/разверните контейнер — настройте развёртывание контейнера Lightsail, используя образ, созданный вашим CI/CD-процессом.
Настройте переменные окружения — храните учётные данные и конфигурацию развёртывания вне репозитория:
AWS_REGION= LIGHTSAIL_SERVICE= CONTAINER_NAME=
⚠️ Никогда не коммитьте секреты или учётные данные в Git.
GitHub Actions
Репозиторий может использовать GitHub Actions для автоматизации развёртывания:
git push → GitHub Actions
├── Checkout
├── Configure AWS credentials
├── Build container
├── Push/deploy
└── Update LightsailРазвёртывание затем следует простому рабочему процессу:
git add .
git commit -m "update scraper"
git push origin mainПосле завершения рабочего процесса обновлённый MCP-сервер развёрнут.
Использование MCP-сервера
После развёртывания сервера подключите его MCP-эндпоинт к MCP-совместимому AI-клиенту:
AI Client → MCP → https://your-mcp-server.example.com → Scrapling → Web ContentAI-клиент затем может вызывать предоставленные инструменты в рамках своего рабочего процесса — сервер ведёт себя как плагин для AI-приложений, заменяя собственный код скрапинга внутри каждого проекта:
AI Application
├── RAG
├── Agents
├── Research
└── Automation
│
▼
MCP Server → ScraplingИнтеграция с RAG
Типичный RAG-пайплайн может использовать этот сервер как слой приёма данных:
Web Sources → Scrapling MCP → Markdown → Document Parser → Chunking
→ Embeddings → Vector Store → Retriever → LLMВозможные нижестоящие компоненты включают:
Qdrant
PostgreSQL + pgvector
Elasticsearch
OpenSearch
Chroma
FAISS
Пользовательские хранилища знаний
MCP-сервер остаётся независимым от нижестоящего слоя хранения.
Агентный рабочий процесс
Сервер также может стать инструментом, доступным AI-агенту:
User → AI Agent
├── Decide what information is required
├── Call Scrapling MCP
├── Extract relevant content
├── Transform/use Markdown
├── Store information
└── Generate final responseЭто позволяет агенту динамически получать информацию вместо того, чтобы полагаться только на статические обучающие данные или ранее проиндексированные документы.
Почему Markdown?
Markdown предоставляет полезное промежуточное представление для LLM-пайплайнов, поскольку сохраняет семантическую структуру.
Markdown:
# AWS Lambda
## Overview
AWS Lambda is a serverless compute service.
## Features
- Event-driven execution
- Automatic scaling
- Pay-per-use pricing
## Architecture
### Invocation
Lambda functions can be invoked through multiple AWS services.По сравнению с сырым HTML:
<div>
<h1>AWS Lambda</h1>
<div>
<h2>Overview</h2>
...
</div>
</div>Markdown, как правило, легче проверять, очищать, разбивать на чанки, обрабатывать, хранить и передавать в LLM-пайплайны.
Таким образом, цель — не просто «соскрапить веб-страницу», а получить внешние знания в форме, которая может естественным образом войти в LLM-пайплайн данных.
Варианты использования
Вариант использования | Описание |
RAG-системы | Автоматически получайте свежую веб-информацию перед её индексацией. |
AI-агенты для исследований | Позволяйте агентам извлекать и анализировать информацию с живых сайтов. |
Базы знаний | Создавайте постоянно обновляемые репозитории знаний. |
AI IDE | Дайте ассистентам по коду внешнюю возможность извлечения веб-данных через MCP. |
Приём документации | Преобразуйте онлайн-документацию в Markdown, подходящий для дальнейшей обработки. |
Агентная автоматизация | Используйте извлечение веб-данных как один из многих инструментов в автономном рабочем процессе. |
Проектирование, ориентированное на производительность
Архитектура отделяет слой получения веб-данных от AI-приложения.
Вместо того чтобы каждое AI-приложение поддерживало собственный скрапер, подход становится таким:
┌───────────────┐
│ Scrapling MCP │
└───────┬───────┘
│
┌─────────────┼─────────────┐
▼ ▼ ▼
RAG Agent AI IDEЭто позволяет развернуть инфраструктуру скрапинга один раз и переиспользовать её в нескольких рабочих процессах.
Вопросы безопасности
При публичном развёртывании сервера:
Не раскрывайте учётные данные AWS в контейнере
Используйте HTTPS в продакшене
Ограничивайте сетевой доступ там, где это уместно
Проверяйте запрашиваемые URL
Применяйте ограничения частоты запросов, где это требуется
Контролируйте потребление ресурсов
Избегайте скрапинга сайтов в нарушение их условий или применимого законодательства
Храните секреты в переменных окружения или в выделенном менеджере секретов
Рекомендации для продакшена
Для продакшен-развёртывания рассмотрите добавление:
Аутентификации
Контроля доступа к API/MCP
HTTPS
Ограничения частоты запросов
Логирования запросов
Наблюдаемости
Политик повторов
Кэширования
Списков разрешённых URL
Лимитов ресурсов
Проверок работоспособности
Мониторинга и оповещений
Будущие улучшения
Аутентификация для MCP-клиентов
Списки разрешённых URL/доменов
Кэширование контента
Распределённый краулинг
Приём данных на основе очередей
Автоматическое разбиение документов на чанки
Прямая интеграция с векторными базами данных
Хранение документов на S3
Планирование краулинга
Панель наблюдаемости
Многопользовательский контроль доступа
Пример сквозного рабочего процесса
User / Agent → MCP-Compatible IDE → Scrapling MCP Server → Website
→ Markdown → Document Processing → Chunking → Embeddings
→ Vector DB → Retriever → LLM → Final ResponseРепозиторий
GitHub: github.com/Santhosh-p653/aws-mcp-test
Техническая статья
Архитектура, развёртывание и мотивация этого проекта задокументированы в AWS Builder Center:
Supercharging Agentic AI with Fast Web Scraping using Scrapling, MCP, and AWS Lightsail
Вклад в проект
Приветствуются вклады, идеи, улучшения и эксперименты. Если вы создали что-то с использованием этого MCP-сервера, не стесняйтесь открыть issue или pull request и поделиться рабочим процессом.
Автор
Santhosh P
Создаёт системы вокруг:
AI-агентов
RAG
MCP
Облачной инфраструктуры
Пайплайнов веб-данных
AI/ML
GitHub: @Santhosh-p653
Ключевая идея: Разверните возможность скрапинга один раз. Подключайте её к своим AI-рабочим процессам всякий раз, когда вам нужны свежие структурированные веб-данные.
Scrapling + MCP превращает извлечение веб-данных в переиспользуемый инфраструктурный компонент для современного LLM-стека.
This server cannot be installed
Maintenance
Resources
Unclaimed servers have limited discoverability.
Looking for Admin?
If you are the server author, to access and configure the admin panel.
Related MCP Servers
- AlicenseNot gradedqualityNot gradedmaintenanceAn MCP server that extracts clean, structured Markdown content from web page URLs using the WebforAI library. It simplifies feeding web content into AI models by removing HTML noise and intelligently processing tables and links.
- AlicenseAqualityCmaintenanceMCP-native web scraping and search API for AI agents. Converts any URL to clean Markdown with 90% success rate, including Cloudflare-protected sites and JS SPAs. Real-time web search via Brave Search API. CAPTCHA solving built-in. 10 free scrapes/day.584MIT
- AlicenseNot gradedqualityCmaintenanceMCP server for AI agents -- fetch any URL with full JavaScript rendering (Playwright/Chromium) and convert to clean, token-efficient markdown. Works on React, Vue, Angular, and any JS-heavy page. Includes web search, batch fetching, binary file download, LRU cache, SSRF protection, and structured output.13MIT
- AlicenseAqualityDmaintenanceConverts URLs and raw HTML to clean Markdown, enabling AI assistants to read web pages for summarization, analysis, or ingestion.2171MIT
Related MCP Connectors
Web scraping for AI agents. Converts URLs to clean, LLM-ready Markdown with anti-bot bypass.
Jina AI Reader/Search MCP — turn any URL into clean LLM-ready markdown, plus web search.
Converts any URL to clean, LLM-ready Markdown using real Chrome browsers
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/Santhosh-p653/aws-mcp-test'
If you have feedback or need assistance with the MCP directory API, please join our Discord server