Skip to main content
Glama
Santhosh-p653

Scrapling MCP Server

Scrapling MCP Server на AWS Lightsail

Высокопроизводительный MCP-сервер для извлечения веб-данных, который превращает живой веб-контент в готовый к использованию LLM Markdown — разверните один раз, затем подключайте его к своим AI IDE, агентам, RAG-пайплайнам и сценариям автоматизации.

AWS MCP Python Docker Scrapling

Обзор

Современным AI-приложениям всё чаще требуется доступ к свежим, структурированным внешним знаниям. Вместо того чтобы реализовывать веб-скрапинг отдельно внутри каждой RAG-системы или AI-агента, этот проект предоставляет возможности извлечения веб-данных Scrapling через Model Context Protocol (MCP).

После развёртывания любой MCP-совместимый AI-клиент может подключиться к серверу и использовать его как переиспользуемый компонент приёма веб-данных.

┌──────────────────────┐
│   AI IDE / AI Agent   │
│ Claude / MCP Client   │
└──────────┬────────────┘
           │ MCP
           ▼
┌──────────────────────┐
│   Scrapling MCP       │
│      Server           │
└──────────┬────────────┘
           ▼
┌──────────────────────┐
│        Web            │
│  Dynamic / Static      │
│     Content            │
└──────────┬────────────┘
           ▼
┌──────────────────────┐
│      Markdown          │
│   LLM-ready Data       │
└──────────┬────────────┘
           ▼
┌─────────────────────────────────┐
│ RAG / Embeddings / Vector DB /   │
│ Knowledge Base / Agent Memory    │
└─────────────────────────────────┘

Related MCP server: Anybrowse

Зачем MCP для извлечения веб-данных?

Традиционно каждое AI-приложение, которому нужны веб-данные, реализует собственные:

  • HTTP-запросы

  • Разбор HTML

  • Автоматизацию браузера

  • Обработку динамических страниц

  • Логику извлечения

  • Механизмы повторов

  • Нормализацию контента

Это создаёт дублирующуюся инфраструктуру. С MCP извлечение веб-данных становится общей возможностью.

До — множественные реализации:

RAG App        ──────► Scraper
Agent          ──────► Scraper
Research Tool  ──────► Scraper
AI IDE         ──────► Scraper

После — одна возможность, множество клиентов:

RAG App    ──┐
Agent      ──┼──► Scrapling MCP Server
AI IDE     ──┤
Research   ──┘

Разверните сервер один раз и переиспользуйте его в MCP-совместимых рабочих процессах.

Не просто веб-скрапер

Основная идея этого проекта шире, чем скрапинг. Для многих LLM-приложений внешняя информация в конечном счёте должна превратиться в представление, которое можно разбирать, очищать, структурировать, разбивать на чанки, эмбеддить, индексировать и извлекать.

Markdown особенно полезен в этом пайплайне, поскольку он сохраняет полезную иерархию документа:

Web Page → Scrapling → Markdown
                          ├── Heading
                          ├── Subheading
                          ├── Paragraph
                          ├── List
                          ├── Table
                          └── Links
                          │
                          ▼
                      Chunking → Embeddings → Vector Database → RAG / Agent

Это делает MCP-сервер полезным как слой вставки/приёма данных для LLM, а не только как утилиту для скрапинга.

Возможности

  • MCP-совместимое извлечение веб-данных

  • На базе Scrapling

  • Разработан для AI-агентов и AI IDE

  • Ориентирован на вывод в Markdown

  • Подходит для RAG-пайплайнов приёма данных

  • Контейнеризирован с помощью Docker

  • Разворачивается на AWS Lightsail

  • Переиспользуется в нескольких AI-приложениях

  • Отделяет получение данных от самого AI-приложения

  • Может быть интегрирован в агентные рабочие процессы

Архитектура

                    Internet
                       │
                       ▼
                ┌───────────────┐
                │      Web       │
                └───────┬───────┘
                        ▼
              ┌───────────────────┐
              │     Scrapling      │
              │  Extraction Layer  │
              └─────────┬─────────┘
                        ▼
              ┌───────────────────┐
              │    MCP Server      │
              │   Tool Interface   │
              └─────────┬─────────┘
                        │
                   MCP Protocol
                        │
          ┌─────────────┼─────────────┐
          ▼             ▼             ▼
       AI IDE         Agent          RAG
          │             │             │
          └─────────────┼─────────────┘
                        ▼
                Markdown / Data
                        ▼
              ┌────────────────────┐
              │ LLM Data Pipeline   │
              └──────────┬─────────┘
                        ▼
              ┌────────────────────┐
              │  Embeddings / DB    │
              └──────────┬─────────┘
                        ▼
                     LLM / RAG

Технологический стек

Компонент

Технология

Извлечение веб-данных

Scrapling

Протокол

Model Context Protocol (MCP)

Язык

Python

Контейнеризация

Docker

Облако

AWS Lightsail

CI/CD

GitHub Actions

Вывод

Markdown / Структурированный контент

AI-интеграция

MCP-совместимые клиенты

Структура проекта

.
├── src/
│   └── ...
├── Dockerfile
├── requirements.txt
├── .dockerignore
├── .gitignore
├── docker-compose.yml
└── README.md

Скорректируйте структуру выше, если ваш репозиторий использует другую раскладку исходников.

Локальный запуск

1. Клонируйте репозиторий

git clone https://github.com/Santhosh-p653/aws-mcp-test.git
cd aws-mcp-test

2. Установите зависимости

Создайте и активируйте виртуальное окружение:

python -m venv .venv

# Linux / macOS
source .venv/bin/activate

# Windows
.venv\Scripts\activate

Установите зависимости:

pip install -r requirements.txt

Запуск с Docker

Соберите образ:

docker build -t scrapling-mcp .

Запустите контейнер:

docker run -d \
  --name scrapling-mcp \
  -p 8000:8000 \
  scrapling-mcp

Проверьте, что контейнер работает:

docker ps

Развёртывание на AWS Lightsail

Проект спроектирован для работы как контейнеризированный сервис на AWS Lightsail.

Общий поток развёртывания:

GitHub → Push → GitHub Actions → Build → Docker Image → Deploy → AWS Lightsail
                                                                      │
                                                                      ▼
                                                          Scrapling MCP Server
                                                                      │
                                                                      ▼
                                                      MCP-Compatible AI Clients

Шаги развёртывания

  1. Создайте контейнерный сервис AWS Lightsail — через консоль AWS или AWS CLI.

  2. Соберите Docker-образ

    docker build -t scrapling-mcp .
  3. Запушьте/разверните контейнер — настройте развёртывание контейнера Lightsail, используя образ, созданный вашим CI/CD-процессом.

  4. Настройте переменные окружения — храните учётные данные и конфигурацию развёртывания вне репозитория:

    AWS_REGION=
    LIGHTSAIL_SERVICE=
    CONTAINER_NAME=

⚠️ Никогда не коммитьте секреты или учётные данные в Git.

GitHub Actions

Репозиторий может использовать GitHub Actions для автоматизации развёртывания:

git push → GitHub Actions
             ├── Checkout
             ├── Configure AWS credentials
             ├── Build container
             ├── Push/deploy
             └── Update Lightsail

Развёртывание затем следует простому рабочему процессу:

git add .
git commit -m "update scraper"
git push origin main

После завершения рабочего процесса обновлённый MCP-сервер развёрнут.

Использование MCP-сервера

После развёртывания сервера подключите его MCP-эндпоинт к MCP-совместимому AI-клиенту:

AI Client → MCP → https://your-mcp-server.example.com → Scrapling → Web Content

AI-клиент затем может вызывать предоставленные инструменты в рамках своего рабочего процесса — сервер ведёт себя как плагин для AI-приложений, заменяя собственный код скрапинга внутри каждого проекта:

AI Application
      ├── RAG
      ├── Agents
      ├── Research
      └── Automation
             │
             ▼
        MCP Server → Scrapling

Интеграция с RAG

Типичный RAG-пайплайн может использовать этот сервер как слой приёма данных:

Web Sources → Scrapling MCP → Markdown → Document Parser → Chunking
    → Embeddings → Vector Store → Retriever → LLM

Возможные нижестоящие компоненты включают:

  • Qdrant

  • PostgreSQL + pgvector

  • Elasticsearch

  • OpenSearch

  • Chroma

  • FAISS

  • Пользовательские хранилища знаний

MCP-сервер остаётся независимым от нижестоящего слоя хранения.

Агентный рабочий процесс

Сервер также может стать инструментом, доступным AI-агенту:

User → AI Agent
         ├── Decide what information is required
         ├── Call Scrapling MCP
         ├── Extract relevant content
         ├── Transform/use Markdown
         ├── Store information
         └── Generate final response

Это позволяет агенту динамически получать информацию вместо того, чтобы полагаться только на статические обучающие данные или ранее проиндексированные документы.

Почему Markdown?

Markdown предоставляет полезное промежуточное представление для LLM-пайплайнов, поскольку сохраняет семантическую структуру.

Markdown:

# AWS Lambda

## Overview
AWS Lambda is a serverless compute service.

## Features
- Event-driven execution
- Automatic scaling
- Pay-per-use pricing

## Architecture
### Invocation
Lambda functions can be invoked through multiple AWS services.

По сравнению с сырым HTML:

<div>
    <h1>AWS Lambda</h1>
    <div>
        <h2>Overview</h2>
        ...
    </div>
</div>

Markdown, как правило, легче проверять, очищать, разбивать на чанки, обрабатывать, хранить и передавать в LLM-пайплайны.

Таким образом, цель — не просто «соскрапить веб-страницу», а получить внешние знания в форме, которая может естественным образом войти в LLM-пайплайн данных.

Варианты использования

Вариант использования

Описание

RAG-системы

Автоматически получайте свежую веб-информацию перед её индексацией.

AI-агенты для исследований

Позволяйте агентам извлекать и анализировать информацию с живых сайтов.

Базы знаний

Создавайте постоянно обновляемые репозитории знаний.

AI IDE

Дайте ассистентам по коду внешнюю возможность извлечения веб-данных через MCP.

Приём документации

Преобразуйте онлайн-документацию в Markdown, подходящий для дальнейшей обработки.

Агентная автоматизация

Используйте извлечение веб-данных как один из многих инструментов в автономном рабочем процессе.

Проектирование, ориентированное на производительность

Архитектура отделяет слой получения веб-данных от AI-приложения.

Вместо того чтобы каждое AI-приложение поддерживало собственный скрапер, подход становится таким:

                ┌───────────────┐
                │ Scrapling MCP  │
                └───────┬───────┘
                        │
          ┌─────────────┼─────────────┐
          ▼             ▼             ▼
        RAG          Agent          AI IDE

Это позволяет развернуть инфраструктуру скрапинга один раз и переиспользовать её в нескольких рабочих процессах.

Вопросы безопасности

При публичном развёртывании сервера:

  • Не раскрывайте учётные данные AWS в контейнере

  • Используйте HTTPS в продакшене

  • Ограничивайте сетевой доступ там, где это уместно

  • Проверяйте запрашиваемые URL

  • Применяйте ограничения частоты запросов, где это требуется

  • Контролируйте потребление ресурсов

  • Избегайте скрапинга сайтов в нарушение их условий или применимого законодательства

  • Храните секреты в переменных окружения или в выделенном менеджере секретов

Рекомендации для продакшена

Для продакшен-развёртывания рассмотрите добавление:

  • Аутентификации

  • Контроля доступа к API/MCP

  • HTTPS

  • Ограничения частоты запросов

  • Логирования запросов

  • Наблюдаемости

  • Политик повторов

  • Кэширования

  • Списков разрешённых URL

  • Лимитов ресурсов

  • Проверок работоспособности

  • Мониторинга и оповещений

Будущие улучшения

  • Аутентификация для MCP-клиентов

  • Списки разрешённых URL/доменов

  • Кэширование контента

  • Распределённый краулинг

  • Приём данных на основе очередей

  • Автоматическое разбиение документов на чанки

  • Прямая интеграция с векторными базами данных

  • Хранение документов на S3

  • Планирование краулинга

  • Панель наблюдаемости

  • Многопользовательский контроль доступа

Пример сквозного рабочего процесса

User / Agent → MCP-Compatible IDE → Scrapling MCP Server → Website
    → Markdown → Document Processing → Chunking → Embeddings
    → Vector DB → Retriever → LLM → Final Response

Репозиторий

GitHub: github.com/Santhosh-p653/aws-mcp-test

Техническая статья

Архитектура, развёртывание и мотивация этого проекта задокументированы в AWS Builder Center:

Supercharging Agentic AI with Fast Web Scraping using Scrapling, MCP, and AWS Lightsail

Вклад в проект

Приветствуются вклады, идеи, улучшения и эксперименты. Если вы создали что-то с использованием этого MCP-сервера, не стесняйтесь открыть issue или pull request и поделиться рабочим процессом.

Автор

Santhosh P

Создаёт системы вокруг:

  • AI-агентов

  • RAG

  • MCP

  • Облачной инфраструктуры

  • Пайплайнов веб-данных

  • AI/ML

GitHub: @Santhosh-p653


Ключевая идея: Разверните возможность скрапинга один раз. Подключайте её к своим AI-рабочим процессам всякий раз, когда вам нужны свежие структурированные веб-данные.

Scrapling + MCP превращает извлечение веб-данных в переиспользуемый инфраструктурный компонент для современного LLM-стека.

F
license - not found
Not graded
quality - not tested
B
maintenance

Maintenance

Maintainers
Response time
Release cycle
Releases (12mo)
Commit activity

Resources

Unclaimed servers have limited discoverability.

Looking for Admin?

If you are the server author, to access and configure the admin panel.

Related MCP Servers

  • A
    license
    Not graded
    quality
    Not graded
    maintenance
    An MCP server that extracts clean, structured Markdown content from web page URLs using the WebforAI library. It simplifies feeding web content into AI models by removing HTML noise and intelligently processing tables and links.
  • A
    license
    A
    quality
    C
    maintenance
    MCP-native web scraping and search API for AI agents. Converts any URL to clean Markdown with 90% success rate, including Cloudflare-protected sites and JS SPAs. Real-time web search via Brave Search API. CAPTCHA solving built-in. 10 free scrapes/day.
    5
    8
    4
    MIT
  • A
    license
    Not graded
    quality
    C
    maintenance
    MCP server for AI agents -- fetch any URL with full JavaScript rendering (Playwright/Chromium) and convert to clean, token-efficient markdown. Works on React, Vue, Angular, and any JS-heavy page. Includes web search, batch fetching, binary file download, LRU cache, SSRF protection, and structured output.
    13
    MIT

View all related MCP servers

Related MCP Connectors

  • Web scraping for AI agents. Converts URLs to clean, LLM-ready Markdown with anti-bot bypass.

  • Jina AI Reader/Search MCP — turn any URL into clean LLM-ready markdown, plus web search.

  • Converts any URL to clean, LLM-ready Markdown using real Chrome browsers

View all MCP Connectors

Latest Blog Posts

MCP directory API

We provide all the information about MCP servers via our MCP API.

curl -X GET 'https://glama.ai/api/mcp/v1/servers/Santhosh-p653/aws-mcp-test'

If you have feedback or need assistance with the MCP directory API, please join our Discord server