Crawl4AI RAG MCP Server
Мощная реализация протокола контекста модели (MCP), интегрированная с Crawl4AI и Supabase для предоставления агентам ИИ и помощникам по кодированию расширенными возможностями веб-сканирования и RAG.
С помощью этого MCP-сервера вы можете извлечь данные из чего угодно, а затем использовать эти знания где угодно для RAG.
Основная цель — перенести этот сервер MCP в Archon , поскольку я развиваю его, чтобы он стал скорее движком знаний для помощников по кодированию ИИ для создания агентов ИИ. Эта первая версия сервера Crawl4AI/RAG MCP будет значительно улучшена в ближайшее время, особенно в плане ее настройки, чтобы вы могли использовать различные модели встраивания и запускать все локально с помощью Ollama.
Обзор
Этот сервер MCP предоставляет инструменты, которые позволяют агентам ИИ сканировать веб-сайты, хранить контент в векторной базе данных (Supabase) и выполнять RAG над просканированным контентом. Он следует лучшим практикам создания серверов MCP на основе шаблона сервера Mem0 MCP, который я ранее предоставил на своем канале.
Related MCP server: Crawl4AI+SearXNG MCP Server
Зрение
Сервер Crawl4AI RAG MCP — это только начало. Вот куда мы направляемся:
Интеграция с Archon : встраивание этой системы непосредственно в Archon для создания комплексного механизма знаний для помощников по кодированию ИИ с целью создания более эффективных агентов ИИ.
Множественные модели встраивания : выход за рамки OpenAI для поддержки различных моделей встраивания, включая возможность локального запуска всего с помощью Ollama для полного контроля и конфиденциальности.
Расширенные стратегии RAG : внедрение сложных методов поиска, таких как контекстный поиск, позднее фрагментирование и другие, чтобы выйти за рамки базовых «наивных поисков» и значительно повысить мощность и точность системы RAG, особенно при ее интеграции с Archon.
Улучшенная стратегия фрагментации : реализация подхода к фрагментации, вдохновленного Context 7, который фокусируется на примерах и создает отдельные, семантически значимые разделы для каждого фрагмента, повышая точность поиска.
Оптимизация производительности : увеличение скорости сканирования и индексирования, что делает более реалистичной «быструю» индексацию новой документации, а затем ее использование в том же запросе в помощнике по кодированию на основе ИИ.
Функции
Интеллектуальное определение URL-адресов : автоматически обнаруживает и обрабатывает различные типы URL-адресов (обычные веб-страницы, карты сайтов, текстовые файлы)
Рекурсивное сканирование : прохождение внутренних ссылок для обнаружения контента.
Параллельная обработка : эффективно сканирует несколько страниц одновременно.
Разделение контента на части : интеллектуальное разделение контента по заголовкам и размеру для лучшей обработки.
Векторный поиск : выполняет RAG по просканированному контенту, опционально фильтруя по источнику данных для точности.
Извлечение источника : извлечение источников, доступных для фильтрации, для руководства процессом RAG.
Инструменты
Сервер предоставляет четыре основных инструмента веб-сканирования и поиска:
crawl_single_page: быстрое сканирование одной веб-страницы и сохранение ее содержимого в векторной базе данныхsmart_crawl_url: интеллектуальное сканирование всего веб-сайта на основе предоставленного типа URL-адреса (карта сайта, llms-full.txt или обычная веб-страница, которую необходимо сканировать рекурсивно)get_available_sources: Получить список всех доступных источников (доменов) в базе данныхperform_rag_query: Поиск релевантного контента с использованием семантического поиска с дополнительной фильтрацией источника
Предпосылки
Docker/Docker Desktop , если сервер MCP запущен как контейнер (рекомендуется)
Python 3.12+, если сервер MCP запущен напрямую через uv
Supabase (база данных для RAG)
Ключ API OpenAI (для генерации вложений)
Установка
Использование Docker (рекомендуется)
Клонируйте этот репозиторий:
git clone https://github.com/coleam00/mcp-crawl4ai-rag.git cd mcp-crawl4ai-ragСоздайте образ Docker:
docker build -t mcp/crawl4ai-rag --build-arg PORT=8051 .Создайте файл
.envна основе раздела конфигурации ниже.
Использование uv напрямую (без Docker)
Клонируйте этот репозиторий:
git clone https://github.com/coleam00/mcp-crawl4ai-rag.git cd mcp-crawl4ai-ragУстановите uv, если у вас его нет:
pip install uvСоздайте и активируйте виртуальную среду:
uv venv .venv\Scripts\activate # on Mac/Linux: source .venv/bin/activateУстановить зависимости:
uv pip install -e . crawl4ai-setupСоздайте файл
.envна основе раздела конфигурации ниже.
Настройка базы данных
Перед запуском сервера необходимо настроить базу данных с расширением pgvector:
Перейдите в редактор SQL на панели управления Supabase (при необходимости сначала создайте новый проект).
Создайте новый запрос и вставьте содержимое
crawled_pages.sqlВыполнить запрос для создания необходимых таблиц и функций.
Конфигурация
Создайте файл .env в корне проекта со следующими переменными:
# MCP Server Configuration
HOST=0.0.0.0
PORT=8051
TRANSPORT=sse
# OpenAI API Configuration
OPENAI_API_KEY=your_openai_api_key
# Supabase Configuration
SUPABASE_URL=your_supabase_project_url
SUPABASE_SERVICE_KEY=your_supabase_service_keyЗапуск сервера
Использование Докера
docker run --env-file .env -p 8051:8051 mcp/crawl4ai-ragИспользование Python
uv run src/crawl4ai_mcp.pyСервер запустится и будет прослушивать настроенный хост и порт.
Интеграция с клиентами MCP
Конфигурация SSE
После того, как сервер будет запущен с транспортом SSE, вы сможете подключиться к нему, используя следующую конфигурацию:
{
"mcpServers": {
"crawl4ai-rag": {
"transport": "sse",
"url": "http://localhost:8051/sse"
}
}
}Примечание для пользователей Windsurf : используйте
serverUrlвместоurlв вашей конфигурации:{ "mcpServers": { "crawl4ai-rag": { "transport": "sse", "serverUrl": "http://localhost:8051/sse" } } }Примечание для пользователей Docker : используйте
host.docker.internalвместоlocalhost, если ваш клиент работает в другом контейнере. Это будет применяться, если вы используете этот сервер MCP в n8n!
Конфигурация Stdio
Добавьте этот сервер в конфигурацию MCP для Claude Desktop, Windsurf или любого другого клиента MCP:
{
"mcpServers": {
"crawl4ai-rag": {
"command": "python",
"args": ["path/to/crawl4ai-mcp/src/crawl4ai_mcp.py"],
"env": {
"TRANSPORT": "stdio",
"OPENAI_API_KEY": "your_openai_api_key",
"SUPABASE_URL": "your_supabase_url",
"SUPABASE_SERVICE_KEY": "your_supabase_service_key"
}
}
}
}Docker с конфигурацией Stdio
{
"mcpServers": {
"crawl4ai-rag": {
"command": "docker",
"args": ["run", "--rm", "-i",
"-e", "TRANSPORT",
"-e", "OPENAI_API_KEY",
"-e", "SUPABASE_URL",
"-e", "SUPABASE_SERVICE_KEY",
"mcp/crawl4ai"],
"env": {
"TRANSPORT": "stdio",
"OPENAI_API_KEY": "your_openai_api_key",
"SUPABASE_URL": "your_supabase_url",
"SUPABASE_SERVICE_KEY": "your_supabase_service_key"
}
}
}
}Создание собственного сервера
Эта реализация обеспечивает основу для создания более сложных серверов MCP с возможностями веб-сканирования. Чтобы создать свой собственный:
Добавьте свои собственные инструменты, создав методы с помощью декоратора
@mcp.tool()Создайте собственную функцию жизненного цикла, чтобы добавить собственные зависимости
Измените файл
utils.pyдля любых необходимых вам вспомогательных функций.Расширьте возможности сканирования, добавив больше специализированных сканеров.
This server cannot be installed
Maintenance
Resources
Unclaimed servers have limited discoverability.
Looking for Admin?
If you are the server author, to access and configure the admin panel.
Related MCP Servers
- AlicenseNot gradedqualityDmaintenanceProvides AI agents and coding assistants with advanced web crawling and RAG capabilities, allowing them to scrape websites and leverage that knowledge through various retrieval strategies.2MIT
- AlicenseNot gradedqualityDmaintenanceProvides AI agents with complete web search, crawling, and RAG capabilities through a Docker-based solution combining Model Context Protocol, Crawl4AI, SearXNG, and Supabase.46MIT
- AlicenseNot gradedqualityDmaintenanceCrawls and indexes documentation websites to Supabase with vector embeddings for RAG, using smart sitemap discovery and Jina AI for fast content extraction with multi-project support.1MIT
- FlicenseNot gradedqualityDmaintenanceEnables AI assistants to crawl websites, extract and store web content with semantic search capabilities using vector embeddings, and retrieve information through natural language queries with tag-based filtering and intelligent content cleaning.
Related MCP Connectors
Scrape, crawl, map & search the web. Open-source, self-hostable Rust crawler & search for AI agents.
Turn the web into structured, reliable, actionable enterprise data for AI Agents
Persistent memory and knowledge management for AI agents with semantic search and 50+ tools.
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/coleam00/mcp-crawl4ai-rag'
If you have feedback or need assistance with the MCP directory API, please join our Discord server