common-crawl-mcp
Click on "Install Server".
Wait a few minutes for the server to deploy. Once ready, it will show a "Started" state.
In the chat, type
@followed by the MCP server name and your instructions, e.g., "@common-crawl-mcpShow the crawl presence and dynamics for example.com"
That's it! The server will respond to your query, and you can continue using it as needed.
Here is a step-by-step guide with screenshots.
common-crawl-mcp
MCP-сервер и CLI для запросов к Common Crawl — открытому корпусу веба, на котором учат языковые модели.
Отвечает на вопрос «виден ли сайт для ИИ»: сколько его страниц попало в корпус, какие разделы, как это менялось, и что видит модель, читая конкретную страницу.
Работает через AWS Athena поверх колоночного индекса (cc-index), а не через публичный
API Common Crawl — тот регулярно отдаёт 504. Запрос по домену стоит около $0.00005.
Установка
uv tool install git+https://github.com/nikolaymokh-dev/common-crawl-mcpНужны AWS-креды с доступом к Athena, Glue и чтением бакета commoncrawl. Берутся
из ~/.aws обычным способом (AWS_PROFILE, AWS_REGION; по умолчанию us-east-1).
Related MCP server: mcp-server-wayback
CLI
ccq example.com # страниц в свежем кравле
ccq example.com --dynamics # динамика по 18 последним кравлам
ccq example.com --locales --sections # разбивка по языкам и разделам
ccq example.com --compare example.org,example.net
ccq example.com --errors # 404/301/5xx, которые получил краулер
ccq example.com --robots # robots.txt глазами краулера
ccq --discover de --min-pages 100 # домены зоны .de
ccq --zone-suffixes uk # co.uk / org.uk / gov.uk ...
ccq --list-crawlsЛюбую команду можно получить в JSON: --json.
MCP
claude mcp add common-crawl -- uvx --from git+https://github.com/nikolaymokh-dev/common-crawl-mcp common-crawl-mcpТулы
Тул | Зачем |
| Сколько страниц домена в кравле |
| Динамика по кравлам — основа для любых выводов |
| Несколько доменов одним сканом |
| Разбивка по языковым префиксам пути |
| Топ разделов: где охват проседает |
| Конкретные URL + координаты в архиве |
| Страницы-дубли (одинаковый |
| Не-200 ответы у домена |
|
|
| Домены по зоне и/или подстроке |
| Суффиксы внутри зоны |
| Текст страницы из архива — то, что читает модель |
| Список доступных кравлов |
Что стоит знать
Ноль страниц ≠ сайта нет. Охват Common Crawl заметно скачет между кравлами: сайт,
стабильно дающий сотни страниц, может провалиться до единиц. Любой вывод делается по
cc_dynamics, а не по одному снимку.
Поиск по зоне почти бесплатен. Индекс отсортирован по url_surtkey — имени хоста
задом наперёд, — поэтому домены одной зоны лежат в файлах подряд, и Athena пропускает
всё остальное. Замерено на CC-MAIN-2026-30: .uz — 0.28 MB скана на 7 954 домена,
.de — 23 MB на 2 075 692 домена.
Поиск по подстроке — нет. host_contains не может воспользоваться этой сортировкой,
поэтому без указания зоны он читает колонку хостов по всему кравлу. Тул это запрещает,
пока не передашь allow_full_scan=True. Заодно зона отсекает ложные совпадения: короткая
подстрока по всему вебу цепляет случайные домены из чужих зон, внутри одной зоны — нет.
Составные зоны. tld='uk' захватывает и example.uk, и example.co.uk. Нужен
конкретный сегмент — фильтруй registry_suffix='co.uk'. Посмотреть, что вообще есть
в зоне, — cc_zone_suffixes.
Стоимость возвращается вместе с данными. В каждом ответе есть scanned_mb и
cost_usd. Athena billing округляет запрос вверх до 10 MB.
Разработка
uv sync --extra dev
uv run pytest # юнит-тесты, сети не требуютСтруктура: athena.py — транспорт, crawls.py — какие кравлы есть, queries.py —
построители SQL (чистые функции, тестируются без AWS), api.py — операции,
warc.py — извлечение текста, cli.py и server.py — две обёртки над api.
Лицензия
MIT
This server cannot be installed
Maintenance
Resources
Unclaimed servers have limited discoverability.
Looking for Admin?
If you are the server author, to access and configure the admin panel.
Related MCP Servers
- Flicense-qualityCmaintenanceBridge the gap between your web crawl and AI language models. With mcp-server-webcrawl, your AI client filters and analyzes web content under your direction or autonomously, extracting insights from your web content. Supports WARC, wget, InterroBot, Katana, and SiteOne crawlers.Last updated44Python
- AlicenseAqualityAmaintenanceMCP server for the Internet Archive's Wayback Machine. Search archived snapshots, extract page text from a specific date, track how a site has changed over time, check if broken links are recoverable, and perform research across Internet Archive collections.Last updated63MIT
- AlicenseAqualityAmaintenanceMCP server for the CrawlGraph backlink-intelligence API. Gives any MCP client - Claude Desktop, Claude Code, Cursor, Cline, Zed, Windsurf - backlink lookups and competitor gap analysis built on the public Common Crawl webgraph (4.4B edges, 120M domains).Last updated4301MIT
- AlicenseBqualityDmaintenanceMCP server & CLI for keyword research, domain analytics, backlinks, traffic analysis, and competitive intelligence using Semrush API data.Last updated774438MIT
Related MCP Connectors
Query SEC EDGAR filings, XBRL financials, and company data through MCP. STDIO & Streamable HTTP.
Fast, intelligent web search and web crawling. New mcp tool: Exa-code is a context tool for coding
Free remote MCP server for fetching public web pages through a rotating proxy pool.
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/nikolaymokh-dev/common-crawl-mcp'
If you have feedback or need assistance with the MCP directory API, please join our Discord server