Skip to main content
Glama

intercept-mcp

Дайте вашему ИИ возможность читать веб-страницы. Одна команда, ключи API не требуются.

Без этого инструмента ваш ИИ при переходе по URL получает ошибку 403, «стену» или гору необработанного HTML. С intercept он почти всегда получает контент — чистый Markdown, готовый к использованию.

Обрабатывает твиты, видео YouTube (с транскриптами, если доступны), статьи arXiv, PDF-файлы, статьи Wikipedia и репозитории GitHub. Если первая стратегия не срабатывает, он пробует еще до 14 вариантов, прежде чем сдаться.

Работает с любым MCP-клиентом: Claude Code, Claude Desktop, Codex, Cursor, Windsurf, Cline и другими.

Установка

Claude Code

claude mcp add intercept -s user -- npx -y intercept-mcp

Codex

codex mcp add intercept -- npx -y intercept-mcp

Cursor

Settings → MCP → Add Server:

{
  "mcpServers": {
    "intercept": {
      "command": "npx",
      "args": ["-y", "intercept-mcp"]
    }
  }
}

Windsurf

Settings → MCP → Add Server → та же конфигурация JSON, что и выше.

Claude Desktop

Добавьте в ваш claude_desktop_config.json:

{
  "mcpServers": {
    "intercept": {
      "command": "npx",
      "args": ["-y", "intercept-mcp"]
    }
  }
}

Другие MCP-клиенты

Любой клиент, поддерживающий stdio MCP-серверы, может запустить npx -y intercept-mcp.

Для инструмента fetch ключи API не нужны.

Related MCP server: urltomarkdown-mcp

Как это работает

URL-адреса обрабатываются в четыре этапа:

1. Обработчики для конкретных сайтов

Известные шаблоны URL направляются к специализированным обработчикам перед конвейером резервных стратегий:

Шаблон

Обработчик

Что вы получаете

twitter.com/*/status/*, x.com/*/status/*

Twitter/X

Текст твита, автор, медиа, статистика вовлеченности (через сторонние API)

youtube.com/watch?v=*, youtu.be/*

YouTube

Название, канал, длительность, просмотры, описание, транскрипт (если доступны субтитры)

arxiv.org/abs/*, arxiv.org/pdf/*

arXiv

Метаданные статьи, авторы, аннотация, категории

*.pdf

PDF

Извлеченный текст (только для PDF с текстовым слоем)

*.wikipedia.org/wiki/*

Wikipedia

Чистое содержимое статьи через Wikimedia REST API

github.com/{owner}/{repo}

GitHub

Необработанное содержимое README.md

2. Общий кэш (agentsweb.org)

Перед обращением к любому загрузчику каждый запрос проверяет agentsweb.org — глобальный общий кэш Markdown для ИИ-агентов. Если другой агент уже загрузил этот URL, вы получите результат менее чем за 50 мс.

Каждая успешная загрузка автоматически вносит вклад в общую базу. Записи получают доверие через модель самовосстанавливающегося консенсуса: когда независимые экземпляры загружают один и тот же URL и подтверждают одинаковый контент, уровень доверия повышается.

Вы можете полностью отказаться от этого с помощью INTERCEPT_SHARED_CACHE=false или использовать режим «только чтение» (потреблять, но не вносить вклад) с помощью INTERCEPT_CACHE_READ_ONLY=true.

API agentsweb.org

agentsweb.org также предоставляет отдельные конечные точки для прямого использования:

  • /web?q= — поиск в интернете

  • /research?q= — поиск + загрузка + кэширование за один вызов

  • /fetch?url= — загрузка по запросу, автоматическое кэширование

См. agentsweb.org/docs для полной документации API.

3. Конвейер резервных стратегий

Если ни один обработчик не подошел (или обработчик ничего не вернул), URL попадает в многоуровневый конвейер:

Уровень

Загрузчик

Стратегия

0

agentsweb.org

Глобальный общий кэш Markdown — мгновенно, если другой агент уже загрузил этот URL

1

Cloudflare Browser Run

Рендеринг JS + извлечение Markdown (опционально, нужен токен API)

1

Jina Reader

Сервис извлечения чистого Markdown

2

Wayback Machine

Архивная версия с archive.org

2

archive.ph

Архивные снимки через API timemap + скрытая загрузка TLS

2

Google Cache

Кэшированная версия страницы от Google

2

Arquivo.pt

Португальский веб-архив (широкий международный охват)

2

Codetabs

CORS-прокси

3

Raw fetch

Прямой GET с заголовками браузера + преобразование в Markdown через Turndown

3

Stealth fetch

Имитация TLS-отпечатка браузера через got-scraping (опционально, см. ниже)

4

RSS, CrossRef, Semantic Scholar, HN, Reddit

Резервные источники метаданных / обсуждений

5

OG Meta

Теги Open Graph (гарантированный резерв)

Загрузчики уровня 2 работают параллельно. Когда успешно срабатывают несколько, побеждает результат наивысшего качества. Все остальные уровни работают последовательно.

Все загрузчики возвращают корректный Markdown (заголовки, ссылки, жирный шрифт, таблицы, блоки кода) через Turndown — не обычный текст.

4. Кэширование

Результаты кэшируются в оперативной памяти с TTL (30 минут для успешных, 5 минут для неудачных). Максимум 100 записей с вытеснением LRU. Неудачные URL кэшируются, чтобы предотвратить повторные попытки для заведомо нерабочих ссылок.

Инструменты

fetch

Загрузить URL и вернуть его содержимое в виде чистого Markdown.

  • url (строка, обязательно) — URL для загрузки

  • maxTier (число, опционально, 1-5) — остановиться на этом уровне для случаев, чувствительных к скорости

Поиск в интернете и возврат результатов.

  • query (строка, обязательно) — поисковый запрос

  • count (число, опционально, 1-20, по умолчанию 5) — количество результатов

Использует Brave Search API, если установлен BRAVE_API_KEY, затем SearXNG, если установлен SEARXNG_URL, и в последнюю очередь DuckDuckGo как ненадежный резервный вариант.

Промпты

research-topic

Поиск темы и загрузка топовых результатов для создания сводки из нескольких источников.

  • topic (строка) — тема для исследования

  • depth (строка, по умолчанию "3") — количество топовых результатов для загрузки

extract-article

Загрузка URL и извлечение ключевых моментов из контента.

  • url (строка) — URL для загрузки и суммаризации

Переменные окружения

Переменная

Обязательно

Описание

BRAVE_API_KEY

Нет

Ключ Brave Search API для поиска

SEARXNG_URL

Нет

URL вашего собственного экземпляра SearXNG (рекомендуется)

CF_API_TOKEN

Нет

Токен API Cloudflare с разрешением "Browser Rendering - Edit"

CF_ACCOUNT_ID

Нет

ID аккаунта Cloudflare (обязательно, если установлен CF_API_TOKEN)

USE_STEALTH_FETCH

Нет

Установите true для включения скрытого загрузчика (см. предупреждение ниже)

INTERCEPT_SHARED_CACHE

Нет

Установите false для отключения общего кэша agentsweb.org

INTERCEPT_CACHE_READ_ONLY

Нет

Установите true для потребления, но без внесения вклада в общий кэш

INTERCEPT_CACHE_TTL_MS

Нет

TTL кэша в памяти для успешных загрузок в мс (по умолчанию 3600000 = 60 мин)

INTERCEPT_CACHE_FAILURE_TTL_MS

Нет

TTL кэша в памяти для неудачных загрузок в мс (по умолчанию 300000 = 5 мин)

INTERCEPT_CACHE_SIZE

Нет

Макс. количество записей в кэше памяти (по умолчанию 250)

HTTPS_PROXY / HTTP_PROXY

Нет

Стандартный прокси — направляет весь исходящий трафик (включая stealth) через прокси. Учитывает NO_PROXY.

Поиск: Есть резервный вариант DuckDuckGo, но он ограничен по частоте запросов и ненадежен. Для промышленного использования разверните SearXNG и установите SEARXNG_URL (см. ниже) или получите ключ Brave Search API.

Загрузка: Работает без каких-либо ключей. Установите CF_API_TOKEN + CF_ACCOUNT_ID для включения Cloudflare Browser Run (ранее Browser Rendering) для страниц с интенсивным использованием JavaScript (SPA, сайты на React).

Скрытая загрузка (USE_STEALTH_FETCH)

Используйте на свой страх и риск. При включении добавляется загрузчик, который имитирует реальные TLS-отпечатки браузера (наборы шифров Chrome/Firefox, настройки HTTP/2, порядок заголовков) с использованием got-scraping. Это может помочь обойти защиту от ботов и CAPTCHA на сайтах, которые в противном случае блокируют автоматизированные запросы.

Этот загрузчик работает на уровне 3 после обычной загрузки. Если обычная загрузка блокируется (CAPTCHA, проверка Cloudflare, 403), скрытый загрузчик повторяет попытку с имитацией браузера.

Это может нарушать условия использования некоторых веб-сайтов. Авторы intercept-mcp не несут ответственности за то, как используется эта функция. Она отключена по умолчанию и должна быть явно активирована.

Использование собственного прокси (HTTPS_PROXY)

Если обычные загрузки начинают помечаться как подозрительные, наиболее эффективным решением обычно является чистый исходящий IP — а не более сложный отпечаток. intercept-mcp учитывает стандартные переменные окружения HTTPS_PROXY / HTTP_PROXY / NO_PROXY, поэтому вы можете направлять весь исходящий трафик через любой прокси, который у вас уже есть:

HTTPS_PROXY=http://user:pass@proxy.example.com:8080 npx intercept-mcp

Это работает с любым HTTP(S)-прокси — самохостинг Squid, выходной узел Tailscale, VPS за $5 с запущенным 3proxy или коммерческие резидентские прокси (Bright Data, Oxylabs и т.д.). Скрытый загрузчик и вызовы got-scraping также автоматически подхватывают эти настройки.

Самохостинг SearXNG

Для надежного поиска разверните SearXNG с помощью Docker. Конфигурация включена в репозиторий:

git clone https://github.com/bighippoman/intercept-mcp.git
cd intercept-mcp/searxng && docker compose up -d

Затем установите SEARXNG_URL=http://localhost:8888. Никаких ограничений по частоте, никаких CAPTCHA, агрегирует Google + Bing + DuckDuckGo + Wikipedia + Brave.

Или используйте любой существующий экземпляр SearXNG — просто установите SEARXNG_URL на его адрес.

Нормализация URL

Входящие URL автоматически очищаются:

  • Удаляются 60+ параметров отслеживания (UTM, click ID, аналитика, A/B тестирование и т.д.)

  • Удаляются фрагменты хеша

  • Обновляются до HTTPS

  • Очищаются артефакты AMP

  • Сохраняются функциональные параметры (ref, format, page, offset, limit)

Оценка качества контента

Результат каждого загрузчика оценивается на качество. Автоматический отказ при:

  • CAPTCHA / проверках Cloudflare

  • Экранах входа (логин-стенах)

  • Страницах с ошибками HTTP в теле ответа

  • Контенте менее 200 символов

Требования

  • Node.js >= 18

  • Для базового использования ключи API не требуются

Available Tools

2 tools
fetchFetch URLA

Fetch a URL and return its content as clean markdown. Handles Twitter/X tweets, YouTube videos, arXiv papers, and PDFs directly. Falls back to a multi-tier chain: Jina Reader, Wayback Machine, raw fetch, RSS, CrossRef, Semantic Scholar, HackerNews, Reddit, OG meta. Results are cached for the session.

ParametersJSON Schema
NameRequiredDescriptionDefault
urlYesThe URL to fetch
maxTierNoStop at this tier (1-5, default 5). Lower = faster but fewer fallbacks.

TDQS

A4.4/5.0
Behavior4/5

Does the description disclose side effects, auth requirements, rate limits, or destructive behavior?

With no annotations, the description fully describes the multi-tier fallback behavior, special handling for certain content types, and session caching. It lacks mention of authentication, rate limits, or error handling, but still provides good transparency.

Agents need to know what a tool does to the world before calling it. Descriptions should go beyond structured annotations to explain consequences.

Conciseness5/5

Is the description appropriately sized, front-loaded, and free of redundancy?

The description is concise (approximately 100 words) and front-loaded with the main purpose. Each sentence adds value without redundancy.

Shorter descriptions cost fewer tokens and are easier for agents to parse. Every sentence should earn its place.

Completeness4/5

Given the tool's complexity, does the description cover enough for an agent to succeed on first attempt?

The description covers the core functionality, special cases, fallback chain, and caching. It does not detail error behavior or output format beyond 'clean markdown', but for a fetch tool this is reasonably complete.

Complex tools with many parameters or behaviors need more documentation. Simple tools need less. This dimension scales expectations accordingly.

Parameters4/5

Does the description clarify parameter syntax, constraints, interactions, or defaults beyond what the schema provides?

Schema coverage is 100%, but the description adds meaning by explaining the tier fallback system, which gives context to the maxTier parameter. The description complements the schema well.

Input schemas describe structure but not intent. Descriptions should explain non-obvious parameter relationships and valid value ranges.

Purpose5/5

Does the description clearly state what the tool does and how it differs from similar tools?

The description clearly states it fetches a URL and returns content as clean markdown, with specific handling for Twitter, YouTube, arXiv, and PDFs. It distinguishes from sibling tool 'search' by focusing on fetching a specific URL rather than searching.

Agents choose between tools based on descriptions. A clear purpose with a specific verb and resource helps agents select the right tool.

Usage Guidelines4/5

Does the description explain when to use this tool, when not to, or what alternatives exist?

The description implicitly guides usage by explaining the fallback chain and caching, but does not explicitly state when to use this vs. search or when not to use it. Given the sibling is 'search', the context is clear enough.

Agents often have multiple tools that could apply. Explicit usage guidance like "use X instead of Y when Z" prevents misuse.

Tool Schema Changelog

Recent tool additions, removals, and schema changes observed during successful MCP inspections. Dates show when Glama detected each change.

  1. 2 tool updatesv1.0.2
    • Addedfetch
    • Addedsearch

TDQS

A4.1/5.0
Disambiguation5/5

fetch and search have clearly distinct purposes: one retrieves content from a specific URL, the other performs web searches. No overlap or ambiguity.

Naming Consistency5/5

Both tool names are single-word verbs ('fetch', 'search'), following a simple and consistent pattern.

Tool Count4/5

With only 2 tools, the server is minimal but appropriate for its focused scope of fetching and searching. Could potentially benefit from a few more, but not necessary.

Completeness4/5

The tool surface covers the core operations of fetching content from URLs and searching the web. No obvious missing operations for the stated purpose.

Maintenance

ActivitySlowing
ResponsivenessUnresponsive

Resources

Unclaimed servers have limited discoverability.

Looking for Admin?

If you are the server author, to access and configure the admin panel.

Related MCP Connectors

Related MCP Servers

Latest Blog Posts

MCP directory API

We provide all the information about MCP servers via our MCP API.

curl -X GET 'https://glama.ai/api/mcp/v1/servers/bighippoman/intercept-mcp'

If you have feedback or need assistance with the MCP directory API, please join our Discord server