dompruner-mcp
dompruner-mcp
한국어 | English

Промежуточное ПО на основе DOM AST для веб-конвейеров LLM — убирает шум вёрстки (навигация, скрипты, сайдбары) и передаёт исходный текст напрямую. Добавьте запрос, чтобы отфильтровать релевантные разделы с помощью BM25.
Когда LLM использует встроенный WebFetch, модель меньшего размера предварительно обрабатывает HTML и возвращает суммаризированный результат — добавляя задержку, затраты и интерпретацию, о которых вы не просили. DomPruner полностью пропускает этот этап: парсинг DOM AST убирает шум и передаёт исходный контент напрямую модели.
Вызов | Поведение |
| Убирает шум вёрстки → возвращает полное извлечённое содержимое |
| Убирает шум вёрстки → BM25 фильтрует релевантные разделы (если совпадений нет, возвращает полное содержимое) |
> [DomPruner] docs.python.org
> | Raw HTML | 44,316 tokens |
> | DomPruner | 1,328 tokens |
> | Reduction | 97.0% |
> Fetch: 194ms · Parse: 11.2msВ среднем на 93,5% меньше контекстных токенов, чем у WebFetch. На 45% быстрее в целом. → Полный бенчмарк
Быстрый старт
Установка не требуется, API-ключ не нужен:
npx -y dompruner-mcpClaude Code
{
"mcpServers": {
"dompruner": {
"type": "stdio",
"command": "npx",
"args": ["-y", "dompruner-mcp"]
}
}
}Добавьте в .mcp.json в корне проекта или в ~/.claude/.mcp.json для глобального использования. Выполните /mcp, чтобы проверить.
Claude Desktop
Отредактируйте ~/Library/Application Support/Claude/claude_desktop_config.json (macOS) или %APPDATA%\Claude\claude_desktop_config.json (Windows):
{
"mcpServers": {
"dompruner": {
"command": "npx",
"args": ["-y", "dompruner-mcp"]
}
}
}Cursor / Windsurf / другие MCP-клиенты
{
"mcpServers": {
"dompruner": {
"type": "stdio",
"command": "npx",
"args": ["-y", "dompruner-mcp"]
}
}
}Remote HTTP (без установки, всегда актуальная версия)
Для клиентов, поддерживающих HTTP-транспорт — не требуется установка Node.js, всегда работает последняя версия:
{
"mcpServers": {
"dompruner": {
"url": "https://dompruner-mcp.vercel.app/api/mcp"
}
}
}LangChain / LangGraph
langchain-mcp-adapters автоматически оборачивает любой MCP stdio-сервер в инструменты LangChain:
from langchain_mcp_adapters.client import MultiServerMCPClient
client = MultiServerMCPClient({
"dompruner": {
"command": "npx",
"args": ["-y", "dompruner-mcp"],
"transport": "stdio",
}
})
tools = await client.get_tools()Related MCP server: Scrapi MCP Server
Как гарантировать, что ваш ИИ всегда использует DomPruner
Описание инструмента DomPruner уже сообщает клиентам, что следует предпочитать dompruner_fetch вместо WebFetch. Если ваш клиент всё равно переключается на WebFetch, добавьте это в его файл инструкций:
When retrieving a URL, always use dompruner_fetch instead of WebFetch.
- URL known → dompruner_fetch(url, query?)
- URL unknown → search for the URL first, then dompruner_fetch(url)Клиент | Файл инструкций |
Claude Code |
|
Cursor |
|
Windsurf |
|
Cline |
|
GitHub Copilot |
|
Инструменты
Инструмент | Описание |
| Получает URL → Markdown, очищенный с помощью DOM. Опциональный |
| Получает все страницы из sitemap.xml → по одному очищенному Document на страницу. |
| Отчёт о сокращении токенов для URL без полного содержимого. |
→ Полный справочник инструментов
Сводка бенчмарка
Метрика | WebFetch | DomPruner |
Среднее количество контекстных токенов | ~15 735 | ~1 019 (на 93,5% меньше) |
Качество ответов (10 запросов) | 9 / 10 | 8 / 10 |
Среднее время ответа | 5 811 ms | 3 168 ms (на 45% быстрее) |
Точность содержимого | Суммаризировано малой моделью | Исходный текст сохранён |
Дополнительный API-ключ / инфраструктура | Нет | Нет |
→ Полный бенчмарк · Архитектура
Связанные проекты
dompruner-py — Python-порт.
DomPrunerLoader,DomPrunerSitemapLoader,DomPrunerFetchToolдля LangChain.pip install dompruner.Интеграции LangChain — dompruner-py указан как сторонний веб-загрузчик.
Glama Score
Лицензия
MIT
Maintenance
Related MCP Servers
- AlicenseAqualityDmaintenanceAn MCP server that fetches web pages and extracts clean, AI-friendly Markdown content using Mozilla Readability. It provides secure web access for LLMs with built-in SSRF protection and automated content cleaning for improved context retrieval and summarization.1314MIT
- AlicenseAqualityCmaintenanceMCP server that converts URLs to clean Markdown/Text for LLM agents.5875MIT
- AlicenseAqualityDmaintenanceMCP server that converts URLs into token-minimized clean text for LLMs, providing a receipt of token and cost savings.163MIT
- AlicenseNot gradedqualityBmaintenanceMCP server that fetches web pages, extracts clean markdown (reducing token count), caches results, and provides searchable reading history.MIT
Related MCP Connectors
Web scraping for AI agents. Converts URLs to clean, LLM-ready Markdown with anti-bot bypass.
Jina AI Reader/Search MCP — turn any URL into clean LLM-ready markdown, plus web search.
Web tools for agents: fetch URL as markdown (free MCP) + x402 scrape, links, AI JSON, snapshot.
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/dong7812/dompruner-mcp'
If you have feedback or need assistance with the MCP directory API, please join our Discord server