dompruner-mcp
dompruner-mcp
한국어 | Inglés

Middleware de AST DOM para pipelines web de LLM: elimina el ruido de maquetación (nav, scripts, barras laterales) y pasa el texto original directamente. Añade una consulta para filtrar las secciones relevantes con BM25.
Cuando un LLM usa el WebFetch integrado, un modelo más pequeño preprocesa el HTML y devuelve un resultado resumido, añadiendo latencia, coste e interpretación que no pediste. DomPruner se salta todo eso: el análisis del AST DOM elimina el ruido y pasa el contenido original directamente al modelo.
Llamada | Comportamiento |
| Elimina el ruido de maquetación → devuelve el contenido extraído completo |
| Elimina el ruido de maquetación → BM25 filtra las secciones relevantes (si no hay coincidencia, usa el contenido completo) |
> [DomPruner] docs.python.org
> | Raw HTML | 44,316 tokens |
> | DomPruner | 1,328 tokens |
> | Reduction | 97.0% |
> Fetch: 194ms · Parse: 11.2msDe media, un 93,5 % menos de tokens de contexto que WebFetch. Un 45 % más rápido de principio a fin. → Benchmark completo
Inicio rápido
Sin instalación, sin clave de API:
npx -y dompruner-mcpClaude Code
{
"mcpServers": {
"dompruner": {
"type": "stdio",
"command": "npx",
"args": ["-y", "dompruner-mcp"]
}
}
}Añádelo a .mcp.json en la raíz de tu proyecto, o a ~/.claude/.mcp.json para uso global. Ejecuta /mcp para verificarlo.
Claude Desktop
Edita ~/Library/Application Support/Claude/claude_desktop_config.json (macOS) o %APPDATA%\Claude\claude_desktop_config.json (Windows):
{
"mcpServers": {
"dompruner": {
"command": "npx",
"args": ["-y", "dompruner-mcp"]
}
}
}Cursor / Windsurf / otros clientes MCP
{
"mcpServers": {
"dompruner": {
"type": "stdio",
"command": "npx",
"args": ["-y", "dompruner-mcp"]
}
}
}HTTP remoto (sin instalación, siempre actualizado)
Para clientes que admiten transporte HTTP — no se requiere instalar Node.js, siempre ejecuta la última versión:
{
"mcpServers": {
"dompruner": {
"url": "https://dompruner-mcp.vercel.app/api/mcp"
}
}
}LangChain / LangGraph
langchain-mcp-adapters envuelve automáticamente cualquier servidor MCP stdio como herramientas de LangChain:
from langchain_mcp_adapters.client import MultiServerMCPClient
client = MultiServerMCPClient({
"dompruner": {
"command": "npx",
"args": ["-y", "dompruner-mcp"],
"transport": "stdio",
}
})
tools = await client.get_tools()Related MCP server: Scrapi MCP Server
Cómo asegurarte de que tu IA use siempre DomPruner
La descripción de la herramienta de DomPruner ya indica a los clientes que prefieran dompruner_fetch sobre WebFetch. Si tu cliente aún recurre a WebFetch, añade esto a su archivo de instrucciones:
When retrieving a URL, always use dompruner_fetch instead of WebFetch.
- URL known → dompruner_fetch(url, query?)
- URL unknown → search for the URL first, then dompruner_fetch(url)Cliente | Archivo de instrucciones |
Claude Code |
|
Cursor |
|
Windsurf |
|
Cline |
|
GitHub Copilot |
|
Herramientas
Herramienta | Descripción |
| Obtiene una URL → Markdown refinado por DOM. El |
| Obtiene todas las páginas de un sitemap.xml → un Documento refinado por página. |
| Informe de reducción de tokens para una URL sin el contenido completo. |
→ Referencia completa de herramientas
Resumen del benchmark
Métrica | WebFetch | DomPruner |
Tokens de contexto promedio | ~15,735 | ~1,019 (93,5 % menos) |
Calidad de respuesta (10 consultas) | 9 / 10 | 8 / 10 |
Tiempo de respuesta promedio | 5,811 ms | 3,168 ms (45 % más rápido) |
Fidelidad del contenido | Resumido por un modelo pequeño | Texto original preservado |
Clave de API / infraestructura adicional | No | No |
→ Benchmark completo · Arquitectura
Relacionados
dompruner-py — Versión en Python.
DomPrunerLoader,DomPrunerSitemapLoader,DomPrunerFetchToolpara LangChain.pip install dompruner.Integraciones de LangChain — dompruner-py aparece como un cargador web de terceros.
Puntuación de Glama
Licencia
MIT
Maintenance
Related MCP Servers
- AlicenseAqualityDmaintenanceAn MCP server that fetches web pages and extracts clean, AI-friendly Markdown content using Mozilla Readability. It provides secure web access for LLMs with built-in SSRF protection and automated content cleaning for improved context retrieval and summarization.1314MIT
- AlicenseAqualityCmaintenanceMCP server that converts URLs to clean Markdown/Text for LLM agents.5875MIT
- AlicenseAqualityDmaintenanceMCP server that converts URLs into token-minimized clean text for LLMs, providing a receipt of token and cost savings.163MIT
- AlicenseNot gradedqualityBmaintenanceMCP server that fetches web pages, extracts clean markdown (reducing token count), caches results, and provides searchable reading history.MIT
Related MCP Connectors
Web scraping for AI agents. Converts URLs to clean, LLM-ready Markdown with anti-bot bypass.
Jina AI Reader/Search MCP — turn any URL into clean LLM-ready markdown, plus web search.
Web tools for agents: fetch URL as markdown (free MCP) + x402 scrape, links, AI JSON, snapshot.
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/dong7812/dompruner-mcp'
If you have feedback or need assistance with the MCP directory API, please join our Discord server