Skip to main content
Glama

dompruner-mcp

한국어 | Inglés

Poda del árbol DOM para DomPruner

Middleware de AST DOM para pipelines web de LLM: elimina el ruido de maquetación (nav, scripts, barras laterales) y pasa el texto original directamente. Añade una consulta para filtrar las secciones relevantes con BM25.

Cuando un LLM usa el WebFetch integrado, un modelo más pequeño preprocesa el HTML y devuelve un resultado resumido, añadiendo latencia, coste e interpretación que no pediste. DomPruner se salta todo eso: el análisis del AST DOM elimina el ruido y pasa el contenido original directamente al modelo.

Llamada

Comportamiento

dompruner_fetch(url)

Elimina el ruido de maquetación → devuelve el contenido extraído completo

dompruner_fetch(url, query)

Elimina el ruido de maquetación → BM25 filtra las secciones relevantes (si no hay coincidencia, usa el contenido completo)

> [DomPruner] docs.python.org
> | Raw HTML  | 44,316 tokens |
> | DomPruner |  1,328 tokens |
> | Reduction |        97.0%  |
> Fetch: 194ms · Parse: 11.2ms

De media, un 93,5 % menos de tokens de contexto que WebFetch. Un 45 % más rápido de principio a fin.Benchmark completo


Inicio rápido

Sin instalación, sin clave de API:

npx -y dompruner-mcp

Claude Code

{
  "mcpServers": {
    "dompruner": {
      "type": "stdio",
      "command": "npx",
      "args": ["-y", "dompruner-mcp"]
    }
  }
}

Añádelo a .mcp.json en la raíz de tu proyecto, o a ~/.claude/.mcp.json para uso global. Ejecuta /mcp para verificarlo.

Claude Desktop

Edita ~/Library/Application Support/Claude/claude_desktop_config.json (macOS) o %APPDATA%\Claude\claude_desktop_config.json (Windows):

{
  "mcpServers": {
    "dompruner": {
      "command": "npx",
      "args": ["-y", "dompruner-mcp"]
    }
  }
}

Cursor / Windsurf / otros clientes MCP

{
  "mcpServers": {
    "dompruner": {
      "type": "stdio",
      "command": "npx",
      "args": ["-y", "dompruner-mcp"]
    }
  }
}

HTTP remoto (sin instalación, siempre actualizado)

Para clientes que admiten transporte HTTP — no se requiere instalar Node.js, siempre ejecuta la última versión:

{
  "mcpServers": {
    "dompruner": {
      "url": "https://dompruner-mcp.vercel.app/api/mcp"
    }
  }
}

LangChain / LangGraph

langchain-mcp-adapters envuelve automáticamente cualquier servidor MCP stdio como herramientas de LangChain:

from langchain_mcp_adapters.client import MultiServerMCPClient

client = MultiServerMCPClient({
    "dompruner": {
        "command": "npx",
        "args": ["-y", "dompruner-mcp"],
        "transport": "stdio",
    }
})
tools = await client.get_tools()

Related MCP server: Scrapi MCP Server

Cómo asegurarte de que tu IA use siempre DomPruner

La descripción de la herramienta de DomPruner ya indica a los clientes que prefieran dompruner_fetch sobre WebFetch. Si tu cliente aún recurre a WebFetch, añade esto a su archivo de instrucciones:

When retrieving a URL, always use dompruner_fetch instead of WebFetch.
- URL known → dompruner_fetch(url, query?)
- URL unknown → search for the URL first, then dompruner_fetch(url)

Cliente

Archivo de instrucciones

Claude Code

CLAUDE.md (proyecto) o ~/.claude/CLAUDE.md (global)

Cursor

.cursorrules

Windsurf

.windsurfrules

Cline

.clinerules

GitHub Copilot

.github/copilot-instructions.md


Herramientas

Herramienta

Descripción

dompruner_fetch

Obtiene una URL → Markdown refinado por DOM. El query opcional habilita el filtrado de secciones con BM25+.

dompruner_sitemap

Obtiene todas las páginas de un sitemap.xml → un Documento refinado por página.

dompruner_analyze

Informe de reducción de tokens para una URL sin el contenido completo.

Referencia completa de herramientas


Resumen del benchmark

Métrica

WebFetch

DomPruner

Tokens de contexto promedio

~15,735

~1,019 (93,5 % menos)

Calidad de respuesta (10 consultas)

9 / 10

8 / 10

Tiempo de respuesta promedio

5,811 ms

3,168 ms (45 % más rápido)

Fidelidad del contenido

Resumido por un modelo pequeño

Texto original preservado

Clave de API / infraestructura adicional

No

No

Benchmark completo · Arquitectura


Relacionados

  • dompruner-py — Versión en Python. DomPrunerLoader, DomPrunerSitemapLoader, DomPrunerFetchTool para LangChain. pip install dompruner.

  • Integraciones de LangChain — dompruner-py aparece como un cargador web de terceros.


Puntuación de Glama

Servidor MCP dompruner-mcp


Licencia

MIT

A
license - permissive license
A
quality
A
maintenance

Maintenance

Maintainers
<1hResponse time
0dRelease cycle
2Releases (12mo)
Commit activity

Related MCP Servers

  • A
    license
    A
    quality
    D
    maintenance
    An MCP server that fetches web pages and extracts clean, AI-friendly Markdown content using Mozilla Readability. It provides secure web access for LLMs with built-in SSRF protection and automated content cleaning for improved context retrieval and summarization.
    1
    314
    MIT
  • A
    license
    A
    quality
    D
    maintenance
    MCP server that converts URLs into token-minimized clean text for LLMs, providing a receipt of token and cost savings.
    1
    63
    MIT
  • A
    license
    Not graded
    quality
    B
    maintenance
    MCP server that fetches web pages, extracts clean markdown (reducing token count), caches results, and provides searchable reading history.
    MIT

View all related MCP servers

Related MCP Connectors

  • Web scraping for AI agents. Converts URLs to clean, LLM-ready Markdown with anti-bot bypass.

  • Jina AI Reader/Search MCP — turn any URL into clean LLM-ready markdown, plus web search.

  • Web tools for agents: fetch URL as markdown (free MCP) + x402 scrape, links, AI JSON, snapshot.

View all MCP Connectors

Latest Blog Posts

MCP directory API

We provide all the information about MCP servers via our MCP API.

curl -X GET 'https://glama.ai/api/mcp/v1/servers/dong7812/dompruner-mcp'

If you have feedback or need assistance with the MCP directory API, please join our Discord server