dompruner-mcp
dompruner-mcp
한국어 | Englisch

DOM-AST-Middleware für LLM-Web-Pipelines – entfernt Layout-Rauschen (Nav, Skripte, Sidebars) und übergibt den Originaltext direkt. Fügen Sie eine Abfrage hinzu, um mit BM25 auf relevante Abschnitte zu filtern.
Wenn ein LLM das integrierte WebFetch verwendet, verarbeitet ein kleineres Modell das HTML vor und liefert ein zusammengefasstes Ergebnis – mit Latenz, Kosten und Interpretation, die Sie nicht angefordert haben. DomPruner überspringt das vollständig: Die DOM-AST-Analyse entfernt Rauschen und übergibt den Originalinhalt direkt an das Modell.
Aufruf | Verhalten |
| Entfernt Layout-Rauschen → gibt den vollständigen extrahierten Inhalt zurück |
| Entfernt Layout-Rauschen → BM25 filtert auf relevante Abschnitte (fällt auf vollständigen Inhalt zurück, wenn keine Übereinstimmung) |
> [DomPruner] docs.python.org
> | Raw HTML | 44,316 tokens |
> | DomPruner | 1,328 tokens |
> | Reduction | 97.0% |
> Fetch: 194ms · Parse: 11.2ms93,5 % weniger Kontext-Tokens als WebFetch im Durchschnitt. 45 % schneller Ende-zu-Ende. → Vollständiger Benchmark
Schnellstart
Keine Installation, kein API-Schlüssel:
npx -y dompruner-mcpClaude Code
{
"mcpServers": {
"dompruner": {
"type": "stdio",
"command": "npx",
"args": ["-y", "dompruner-mcp"]
}
}
}Fügen Sie .mcp.json im Projektstamm oder ~/.claude/.mcp.json für global hinzu. Führen Sie /mcp aus, um zu überprüfen.
Claude Desktop
Bearbeiten Sie ~/Library/Application Support/Claude/claude_desktop_config.json (macOS) oder %APPDATA%\Claude\claude_desktop_config.json (Windows):
{
"mcpServers": {
"dompruner": {
"command": "npx",
"args": ["-y", "dompruner-mcp"]
}
}
}Cursor / Windsurf / andere MCP-Clients
{
"mcpServers": {
"dompruner": {
"type": "stdio",
"command": "npx",
"args": ["-y", "dompruner-mcp"]
}
}
}Remote-HTTP (keine Installation, immer aktuell)
Für Clients, die HTTP-Transport unterstützen – keine Node.js-Installation erforderlich, läuft immer mit der neuesten Version:
{
"mcpServers": {
"dompruner": {
"url": "https://dompruner-mcp.vercel.app/api/mcp"
}
}
}LangChain / LangGraph
langchain-mcp-adapters umschließt jeden MCP-stdio-Server automatisch als LangChain-Tools:
from langchain_mcp_adapters.client import MultiServerMCPClient
client = MultiServerMCPClient({
"dompruner": {
"command": "npx",
"args": ["-y", "dompruner-mcp"],
"transport": "stdio",
}
})
tools = await client.get_tools()Related MCP server: Scrapi MCP Server
Sicherstellen, dass Ihre KI immer DomPruner verwendet
Die Tool-Beschreibung von DomPruner weist Clients bereits an, dompruner_fetch gegenüber WebFetch zu bevorzugen. Wenn Ihr Client dennoch zurückfällt, fügen Sie dies zu seiner Anweisungsdatei hinzu:
When retrieving a URL, always use dompruner_fetch instead of WebFetch.
- URL known → dompruner_fetch(url, query?)
- URL unknown → search for the URL first, then dompruner_fetch(url)Client | Anweisungsdatei |
Claude Code |
|
Cursor |
|
Windsurf |
|
Cline |
|
GitHub Copilot |
|
Werkzeuge
Tool | Beschreibung |
| URL abrufen → DOM-verfeinertes Markdown. Optionale |
| Alle Seiten in einer sitemap.xml abrufen → ein verfeinertes Dokument pro Seite. |
| Token-Reduktionsbericht für eine URL ohne vollständigen Inhalt. |
Benchmark-Zusammenfassung
Metrik | WebFetch | DomPruner |
Durchschnittliche Kontext-Tokens | ~15,735 | ~1,019 (93,5 % weniger) |
Antwortqualität (10 Abfragen) | 9 / 10 | 8 / 10 |
Durchschnittliche Antwortzeit | 5,811 ms | 3,168 ms (45 % schneller) |
Inhaltstreue | Von kleinem Modell zusammengefasst | Originaltext erhalten |
Zusätzlicher API-Schlüssel / Infrastruktur | Nein | Nein |
→ Vollständiger Benchmark · Architektur
Verwandt
dompruner-py — Python-Port.
DomPrunerLoader,DomPrunerSitemapLoader,DomPrunerFetchToolfür LangChain.pip install dompruner.LangChain-Integrationen — dompruner-py als Drittanbieter-Web-Loader aufgeführt.
Glama Score
Lizenz
MIT
Maintenance
Related MCP Servers
- AlicenseAqualityDmaintenanceAn MCP server that fetches web pages and extracts clean, AI-friendly Markdown content using Mozilla Readability. It provides secure web access for LLMs with built-in SSRF protection and automated content cleaning for improved context retrieval and summarization.1314MIT
- AlicenseAqualityCmaintenanceMCP server that converts URLs to clean Markdown/Text for LLM agents.5875MIT
- AlicenseAqualityDmaintenanceMCP server that converts URLs into token-minimized clean text for LLMs, providing a receipt of token and cost savings.163MIT
- AlicenseNot gradedqualityBmaintenanceMCP server that fetches web pages, extracts clean markdown (reducing token count), caches results, and provides searchable reading history.MIT
Related MCP Connectors
Web scraping for AI agents. Converts URLs to clean, LLM-ready Markdown with anti-bot bypass.
Jina AI Reader/Search MCP — turn any URL into clean LLM-ready markdown, plus web search.
Web tools for agents: fetch URL as markdown (free MCP) + x402 scrape, links, AI JSON, snapshot.
Latest Blog Posts
- Who's Calling? MCP Hosts Are an Identity Blind Spot (And the Spec Knows It)By Om-Shree-0709 on .mcpAgent IdentityOAuth 2.1
- Your AI Chatbot Just Exposed Your CEO's Salary to an InternBy Om-Shree-0709 on .Agent IdentityMCP SecurityOAuth Delegation
- Why MCP Servers Need Execution Sandboxing (And Why Your Current Stack Isn't Enough)By Om-Shree-0709 on .Agentic AiPrompt InjectionWebAssembly
MCP directory API
We provide all the information about MCP servers via our MCP API.
curl -X GET 'https://glama.ai/api/mcp/v1/servers/dong7812/dompruner-mcp'
If you have feedback or need assistance with the MCP directory API, please join our Discord server