Skip to main content
Glama

dompruner-mcp

한국어 | 日本語

DOM Tree Pruning for DomPruner

LLMウェブパイプライン向けのDOM ASTミドルウェア — レイアウトノイズ(ナビ、スクリプト、サイドバー)を除去し、元のテキストを直接渡します。クエリを追加してBM25で関連セクションにフィルタリングできます。

LLMが組み込みのWebFetchを使用すると、より小さなモデルがHTMLを前処理して要約結果を返します — これにより、不要なレイテンシ、コスト、解釈が追加されます。DomPrunerはそれを完全にスキップします:DOM AST解析がノイズを除去し、元のコンテンツを直接モデルに渡します

呼び出し

動作

dompruner_fetch(url)

レイアウトノイズを除去 → 抽出された完全なコンテンツを返す

dompruner_fetch(url, query)

レイアウトノイズを除去 → BM25で関連セクションにフィルタリング(一致しない場合は完全なコンテンツにフォールバック)

> [DomPruner] docs.python.org
> | Raw HTML  | 44,316 tokens |
> | DomPruner |  1,328 tokens |
> | Reduction |        97.0%  |
> Fetch: 194ms · Parse: 11.2ms

平均でWebFetchより93.5%少ないコンテキストトークン。エンドツーエンドで45%高速。完全なベンチマーク


クイックスタート

インストール不要、APIキー不要:

npx -y dompruner-mcp

Claude Code

{
  "mcpServers": {
    "dompruner": {
      "type": "stdio",
      "command": "npx",
      "args": ["-y", "dompruner-mcp"]
    }
  }
}

プロジェクトルートの.mcp.jsonに追加するか、グローバルには~/.claude/.mcp.jsonに追加します。/mcpを実行して確認してください。

Claude Desktop

~/Library/Application Support/Claude/claude_desktop_config.json(macOS)または%APPDATA%\Claude\claude_desktop_config.json(Windows)を編集します:

{
  "mcpServers": {
    "dompruner": {
      "command": "npx",
      "args": ["-y", "dompruner-mcp"]
    }
  }
}

Cursor / Windsurf / その他のMCPクライアント

{
  "mcpServers": {
    "dompruner": {
      "type": "stdio",
      "command": "npx",
      "args": ["-y", "dompruner-mcp"]
    }
  }
}

リモートHTTP(インストール不要、常に最新)

HTTPトランスポートをサポートするクライアント向け — Node.jsのインストールは不要で、常に最新バージョンが実行されます:

{
  "mcpServers": {
    "dompruner": {
      "url": "https://dompruner-mcp.vercel.app/api/mcp"
    }
  }
}

LangChain / LangGraph

langchain-mcp-adaptersは、任意のMCP stdioサーバーをLangChainツールとして自動的にラップします:

from langchain_mcp_adapters.client import MultiServerMCPClient

client = MultiServerMCPClient({
    "dompruner": {
        "command": "npx",
        "args": ["-y", "dompruner-mcp"],
        "transport": "stdio",
    }
})
tools = await client.get_tools()

Related MCP server: Scrapi MCP Server

AIが常にDomPrunerを使用するようにする

DomPrunerのツール説明は、クライアントにWebFetchよりもdompruner_fetchを優先するよう指示しています。それでもクライアントがフォールバックする場合は、これを指示ファイルに追加してください:

When retrieving a URL, always use dompruner_fetch instead of WebFetch.
- URL known → dompruner_fetch(url, query?)
- URL unknown → search for the URL first, then dompruner_fetch(url)

クライアント

指示ファイル

Claude Code

CLAUDE.md(プロジェクト)または~/.claude/CLAUDE.md(グローバル)

Cursor

.cursorrules

Windsurf

.windsurfrules

Cline

.clinerules

GitHub Copilot

.github/copilot-instructions.md


ツール

ツール

説明

dompruner_fetch

URLを取得 → DOM精製されたMarkdown。オプションのqueryでBM25+セクションフィルタリングが有効になります。

dompruner_sitemap

sitemap.xml内のすべてのページを取得 → ページごとに精製されたDocumentを1つ生成。

dompruner_analyze

完全なコンテンツなしでURLのトークン削減レポートを生成。

完全なツールリファレンス


ベンチマーク概要

メトリック

WebFetch

DomPruner

平均コンテキストトークン

~15,735

~1,019(93.5%削減)

回答品質(10クエリ)

9 / 10

8 / 10

平均応答時間

5,811 ms

3,168 ms(45%高速)

コンテンツ忠実度

小規模モデルによる要約

元のテキストを保持

追加のAPIキー / インフラ

いいえ

いいえ

完全なベンチマーク · アーキテクチャ


関連

  • dompruner-py — Python移植版。LangChain用のDomPrunerLoaderDomPrunerSitemapLoaderDomPrunerFetchToolpip install dompruner

  • LangChainインテグレーション — dompruner-pyはサードパーティのウェブローダーとしてリストされています。


Glamaスコア

dompruner-mcp MCP server


ライセンス

MIT

A
license - permissive license
A
quality
A
maintenance

Maintenance

Maintainers
<1hResponse time
0dRelease cycle
2Releases (12mo)
Commit activity

Related MCP Servers

  • A
    license
    A
    quality
    D
    maintenance
    An MCP server that fetches web pages and extracts clean, AI-friendly Markdown content using Mozilla Readability. It provides secure web access for LLMs with built-in SSRF protection and automated content cleaning for improved context retrieval and summarization.
    1
    314
    MIT
  • A
    license
    A
    quality
    D
    maintenance
    MCP server that converts URLs into token-minimized clean text for LLMs, providing a receipt of token and cost savings.
    1
    63
    MIT
  • A
    license
    Not graded
    quality
    B
    maintenance
    MCP server that fetches web pages, extracts clean markdown (reducing token count), caches results, and provides searchable reading history.
    MIT

View all related MCP servers

Related MCP Connectors

  • Web scraping for AI agents. Converts URLs to clean, LLM-ready Markdown with anti-bot bypass.

  • Jina AI Reader/Search MCP — turn any URL into clean LLM-ready markdown, plus web search.

  • Web tools for agents: fetch URL as markdown (free MCP) + x402 scrape, links, AI JSON, snapshot.

View all MCP Connectors

Latest Blog Posts

MCP directory API

We provide all the information about MCP servers via our MCP API.

curl -X GET 'https://glama.ai/api/mcp/v1/servers/dong7812/dompruner-mcp'

If you have feedback or need assistance with the MCP directory API, please join our Discord server