agent-web-combo
Agent Web Combo
Una herramienta de conexión a internet para agentes de IA: combinación de búsqueda + extracción de contenido + renderizado con Kitesurf/Playwright + lectura de plataformas agent-reach.
Búsqueda: Tavily / Exa / AnySearch
Renderizado: Cloudflare Kitesurf + Playwright (CDP)
Contenido de plataformas: agent-reach (opcional)
Modo de acceso: CLI y MCP Server
Funciones
Cambio entre múltiples fuentes de búsqueda:
tavily/exa/anysearchExtracción del contenido de las páginas de resultados de búsqueda
Kitesurf renderiza páginas, extrae el cuerpo del texto y captura pantallas
Pipeline completo: búsqueda → extracción → renderizado → captura de pantalla
MCP Server: se puede invocar directamente desde Claude Code / Cursor / OpenCode / DSH Desktop
Related MCP server: myscrape
Arquitectura
搜索发现:Tavily / Exa / AnySearch
↓
内容提取:AnySearch extract / Tavily Extract / Exa Contents
↓
需要渲染/截图/JS:Kitesurf + Playwright (connectOverCDP)
↓
平台类内容/登录态:agent-reach (可选)Estructura del proyecto
agent-web-combo/
├── combo/
│ ├── __main__.py # CLI 入口
│ ├── cli.py # 命令行
│ ├── config.py # 环境变量配置
│ ├── search.py # Tavily / Exa / AnySearch
│ ├── kitesurf.py # Kitesurf + Playwright
│ ├── agent_reach.py # agent-reach CLI
│ └── pipeline.py # 组合流水线
├── combo_mcp.py # MCP Server 入口
├── requirements.txt
├── pyproject.toml
└── .env.exampleInstalación
pip install -r requirements.txt
playwright install chromium # 仅本地调试/备选浏览器时需要;连 Kitesurf 不需要Configuración
cp .env.example .envRellene según sea necesario:
# Cloudflare / Kitesurf(需要 Browser Run 权限)
CF_ACCOUNT_ID=你的账号ID
CF_API_TOKEN=你的API Token
# 搜索源(至少一个;AnySearch 可不填 Key)
TAVILY_API_KEY=tvly-xxx
EXA_API_KEY=xxx
ANYSEARCH_API_KEY=as_sk_xxxEl archivo
.envya está ignorado por.gitignore; no lo envíe al repositorio.
Uso desde CLI
# 搜索
python -m combo search "Cloudflare Kitesurf" --provider anysearch --max-results 5
# 渲染单个页面 + 截图
python -m combo render "https://example.com" --screenshot output.png
# 完整流水线
python -m combo research "Kitesurf vs Tavily" \
--provider auto \
--max-results 5 \
--extract \
--render \
--render-limit 3 \
--screenshot-dir shots
# 检查 agent-reach
python -m combo agent-reachUso con MCP
Inicie el MCP Server:
python combo_mcp.pyHerramientas expuestas:
Herramienta | Función |
| Búsqueda |
| Renderizado/captura con Kitesurf |
| Búsqueda + extracción + renderizado |
| Comprobación del estado de agent-reach |
Para la configuración de cada cliente, consulte README.mcp.md.
Notas de seguridad
Todas las claves de API se guardan únicamente en el archivo local
.env.gitignoreya excluye.env, capturas de pantalla y cachéEn la configuración de MCP no se escriben claves en texto plano
Antes de publicar, asegúrese de que no se hayan enviado el archivo
.envni capturas de pantalla
Notas
AnySearch utiliza la interfaz HTTP
tools/callde MCP, disponible de forma anónimaKitesurf se conecta a través del endpoint CDP de Cloudflare Browser Run
Kitesurf se encuentra actualmente en fase Beta; es adecuado para tareas habituales de agentes como captura de pantalla, extracción de HTML y operaciones con el DOM
This server cannot be deployed
Maintenance
Related MCP Connectors
Scrape, crawl and search the web for AI agents via MCP.
MCP server for Firecrawl — web search, scraping, and biomedical/arXiv paper search.
Docs: https://docs.keenable.ai/mcp-server Keenable is a free, remote MCP server that gives agents access to the web index. Search the web with ranked results and date/site filters, then fetch any indexed page as clean markdown. Works out of the box with no account or API key.
Free web search for AI agents. No API key required. Hosted MCP in active development.
Related MCP Servers
- AlicenseNot gradedqualityDmaintenanceA minimal MCP server for agent-friendly web extraction and search. Offers two tools: fetching real pages with Playwright and Crawl4AI, and searching across 7 engines with automatic fallback.34AGPL 3.0
- AlicenseNot gradedqualityCmaintenanceA self-contained web-research MCP server that lets local LLM agents search, fetch, and synthesize web content using tools like web_search, web_fetch, and web_research.2MIT
- AlicenseNot gradedqualityDmaintenanceMCP server that wraps Playwright to give AI agents eyes on the web, enabling browser search, navigation, extraction, and interaction with intelligent LLM-based DOM extraction and skill caching.14 npmMIT
- FlicenseNot gradedqualityDmaintenanceMCP server that enables AI agents to search the web and extract clean Markdown content, with support for JavaScript rendering, structured data extraction, and screenshots.1-