crawl_single
Extract main content from a single webpage URL as Markdown, using fast extraction first and falling back to browser rendering for dynamic or SPA pages.
Instructions
爬取单个网页(自动降级:快速提取 → 浏览器渲染)
适用于已经知道一个明确 URL、需要提取该页面正文 Markdown 的场景。 默认先尝试轻量级快速提取(适合静态文章/文档页),失败、内容过短或检测到 SPA 骨架页时 自动切换到浏览器渲染。若要从一个入口页继续发现站内链接,请使用 crawl_site; 若已有多个明确 URL,请使用 crawl_batch。
参数组合:
默认 prefer_fast=True:先快提取,必要时 fallback 到浏览器。
prefer_fast=False:跳过快速提取,强制直接使用浏览器。
enhanced=True:只影响浏览器路径的等待时间;不会单独跳过快速提取。 如需强制浏览器增强模式,请同时设置 prefer_fast=False, enhanced=True。
Input Schema
| Name | Required | Description | Default |
|---|---|---|---|
| url | Yes | 要爬取的网页 URL | |
| enhanced | No | 浏览器增强模式。适用于 SPA/慢加载页面,等待时间更长;仅在浏览器路径生效。 | |
| llm_config | No | [实验性] LLM 后处理配置(可选),需设置 CRAWL_MCP_API_KEY 才生效。 支持三种格式: - 字典: {"instruction": "总结", "schema": {...}} - JSON 字符串: '{"instruction": "总结"}' - 纯文本: "总结页面内容"(自动作为 instruction) 未设置 API Key 时传此参数会优雅跳过,结果中包含 llm_skipped 提示。 | |
| prefer_fast | No | 是否优先尝试快速提取(默认 True)。设为 False 时强制浏览器爬取。 | |
| min_content_length | No | 快速提取结果的最小内容长度阈值(默认 200 字符) |
Output Schema
| Name | Required | Description | Default |
|---|---|---|---|
No arguments | |||