crawl_batch
Batch crawl multiple URLs with parallel extraction and automatic browser fallback for failed or incomplete pages.
Instructions
批量爬取多个网页(自动降级版)
适用于已经有一组明确 URL、需要并行抓取多个页面的场景。 默认对所有 URL 并行快速提取;只有失败、内容过短或 SPA 骨架页才进入浏览器 fallback。 若只有一个 URL,请使用 crawl_single;若只有入口页并希望发现站内链接,请使用 crawl_site。
参数组合:
prefer_fast=True:静态页走快速路径,失败项才走浏览器 fallback。
prefer_fast=False:所有 URL 都直接走浏览器,不返回 fast/fallback 方法标记。
min_content_length 只影响快速提取是否被认为足够完整。
Input Schema
| Name | Required | Description | Default |
|---|---|---|---|
| urls | Yes | URL 列表 | |
| concurrent | No | 网页爬取并发数(默认:3) | |
| llm_config | No | [实验性] LLM 后处理配置(可选),需设置 CRAWL_MCP_API_KEY 才生效 | |
| prefer_fast | No | 是否优先尝试快速提取(默认 True) | |
| llm_concurrent | No | LLM 处理并发数(默认:3) | |
| min_content_length | No | 快速提取最小内容长度阈值(默认 200 字符) |
Output Schema
| Name | Required | Description | Default |
|---|---|---|---|
| result | Yes |