scrape_url
Scrape a single URL using request, browser, or auto mode. Get HTML, markdown, screenshot, or PDF output, with optional AI extraction for structured data.
Instructions
Scrape a single URL. Modes: request (fast), browser (JS), auto (detect). Output: html, markdown, screenshot, pdf. Use ai_enhance with ai_prompt for AI extraction.
Input Schema
| Name | Required | Description | Default |
|---|---|---|---|
| No | |||
| url | Yes | URL to scrape | |
| mode | No | auto | |
| device | No | Device type to emulate | windows |
| output | No | markdown | |
| no_html | No | Exclude HTML from JSON response | |
| ai_prompt | No | Prompt for AI extraction | |
| ai_source | No | Source for AI processing | |
| config_id | No | Saved config ID to use | |
| scheme_id | No | Saved extraction schema ID | |
| ai_enhance | No | ||
| async_mode | No | ||
| execute_js | No | Raw JavaScript code to execute | |
| proxy_type | No | residential | |
| screenshot | No | ||
| storage_id | No | Storage config ID for results | |
| wait_until | No | domcontentloaded | |
| wait_seconds | No | Seconds to wait after page load | |
| ai_force_json | No | Force AI response to be valid JSON | |
| excluded_tags | No | HTML tags to remove | |
| proxy_country | No | Two-letter country code for proxy | US |
| extract_scheme | No | Inline extraction schema | |
| block_resources | No | Resource types to block | |
| capture_headers | No | Capture response headers | |
| js_instructions | No | JS actions: click, wait, fill, wait_for | |
| network_capture | No | Network capture filters | |
| proxy_session_id | No | Proxy session ID (6-8 characters) | |
| additional_headers | No | Extra HTTP headers | |
| excluded_selectors | No | CSS selectors to remove | |
| use_default_storage | No |