crawl_website
Crawl a website to collect on-page SEO data: URLs, titles, H1-H4, meta robots, canonical tags, word counts, internal/external links, anchor texts, and bold keywords.
Instructions
Crawl toàn bộ hoặc một phần website để thu thập toàn bộ dữ liệu URL, Title, H1-H4, Meta robots, Canonical, Word count, Inlinks/Outlinks, Anchor texts và Bold keywords.
Input Schema
| Name | Required | Description | Default |
|---|---|---|---|
| url | Yes | URL gốc của website cần quét (ví dụ: https://homecaresausinh.com) | |
| mode | No | Chế độ quét: 'full' (quét theo liên kết nội bộ), 'sitemap' (quét qua XML sitemap), 'fast' (quét nhanh trang chủ và menu). Mặc định: 'full' | |
| delayMs | No | Độ trễ giữa các request tính bằng ms để tránh quá tải máy chủ (mặc định: 200) | |
| maxDepth | No | Độ sâu quét tối đa (mặc định: 3) | |
| maxPages | No | Số trang tối đa cần quét (mặc định: 100) | |
| sitemapUrl | No | URL sitemap tùy chọn nếu muốn chỉ định trực tiếp (ví dụ: https://example.com/sitemap.xml) | |
| concurrency | No | Số lượng request đồng thời (mặc định: 3, tối đa 10) | |
| excludePattern | No | Regex hoặc chuỗi mẫu để bỏ qua URL (ví dụ: '/tag|/cart|/checkout') | |
| includePattern | No | Regex hoặc chuỗi mẫu để chỉ quét các URL khớp (ví dụ: '/dich-vu|/blog') |