crawl_structured
Extract specific data fields from repeated HTML elements using CSS selectors, converting web content into clean JSON for targeted scraping.
Instructions
CSS 셀렉터로 반복 요소를 잡아 지정한 필드만 JSON으로 추출한다.
Args: url: 크롤링할 URL. selector: 반복 요소를 잡는 CSS 셀렉터 (예: "table tr.item", "div.product-card"). fields: 추출할 필드. 키=필드명, 값=추출 지정 문자열. - 텍스트: "td" 또는 "td:text" - 속성: "a@href" (요소@속성명), 요소 자체 속성은 "@data-value" - N번째 요소는 CSS 문법 "td:nth-of-type(1)" 사용 (":eq()" 미지원) 예: {"이름": "td:nth-of-type(1):text", "링크": "a@href"} wait_seconds: HTML을 받기 전 대기 시간(초). JS 동적 로딩 페이지에 사용. wait_selector: 이 CSS 셀렉터가 나타날 때까지 대기. 지정 시 wait_seconds보다 우선.
Input Schema
| Name | Required | Description | Default |
|---|---|---|---|
| url | Yes | ||
| fields | Yes | ||
| selector | Yes | ||
| wait_seconds | No | ||
| wait_selector | No |
Output Schema
| Name | Required | Description | Default |
|---|---|---|---|
| result | Yes |