read_pdf
Extract page-by-page text from PDF files. Specify page ranges to read large documents efficiently, and enable OCR to handle scanned, textless pages.
Instructions
PDF에서 페이지별 텍스트를 추출한다.
긴 PDF는 컨텍스트를 아끼기 위해 page_start/page_end로 범위를 지정해 나눠 읽으세요. page_end를 생략하면 기본 상한(30페이지)까지만 읽고, 그 이상은 truncated 여부 대신 total_pages와 end_page 차이로 알 수 있습니다.
Args: file_path: PDF 파일 경로. page_start: 시작 페이지 (기본 1). page_end: 끝 페이지. 생략 시 최대 30페이지. ocr: 텍스트 레이어가 없는 페이지를 OCR로 보강할지 여부 (기본 False, 느립니다). ocr_lang: OCR 언어 코드 (기본 'kor+eng').
Returns:
ReadPdfResponse: pages[]에 페이지별 text와 text_source
('extracted'/'ocr'/'empty'). likely_scanned가 True면 원래 텍스트
레이어가 없는 스캔본 — ocr=True로 다시 호출하면 내용을 읽을 수 있습니다.
Raises: ToolFailure: PATH_NOT_FOUND / NOT_A_FILE / FILE_TOO_LARGE / UNSUPPORTED_EXTENSION / OCR_ENGINE_NOT_FOUND.
Input Schema
| Name | Required | Description | Default |
|---|---|---|---|
| ocr | No | True면 텍스트 레이어가 없는 페이지를 Tesseract OCR로 다시 읽습니다. 스캔본 PDF에서만 켜세요 — 텍스트 레이어가 있는 페이지는 그대로 추출을 씁니다. | |
| ocr_lang | No | OCR 언어 코드. 기본 'kor+eng'(한국어+영어 동시 인식) | kor+eng |
| page_end | No | 끝 페이지. 생략하면 문서 끝까지(단, 기본 상한 30페이지) | |
| file_path | Yes | 읽을 .pdf 파일 경로 | |
| page_start | No | 시작 페이지(1부터) |
Output Schema
| Name | Required | Description | Default |
|---|---|---|---|
| pages | Yes | ||
| status | Yes | 이 호출의 결과 상태 | |
| end_page | Yes | ||
| metadata | Yes | ||
| file_path | Yes | ||
| start_page | Yes | ||
| total_pages | Yes | ||
| next_actions | No | 이어서 호출하면 좋은 도구 목록 | |
| likely_scanned | Yes | True면 텍스트 레이어가 없는 스캔 이미지 PDF로 추정됨. 이 서버는 OCR을 수행하지 않으므로 요약이 불가능합니다. |