read_document
Read a document's text within a selected block range, returning citation-anchored content and structured blocks for accurate summarization and source-grounding verification.
Instructions
문서 본문을 인용 앵커를 붙여 범위 지정으로 읽습니다.
형식이 달라도 인터페이스는 하나입니다. 모든 형식을 블록의 1차원 목록으로
평탄화하므로 start/end만 쓰면 됩니다. 블록 하나가 무엇인지는 응답의
unit이 알려 줍니다 (pdf=페이지, pptx=슬라이드 줄, docx=문단·표행).
등급이 C면 텍스트가 없다는 뜻입니다. 그때는 read_document_image로
넘어가세요 — 이 도구가 빈 본문을 돌려주는 것을 "내용이 없다"로 읽으면 안 됩니다.
요약할 때 앵커를 그대로 인용하세요. Phase 4의 check_summary_grounding이
그 앵커로 원문 대조를 합니다. 앵커 없는 문장은 근거 없는 문장으로 처리됩니다.
Args: path: 읽을 파일. start: 시작 블록 번호(1부터). end: 끝 블록 번호(포함). 생략하면 글자 수 상한까지.
Returns: ReadDocumentResponse: 확정 등급, 앵커 붙은 본문, 구조화 블록, 형식별 메타.
Examples: - 사용: "이 PDF 3~8페이지에 뭐가 있나요?" → start=3, end=8 - 사용하지 않음: 페이지 수·제목 구조만 필요할 때 → inspect_document - 사용하지 않음: 등급 C 파일 → read_document_image
Input Schema
| Name | Required | Description | Default |
|---|---|---|---|
| end | No | 읽기를 끝낼 블록 번호(포함). None이면 글자 수 상한까지 읽습니다. 블록의 뜻은 응답의 unit 필드가 알려 줍니다 | |
| path | Yes | scan_folder가 돌려준 상대 경로, 또는 root 안의 절대 경로 | |
| start | No | 읽기 시작할 블록 번호(1부터) |
Output Schema
| Name | Required | Description | Default |
|---|---|---|---|
| end | Yes | 이 응답이 담은 마지막 블록 번호 | |
| meta | Yes | 형식별 메타 (페이지 수, 표 개수 등) | |
| path | Yes | ||
| unit | Yes | 이 형식에서 블록 하나가 무엇인지 (페이지/슬라이드/문단) | |
| grade | Yes | 확정된 추출가능등급. A=구조까지, B=본문만, C=텍스트 없음 | |
| stage | Yes | 분석 워크플로에서 지금 위치한 단계 | |
| start | Yes | 이 응답이 담은 첫 블록 번호 (1부터) | |
| blocks | Yes | 같은 내용의 구조화 형태 | |
| status | Yes | 이 호출의 결과 상태 | |
| content | Yes | 앵커가 붙은 본문. 'p3 | 내용' 형태로 한 줄씩 이어집니다 | |
| unit_count | Yes | 원래 단위의 개수 (총 페이지 수 등) | |
| grade_reason | Yes | 그 등급으로 판정한 근거 | |
| next_actions | No | 이어서 호출하면 좋은 도구 목록 | |
| total_blocks | Yes | 문서 전체의 블록 수 | |
| truncated_by_chars | Yes | True면 글자 수 상한 때문에 범위 안에서도 잘렸습니다 |