read_pdf_as_text
Extract text from plain PDF files with page range selection and character limits for efficient processing.
Instructions
提取PDF的文本内容。适合纯文本PDF,速度快,消耗token少。
注意:对于扫描版PDF(图片PDF),此方法可能无法提取文本,建议使用read_pdf_as_images。
Args: file_path: PDF文件的完整路径 pages: 要读取的页码,支持多种格式: - 不传或"all": 所有页面 - "1": 单页 - "1-5": 页码范围 - "1-": 从第1页到末尾 - "-5": 从开头到第5页 - "1,3,5": 指定多页 - "1-3,5,7-9": 混合格式 max_pages: 单次调用最多返回的页数,默认50 max_chars: 单次调用最多返回的总字符数,默认200000
Returns: 包含以下信息的字典: - total_pages: 总页数 - extracted_pages: 提取的页码列表 - pages: 每页内容列表,包含page_number和text - full_text: 所有页面的合并文本 - warning: 警告信息(如检测到可能是扫描版PDF或结果被截断)
Input Schema
| Name | Required | Description | Default |
|---|---|---|---|
| pages | No | ||
| file_path | Yes | ||
| max_chars | No | ||
| max_pages | No |