doc_parse
把 PDF / Word(.docx) / PPT(.pptx) / HTML / 纯文本 解析成干净 Markdown + 结构化(按实际解析页数计费,每页 1 credit)。
纯解析 + 格式转换、不生成任何 AI 内容;扫描件 OCR 暂未支持。
支持 page_range 只解析指定页码段(只按解析的页数扣费)。
Input Schema
| Name | Required | Description | Default |
|---|---|---|---|
| file_id | No | 已上传到文件中转站的文档 ID(与 data_base64 二选一) | |
| filename | No | 文件名带扩展名;base64 输入时必填以判类型(.pdf/.docx/.pptx) | |
| max_pages | No | 最多解析页数,0=全部 | |
| page_range | No | 页码范围,如 3-10 或 5,空=全部(PDF/PPT 有效) | |
| data_base64 | No | 文档内容 base64(与 file_id 二选一) |