pdf_extract
Extract a PDF page's text, shapes, and images with exact coordinates, colors, and vector paths to rebuild the original design layout.
Instructions
抽取 PDF 某一页的全部内容,用于从 PDF 精确还原设计稿:
text:文本片段(字符串、基线坐标 x/y、宽高、字号、旋转角、颜色、外框 bbox)
shapes:矢量图形(填充/描边色、透明度、线宽、外框 bbox、以及子路径几何:M/L/C/Q/Z 线段;paint="clip" 是不可见的裁剪区)
images:位图贴图(外框 bbox、原始像素尺寸、对象名) 坐标:左上原点、y 向下、单位 pt(1pt=1/72 英寸)。 注意:Chrome/Skia 导出的 PDF 常把可见文字画成矢量轮廓,另垫一层不可见的文本对象;这类文本会被标 "covered":true,颜色则由同位置的轮廓反推并标 "colorFrom":"outline"。 建议先整体抽取一次看清结构,图形很多时用 detail="box" 只取外框与样式,再对重点区域用 pdf_extract + pdf_render 局部细看。
Input Schema
| Name | Required | Description | Default |
|---|---|---|---|
| page | Yes | 页码,从 1 开始 | |
| path | Yes | PDF 文件路径(绝对或相对当前工作目录) | |
| limit | No | 每类结果条数上限,默认 5000 | |
| detail | No | 图形细节级别:full(默认)含完整路径线段;box 只给外框+样式,输出更小 | |
| include | No | 只返回指定类别,默认全部 | |
| password | No | 若 PDF 已加密,提供打开密码 | |
| precision | No | 坐标保留小数位,默认 3 |