check_pdf_ocr
Analyze a PDF file to determine if it contains selectable text or is a scanned image. Returns flags indicating whether OCR is needed and if the PDF has a double-layer text overlay.
Instructions
判断一个已经传上去的 PDF 是不是扫描件(图片版)。PDF 传完就调它——看到「上传结果 HTTP 200」之后、提交翻译之前,把 objectKey 传进来。只有 PDF 需要,其他格式不用调。返回 isOcr=1 表示扫描件、翻译要走 OCR(扣的是 OCR 额度,和普通翻译不是同一本账,请把这点告诉用户),isOcr=0 是文本版 PDF;isDoubleDeck=1 表示双层 PDF(扫描图上盖了一层文字)——这种直接翻会翻到那层往往是错的文字上,返回的 msg 里会给出拍平工具的链接,请原样转述给用户,让他先拍平再重新上传。结果会被记住,随后 translate_document 直接复用、不会重复检测,也不用你把 is_ocr 填回去(检测只负责把扫描件标出来,不会去关掉别人显式打开的 OCR)。大文件可能要等十几秒到一分钟,那是服务端在下载并分析整个 PDF,属正常。测不出来时返回 code=500——那不影响提交,照常翻就是了。
Input Schema
| Name | Required | Description | Default |
|---|---|---|---|
| file_name | No | 文件名,只用于返回里的可读说明,可不传 | |
| file_object_key | Yes | 上传时拿到的 objectKey |