ocr_extract_pdf
Extract text from scanned legal PDFs—judicial files, notarial deeds, public resolutions—using native text extraction or OCR with adjustable language, engine, and page range.
Instructions
Extrae texto nativo o ejecuta OCR (Tesseract) sobre expedientes PDF judiciales, actas notariales o resoluciones públicas escaneadas.
Input Schema
| Name | Required | Description | Default |
|---|---|---|---|
| dpi | No | Resolución de rasterizado para el OCR (por defecto 150; 300 para documentos borrosos) | |
| lang | No | Modelo de idioma del OCR. Por defecto 'spa' (español), que es lo que necesitan los expedientes chilenos. Si el modelo no está instalado, la respuesta trae una advertencia en 'advertencias' y el idioma realmente usado en 'ocr_language'. | spa |
| engine | No | Motor de OCR: 'auto' (detecta el mejor disponible), 'rapidocr' (PaddleOCR ONNX de alta precisión), 'paddleocr' o 'tesseract' | |
| end_page | No | Página final a procesar (opcional) | |
| pdf_path | Yes | Ruta absoluta o relativa al archivo PDF | |
| force_ocr | No | Forzar OCR incluso si hay texto digital | |
| start_page | No | Página de inicio (1-indexed, por defecto 1) |