convert_pdf_directory
Batch convert every PDF in a folder to Markdown, including subfolders. Per-file errors are logged without stopping the batch, and OCR is available for scanned pages.
Instructions
Convierte todos los PDF de una carpeta a archivos Markdown.
Aplica la misma logica que convert_pdf_to_markdown a cada PDF
encontrado. Si un archivo puntual falla, se registra en errors y
se sigue con el resto (no corta el lote entero).
Args: input_dir: Carpeta con los PDF a convertir output_dir: Carpeta base de salida (default: junto a cada PDF de origen). Si recursive=True, se replica la subcarpeta relativa de cada PDF dentro de output_dir recursive: Si busca PDFs en subcarpetas tambien (default: True) ocr_lang: Idioma(s) para Tesseract (ver convert_pdf_to_markdown)
Returns:
dict con converted (lista de resultados por PDF, mismo shape
que convert_pdf_to_markdown), errors (lista de
{pdf, error}) y total_found (cantidad de PDFs encontrados)
Input Schema
| Name | Required | Description | Default |
|---|---|---|---|
| ocr_lang | No | ||
| input_dir | Yes | ||
| recursive | No | ||
| output_dir | No |