convert_pdf_to_markdown
Converts PDF to Markdown, extracting text, headers, lists, tables, and images per page and preserving page structure. Automatically OCRs scanned pages.
Instructions
Convierte un PDF a un archivo Markdown (.md).
Extrae texto y estructura (headers, listas, tablas simples) pagina por pagina. Las imagenes/diagramas incrustados se guardan en una carpeta aparte y se referencian desde el .md. Las paginas sin texto seleccionable (escaneos) se procesan con OCR (Tesseract) como fallback automatico.
El .md generado arranca con un frontmatter YAML (title, author/
subject/keywords si el PDF los trae, pages, ocr_pages,
converted_at) que resume de que trata el documento, y cada pagina
queda delimitada por un comentario <!-- pdf-page: N --> (N
1-indexado) para poder ubicar cualquier seccion en su pagina de
origen del PDF.
Args: pdf_path: Ruta al archivo .pdf a convertir output_dir: Carpeta donde escribir el .md y las imagenes (default: la misma carpeta del PDF de entrada) ocr_lang: Idioma(s) para Tesseract, formato ISO 639-2 separados por '+' (ej: "spa+eng"). Default: configurado en el server (PDF2MD_OCR_LANG, "spa+eng" si no esta seteado)
Returns:
dict con markdown_path (ruta del .md generado), images_dir
(carpeta de imagenes extraidas, o None si no hubo ninguna),
page_count y ocr_pages (numeros de pagina, 1-indexados, que
se procesaron con OCR por no tener texto extraible)
Input Schema
| Name | Required | Description | Default |
|---|---|---|---|
| ocr_lang | No | ||
| pdf_path | Yes | ||
| output_dir | No |