leer_pdf
Extract text from official Melilla gazette PDFs (BOME) or legacy portal PDFs using a CVE identifier or direct URL, with pagination for long documents and detection of scanned pages.
Instructions
Texto del PDF de cualquier CVE: boletín, sumario (BOME-S), artículo (BOME-A) o página (BOME-P / BOME-PX); o, con url en vez de cve, de un PDF del portal antiguo de melilla.es.
Da exactamente uno: cve, o url (solo las URL https://www.melilla.es/mandar.php/... que devuelven buscar_bome_antiguo y ver_bome_antiguo, por página o del boletín entero; se rechaza cualquier otra). Las páginas sin texto extraíble (escaneadas, frecuentes en los boletines antiguos) salen con sin_texto=true y un aviso. Paginación: devuelve páginas enteras hasta max_caracteres (1000-100000, por defecto 20000), siempre al menos una; una página más larga que max_caracteres se corta ahí (cortada=true). Si 'siguiente' no es null, vuelve a llamar con desde_pagina y desde_caracter de 'siguiente'; null significa que no queda más.
Input Schema
| Name | Required | Description | Default |
|---|---|---|---|
| cve | No | ||
| url | No | ||
| desde_pagina | No | ||
| desde_caracter | No | ||
| max_caracteres | No |