texterkennung
texterkennungExtract text from images or PDFs lacking a text layer using OCR. Generate a new text file with source metadata while preserving the original.
Instructions
SCHREIBT IN DIE AKTE. Texterkennung (OCR) für ein Foto oder eine PDF ohne Textschicht, über das freiwillige Zusatzprogramm tesseract auf diesem Rechner. Legt den erkannten Text als neue Textdatei unter 07 Recherche/Texterkennung an (eigene D-Kennung, Verweis auf das Original, Kopf mit Quelle, Prüfsumme, Programm, Sprache, Datum und Warnhinweis) und vermerkt beim Original den Textstand „OCR-erkannt“, wenn dort noch keiner steht. Das Original bleibt unverändert, nichts wird überschrieben. Erkannter Text ist eine Ableitung: Zahlen, Daten, Fristen, Beträge und Namen am Original prüfen. Nur mit bestaetigt=true nach Rückfrage beim Nutzer.
Input Schema
| Name | Required | Description | Default |
|---|---|---|---|
| fall | Yes | ||
| sprache | No | tesseract-Sprachkürzel, Standard deu; mehrere mit +, etwa deu+eng | |
| dokument | Yes | D-Kennung eines Fotos oder einer PDF ohne Textschicht | |
| bestaetigt | No | Nur true, wenn der Nutzer genau diesen Aufruf mit diesen Parametern ausdrücklich bestätigt hat. Ohne true wird nichts geändert; die Antwort enthält dann die Rückfrage. |