Tesseract OCR: Der weltweite Open-Source-Standard für Texterkennung
Dieser Artikel wurde bereits 21x gelesen...
Ob gescannte Rechnungen, historische Archivdokumente oder automatisierte Kennzeichenerkennung: Die Umwandlung von Bilddaten in durchsuchbaren und bearbeitbaren Text ist eine Schlüsseltechnologie modernster Datenverarbeitung.
Tesseract OCR ist dabei eine leistungsfähige Open-Source-Engine für optische Zeichenerkennung.
Ursprünglich zwischen 1985 und 1995 von Hewlett-Packard entwickelt, wurde Tesseract 2005 als Open-Source-Software freigegeben und jahrelang maßgeblich von Google weiterentwickelt. Seit der Version 4 arbeitet Tesseract mit neuronalen Netzwerken (LSTM – Long Short-Term Memory), was die Erkennungsgenauigkeit auf über 99 % angehoben hat.
Tesseract OCR unterstützt über 100 Sprachen, lateinische, kyrillische, arabische, chinesische und viele weitere Schriften. Tesseract OCR arbeitet 100% Offline – Kein Datenabfluss an Drittanbieter. Die Erkennung läuft vollständig auf Ihren Servern oder Clients.
Ausgabe als Klartext (.txt), durchsuchbares PDF, hOCR (HTML mit Koordinaten) oder TSV.
Tesseract ist als plattformübergreifendes Befehlszeilen-Werkzeug (CLI) konzipiert, lässt sich aber dank zahlreicher Wrappers (wie pytesseract für Python) nahtlos in eigene Software-Infrastrukturen einbinden.
Da Tesseract selbst im Terminal läuft, greifen Anwender ohne Programmierkenntnisse häufig zu grafischen Benutzeroberflächen aus der Community:
| Plattform | Einsatzzweck | |
|---|---|---|
| gImageReader | Windows, Linux | Umfangreiche Dokumentenverarbeitung mit manueller Layoutanpassung |
| Capture2Text | Windows | Schnelle Texterkennung per Bildschirm-Screenshot |
| NAPS2 | Windows, Mac, Linux | Bequemes Scannen von Dokumenten mit automatischer OCR |
0 Kommentare