Tesseract OCR: Der weltweite Open-Source-Standard für Texterkennung

Veröffentlicht von maikom am

Dieser Artikel wurde bereits 21x gelesen...

Ob gescannte Rechnungen, historische Archivdokumente oder automatisierte Kennzeichenerkennung: Die Umwandlung von Bilddaten in durchsuchbaren und bearbeitbaren Text ist eine Schlüsseltechnologie modernster Datenverarbeitung.
Tesseract OCR ist dabei eine leistungsfähige Open-Source-Engine für optische Zeichenerkennung.

Ursprünglich zwischen 1985 und 1995 von Hewlett-Packard entwickelt, wurde Tesseract 2005 als Open-Source-Software freigegeben und jahrelang maßgeblich von Google weiterentwickelt. Seit der Version 4 arbeitet Tesseract mit neuronalen Netzwerken (LSTM – Long Short-Term Memory), was die Erkennungsgenauigkeit auf über 99 % angehoben hat.

Tesseract OCR unterstützt über 100 Sprachen, lateinische, kyrillische, arabische, chinesische und viele weitere Schriften. Tesseract OCR arbeitet 100% Offline – Kein Datenabfluss an Drittanbieter. Die Erkennung läuft vollständig auf Ihren Servern oder Clients.

Ausgabe als Klartext (.txt), durchsuchbares PDF, hOCR (HTML mit Koordinaten) oder TSV.

Tesseract ist als plattformübergreifendes Befehlszeilen-Werkzeug (CLI) konzipiert, lässt sich aber dank zahlreicher Wrappers (wie pytesseract für Python) nahtlos in eigene Software-Infrastrukturen einbinden.

Da Tesseract selbst im Terminal läuft, greifen Anwender ohne Programmierkenntnisse häufig zu grafischen Benutzeroberflächen aus der Community:

PlattformEinsatzzweck
gImageReaderWindows, LinuxUmfangreiche Dokumentenverarbeitung mit manueller Layoutanpassung
Capture2TextWindowsSchnelle Texterkennung per Bildschirm-Screenshot
NAPS2Windows, Mac, LinuxBequemes Scannen von Dokumenten mit automatischer OCR

Offizielle Website & Downloads
GitHub Repository (v5.3+)

Kategorien: Freeware

0 Kommentare

Schreibe einen Kommentar

Deine E-Mail-Adresse wird nicht veröffentlicht. Erforderliche Felder sind mit * markiert