> For the complete documentation index, see [llms.txt](https://docs.augelab.com/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.augelab.com/german/funktionsblocke/blocks-reference/ai-blocks/ocr.md).

# OCR

Dieser Funktionsblock extrahiert Text aus Bildern und liefert erkannten Text, Begrenzungsrahmen und optional ein annotiertes Bild. Er ist für einfache Drag-and-Drop-Pipelines ausgelegt: Bild einspeisen, Konfidenz-Schwelle und Optionen einstellen und dann Text auslesen oder Ergebnisse visualisieren.

## 📥 Eingänge

`Image`\
Dieser Eingang akzeptiert beliebige Bilder, auf denen eine Texterkennung durchgeführt werden soll.

## 📤 Ausgänge

`Result`\
Annotiertes Bild mit Erkennungsrahmen und optionaler Textüberlagerung.

`Whole Text`\
Alle erkannten Texte als ein einzelner, zusammengefügter String.

`Texts`\
Einzeln erkannte Textstrings (mehrere Ausgaben möglich).

`Boxes`\
Erkannte Begrenzungsrahmen für jede Textregion.

## 🕹️ Steuerungen

`Use auto rotation`\
Schalter, um automatische Rotationserkennung für umgedrehten/gedrehten Text zu aktivieren.

`Show Texts`\
Schalter, um erkannte Textlabels auf dem annotierten Ausgabe-Bild zu zeichnen.

`Threshold`\
Schieberegler zur Einstellung der minimalen Konfidenz für akzeptierte Erkennungen (höher = weniger, aber vertrauenswürdigere Ergebnisse).

## 🎨 Funktionen

* Echtzeit-Textdetektion und -erkennung aus Bildern, die an den Eingang `Image` geliefert werden.
* Konfidenzfilterung über den Schieberegler `Threshold`, um schwache Erkennungen zu ignorieren.
* Optionale Bildannotierung: Zeichnen von Kästchen und Text auf dem zurückgegebenen Bild `Result`, wenn `Show Texts` aktiviert ist.
* Unterstützung für automatische Rotation, um die Erkennung bei gedrehtem oder umgedrehtem Text zu verbessern, wenn `Use auto rotation` aktiviert ist.
* Ausgaben liegen sowohl in menschenlesbarer Form (`Whole Text` / `Texts`) als auch in strukturierter Geometrieform (`Boxes`) für die Weiterverarbeitung vor.

## ⚙️ Ablauf

* Geben Sie ein Bild in den Eingang `Image` und führen Sie das Szenario aus.
* Der Block verarbeitet das Bild und filtert Erkennungen unterhalb der gewählten `Threshold`-Schwelle heraus.
* Sind Ausgänge verbunden, die eine Visualisierung erfordern, liefert der Block ein annotiertes `Result`-Bild mit Rahmen und optionaler Textüberlagerung.
* Textausgaben (`Whole Text`, `Texts`) und Geometrieausgaben (`Boxes`) werden für andere Blöcke oder Exportwerkzeuge bereitgestellt.
* Hinweis: Der erste Lauf kann länger dauern (Modelle oder Ressourcen werden bei Bedarf initialisiert). Danach läuft die Inferenz schneller.

## 📝 Nutzungshinweise

1. Speisen Sie das Bild, das Sie auslesen möchten, in den Eingang `Image` ein.
2. Stellen Sie mit dem Schieberegler `Threshold` ein, welche Erkennungen gefiltert werden sollen. Beginnen Sie mit moderaten Werten (z. B. 30–50) und passen Sie an.
3. Aktivieren Sie `Use auto rotation`, falls Ihre Bilder gedrehten Text enthalten könnten.
4. Aktivieren Sie `Show Texts`, wenn das zurückgegebene `Result`-Bild erkannte Textlabels anzeigen soll.
5. Verwenden Sie die Ausgänge `Whole Text`, `Texts` oder `Boxes` nach Bedarf (zur Anzeige, Protokollierung oder für logische Entscheidungen).

## 💡 Tipps und Tricks

* Verbessern Sie die Genauigkeit, indem Sie zuerst den Bereich mit Text per `Image ROI Select` zuschneiden, sodass der Block nur die relevante Region verarbeitet.
* Beschleunigen Sie die Inferenz bei großen Bildern durch Verwendung von `Image Resize` vor dem Einspeisen in diesen Block.
* Entfernen Sie komplexe Hintergründe oder isolieren Sie Textregionen mit `Background Removal (RMBG-1.4)` oder `Background Removal (BiRefNet)`, wenn Text auf unruhigem Hintergrund liegt.
* Reduzieren Sie visuelles Rauschen mit `Blur` oder erzeugen Sie ein saubereres binäres Bild mit `Image Threshold` bei verrauschten Aufnahmen.
* Vorschau der OCR-Ergebnisse schnell anzeigen, indem Sie das annotierte `Result`-Bild an `Show Image` senden.
* Als Alternative können Sie den Block `OCR (EasyOCR)` ausprobieren und die Ergebnisse für Ihre Daten vergleichen.
* Erkannte Texte oder Bilder zur Nachverfolgbarkeit mit `Image Logger`, `Image Write` oder `CSV Export` speichern.

## 🛠️ Fehlersuche

* Kein Text erkannt: Erhöhen Sie die Eingangsbildqualität (auf Text zuschneiden, Auflösung erhöhen) oder senken Sie die `Threshold`-Schwelle leicht.
* Viele falsche Erkennungen: Erhöhen Sie die `Threshold`-Schwelle und schneiden Sie das Bild so zu, dass nur echte Textregionen enthalten sind.
* Gedrehter Text wird nicht korrekt gelesen: Aktivieren Sie `Use auto rotation` oder rotieren Sie das Bild vorab mit `Image AutoRotator` oder einer Kombination aus `Image Resize` + Rotation.
* Langsamer erster Lauf: Die erste Ausführung kann länger dauern, während Ressourcen initialisiert werden. Folgeausführungen sind schneller.
* Benötigen Sie nur die geometrischen Rahmen für logische Verarbeitung (keine annotierten Bilder), trennen Sie Visualisierungs-Ausgänge, um die Verarbeitungsbelastung zu reduzieren.
