For the complete documentation index, see llms.txt. This page is also available as Markdown.

OCR

Dieser Funktionsblock extrahiert Text aus Bildern und liefert erkannten Text, Begrenzungsrahmen und optional ein annotiertes Bild. Er ist für einfache Drag-and-Drop-Pipelines ausgelegt: Bild einspeisen, Konfidenz-Schwelle und Optionen einstellen und dann Text auslesen oder Ergebnisse visualisieren.

📥 Eingänge

Image Dieser Eingang akzeptiert beliebige Bilder, auf denen eine Texterkennung durchgeführt werden soll.

📤 Ausgänge

Result Annotiertes Bild mit Erkennungsrahmen und optionaler Textüberlagerung.

Whole Text Alle erkannten Texte als ein einzelner, zusammengefügter String.

Texts Einzeln erkannte Textstrings (mehrere Ausgaben möglich).

Boxes Erkannte Begrenzungsrahmen für jede Textregion.

🕹️ Steuerungen

Use auto rotation Schalter, um automatische Rotationserkennung für umgedrehten/gedrehten Text zu aktivieren.

Show Texts Schalter, um erkannte Textlabels auf dem annotierten Ausgabe-Bild zu zeichnen.

Threshold Schieberegler zur Einstellung der minimalen Konfidenz für akzeptierte Erkennungen (höher = weniger, aber vertrauenswürdigere Ergebnisse).

🎨 Funktionen

  • Echtzeit-Textdetektion und -erkennung aus Bildern, die an den Eingang Image geliefert werden.

  • Konfidenzfilterung über den Schieberegler Threshold, um schwache Erkennungen zu ignorieren.

  • Optionale Bildannotierung: Zeichnen von Kästchen und Text auf dem zurückgegebenen Bild Result, wenn Show Texts aktiviert ist.

  • Unterstützung für automatische Rotation, um die Erkennung bei gedrehtem oder umgedrehtem Text zu verbessern, wenn Use auto rotation aktiviert ist.

  • Ausgaben liegen sowohl in menschenlesbarer Form (Whole Text / Texts) als auch in strukturierter Geometrieform (Boxes) für die Weiterverarbeitung vor.

⚙️ Ablauf

  • Geben Sie ein Bild in den Eingang Image und führen Sie das Szenario aus.

  • Der Block verarbeitet das Bild und filtert Erkennungen unterhalb der gewählten Threshold-Schwelle heraus.

  • Sind Ausgänge verbunden, die eine Visualisierung erfordern, liefert der Block ein annotiertes Result-Bild mit Rahmen und optionaler Textüberlagerung.

  • Textausgaben (Whole Text, Texts) und Geometrieausgaben (Boxes) werden für andere Blöcke oder Exportwerkzeuge bereitgestellt.

  • Hinweis: Der erste Lauf kann länger dauern (Modelle oder Ressourcen werden bei Bedarf initialisiert). Danach läuft die Inferenz schneller.

📝 Nutzungshinweise

  1. Speisen Sie das Bild, das Sie auslesen möchten, in den Eingang Image ein.

  2. Stellen Sie mit dem Schieberegler Threshold ein, welche Erkennungen gefiltert werden sollen. Beginnen Sie mit moderaten Werten (z. B. 30–50) und passen Sie an.

  3. Aktivieren Sie Use auto rotation, falls Ihre Bilder gedrehten Text enthalten könnten.

  4. Aktivieren Sie Show Texts, wenn das zurückgegebene Result-Bild erkannte Textlabels anzeigen soll.

  5. Verwenden Sie die Ausgänge Whole Text, Texts oder Boxes nach Bedarf (zur Anzeige, Protokollierung oder für logische Entscheidungen).

💡 Tipps und Tricks

  • Verbessern Sie die Genauigkeit, indem Sie zuerst den Bereich mit Text per Image ROI Select zuschneiden, sodass der Block nur die relevante Region verarbeitet.

  • Beschleunigen Sie die Inferenz bei großen Bildern durch Verwendung von Image Resize vor dem Einspeisen in diesen Block.

  • Entfernen Sie komplexe Hintergründe oder isolieren Sie Textregionen mit Background Removal (RMBG-1.4) oder Background Removal (BiRefNet), wenn Text auf unruhigem Hintergrund liegt.

  • Reduzieren Sie visuelles Rauschen mit Blur oder erzeugen Sie ein saubereres binäres Bild mit Image Threshold bei verrauschten Aufnahmen.

  • Vorschau der OCR-Ergebnisse schnell anzeigen, indem Sie das annotierte Result-Bild an Show Image senden.

  • Als Alternative können Sie den Block OCR (EasyOCR) ausprobieren und die Ergebnisse für Ihre Daten vergleichen.

  • Erkannte Texte oder Bilder zur Nachverfolgbarkeit mit Image Logger, Image Write oder CSV Export speichern.

🛠️ Fehlersuche

  • Kein Text erkannt: Erhöhen Sie die Eingangsbildqualität (auf Text zuschneiden, Auflösung erhöhen) oder senken Sie die Threshold-Schwelle leicht.

  • Viele falsche Erkennungen: Erhöhen Sie die Threshold-Schwelle und schneiden Sie das Bild so zu, dass nur echte Textregionen enthalten sind.

  • Gedrehter Text wird nicht korrekt gelesen: Aktivieren Sie Use auto rotation oder rotieren Sie das Bild vorab mit Image AutoRotator oder einer Kombination aus Image Resize + Rotation.

  • Langsamer erster Lauf: Die erste Ausführung kann länger dauern, während Ressourcen initialisiert werden. Folgeausführungen sind schneller.

  • Benötigen Sie nur die geometrischen Rahmen für logische Verarbeitung (keine annotierten Bilder), trennen Sie Visualisierungs-Ausgänge, um die Verarbeitungsbelastung zu reduzieren.

Zuletzt aktualisiert