For the complete documentation index, see llms.txt. This page is also available as Markdown.

OCR

Cette fonction détecte et extrait le texte présent dans une image et renvoie le texte reconnu, les boîtes englobantes et, en option, une image annotée. Elle est conçue pour des pipelines simples en glisser‑déposer : fournissez une image, réglez le seuil de confiance et les options, puis récupérez le texte ou visualisez les résultats.

📥 Entrées

Image Entrée acceptant n’importe quelle image sur laquelle vous souhaitez effectuer la reconnaissance de texte.

📤 Sorties

Result Image annotée avec les boîtes de détection et, si activé, le texte superposé.

Whole Text Tout le texte détecté concaténé en une seule chaîne.

Texts Chaînes de texte détectées individuellement (plusieurs sorties possibles).

Boxes Boîtes englobantes détectées pour chaque région de texte.

🕹️ Contrôles

Use auto rotation Basculer pour activer la gestion automatique de la rotation (texte à l’envers ou pivoté).

Show Texts Basculer pour dessiner les étiquettes de texte reconnues sur l’image annotée de sortie.

Threshold Curseur pour définir la confiance minimale acceptée pour les détections (plus élevé = moins de détections mais plus fiables).

🎨 Fonctionnalités

  • Détection et reconnaissance de texte en temps réel à partir de l’image fournie sur l’entrée Image.

  • Filtrage par confiance via le curseur Threshold pour ignorer les détections faibles.

  • Annotation optionnelle de l’image : dessinez boîtes et textes sur la sortie Result si Show Texts est activé.

  • Prise en charge de la rotation automatique pour améliorer la reconnaissance du texte pivoté ou inversé avec Use auto rotation.

  • Sorties fournies à la fois en format lisible (Whole Text / Texts) et en forme géométrique structurée (Boxes) pour un traitement en aval.

⚙️ Mécanisme d’exécution

  • Fournissez une image sur l’entrée Image et lancez le scénario.

  • Le bloc traite l’image et filtre les détections dont la confiance est inférieure au Threshold choisi.

  • Si des sorties de visualisation sont connectées, le bloc renvoie une image Result annotée avec boîtes et textes (optionnel).

  • Les sorties textuelles (Whole Text, Texts) et géométriques (Boxes) sont produites pour être utilisées par d’autres blocs ou outils d’export.

  • Remarque : la première exécution peut être plus lente (initialisation du modèle ou des ressources à la demande). Les inférences suivantes sont plus rapides.

📝 Instructions d’utilisation

  1. Envoyez l’image à lire sur l’entrée Image.

  2. Réglez le curseur Threshold pour filtrer les reconnaissances peu fiables. Commencez par des valeurs modérées (par ex. 30–50) et ajustez.

  3. Activez Use auto rotation si vos images peuvent contenir du texte pivoté.

  4. Activez Show Texts si vous souhaitez que l’image Result affiche les étiquettes de texte détectées.

  5. Utilisez Whole Text, Texts ou Boxes selon vos besoins (affichage, journalisation ou logique).

💡 Conseils et astuces

  • Améliorez la précision en recadrant d’abord la zone contenant le texte avec Image ROI Select pour ne traiter que la région d’intérêt.

  • Accélérez l’inférence sur de grandes images en appliquant Image Resize avant d’alimenter ce bloc.

  • Isolez ou supprimez les arrière‑plans complexes avec Background Removal (RMBG-1.4) ou Background Removal (BiRefNet) lorsque le texte est posé sur un fond encombré.

  • Réduisez le bruit visuel avec Blur ou convertissez en image binaire propre avec Image Threshold pour des prises de vue bruyantes.

  • Prévisualisez rapidement les résultats OCR en envoyant l’image annotée Result vers Show Image.

  • Pour une approche alternative, essayez le bloc OCR (EasyOCR) et comparez les résultats sur votre jeu de données.

  • Sauvegardez le texte ou les images reconnus en aval avec Image Logger, Image Write ou CSV Export pour traçabilité.

🛠️ Résolution des problèmes

  • Aucun texte détecté : améliorez la qualité de l’image d’entrée (recadrez sur le texte, augmentez la résolution) ou baissez légèrement le Threshold.

  • Trop de fausses détections : augmentez le Threshold et recadrez l’image pour vous concentrer sur les vraies zones de texte.

  • Texte pivoté mal lu : activez Use auto rotation ou pré‑pivotez l’image avec Image AutoRotator ou une étape de Image Resize + rotation.

  • Première exécution lente : la première évaluation initialise les ressources ; les exécutions suivantes seront plus rapides.

  • Si vous avez seulement besoin de la géométrie pour la logique (pas d’images annotées), déconnectez les sorties de visualisation pour réduire la charge de traitement.

Mis à jour