OCR
OCR classique ou OCR par IA : ce que l’un transcrit, ce que l’autre comprend
OCR classique ou OCR IA : la différence ne tient pas à la qualité de lecture, elle tient à la compréhension. Un OCR (reconnaissance optique de caractères) transcrit des caractères. Un traitement par IA reconnaît la structure du document, identifie les champs demandés sur une mise en page inconnue et rend un niveau de confiance par valeur.
Le problème
Le texte est lisible, la donnée reste introuvable
Vous comparez deux outils et vous voulez savoir lequel lit le mieux. La question est mal posée. Convertir l’image d’une page en texte est la première étape, et ce qui est réellement extrait document par document est décrit sur le pilier OCR pour la finance et les achats. Ce qui sépare les deux approches vient après : quand il faut savoir laquelle des quarante lignes porte le prix unitaire, et à quel article il se rapporte.
Sur un document réel, le texte brut ne suffit pas. Un tableau à douze colonnes redevient une suite de mots sans colonnes. Une remise de pied de facture se retrouve collée à un total. Une référence article coupée par un saut de ligne devient deux références. Le fichier est lisible ; il n’est pas exploitable.
C’est la raison d’être des gabarits : un rectangle à telle position pour le numéro de facture, un autre pour le total. Le gabarit fonctionne tant que le fournisseur ne change rien. Il casse le jour où celui-ci déplace son bloc d’adresse, ajoute une colonne d’écotaxe ou passe à un nouveau logiciel de facturation.
Ce que fait un OCR classique
Il transcrit. C’est déjà beaucoup, et c’est tout.
- Il convertit l’image d’une page en caractères, puis en mots, puis en lignes de texte.
- Il ne sait pas qu’une facture a un en-tête, un tableau de lignes et un pied, ni où trouver le prix unitaire.
- Sans gabarit par mise en page, il ne rend qu’un bloc de texte, dans l’ordre où les caractères sont apparus sur la page.
- Il ne dit pas ce dont il est sûr : un caractère deviné ressort avec la même assurance qu’un caractère net.
Ce qu’ajoute un traitement par IA
Les analystes de ce marché appellent cette couche l’IDP, pour traitement intelligent de documents. Le sigle importe peu ; ce qu’il recouvre change le travail quotidien d’une équipe comptable.
- Il comprend la structure du document : en-tête, corps, tableau de lignes, pied, annexes jointes.
- Il identifie les champs que vous avez demandés, même sur une mise en page qu’il n’a jamais rencontrée.
- Il rend un niveau de confiance sur chaque valeur, et la position exacte à laquelle elle a été lue dans la page.
- Il tient sans gabarit, y compris quand un fournisseur change son format sans prévenir.
Vous décrivez les champs voulus en français : aucun modèle à entraîner, aucun paramétrage par fournisseur. La conséquence pratique est simple : le premier document d’un nouveau fournisseur se traite comme le millième d’un fournisseur connu.
Les deux approches, point par point
Aucun nom d’éditeur dans ce tableau, et aucun pourcentage : ces deux terrains n’apprennent rien à qui doit décider.
Ce qui sort du traitement
OCR classique
Du texte, dans l’ordre où les caractères ont été rencontrés sur la page.
Traitement par agent
Des champs nommés, chacun relié à sa position dans le document.
Mise en page inconnue
OCR classique
Un gabarit à créer, puis à maintenir à chaque évolution du format.
Traitement par agent
Traitée sans gabarit et sans modèle à entraîner.
Tableau de lignes
OCR classique
Colonnes perdues, lignes fusionnées, désignations coupées en deux.
Traitement par agent
Une ligne reste une ligne : référence, désignation, quantité, unité, prix unitaire, remise, taux de taxe.
Document de trente pages
OCR classique
Les lignes disparaissent en silence, sans erreur affichée.
Traitement par agent
Le tableau reste continu jusqu’à la dernière page.
Certitude sur une valeur
OCR classique
Aucune indication : tout ressort au même niveau.
Traitement par agent
Un score par champ, et un seuil de relecture humaine que vous fixez.
Plusieurs langues et devises
OCR classique
Séparateurs de milliers et formats de date pris au pied de la lettre.
Traitement par agent
Formats de date, séparateurs et symboles monétaires normalisés en sortie.
Le prix facturé est-il le bon ?
OCR classique
Hors périmètre.
Traitement par agent
Hors périmètre de l’extraction elle-même. C’est l’étape suivante, et c’est le sujet de la section ci-dessous.
Ce qu’aucun OCR ne fait, mais que la plateforme fait
Vous cherchez un OCR. Vous avez besoin de ce qui vient après.
L’extraction n’est pas le résultat. C’est la première étape. Un prix bien lu qui ne respecte pas votre contrat reste un prix payé à tort.
Un OCR classique et un traitement par IA s’arrêtent au même endroit : une donnée propre. Ni l’un ni l’autre ne sait que le prix unitaire de la ligne vingt-sept dépasse de quatre centimes la grille signée en janvier, que le palier de dégressivité prévu n’a pas été appliqué, ou que cette facture est le doublon d’une pièce déjà réglée. Ce travail-là confronte la donnée lue aux conditions négociées : contrat cadre, BPU (bordereau de prix unitaires), commande, réception.
Extraire, confronter, puis prouver.
Ce que produit l’étape suivante
- La clause du contrat et la ligne de facture, surlignées côte à côte.
- Aucun écart n’est écarté en silence. Ce qui ne correspond à aucune règle remonte, avec son motif.
- Il instruit, vous tranchez.
Capture
Rassemblez et consolidez toutes vos données d’achats.
Collecte par boîte mail dédiée, dépôt, SFTP, scan, API ou export ERP. Lecture de tous les formats (PDF natif, scan, photo, tableur, flux structuré), puis extraction ligne à ligne : fournisseur, références, quantités, prix unitaires, remises, taxes, conditions.
Fin de la ressaisie. Un historique d’achats enfin interrogeable.
Ce que Capture détecte
- Documents longs et tableaux multi-pages
- Mises en page inconnues
- Plusieurs langues et devises
- Scans médiocres et écriture manuscrite
Le forfait couvre l’extraction. Le contrôle de vos conditions négociées est l’étape suivante et se dimensionne avec vous.
Voir le détail des paliers et du prix à la pageRien ne se perd. Tout se vérifie, tout se prouve.
- La clause du contrat et la ligne de facture, surlignées côte à côte.
- Chaque valeur extraite reste reliée à l’endroit exact du document où elle a été lue.
- Le même cas produit la même décision, aujourd’hui comme dans six mois : les règles sont appliquées de façon déterministe.
- Aucun écart n’est écarté en silence. Ce qui ne correspond à aucune règle remonte, avec son motif.
- L’agent consigne ce qu’il a fait, dans l’ordre où il l’a fait : qui, quoi, combien, quand.
Questions fréquentes
Quelle différence entre un OCR classique et un OCR par IA ?
Un OCR classique transcrit des caractères. Il ne sait pas qu’une facture a un en-tête, des lignes et un pied, ni où trouver le prix unitaire. Un traitement par IA comprend la structure du document, identifie les champs demandés même sur une mise en page inconnue, et rend un niveau de confiance sur chaque valeur.
Faut-il créer un gabarit par fournisseur ?
Non. Vous décrivez les champs que vous voulez, en français. Aucun modèle à entraîner, aucun paramétrage par mise en page, y compris quand un fournisseur change son format sans prévenir.
Qu’appelle-t-on IDP ?
Le traitement intelligent de documents, ou IDP, désigne la couche qui s’ajoute à la reconnaissance de caractères : comprendre la structure, nommer les champs attendus, mesurer la confiance sur chaque valeur. C’est le vocabulaire des analystes de ce marché ; sur ce site, nous parlons de traitement par agent, parce que le travail ne s’arrête pas au document.
Faut-il des données parfaitement propres ?
Non. L’agent Capture est conçu pour des documents hétérogènes et des référentiels incomplets ; la structuration fait partie du livrable.
Un impact mesurable dans chaque environnement
Plus de 5 millions de documents d’achats analysés
Entre 1 et 7 % de marge récupérée
sur le périmètre analysé
De 15 à 45 % de temps rendu aux équipes, par ETP
selon le périmètre et la maturité des données
Zylio s’intègre à votre écosystème existant.
L’ERP gère le processus. Zylio traite l’exception et récupère la valeur qui s’en échappe : factures sans commande, écarts de prix ligne à ligne, doublons et surfacturations, achats hors cadre.
Vos données sous haute sécurité.
Zylio répond aux normes les plus exigeantes, et rien ne s’engage sans votre validation.
- Certifications
- Hébergement
- Chiffrement
- Accès
À lire ensuite
- Le pilier OCR : lire, puis vérifierLe pilier : ce qui est extrait, document par document, et ce qui vient après.
- Précision OCR factureUn score par champ et la position dans la page, plutôt qu’un pourcentage global.
- OCR facture fournisseurLes champs réellement attendus sur une facture d’achat, de l’en-tête au pied.
- Coût de la saisie manuelle des facturesL’autre comparaison : le temps par facture et le seuil de volume.
- Extraction ligne à ligneChaque poste, avec sa référence, sa quantité, son prix unitaire et sa remise : le niveau où se joue le contrôle.
Voir ce que ça donne sur vos données
Vingt minutes, sur une famille d’achat de votre choix. Nous vous montrons ce que les agents détectent, avec la preuve à l’appui.
- Sans engagement, sur vos données
- Résultat en 3 semaines
- 20 minutes, sans présentation commerciale
- Vos données restent hébergées en France
- Aucun changement d’outil ni de process

