TENDANCES IT
Quand l'OCR lit, l'IA générative comprend
PARTAGEZ L’ARTICLE SUR
Depuis plusieurs années, les technologies de reconnaissance documentaire ont profondément transformé le traitement des documents RH. L'OCR (Optical Character Recognition) a permis d'automatiser la lecture de documents numérisés et d'éviter aux gestionnaires RH de nombreuses tâches de ressaisie.
Cette première génération a ensuite été enrichie par les technologies de Computer Vision, capables d'identifier automatiquement le type de document reçu, puis par l'OCR zonal, qui extrait les informations dans des zones précises en fonction du document reconnu. Plus récemment, l'Intelligent Document Processing (IDP) a permis de structurer les données extraites afin de les intégrer automatiquement dans les processus RH.
Ces avancées ont considérablement amélioré l'efficacité opérationnelle. Pourtant, elles présentent encore une limite importante : elles savent lire, mais elles ne savent pas toujours comprendre générant de nombreux erreurs, besoins de traitements manuels.
La limite des approches traditionnelles
Sur un document bien structuré et correctement numérisé, les taux de reconnaissance sont généralement excellents. Les difficultés apparaissent lorsque les documents sont manuscrits, mal scannés ou comportent des informations ambiguës.
Ces technologies de computer vision ont fait leurs premières preuves en RH dans une solution que nous avons déployée pendant la période Covid lors du traitement automatisé de justificatifs de vaccination aux États-Unis pour le retour au travail. Beaucoup de cartes étaient partiellement manuscrites, parfois difficiles à déchiffrer, avec des signatures recouvrant certaines informations essentielles.
Dans ces situations, les algorithmes de Computer Vision et d'OCR parvenaient souvent à proposer une lecture du document mais étaient incapables de déterminer si cette lecture était réellement cohérente. Le travail complémentaire manuel restait important et coûteux.
L'exemple des arrêts de travail
Les arrêts de travail illustrent parfaitement cette problématique car ils illustrent bien la pression exercée sur les processus RH : le salarié doit prévenir son employeur sans délai, l’usage retenant généralement 48 heures lorsque la convention collective ou l’accord d’entreprise ne fixe pas d’autre règle ; il dispose aussi de 48 heures pour informer son organisme de Sécurité sociale.
Les indemnités journalières restent, par ailleurs, un poste en forte progression. Dans l’édition 2025 des Dépenses de santé en 2024, la DREES indique qu’elles ont augmenté de 6,2 % en 2024, pour atteindre 21,4 milliards d’euros, dont 12,1 milliards au titre de la maladie. L’Assurance Maladie publie aussi des séries open data couvrant les arrêts maladie indemnisés jusqu’en 2024.
Ces chiffres confirment que l’automatisation documentaire RH répond à un besoin massif : fluidifier les traitements, réduire les délais et sécuriser des processus qui concernent directement collaborateurs et équipes RH.
Dans le cas des arrêts de travail, l'OCR peut extraire les dates d'arrêt, l'identité du salarié ou les informations du praticien. Mais le véritable enjeu est ailleurs :
Les dates sont-elles cohérentes entre elles ?
Les informations extraites correspondent-elles aux données déjà présentes dans le SIRH ?
Une valeur mal lue est-elle plausible compte tenu du contexte ? exemple : La durée de l’arrêt correspond-elle à la période entre la date de début et la date de fin de l’arrêt ?
Une erreur sur ce type de document peut avoir des conséquences en paie, en gestion administrative ou dans les déclarations réglementaires.
L'objectif n'est donc pas seulement de lire correctement les informations, mais d'évaluer leur cohérence avant automatisation.
Ajouter une couche de compréhension grâce aux LLM
C'est précisément là que les modèles de langage de nouvelle génération, les LLM et certains SLM, apportent une rupture.
Contrairement à un OCR traditionnel qui cherche à reconnaître des caractères, un modèle de langage est capable d'analyser la relation entre les informations extraites et de raisonner sur leur cohérence.
Nos équipes ont expérimenté et validé l'ajout de cette couche d'intelligence au-dessus de nos mécanismes d'OCR et d'IDP afin de :
détecter des incohérences
vérifier des règles métier
choisir entre plusieurs interprétations possibles d'un texte manuscrit
compléter ou qualifier certaines informations
mesurer un niveau de confiance avant automatisation
Autrement dit, l'IA générative ne remplace pas l'OCR. Elle exploite le résultat produit par le moteur de reconnaissance documentaire et ajoute une capacité de compréhension qui faisait jusqu'à présent défaut. Par ailleurs la valeur de cette approche ne réside pas dans une automatisation aveugle. En effet lorsqu'une information reste incertaine, le système peut demander une validation humaine.
L’avenir de l’IDP, une transformation et non une disparition
Cette combinaison entre OCR, Computer Vision, et IA générative ouvre une nouvelle étape dans la digitalisation des services RH. Elle permet d'augmenter significativement le nombre de documents traitables automatiquement tout en améliorant la fiabilité des données intégrées dans le SIRH : fiabilité indispensable à des données aussi sensibles que la paie, les droits des salariés ou la conformité administrative.
On peut lire dans certains articles traitant de l’IA que l’avenir de l’IDP est incertain. Beaucoup émettent l'hypothèse que les documents vont disparaitre car tous les systèmes seront connectés par API, les échanges se feront en temps réel, les données seront directement consommées par les agents IA.
Chez Sopra HR nous pensons que c’est inexact en RH car les documents sont des objets légaux avant d'être des données. L’employé continuera à fournir des documents à valeur juridique pour accéder à ses services RH (arrêt de travail, RIB, pièce d’identité, permis de travail, justificatif de domicile…). Les analystes prédisent une augmentation de la fraude dans ce domaine. L’avenir de l’IDP n’est pas la disparition du document, mais sa transformation : de simple source de données via l’OCR, le document RH devient, grâce à l’IA, un déclencheur de contrôles, de décisions et de processus RH.
Plus qu’une évolution technologique, cette transformation marque le passage d’une automatisation fondée sur la lecture des documents à une automatisation fondée sur la confiance accordée aux informations qu’ils contiennent.