SERVICES
Développement sur mesure Backend & architecture Analyse de prestataire Recherche, analyse & investigationOUTILS GRATUITS
Générateur de devis Générateur de Factur-X Analyseur SEO Dependency Security Checker PDF Comparator PDF / XML ComparatorSERVICES
Développement sur mesure Backend & architecture Analyse de prestataire Recherche, analyse & investigationOUTILS GRATUITS
Générateur de devis Générateur de Factur-X Analyseur SEO Dependency Security Checker PDF Comparator PDF / XML ComparatorPDF / XML Comparator est un outil open source permettant de comparer localement les données présentes dans un fichier PDF et un fichier XML afin de repérer les valeurs qui ne sont pas retrouvées dans l'une des deux représentations.
PDF / XML Comparator est un outil local et open source conçu pour comparer les données présentes dans un fichier PDF et un fichier XML.
Il recherche les valeurs dans les deux sens afin de signaler celles qui sont présentes dans une représentation mais qui ne sont pas retrouvées dans l'autre.
L'objectif est de faciliter une première vérification humaine des deux fichiers, sans API, service externe ou système d'intelligence artificielle.
main.py contient l'interface et le moteur principal du comparateur
Les valeurs détectées dans le PDF sont recherchées dans les données extraites du fichier XML. Lorsqu'une valeur n'est pas retrouvée, elle est signalée afin de pouvoir être vérifiée.
Les valeurs contenues dans le fichier XML sont également recherchées dans le texte extrait du PDF.
Différentes représentations de nombres, de dates, d'espaces ou d'espaces insécables sont prises en compte afin de limiter les faux écarts. L'application distingue ensuite les valeurs PDF non retrouvées dans le XML des valeurs XML non retrouvées dans le PDF.
Le texte extrait du PDF, les données XML et le rapport de comparaison restent visibles dans l'interface afin de faciliter la vérification humaine.
Le traitement est effectué localement, sans transfert de fichiers vers un service tiers ni utilisation d'une API externe, une approche cohérente avec les principes de sécurité des données .
Le dépôt contient des exemples en français et en anglais comprenant un fichier PDF et son fichier XML Factur-X associé. Ils permettent de tester directement le fonctionnement du comparateur.
Ce type de comparaison peut notamment faciliter une première vérification des données entre les deux représentations d'une facture électronique Factur-X .
Une valeur signalée n'est pas nécessairement une erreur. PDF / XML Comparator n'est pas un validateur de conformité : il ne vérifie pas une norme de facturation, un schéma XSD, des règles Schematron, la conformité PDF/A ou la validité juridique ou comptable d'un document.
Son rôle est de signaler les différences pouvant nécessiter une vérification humaine. Une validation spécialisée reste nécessaire lorsqu'une vérification de conformité est recherchée.
La démonstration montre la comparaison bidirectionnelle des données et l'identification des valeurs non retrouvées dans l'une des deux représentations.
▶ Voir la démonstration sur YouTube
Le projet nécessite Python 3. La seule dépendance Python externe
actuellement nécessaire est pypdf.
pip install pypdf
python main.py
Dans l'interface, sélectionnez le fichier PDF puis le fichier XML, lancez la comparaison et examinez les valeurs signalées dans le rapport.
La comparaison du PDF repose sur le texte pouvant être extrait du document. Un PDF scanné sous forme d'image, un document dont le texte n'est pas extractible ou certaines structures PDF complexes peuvent produire des résultats incomplets.
Le comparateur recherche la présence de valeurs et de représentations équivalentes, mais n'établit pas de correspondance métier entre une zone précise du PDF et une balise XML précise.
Le projet est open source sous licence MIT.
Cette page vous a été utile ?
Merci pour votre retour.