FR / EN
🔥 -20 % sur toutes les ressources jusqu'au 30 septembre inclus 🇺🇸 Available for U.S. projects Voir les offres →

BASE

Accueil Studio Approche

SERVICES

Développement sur mesure Backend & architecture Analyse de prestataire Recherche, analyse & investigation

INSTALLATION

Recrutement Collecte de données Tamponneur de factures PDF

OUTILS GRATUITS

Générateur de devis Générateur de Factur-X Analyseur SEO Dependency Security Checker PDF Comparator PDF / XML Comparator

RESSOURCES

Chatbot Flask Pack VS Code Framework documentation Static site

CONTENU

Facturation électronique 2026 Enquête sur la facturation électronique Pourquoi développer sans SaaS Sécurité des données Notes techniques Expériences intéractives

SUPPORT

FAQ Contact Liens

SUPPORT

FAQ Contact Liens

PDF / XML Comparator open source : comparer les données PDF et XML localement

PDF / XML Comparator est un outil open source permettant de comparer localement les données présentes dans un fichier PDF et un fichier XML afin de repérer les valeurs qui ne sont pas retrouvées dans l'une des deux représentations.

PDF / XML Comparator est un outil local et open source conçu pour comparer les données présentes dans un fichier PDF et un fichier XML.

Il recherche les valeurs dans les deux sens afin de signaler celles qui sont présentes dans une représentation mais qui ne sont pas retrouvées dans l'autre.

L'objectif est de faciliter une première vérification humaine des deux fichiers, sans API, service externe ou système d'intelligence artificielle.

Que contient PDF / XML Comparator ?

Application et comparaison

  • Application principale main.py contient l'interface et le moteur principal du comparateur
  • Comparaison PDF ↔ XML Recherche bidirectionnelle des valeurs présentes dans les deux représentations
  • Traitement local Comparaison effectuée sur votre machine, sans API ni transfert de fichiers

Documentation et exemples

  • Documentation bilingue README complet disponible en français et en anglais
  • Exemples Factur-X Couples PDF + XML prêts à tester en français et en anglais
  • Démonstrations vidéo Deux démonstrations montrent directement la comparaison des fichiers d'exemple

Comment fonctionne la comparaison ?

PDF vers XML

Les valeurs détectées dans le PDF sont recherchées dans les données extraites du fichier XML. Lorsqu'une valeur n'est pas retrouvée, elle est signalée afin de pouvoir être vérifiée.

XML vers PDF

Les valeurs contenues dans le fichier XML sont également recherchées dans le texte extrait du PDF.

Normalisation et rapport

Différentes représentations de nombres, de dates, d'espaces ou d'espaces insécables sont prises en compte afin de limiter les faux écarts. L'application distingue ensuite les valeurs PDF non retrouvées dans le XML des valeurs XML non retrouvées dans le PDF.

Le texte extrait du PDF, les données XML et le rapport de comparaison restent visibles dans l'interface afin de faciliter la vérification humaine.

Le traitement est effectué localement, sans transfert de fichiers vers un service tiers ni utilisation d'une API externe, une approche cohérente avec les principes de sécurité des données .

Utilisation avec des fichiers Factur-X

Le dépôt contient des exemples en français et en anglais comprenant un fichier PDF et son fichier XML Factur-X associé. Ils permettent de tester directement le fonctionnement du comparateur.

Ce type de comparaison peut notamment faciliter une première vérification des données entre les deux représentations d'une facture électronique Factur-X .

Un comparateur, pas un validateur

Une valeur signalée n'est pas nécessairement une erreur. PDF / XML Comparator n'est pas un validateur de conformité : il ne vérifie pas une norme de facturation, un schéma XSD, des règles Schematron, la conformité PDF/A ou la validité juridique ou comptable d'un document.

Son rôle est de signaler les différences pouvant nécessiter une vérification humaine. Une validation spécialisée reste nécessaire lorsqu'une vérification de conformité est recherchée.

Voir PDF / XML Comparator en action

Démonstration de la comparaison locale entre un fichier PDF et son fichier XML Factur-X associé.

La démonstration montre la comparaison bidirectionnelle des données et l'identification des valeurs non retrouvées dans l'une des deux représentations.

▶ Voir la démonstration sur YouTube

Installation et utilisation

Le projet nécessite Python 3. La seule dépendance Python externe actuellement nécessaire est pypdf.

  • Installer la dépendance : pip install pypdf
  • Lancer l'application : python main.py

Dans l'interface, sélectionnez le fichier PDF puis le fichier XML, lancez la comparaison et examinez les valeurs signalées dans le rapport.

Limites et cas d'utilisation

La comparaison du PDF repose sur le texte pouvant être extrait du document. Un PDF scanné sous forme d'image, un document dont le texte n'est pas extractible ou certaines structures PDF complexes peuvent produire des résultats incomplets.

Le comparateur recherche la présence de valeurs et de représentations équivalentes, mais n'établit pas de correspondance métier entre une zone précise du PDF et une balise XML précise.

Le projet est open source sous licence MIT.

➜ Voir le projet sur GitHub

Télécharger le projet

Cette page vous a été utile ?

← Retour au contenu

Un cookie, vous avez l'habitude ? Essayez l'expérience → Votre application fonctionne ? Regardez ce qui la protège →