SERVICES
Développement sur mesure Backend & architecture Analyse de prestataire Recherche, analyse & investigationOUTILS GRATUITS
Générateur de devis Générateur de Factur-X Analyseur SEO Dependency Security Checker PDF Comparator PDF / XML ComparatorSERVICES
Développement sur mesure Backend & architecture Analyse de prestataire Recherche, analyse & investigationOUTILS GRATUITS
Générateur de devis Générateur de Factur-X Analyseur SEO Dependency Security Checker PDF Comparator PDF / XML ComparatorPDF Comparator est un outil open source permettant de comparer localement le contenu textuel de deux fichiers PDF afin d'identifier rapidement les lignes ajoutées ou supprimées.
PDF Comparator est un outil local et open source conçu pour comparer rapidement le contenu textuel de deux fichiers PDF.
Il extrait le texte des deux documents, normalise légèrement leur contenu puis affiche directement les différences détectées entre les deux versions.
L'objectif est de fournir un moyen simple d'identifier les modifications textuelles apportées à un document, sans recourir à une plateforme externe, une API ou un système d'intelligence artificielle.
pdf-compare.py contient la logique de comparaison des fichiers PDF
Le script pdf-compare.py extrait le contenu textuel
des pages des deux fichiers PDF fournis lors de son exécution.
Une légère normalisation est ensuite appliquée au contenu avant d'effectuer la comparaison entre le document de référence et sa nouvelle version.
Les différences sont affichées directement dans le terminal sous la forme de lignes ajoutées et supprimées.
Si aucune différence textuelle n'est détectée, l'outil l'indique simplement au lieu de produire un rapport inutile.
Le traitement est effectué localement, sans transfert de fichiers vers un service tiers ni utilisation d'une API externe, une approche cohérente avec les principes de sécurité des données .
La démonstration montre l'extraction du texte des deux documents et l'identification des lignes ajoutées ou supprimées entre les deux versions.
▶ Voir la démonstration sur YouTube
Le projet nécessite Python 3 ainsi que la bibliothèque
pypdf.
python -m pip install -r requirements.txt
python pdf-compare.py ancien.pdf nouveau.pdf
Le premier fichier correspond à la version de référence. Le second correspond à la nouvelle version à comparer.
PDF Comparator effectue une comparaison du contenu textuel extrait des documents. Il ne compare pas visuellement le rendu des pages, les images, les polices, les couleurs ou la disposition graphique.
La qualité de la comparaison dépend également du texte réellement extractible depuis le PDF. Un document composé uniquement d'images ou issu d'un scan sans couche de texte exploitable ne pourra pas être comparé correctement.
Le projet est open source sous licence MIT.
Cette page vous a été utile ?
Merci pour votre retour.