ForHosting KIT · Documents et PDF

Comparez le texte de deux PDF et repérez les pages modifiées

Comparez deux PDF sans passer constamment d’une fenêtre à l’autre ni vous fier à une inspection visuelle.

● BetaGratuit · dans votre navigateur
Utilisez-le depuis WebAPIE-mailTelegramApp bientôt

Fournissez le texte extrait de chaque document sous forme d’une chaîne par page : cet outil indique précisément les numéros de pages qui diffèrent. Chaque page modifiée reçoit un résumé court et déterministe avec le nombre de mots ajoutés ou supprimés. L’outil signale aussi les pages présentes dans une seule version. La comparaison s’effectue sans accès au réseau, respecte l’ordre des pages et refuse tout document dépourvu de texte extrait.

Préparez le texte en conservant la structure des pages

Commencez par le texte déjà extrait des deux fichiers PDF. Transmettez chaque document comme une liste ordonnée où la première chaîne correspond à la première page, la deuxième à la deuxième page, et ainsi de suite. Il est essentiel de conserver ces limites, car le résultat présente les différences par numéro de page au lieu de traiter le document comme un bloc continu. Les outils d’extraction peuvent produire des espaces, tabulations ou retours à la ligne répétés ; la comparaison normalise donc les espaces avant de déterminer si le texte a changé. Une page n’est ainsi pas signalée simplement parce qu’un extracteur a coupé une phrase autrement. L’outil n’effectue pas de reconnaissance optique, n’ouvre pas les PDF et ne reconstitue pas les limites absentes. Si un document numérisé ne possède aucune couche de texte, appliquez d’abord un OCR et transmettez le résultat page par page. Vérifiez la qualité lorsque les polices, colonnes ou tableaux perturbent l’ordre de lecture. Les deux entrées doivent contenir au moins une page avec du texte réel.

Comprenez le résumé des pages modifiées

L’outil compare les positions de page correspondantes après normalisation des espaces. Un texte normalisé identique ne produit aucune différence. Lorsqu’une page change, le résumé découpe les deux versions en mots, compare leurs fréquences sans tenir compte de la casse et indique combien de mots ont été supprimés ou ajoutés. Un aperçu affiche jusqu’à cinq mots supprimés et cinq mots ajoutés, ce qui permet de repérer rapidement un montant, une date, le nom d’une partie ou un terme contractuel actualisé. Les occurrences répétées sont conservées : supprimer deux fois le même terme compte comme deux suppressions. Si les mots sont identiques mais que leur ordre, leur casse ou leur ponctuation diffère, la page reste marquée comme modifiée et le résumé en donne la raison. Il s’agit d’un diagnostic concis, pas d’un correctif caractère par caractère. L’outil n’évalue pas l’importance sémantique et n’affirme pas que deux formulations différentes ont le même sens. Utilisez les numéros indiqués pour cibler une vérification humaine.

Interprétez les pages absentes et utilisez le résultat prudemment

Les documents n’ont pas toujours la même longueur. Lorsqu’une entrée comporte des positions supplémentaires, chaque page en plus est signalée comme présente uniquement dans le PDF A ou le PDF B, avec le nombre de mots extraits. Le résultat principal contient le total des pages de chaque document, une liste ordonnée des pages différentes, une entrée détaillée pour chaque écart et un indicateur d’égalité adapté à l’automatisation. La sortie convient ainsi aux contrôles avant publication, aux circuits d’approbation, à la validation d’archives et aux chaînes d’importation documentaire. Un indicateur vrai signifie que le texte normalisé correspond page par page ; il ne prouve pas que les images, annotations, signatures, couleurs, polices, métadonnées, couches cachées ou positions sont identiques. Inversement, une différence d’extraction peut provenir de l’encodage du PDF et non d’une modification éditoriale volontaire. Pour un examen sensible, servez-vous du rapport pour localiser les écarts textuels, puis consultez les pages originales avec le discernement juridique, financier ou opérationnel requis.

Réviser un contrat modifié

Repérez les pages dont le texte extrait a changé avant d’examiner les clauses concernées dans les originaux.

Contrôler un rapport avant publication

Comparez le brouillon et la version finale pour détecter montants, dates, libellés ou pages ajoutées et supprimées par erreur.

Automatiser le suivi des versions

Utilisez l’indicateur d’égalité et la liste des pages différentes pour soumettre uniquement les PDF modifiés à une validation manuelle.

Cet outil accepte-t-il directement les fichiers PDF ?

Non. Il accepte du texte déjà extrait, organisé sous forme d’une chaîne par page.

Que se passe-t-il si une entrée est vide ?

La requête échoue pour entrée incorrecte. Chaque PDF doit contenir au moins une page avec du texte autre que des espaces.

Les retours à la ligne et espaces répétés comptent-ils comme changements ?

Non. Les espaces sont normalisés avant la comparaison ; les coupures dues à l’extraction sont donc ignorées.

Peut-il détecter les différences visuelles ou de mise en forme ?

Non. Il compare uniquement le texte extrait, sans inspecter images, typographie, annotations, signatures, métadonnées ni géométrie.

Comment les pages ajoutées ou supprimées sont-elles signalées ?

Une position sans équivalent est indiquée comme présente uniquement dans le PDF A ou B, avec son nombre de mots extraits.

Quel est le prix d’une comparaison ?

Chaque requête API coûte $0.002. L’implémentation déterministe du navigateur fonctionne aussi sans appel réseau.

Tout sur cette page est disponible par programmation. Cette section s'adresse aux équipes qui veulent l'intégrer à leurs systèmes ; les autres peuvent simplement utiliser l'outil ci-dessus.

POSThttps://api.kit.forhosting.com/pdf/compare-text

Authentification par jeton Bearer : un seul POST met la tâche en file d’attente, et le résultat vous parvient par webhook ou lien signé.

curl -X POST https://api.kit.forhosting.com/pdf/compare-text \
  -H "Authorization: Bearer $KIT_KEY" \
  -H "Content-Type: application/json" \
  -d '{"pages_a":["Quarterly report\nRevenue was $2.4 million.","Operating expenses were $1.1 million."],"pages_b":["Quarterly report\nRevenue was $2.7 million.","Operating expenses were $1.1 million."]}'
{
  "pages_a": [
    "Quarterly report\nRevenue was $2.4 million.",
    "Operating expenses were $1.1 million."
  ],
  "pages_b": [
    "Quarterly report\nRevenue was $2.7 million.",
    "Operating expenses were $1.1 million."
  ]
}
{
  "task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
  "type": "pdf.compare_text",
  "status": "queued",
  "_links": {
    "result": "/tasks/tsk_…/result"
  }
}

L’API est asynchrone : chaque appel renvoie un task_id immédiatement, puis vous interrogez l’état à raison d’une requête par seconde.

par requête$0.002

Le prix est publié, sans tokens ni crédits. Une tâche qui échoue n’est pas facturée.

max_mb25
max_pages200
HTTPCodeSignification
401unauthorizedClé API absente ou invalide : vérifiez l’en-tête Authorization.
402insufficient_balanceSolde insuffisant : rechargez votre compte pour lancer cette tâche.
404unknown_typeType de tâche inconnu : vérifiez le champ type de votre requête.
429rate_limitedTrop de requêtes : ralentissez la cadence, puis réessayez.

Consulter la documentation complète du KIT →