ForHosting KIT · Dokumente & PDF

Texte zweier PDFs vergleichen und geänderte Seiten finden

Vergleichen Sie zwei PDFs, ohne ständig zwischen Fenstern zu wechseln oder sich auf eine Sichtprüfung zu verlassen.

● BetaKostenlos · im Browser
Nutzen Sie es über WebAPIE-MailTelegramApp bald

Geben Sie den extrahierten Text jedes Dokuments als eine Zeichenfolge pro Seite an. Dieses Werkzeug nennt Ihnen genau die abweichenden Seitennummern. Jede geänderte Seite erhält eine kurze, deterministische Zusammenfassung mit Wortzahlen sowie hinzugefügten und entfernten Wörtern. Auch Seiten, die nur in einer Fassung vorkommen, werden erkannt. Der Vergleich benötigt keinen Netzwerkzugriff, bewahrt die Seitenfolge und weist Dokumente ohne extrahierten Text zurück.

Bereiten Sie den Text mit erhaltener Seitenstruktur vor

Beginnen Sie mit dem bereits aus beiden PDF-Dateien extrahierten Text. Übergeben Sie jedes Dokument als geordnete Liste, in der die erste Zeichenfolge Seite eins, die zweite Seite zwei und so weiter darstellt. Der Erhalt dieser Grenzen ist entscheidend, weil das Ergebnis Unterschiede nach Seitennummer meldet und das Dokument nicht als durchgehenden Block behandelt. Extraktionswerkzeuge können wiederholte Leerzeichen, Tabulatoren oder Zeilenumbrüche erzeugen. Daher vereinheitlicht der Vergleich Abstände, bevor er eine Textänderung feststellt. So wird eine Seite nicht allein deshalb markiert, weil ein anderes Werkzeug einen Satz anders umbrochen hat. Das Werkzeug führt keine optische Zeichenerkennung durch, öffnet keine PDF-Dateien und errät keine fehlenden Seitengrenzen. Besitzt ein gescanntes Dokument keine Textebene, führen Sie zuerst OCR aus und übergeben Sie das Ergebnis seitenweise. Prüfen Sie die Extraktionsqualität, wenn Schriftarten, Spalten oder Tabellen eine ungewöhnliche Lesereihenfolge erzeugen. Beide Eingaben müssen mindestens eine Seite mit Text enthalten, der nicht nur aus Leerraum besteht; andernfalls wird ein Eingabefehler ausgegeben.

Verstehen Sie die Zusammenfassung geänderter Seiten

Das Werkzeug vergleicht entsprechende Seitenpositionen nach der Vereinheitlichung von Leerraum. Identischer normalisierter Text erzeugt keinen Unterschiedseintrag. Ändert sich eine Seite, zerlegt die Zusammenfassung beide Fassungen in Wörter, vergleicht deren Häufigkeit ohne Beachtung der Großschreibung und meldet die Zahl entfernter und hinzugefügter Wörter. Eine Vorschau zeigt jeweils bis zu fünf Wörter. Dadurch erkennen Sie einen geänderten Betrag, ein Datum, einen Parteinamen oder eine Vertragsklausel schnell. Wiederholungen bleiben in den Zählungen erhalten: Wird derselbe Begriff zweimal gelöscht, werden zwei Entfernungen gemeldet. Sind die Wörter gleich, unterscheiden sich jedoch Reihenfolge, Großschreibung oder Zeichensetzung, bleibt die Seite als geändert markiert und die Zusammenfassung nennt diesen Grund. Dies ist eine knappe Diagnose und kein zeichenweiser Patch. Das Werkzeug bewertet keine semantische Bedeutung und behauptet nicht, dass zwei unterschiedliche Formulierungen dasselbe aussagen. Nutzen Sie die genannten Seitennummern für eine gezielte menschliche Prüfung, besonders bei Verträgen, Abschlüssen und regulierten Unterlagen.

Deuten Sie fehlende Seiten und nutzen Sie das Ergebnis sicher

Dokumente sind nicht immer gleich lang. Enthält eine Eingabe zusätzliche Seitenpositionen, wird jede weitere Seite als ausschließlich in PDF A oder PDF B vorhanden gemeldet, zusammen mit der Zahl ihrer extrahierten Wörter. Das Hauptergebnis umfasst beide Seitenzahlen, eine geordnete Liste abweichender Seiten, einen ausführlichen Eintrag für jeden Unterschied und ein Gleichheitskennzeichen für Automatisierungen. Dadurch eignet es sich für Freigabeprüfungen, Genehmigungsabläufe, Archivvalidierung und die Dokumentenübernahme. Ein wahres Gleichheitskennzeichen bedeutet, dass der normalisierte Text Seite für Seite übereinstimmte. Es beweist nicht, dass Bilder, Anmerkungen, Unterschriften, Farben, Schriftarten, Metadaten, verborgene Ebenen oder Positionen identisch sind. Umgekehrt kann ein Extraktionsunterschied auf der PDF-Codierung statt auf einer beabsichtigten redaktionellen Änderung beruhen. Verwenden Sie den Bericht bei wichtigen Prüfungen zum Auffinden textlicher Abweichungen und untersuchen Sie anschließend die Originalseiten mit der erforderlichen rechtlichen, finanziellen oder betrieblichen Beurteilung.

Einen geänderten Vertrag prüfen

Finden Sie Seiten mit geändertem extrahiertem Wortlaut, bevor Sie die betroffenen Klauseln in den Originalen untersuchen.

Einen Bericht vor Veröffentlichung prüfen

Vergleichen Sie Entwurf und Endfassung auf geänderte Beträge, Daten, Beschriftungen oder versehentlich verschobene Seiten.

Dokumentversionen automatisiert kontrollieren

Leiten Sie anhand des Gleichheitskennzeichens und der Seitenliste nur geänderte PDFs an die manuelle Freigabe weiter.

Nimmt dieses Werkzeug PDF-Dateien direkt an?

Nein. Es verarbeitet bereits extrahierten Text, geordnet als eine Zeichenfolge pro Seite.

Was geschieht bei einer leeren Eingabe?

Die Anfrage scheitert mit einem Eingabefehler. Jedes PDF muss mindestens eine Seite mit echtem extrahiertem Text enthalten.

Gelten Zeilenumbrüche und wiederholte Leerzeichen als Änderungen?

Nein. Leerraum wird vor dem Vergleich normalisiert, sodass extraktionsbedingte Umbrüche ignoriert werden.

Erkennt das Werkzeug optische oder formatbezogene Unterschiede?

Nein. Es vergleicht nur extrahierten Text und untersucht weder Bilder, Typografie, Anmerkungen, Signaturen, Metadaten noch Geometrie.

Wie werden hinzugefügte oder entfernte Seiten gemeldet?

Eine Position ohne Gegenstück wird als nur in PDF A oder PDF B vorhanden aufgeführt, einschließlich ihrer Wortzahl.

Was kostet ein Vergleich?

Jede API-Anfrage kostet $0.002. Die deterministische Browser-Implementierung funktioniert auch ohne Netzwerkaufruf.

Alles auf dieser Seite ist auch per API verfügbar. Dieser Abschnitt richtet sich an Teams, die es in ihre eigenen Systeme einbinden möchten; alle anderen nutzen einfach das Tool oben.

POSThttps://api.kit.forhosting.com/pdf/compare-text

Authentifizierung per Bearer-Token. Ein einziger POST stellt die Aufgabe in die Warteschlange; das Ergebnis erhalten Sie per Webhook oder über einen signierten Link.

curl -X POST https://api.kit.forhosting.com/pdf/compare-text \
  -H "Authorization: Bearer $KIT_KEY" \
  -H "Content-Type: application/json" \
  -d '{"pages_a":["Quarterly report\nRevenue was $2.4 million.","Operating expenses were $1.1 million."],"pages_b":["Quarterly report\nRevenue was $2.7 million.","Operating expenses were $1.1 million."]}'
{
  "pages_a": [
    "Quarterly report\nRevenue was $2.4 million.",
    "Operating expenses were $1.1 million."
  ],
  "pages_b": [
    "Quarterly report\nRevenue was $2.7 million.",
    "Operating expenses were $1.1 million."
  ]
}
{
  "task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
  "type": "pdf.compare_text",
  "status": "queued",
  "_links": {
    "result": "/tasks/tsk_…/result"
  }
}

Die API arbeitet asynchron: Sie erhalten sofort eine task_id. Polling ist mit 1 Anfrage pro Sekunde erlaubt.

pro Anfrage$0.002

Der Preis steht auf der Seite – keine Tokens, keine Credits. Fehlgeschlagene Aufgaben werden nicht berechnet.

max_mb25
max_pages200
HTTPCodeBedeutung
401unauthorizedDer API-Schlüssel fehlt oder ist ungültig – prüfen Sie den Authorization-Header (Bearer).
402insufficient_balanceIhr Guthaben reicht für diese Aufgabe nicht aus – Aufladungen verfallen nicht.
404unknown_typeUnbekannter Aufgabentyp – prüfen Sie das Feld „type“ gegen den Katalog.
429rate_limitedZu viele Anfragen – warten Sie kurz; Polling ist mit 1 Anfrage pro Sekunde erlaubt.

Vollständige KIT-Dokumentation lesen →