ForHosting KIT · Documentos y PDF

Compare el texto de dos PDF y encuentre páginas distintas

Compare dos PDF sin alternar continuamente entre ventanas ni depender de una revisión visual.

● BetaGratis · en su navegador
Úselo desde WebAPIEmailTelegramApp pronto

Proporcione el texto extraído de cada documento como una cadena por página y esta herramienta indicará exactamente qué números de página difieren. Cada página modificada incluye un resumen breve y determinista con el recuento de palabras añadidas o eliminadas. También identifica las páginas presentes en una sola versión. La comparación funciona sin acceso a la red, conserva el orden y rechaza cualquier documento sin texto extraído.

Prepare el texto conservando la estructura de páginas

Comience con el texto ya extraído de ambos archivos PDF. Envíe cada documento como una matriz ordenada: la primera cadena corresponde a la página uno, la segunda a la página dos, y así sucesivamente. Mantener estos límites es esencial, pues el resultado comunica las diferencias por número de página y no trata todo el documento como un bloque continuo. Las herramientas de extracción pueden generar espacios, tabulaciones o saltos de línea repetidos; por ello, la comparación normaliza los espacios antes de decidir si cambió el texto. Así no se marca una página solo porque otro extractor dividió una frase de forma diferente. La herramienta no realiza reconocimiento óptico de caracteres, no abre archivos PDF ni deduce límites ausentes. Si un documento escaneado carece de capa de texto, aplique primero OCR y envíe aquí el resultado por páginas. Revise la calidad cuando las fuentes, columnas o tablas alteren el orden de lectura. Ambas entradas deben contener al menos una página con texto distinto de espacios; de lo contrario, se devuelve un error.

Comprenda el resumen de las páginas modificadas

La herramienta compara posiciones de página equivalentes después de normalizar los espacios. Un texto normalizado idéntico no genera ninguna diferencia. Cuando una página cambia, el resumen divide ambas versiones en palabras, compara sus frecuencias sin distinguir mayúsculas y comunica cuántas se eliminaron y añadieron. Una vista previa muestra hasta cinco palabras eliminadas y cinco añadidas, lo que permite detectar con rapidez un importe, una fecha, el nombre de una parte o un término contractual actualizado. Los recuentos conservan las repeticiones: eliminar dos veces el mismo término produce dos eliminaciones. Si las palabras coinciden pero cambia su orden, capitalización o puntuación, la página sigue marcada como modificada y el resumen lo explica. Se trata de un diagnóstico conciso, no de un parche carácter por carácter. No intenta adivinar la importancia semántica ni afirmar que dos redacciones distintas tienen el mismo significado. Utilice los números indicados para orientar una revisión humana, especialmente en contratos, estados financieros y documentos regulados.

Interprete páginas ausentes y use el resultado con seguridad

Los documentos no siempre tienen la misma longitud. Cuando una entrada contiene posiciones adicionales, cada página extra se identifica como presente solo en PDF A o solo en PDF B, junto con su número de palabras extraídas. El resultado principal incluye los totales de páginas, una lista ordenada de páginas distintas, una entrada detallada por diferencia y un indicador de igualdad para automatizaciones. Esto resulta útil en controles de publicación, flujos de aprobación, validación de archivos y procesos de incorporación documental. Un indicador verdadero significa que el texto normalizado coincidió página por página; no demuestra que sean idénticas las imágenes, anotaciones, firmas, fuentes, metadatos, capas ocultas o posiciones. A la inversa, una diferencia de extracción puede deberse a la codificación del PDF y no a una edición intencionada. En revisiones importantes, use el informe para localizar diferencias textuales y examine después las páginas originales aplicando el criterio jurídico, financiero u operativo apropiado.

Revisar un contrato modificado

Localice las páginas cuya redacción extraída cambió antes de examinar las cláusulas afectadas en los originales.

Comprobar un informe antes de publicarlo

Compare borrador y versión final para detectar importes, fechas, etiquetas o páginas añadidas y eliminadas por error.

Automatizar el control de versiones

Use el indicador de igualdad y la lista de páginas distintas para enviar solo los PDF modificados a aprobación manual.

¿Esta herramienta acepta archivos PDF directamente?

No. Acepta texto ya extraído, organizado como una cadena por página.

¿Qué ocurre si una entrada está vacía?

La solicitud falla por entrada no válida. Cada PDF debe incluir una página con texto extraído distinto de espacios.

¿Los saltos de línea y espacios repetidos cuentan como cambios?

No. Los espacios se normalizan antes de comprobar la igualdad, por lo que se ignoran diferencias de ajuste causadas por la extracción.

¿Puede detectar diferencias visuales o de formato?

No. Solo compara texto extraído; no inspecciona imágenes, tipografía, anotaciones, firmas, metadatos ni geometría.

¿Cómo se comunican las páginas añadidas o eliminadas?

Una posición sin pareja aparece como presente solo en PDF A o PDF B, con su recuento de palabras extraídas.

¿Cuánto cuesta una comparación?

Cada solicitud de API cuesta $0.002. La implementación determinista del navegador también funciona sin una llamada de red.

Todo lo de esta página está disponible por programación. Esta sección es para equipos que quieren integrarlo en sus sistemas; el resto puede usar la herramienta de arriba sin más.

POSThttps://api.kit.forhosting.com/pdf/compare-text

¿Prefiere automatizarlo? Un POST autenticado crea la tarea; el resultado llega por webhook o enlace firmado. La misma capacidad también se ejecuta aquí en la web, por email y desde Telegram — y pronto también desde nuestra app.

curl -X POST https://api.kit.forhosting.com/pdf/compare-text \
  -H "Authorization: Bearer $KIT_KEY" \
  -H "Content-Type: application/json" \
  -d '{"pages_a":["Quarterly report\nRevenue was $2.4 million.","Operating expenses were $1.1 million."],"pages_b":["Quarterly report\nRevenue was $2.7 million.","Operating expenses were $1.1 million."]}'
{
  "pages_a": [
    "Quarterly report\nRevenue was $2.4 million.",
    "Operating expenses were $1.1 million."
  ],
  "pages_b": [
    "Quarterly report\nRevenue was $2.7 million.",
    "Operating expenses were $1.1 million."
  ]
}
{
  "task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
  "type": "pdf.compare_text",
  "status": "queued",
  "_links": {
    "result": "/tasks/tsk_…/result"
  }
}

La API es asíncrona: la llamada devuelve un task_id al instante y el resultado llega por webhook. El polling está limitado a 1 req/s por tarea.

Por solicitud$0.002

Precio publicado — sin tokens ni créditos inventados. Una tarea fallida no se cobra.

max_mb25
max_pages200
HTTPCódigoSignificado
401unauthorizedAPI key ausente o inválida.
402insufficient_balanceEl saldo no cubre el precio de la tarea.
404unknown_typeEl tipo de tarea no existe.
429rate_limitedDemasiadas peticiones. Use el webhook en vez de sondear.

Ver la documentación completa del KIT →