Español

Compresión de PDF explicada

ToolAcre PDF Toolkit no comprime archivos PDF. Se trata de una omisión deliberada, no de una característica faltante: la técnica disponible para un navegador rasteriza cada página, lo que destruye el texto seleccionable y con frecuencia hace que un documento de texto sea más grande en lugar de más pequeño.

Casi todo el exceso de tamaño en un PDF son imágenes incrustadas. Reducirlos antes de crear el PDF o reconstruir el documento a partir de una fuente más pequeña permite ahorrar dinero sin dañar el archivo. Esta página explica cómo encontrar el peso y qué ayuda realmente.

¿Qué hace que un PDF sea grande?

Un PDF es un contenedor. Su texto se almacena como instrucciones más subconjuntos de fuentes incrustadas y es notablemente compacto: cien páginas de prosa suelen estar muy por debajo de un megabyte. Sus imágenes se almacenan como secuencias codificadas y casi siempre tienen el tamaño.

El culpable habitual es un escaneo o una fotografía colocada con la resolución máxima de la cámara. La foto de un teléfono puede tener cuatro mil píxeles de ancho; impreso en una página A4, se muestra en una fracción de eso, y los píxeles adicionales se guardan en el archivo para siempre, sin hacer nada.

Las fuentes incrustadas importan en los márgenes. Un documento que incorpore varias familias de fuentes completas en lugar de subconjuntos puede contener unos cientos de kilobytes de tipografía. Molesto, rara vez decisivo.

Las tres cosas que puede significar "comprimir PDF"

Rasterizar es lo que hacen muchos "compresores de PDF" basados en navegador, porque un navegador ya puede representar una página en un lienzo y escribir imágenes en un nuevo documento. Produce de manera confiable un archivo más pequeño para un documento escaneado. En el caso de un documento de texto, destruye la capa de texto (sin selección, sin búsqueda, sin acceso al lector de pantalla) y las imágenes de la página resultantes suelen ser más grandes que las instrucciones vectoriales que reemplazaron.

Una herramienta que cambia silenciosamente su contrato de búsqueda por una pila de imágenes le ha quitado algo que no aceptó perder. En lugar de ofrecer eso detrás de un botón amigable "Comprimir", este conjunto de herramientas no lo ofrece y dice por qué.

  • Reducción de resolución de imágenes: recodificación de imágenes incrustadas con una resolución o calidad más baja. De aquí provienen casi todos los ahorros honestos, y genera pérdidas para las imágenes pero es inofensivo para el texto.
  • Compresión de flujo: aplicar o mejorar la compresión desinflada en flujos de contenido. La mayoría de los escritores ya hacen esto, por lo que el ahorro suele ser pequeño.
  • Rasterización: renderizar cada página en una imagen y reconstruir el PDF a partir de esas imágenes. Esta es la técnica fácilmente disponible en un navegador y es la destructiva.

Que hacer en su lugar

Calcula dónde está el peso antes de hacer cualquier cosa. Si el número de páginas es alto y el archivo por página es pequeño, no hay nada que ganar. Si un documento de diez páginas es 40 MB, contiene imágenes, y esas imágenes son todo el problema.

Reduzca las imágenes antes de que exista el PDF. Si está creando el documento a partir de fotografías o escaneos, primero cambie su tamaño y codifíquelos: un JPEG de 1600 píxeles de ancho con calidad 80 es suficiente para una imagen de ancho completo en una página A4 y es una pequeña fracción del archivo original de la cámara. Luego monte el PDF a partir de ellos.

Si el PDF ya existe y no tiene las fuentes, la respuesta honesta es que necesita una herramienta que pueda reescribir secuencias de imágenes en el lugar: un editor de PDF de escritorio o una herramienta de línea de comandos como Ghostscript o qpdf. Esto está fuera de lo que un navegador puede hacer sin rasterizar, por lo que este sitio le indica esto en lugar de fingirlo.

Vale la pena comprobar primero dos victorias económicas. Exporte nuevamente desde la aplicación original con su ajuste preestablecido de "tamaño de archivo más pequeño" o "web", que generalmente reduce la resolución de las imágenes correctamente. Y si el documento es un escaneo que solo necesita leer, convertirlo una vez a una resolución razonable supera cualquier compresión post hoc.

Ejemplo resuelto: un "folleto" 46 MB que debería ser 3 MB

Un folleto de seis páginas se exporta a 46 MB. Seis páginas de diseño no pueden dar cuenta de eso, por lo que el peso son las imágenes. El archivo fuente contiene seis fotografías de resolución completa, cada una de aproximadamente 4000 por 3000 píxeles tomadas directamente de una cámara.

En una página A4, una fotografía a sangre completa mide aproximadamente 8,3 pulgadas de ancho. En 150 dpi, suficiente para cualquier cosa que no sea una impresión artística, eso es aproximadamente 1250 píxeles. Las fotografías tienen más de tres veces la resolución lineal que puede mostrar la página, que es aproximadamente diez veces el número de píxeles.

  1. Cambie el tamaño de cada fotografía a 1500 píxeles en el borde largo.
  2. Exporte cada uno como JPEG con calidad 80.
  3. Reconstruya el folleto a partir de las imágenes redimensionadas.

Resultado: Seis imágenes de aproximadamente 300-450 KB cada una en lugar de 6-9 MB cada una, y un PDF de megabytes de un solo dígito. La capa de texto está intacta y aún se puede seleccionar, porque no se rasterizó nada.

Abre la herramienta

Reduzca las imágenes antes de crear el PDF

Image Converter cambia el tamaño y vuelve a codificar JPEG, PNG y WebP en su navegador. No abre archivos PDF.

Lo que esto no cubre

  • Esta página explica el problema; ToolAcre PDF Toolkit no tiene función de compresión y no la obtendrá al rasterizar.
  • ToolAcre Image Converter puede reducir las imágenes que introduce en un PDF, pero no puede acceder al interior de un PDF existente para reemplazarlas.
  • Ghostscript y qpdf se mencionan aquí como respuestas precisas, no como productos de este sitio. Nadie aquí los mantiene y no existe ninguna relación.
  • No hay OCR en ninguna parte de este kit de herramientas, por lo que una página escaneada no se puede volver a convertir en texto con capacidad de búsqueda.