简体中文

PDF 压缩解释

ToolAcre PDF 工具包不压缩 PDF。这是故意的遗漏,而不是缺失的功能:浏览器可用的技术会对每个页面进行光栅化,这会破坏可选择的文本,并经常使文本文档变得更大而不是更小。

PDF 中几乎所有多余的尺寸都是嵌入图像。在构建 PDF 之前减少这些内容,或者从较小的源重建文档,可以在不损坏文件的情况下获得真正的节省。本页介绍了如何找到重量以及什么有实际帮助。

是什么让 PDF 变大

PDF 是一个容器。它的文本存储为指令加上嵌入的字体子集,并且非常紧凑——一百页的散文通常远低于一兆字节。它的图像存储为编码流,并且几乎总是在大小所在的位置。

通常的罪魁祸首是扫描或以全相机分辨率放入的照片。手机照片的宽度可以是四千像素;打印到 A4 页面上时,它会显示为 A4 页面的一小部分,并且额外的像素将永远保留在文件中,不执行任何操作。

嵌入字体在边缘很重要。嵌入多个完整字体系列而不是子集的文档可以携带几百千字节的字体。烦人,很少果断。

“压缩 PDF”的三个含义

光栅化是许多基于浏览器的“PDF 压缩器”所做的事情,因为浏览器已经可以将页面渲染到画布上并将图像写入新文档中。它可靠地为扫描文档生成较小的文件。对于文本文档,它会破坏文本层 - 没有选择,没有搜索,没有屏幕阅读器访问 - 并且生成的页面图像通常比它们替换的矢量指令更大。

一个工具悄悄地将你的可搜索合同交换为一堆图片,它从你身上夺走了一些你不同意失去的东西。该工具包没有提供它并说明原因,而不是在友好的“压缩”按钮后面提供它。

  • 图像下采样:以较低的分辨率或质量重新编码嵌入的图片。这就是几乎所有诚实节省的来源,它对图像有损耗,但对文本无害。
  • 流压缩:在内容流上应用或改进 deflate 压缩。大多数作家已经这样做了,所以节省的费用通常很小。
  • 光栅化:将每个页面渲染为图像并从这些图片重建 PDF。这是一种在浏览器中很容易使用的技术,也是一种破坏性的技术。

该怎么办

在做任何事情之前先弄清楚重量在哪里。如果页数很高并且每页文件很小,则没有什么可取的。如果一个十页的文档是 40 MB,它包含图像,而这些图像就是整个问题。

在 PDF 存在之前缩小图像。如果您要根据照片或扫描件构建文档,请先调整它们的大小并重新编码 - 质量为 80 的 1600 像素宽的 JPEG 足以满足 A4 页面上的全宽图片,并且只是原始相机文件的一小部分。然后将它们组合成 PDF。

如果 PDF 已经存在并且您没有源,那么诚实的答案是您需要一个可以就地重写图像流的工具 - 桌面 PDF 编辑器或命令行工具,例如 Ghostscript 或 qpdf。这超出了浏览器在不进行光栅化的情况下所能做到的范围,因此该网站会向您指出它而不是伪造它。

两场便宜的胜利值得首先检查。使用“较小的文件大小”或“Web”预设再次从原始应用程序导出,这通常会正确降低图像采样率。如果文档是您只需要阅读的扫描件,那么以合理的分辨率将其转换一次会胜过任何事后压缩。

工作示例: 46 MB “小册子”应该是 3 MB

六页小册子在 46 MB 处导出。六页布局无法解释这一点,因此权重是图像。源文件包含六张全分辨率照片,每张照片都是直接从相机拍摄的,像素约为 4000 x 3000 像素。

在 A4 纸上,一张全出血照片的宽度约为 8.3 英寸。在 150 dpi 处(足以容纳任何非美术印刷品),大约为 1250 像素。这些照片的线性分辨率是页面可显示的线性分辨率的三倍以上,大约是像素数的十倍。

  1. 将每张照片的长边尺寸调整为 1500 像素。
  2. 将每个导出为 JPEG,质量为 80。
  3. 从调整大小的图像重建小册子。

结果: 六个图像,每个图像大约 300-450 KB,而不是每个 6-9 MB,以及一个低个位数兆字节的 PDF。文本层未受影响并且仍然可以选择,因为没有任何内容被光栅化。

打开工具

在构建 PDF 之前缩小图像

图像转换器可在浏览器中调整 JPEG、PNG 和 WebP 的大小并重新编码。它不会打开 PDF 文件。

这不包括什么

  • 本页解释了问题; ToolAcre PDF 工具包没有压缩功能,也不会通过光栅化获得压缩功能。
  • ToolAcre 图像转换器可以缩小您输入到 PDF 中的图像,但它无法到达现有 PDF 内部来替换它们。
  • Ghostscript 和 qpdf 在此被命名为准确的答案,而不是本网站的产品。这里没有人维护它们,也不存在任何关系。
  • 该工具包中没有任何 OCR 功能,因此扫描的页面无法转回可搜索的文本。