简体中文

文档 · PDF 工具包

在浏览器中按页面范围拆分 PDF:工作原理

· 工作原理

pdf 页面范围 浏览器处理

一个 PDF 对象结构,分为多个页面范围文档
原始 ToolAcre 矢量图

像 3-7 这样的页面范围是一条小指令,但会产生很多后果。这篇文章解释了浏览器工具如何将该范围转换为新的、独立的 PDF,以及为什么输出通常比您预期的更大或更小。

一次长扫描,五个展示 - 常见情况是单个 PDF 必须在不离开计算机的情况下变成多个文件

扫描的协议通常会作为一个长文件到达,即使其展品必须传送给不同的审阅者。拆分器接受一个 PDF 到 50 MB,将其读入当前选项卡,并让每个逗号分隔的范围成为一个单独的结果,而无需将合同发送到上传服务。

该工作流程适合需要 1-18 页作为主要协议、19-25 作为时间表、26-40 作为签名的律师助理。源头保持不变。该操作从选定的页面创建新的文档,因此在存档或分发原始扫描之前检查每个输出都很重要。

如何解释页面范围 - 物理页面位置、包含范围以及为什么第一页是页面 1 即使它被标记为“i”

范围使用物理位置并且基于 1:文件中的第一页是页 1,即使其打印的页脚显示“i”或没有编号。普通数字选择一页,包括 `2-6` 两端,`8-` 到达末尾,`-3` 从页 1 开始。

解析器拒绝格式错误的标记、反向跨度(例如 `7-2`)以及超出实际页数的位置。逗号定义输出而不仅仅是连接选择。因此 `1-3, 4-6` 生成两个文件,而 `1-6` 生成一个;重叠范围故意将共享页面复制到多个部分。

提取页面树的子集 - 该工具如何构建仅包含您要求的页面的新文档

在重写任何内容之前,范围解析器将每个请求的组转换为从零开始的页面索引。然后,工作人员为该组创建一个新的 PDF,使用 pdf-lib 复制指定页面,并序列化结果。未命名的页面不会重新分发到其他地方;空白是遗漏材料的有效指示。

页面复制保留可见的页面内容、尺寸、现有旋转、可选文本以及这些页面使用的嵌入图像。它不会重建书签、文档级附件或表单定义。每个部分都是一个新文件,输入数字签名不再验证那些新写入的字节。

为什么当每个范围成为新文档时输出大小会发生变化

工作簿将大小差异专门归因于重复的共享资源,但实现不会公开该记帐。合理的观察是,每个范围都保存为新的 PDF 并且输出大小不需要与页数成比例划分。扫描页面和矢量页面携带的数据量截然不同。

由于 PDF 已经包含压缩流,因此多个部分被放置在具有存储的未压缩条目的 ZIP 中。归档简化了交付;它不是压缩通道。期望合并的条目保持接近其保存的大小,并且不承诺拆分将使大文档实质上变小。

拆分与提取 — 将文件分成多个部分,与将选定的页面拉入一个新文件相比,以及每个部分何时适合

拆分并提取答案不同的交付问题。 Split 将每个逗号分隔的组视为一个单独的文档。 Extract 接受页面列表并将所有命名页面写入一个新的 PDF。对多个展品或章节使用拆分;当收件人应该收到由分散位置组装而成的简洁数据包时,请使用 extract。

这种区别还控制下载形状。一个分割范围返回带有 `-part-1` 后缀的 PDF。两个或多个范围返回 `-split.zip` 存档。 Extract 始终返回 1 `-pages.pdf`。有意选择该操作可防止在提交截止日期前出现意外捆绑。

工作示例 — 将四十页的扫描协议拆分为签名页、明细表和正文

对于四十页的协议,实际规范可能是 `1-24, 25-34, 35-40`。该工具根据四十页验证所有三组,按照书面顺序创建三个新的 PDF,并将它们打包在一个 ZIP 中。零件编号遵循范围顺序,而不是打印在纸张上的原始页码。

下载后打开每个部分。确认主体按预期结束,时间表以标题开头,签名页保持正确的方向。如果打印的标签与物理位置不同,请在运行拆分之前确定偏移量;该工具按照它实际可以读取的页面树顺序进行操作。

这不包括什么 - 按书签或检测到的内容分割,这需要许多扫描文件不具备的结构

此分割器不会在书签、标题、检测到的文本或视觉分隔符处进行分割。这些请求需要可靠的结构或内容识别,而许多源扫描仅包含页面图像。它还拒绝加密或受密码保护的 PDF,而不是绕过访问控制;首先在其原始应用程序中解锁授权副本。

没有 OCR、内容分类或服务器端历史记录。输入 PDF 可接受的最大值为 50 MB,实际工作还受到设备内存的限制。页面级选择完成后,应在专业软件中验证复杂的存档或可访问性要求。

拆分在本地重建每个选定的范围并省略文档级结构

拆分是一系列受控重建:解析包含范围,将每个组复制到新文档中,对其进行序列化,并在必要时打包多个输出。这就解释了为什么页面质量保持不变,而文档级导航和签名则不然。它还解释了为什么逗号具有结构性后果。

PDF 工具包在设备上的 Web Worker 中执行这些转换。尽管同意的分析可能会加载到规范的生产主机上并从 ToolAcre 事件中排除文件名和内容,但其代码不会发出携带文档字节的请求。之后清除文件以释放缓冲区并终止工作程序。保留 ZIP 直到打开每个范围,因为该选项卡不会保留从未下载过的输出的恢复副本。还要验证文件名。