Deutsch

Dokumente · PDF Toolkit

Aufteilen eines PDF nach Seitenbereich im Browser: So funktioniert es

· Wie es funktioniert

pdf Seitenbereiche Browser-Verarbeitung

Eine PDF-Objektstruktur, die in mehrere Seitenbereichsdokumente unterteilt ist
Original-ToolAcre-Vektorillustration

Ein Seitenbereich wie 3-7 ist eine kleine Anweisung mit vielen Konsequenzen. In diesem Beitrag wird erklärt, wie ein Browser-Tool diesen Bereich in ein neues, eigenständiges PDF umwandelt und warum die Ausgabe oft größer oder kleiner ist als erwartet.

Ein langer Scan, fünf Exponate – die häufige Situation, in der aus einem einzigen PDF mehrere Dateien werden müssen, ohne Ihren Computer zu verlassen

Eine gescannte Vereinbarung kommt oft als eine einzige lange Datei an, auch wenn ihre Exponate an verschiedene Prüfer weitergeleitet werden müssen. Der Splitter akzeptiert einen PDF bis zu 50 MB, liest ihn in die aktuelle Registerkarte ein und lässt jeden durch Kommas getrennten Bereich zu einem separaten Ergebnis werden, ohne den Vertrag an einen Upload-Dienst zu senden.

Dieser Workflow eignet sich für einen Anwaltsgehilfen, der die Seiten 1-18 als Hauptvereinbarung, 19-25 als Zeitplan und 26-40 als Unterschriften benötigt. Die Quelle bleibt unberührt. Der Vorgang erstellt neue Dokumente aus ausgewählten Seiten. Daher ist es wichtig, jede Ausgabe zu überprüfen, bevor der Originalscan archiviert oder verteilt wird.

Wie Seitenbereiche interpretiert werden – physische Seitenpositionen, inklusive Bereiche und warum die erste Seite Seite 1 ist, auch wenn sie mit „i“ gekennzeichnet ist

Bereiche verwenden physische Positionen und sind einsbasiert: Die erste Seite in der Datei ist Seite 1, auch wenn in der gedruckten Fußzeile „i“ steht oder keine Nummer vorhanden ist. Eine einfache Zahl wählt eine Seite aus, beide Enden von `2-6` sind enthalten, `8-` erreicht das Ende und `-3` beginnt auf Seite 1.

Der Parser lehnt fehlerhafte Token, umgekehrte Bereiche wie `7-2` und Positionen ab, die über die tatsächliche Seitenzahl hinausgehen. Kommas definieren Ausgaben und verbinden nicht nur Auswahlen. Somit erzeugt `1-3, 4-6` zwei Dateien, während `1-6` eine erzeugt; Überlappende Bereiche kopieren gemeinsam genutzte Seiten absichtlich in mehr als einen Teil.

Extrahieren einer Teilmenge des Seitenbaums – wie das Tool ein neues Dokument erstellt, das nur die von Ihnen angeforderten Seiten enthält

Bevor etwas neu geschrieben wird, konvertiert der Bereichsparser jede angeforderte Gruppe in nullbasierte Seitenindizes. Der Worker erstellt dann ein neues PDF für diese Gruppe, kopiert die benannten Seiten mit pdf-lib und serialisiert das Ergebnis. Unbenannte Seiten werden nicht an anderer Stelle weitergegeben; Eine Lücke ist eine gültige Anweisung, Material wegzulassen.

Beim Kopieren von Seiten bleiben der sichtbare Seiteninhalt, die Abmessungen, die vorhandene Drehung, der auswählbare Text und die eingebetteten Bilder, die von diesen Seiten verwendet werden, erhalten. Lesezeichen, Anhänge auf Dokumentebene oder Formulardefinitionen werden nicht rekonstruiert. Jeder Teil ist eine neue Datei und eine eingegebene digitale Signatur authentifiziert diese neu geschriebenen Bytes nicht mehr.

Warum die Ausgabegröße variiert, wenn jeder Bereich zu einem neuen Dokument wird

Die Arbeitsmappe ordnet Größenunterschiede speziell duplizierten gemeinsam genutzten Ressourcen zu, aber die Implementierung macht diese Abrechnung nicht verfügbar. Die vertretbare Beobachtung ist, dass jeder Bereich als neues PDF gespeichert wird und die Ausgabegröße nicht proportional zur Seitenzahl geteilt werden muss. Gescannte Seiten und Vektorseiten enthalten sehr unterschiedliche Datenmengen.

Mehrere Teile werden in einer ZIP-Datei mit gespeicherten, unkomprimierten Einträgen abgelegt, da PDFs bereits komprimierte Streams enthalten. Das Archiv vereinfacht die Lieferung; es handelt sich nicht um einen Komprimierungsdurchlauf. Erwarten Sie, dass die kombinierten Einträge in der Nähe ihrer eigenen gespeicherten Größe bleiben, und versprechen Sie nicht, dass durch die Aufteilung ein großes Dokument wesentlich kleiner wird.

Teilen versus Extrahieren – Aufteilen einer Datei in Teile im Vergleich zum Ziehen ausgewählter Seiten in eine neue Datei und wann jeder passt

Aufteilen und Extrahieren beantworten verschiedene Lieferfragen. Split behandelt jede durch Kommas getrennte Gruppe als separates Dokument. Extract akzeptiert eine Seitenliste und schreibt alle benannten Seiten in ein neues PDF. Verwenden Sie die Aufteilung für mehrere Exponate oder Kapitel. Verwenden Sie Extract, wenn ein Empfänger ein kurzes, aus verstreuten Positionen zusammengestelltes Paket erhalten soll.

Die Unterscheidung steuert auch die Download-Form. Ein geteilter Bereich gibt einen PDF mit dem Suffix `-part-1` zurück. Zwei oder mehr Bereiche geben ein `-split.zip`-Archiv zurück. Extract gibt immer einen `-pages.pdf` zurück. Durch die Wahl des Vorgangs wird bewusst verhindert, dass es kurz vor Ablauf der Einreichungsfrist zu einem unerwarteten Bündel kommt.

Arbeitsbeispiel – Aufteilung einer vierzigseitigen gescannten Vereinbarung in Unterschriftenseiten, Zeitpläne und den Hauptteil

Für eine vierzigseitige Vereinbarung könnte eine praktische Spezifikation `1-24, 25-34, 35-40` sein. Das Tool validiert alle drei Gruppen anhand von vierzig Seiten, erstellt drei neue PDFs in dieser schriftlichen Reihenfolge und verpackt sie in einer ZIP-Datei. Die Teilenummern richten sich nach der Bereichsreihenfolge und nicht nach den Originalseitenzahlen, die auf den Blättern aufgedruckt sind.

Öffnen Sie jedes Teil nach dem Download. Stellen Sie sicher, dass der Hauptteil an der vorgesehenen Stelle endet, die Zeitpläne mit ihren Überschriften beginnen und die Signaturseiten die richtige Ausrichtung behalten. Wenn gedruckte Etiketten von den physischen Positionen abweichen, ermitteln Sie den Versatz, bevor Sie die Aufteilung durchführen. Das Tool arbeitet in der Seitenbaumreihenfolge, die es tatsächlich lesen kann.

Was dies nicht abdeckt – Aufteilung nach Lesezeichen oder erkanntem Inhalt, was eine Struktur erfordert, die viele gescannte Dateien nicht haben

Dieser Splitter teilt nicht an Lesezeichen, Überschriften, erkanntem Text oder visuellen Trennzeichen. Diese Anfragen erfordern eine zuverlässige Struktur- oder Inhaltserkennung, während viele Quellscans nur Seitenbilder enthalten. Es lehnt auch verschlüsselte oder passwortgeschützte PDFs ab, anstatt Zugriffskontrollen zu umgehen; Entsperren Sie zunächst eine autorisierte Kopie in der ursprünglichen Anwendung.

Es gibt keine OCR, Inhaltsklassifizierung oder serverseitigen Verlauf. Das akzeptierte Maximum beträgt 50 MB für die Eingabe PDF, wobei die praktische Arbeit zusätzlich durch den Gerätespeicher begrenzt ist. Komplexe Archivierungs- oder Barrierefreiheitsanforderungen sollten nach Abschluss der Auswahl auf Seitenebene in einer speziellen Software validiert werden.

Bei einer Aufteilung wird jeder ausgewählte Bereich lokal neu erstellt und Strukturen auf Dokumentebene weggelassen

Eine Aufteilung ist eine Folge kontrollierter Neuerstellungen: inklusive Bereiche analysieren, jede Gruppe in ein neues Dokument kopieren, es serialisieren und bei Bedarf mehrere Ausgaben packen. Das erklärt, warum die Seitenqualität erhalten bleibt, während die Navigation und Signaturen auf Dokumentebene nicht der Fall sind. Es erklärt auch, warum Kommas strukturelle Konsequenzen haben.

Das PDF Toolkit führt diese Transformationen in einem Web Worker auf dem Gerät durch. Sein Code fordert keine Dokumentbytes an, obwohl genehmigte Analysen möglicherweise auf dem kanonischen Produktionshost geladen werden und Dateinamen und Inhalte von ToolAcre-Ereignissen ausgeschlossen werden. Löschen Sie anschließend die Dateien, um Puffer freizugeben und den Worker zu beenden. Bewahren Sie die ZIP-Datei auf, bis alle Bereiche geöffnet wurden, da auf der Registerkarte keine Wiederherstellungskopie einer Ausgabe gespeichert ist, die nie heruntergeladen wurde. Überprüfen Sie auch Dateinamen.