Deutsch

Dokumente · PDF Toolkit

Was das Konvertieren eines PDF tatsächlich bedeutet: Rasterisieren vs. Neukodieren

· Hintergrund

pdf Bildkonvertierung Rasterisierung

Eine Vektorseite PDF wird zu Pixeln und Bilder werden zu PDF Seiten
Original-ToolAcre-Vektorillustration

„Konvertieren“ deckt sehr unterschiedliche Vorgänge ab: das Zeichnen einer Seite in Pixel, das Umschließen eines Bildes in eine Seite oder das Rekonstruieren von bearbeitbarem Text. In diesem Beitrag wird erklärt, was die einzelnen Umrechnungen beinhalten und warum einige Umrechnungen exakt sind, während andere Näherungswerte sind.

Die „konvertierte“ Datei, die ihren Text verloren hat – warum eine Seite, die in ein Bild umgewandelt wurde, nicht mehr durchsucht oder ausgewählt werden kann

Eine konvertierte Seite kann identisch aussehen und dennoch ihre nützlichsten Eigenschaften verlieren. PDF-to-image rendert jede Seite in Pixel, sodass Wörter nicht mehr als Textebene ausgewählt, durchsucht oder gelesen werden können. Die ZIP-Datei enthält Bilder von Seiten, keine kleineren PDFs oder bearbeitbaren Dokumentinhalte.

Dieser Verlust ist angemessen, wenn für eine Folie, einen Chat, einen Katalog oder eine Vorschau ein Bild erforderlich ist. Es ist schädlich, wenn es um Zugänglichkeit, Suche, Kopieren oder spätere Bearbeitung geht. Wählen Sie eine Konvertierung basierend auf der erforderlichen Darstellung und nicht auf der beruhigenden Ähnlichkeit der ersten visuellen Inspektion.

Rasterisieren – Rendern der Vektoranweisungen einer Seite in eine Bitmap mit einer gewählten Auflösung und was gewonnen und verloren wird

Beim Rasterisieren wird pdf.js aufgefordert, Vektorzeichnungsanweisungen, Schriftarten und Bilder zu interpretieren und dann eine Leinwand in einem ausgewählten Maßstab zu malen. ToolAcre bietet PNG für scharfe Dokumentkanten und JPEG für kleinere Fotoausgaben. Jede Seite wird zu einem separat benannten Bild in einer ZIP-Datei.

Der Renderer prüft vor der Zuweisung ein Pixelbudget pro Gerät und kann übergroße Seiten unter den angeforderten Maßstab reduzieren. PNG und JPEG bewahren das gerenderte Erscheinungsbild in diesem Pixelraster, nicht die Quellvektoren oder die Textsemantik. Durch Zoomen über die gewählte Auflösung hinaus wird schließlich das endliche Raster sichtbar.

Wrapping – Platzieren eines Bildes innerhalb einer neuen Seite, sodass es zu einem PDF wird, und warum dies für das Bild selbst verlustfrei ist

Images-to-PDF geht in die andere Richtung, indem auf jeder neuen PDF-Seite ein vorbereitetes Bild platziert wird. Passen Sie die Seitengröße jedes Bildes an das Bild plus Ränder an. Die Voreinstellungen für A4 und US-Letter enthalten und zentrieren das gesamte Bild, ohne es zu beschneiden. Das Ergebnis ist ein Standbildinhalt, kein rekonstruierter Text.

JPEG und PNG Bytes werden nach Möglichkeit direkt eingebettet. WebP, AVIF, GIF, BMP, HEIC und HEIF hängen von der Browser-Dekodierung ab und werden als PNG neu kodiert; Animiertes GIF steuert nur seinen ersten Frame bei. Große Bilder können verkleinert werden, um sie an das Pixelbudget des Geräts anzupassen, und jedes Eingabebild ist auf 30 MB begrenzt.

Rekonstruieren – warum die Umwandlung eines PDF in ein bearbeitbares Dokument das Erraten von Absätzen, Spalten und Tabellen erfordert

Um ein bearbeitbares Textverarbeitungsdokument zu rekonstruieren, müssten Lesereihenfolge, Absätze, Spalten, Tabellen und Stile aus dem Erscheinungsbild der Seite abgeleitet werden. ToolAcre bietet diesen Vorgang oder OCR nicht an. PDF-to-image verwirft bewusst die semantische Struktur, während images-to-PDF Bilder absichtlich in Seiten einschließt.

Das Fehlen einer bearbeitbaren Konvertierung ist ein wichtiger Bereich, kein fehlender Schalter. Ein Scan enthält keinen Text, es sei denn, ein anderes System erkennt ihn, und die Erkennung stellt das ursprüngliche Erstellungsmodell immer noch nicht perfekt wieder her. Verwenden Sie einen dedizierten OCR- oder Dokumentenkonvertierungs-Workflow, wenn eine bearbeitbare Struktur die eigentliche Anforderung ist.

Auflösung, Farbe und Größe – die Einstellungen, die darüber entscheiden, ob eine gerasterte Seite sauber gedruckt wird oder weich aussieht

Die Auflösung steuert die Ausgabepixelabmessungen und die Speichernutzung. „Bildschirm“, „Gut“, „Hoch“ und „Sehr hoch“ entsprechen zunehmenden Skalierungen in der Benutzeroberfläche, während der Renderer möglicherweise eine Seite herunterskaliert, die sein Budget überschreitet. JPEG verwendet eine feste Qualität in der Nähe von 92 Prozent; Es gibt keinen Qualitätsregler.

PNG eignet sich für kleine Texte und Linienarbeiten, da JPEG Kantenartefakte vermieden werden, obwohl es größer sein kann. JPEG eignet sich für Fotoseiten, wenn es auf kleinere Lieferungen ankommt. Quellseiten unterschiedlicher Größe erzeugen Bilder unterschiedlicher Größe in einem Maßstab, und eine ZIP-Datei verwendet gespeicherte Einträge, anstatt bereits komprimierte Bilddaten erneut zu komprimieren. Beim Parsen von

PDF wird ein Worker verwendet, während die Canvas-Kodierung und die Bildvorbereitung Haupt-Thread-Browser-APIs erfordern

Lokale Konvertierung bedeutet nicht, dass jeder Schritt in einem Worker ausgeführt wird. pdf.js analysiert seinen eigenen gebündelten Worker mit deaktivierter JavaScript-Auswertung des Dokuments, während die Canvas-Kodierung im Hauptthread bleiben muss. Die Schleife gibt zwischen den Seiten nach, sodass der Fortschritt und die Steuerelemente weiterhin angezeigt werden.

Für Bilder-zu-PDF kann die Browser-Bildvorbereitung nicht unterstützte Formate im Hauptthread dekodieren und zeichnen, dann stellt pdf-lib vorbereitete PNG- oder JPEG-Daten im Toolkit-Worker zusammen. Diese Grenzen erklären die Implementierung genau und ersetzen die umfassendere Behauptung der Gliederung, dass das Rendern und Neukodieren einfach in einem Web Worker erfolgt.

Das Toolkit bietet speziell PDF-zu-PNG/JPEG und Bilder-zu-PDF

Die gelieferten Konvertierungen sind spezifisch. PDF to Image akzeptiert eine unverschlüsselte PDF bis zu 50 MB und gibt PNG oder JPEG Seiten in einer ZIP-Datei zurück. Bilder an PDF akzeptieren unterstützte Browser-Bildformate bis zu jeweils 30 MB und geben ein `images.pdf` mit einem Bild pro Seite zurück.

Das Toolkit konvertiert PDF nicht in bearbeitbare Office-Formate, führt keine OCR aus, fügt nicht alle Seiten zu einem langen Bild zusammen und bewahrt den Text nicht durch einen PDF-image-PDF-Roundtrip auf. Die unterstützten Eingabeabschnitte und Betriebssteuerungen geben diese genauen Pfade an, sodass keine Notwendigkeit besteht, die Fähigkeit mehrdeutig zu lassen.

Takeaway – wissen Sie, welche Art von Konvertierung Sie benötigen, bevor Sie beginnen, und verwenden Sie dann das PDF Toolkit für die unterstützten Konvertierungen

„Konvertieren“ kann bedeuten, strukturierte Seiten in Pixel umzuwandeln oder Pixel in neu strukturierte Seiten einzuschließen. Diese Richtungen sehen möglicherweise umkehrbar aus, sind es aber nicht: Sobald der Seitentext zu einem Raster wird, werden durch das Einfügen dieses Rasters in ein anderes PDF keine auswählbaren Zeichen oder Vektorzeichnungsanweisungen neu erstellt.

Verwenden Sie PDF-to-image, wenn das erforderliche Artefakt tatsächlich ein Bild ist, und images-to-PDF, wenn der erforderliche Container tatsächlich ein ausgelagertes PDF ist. Beide werden lokal mit expliziten Worker- und Haupt-Thread-Zuständigkeiten, festen Eingabebeschränkungen und Speicherwächtern ausgeführt. Die Auswahl der richtigen Darstellung vor dem Start verhindert ein optisch gelungenes, aber funktional falsches Ergebnis. Überprüfen Sie die Ergebnisnotiz auf automatische Verkleinerung oder Formatkonvertierung, da diese gemeldeten Änderungen die Drucktauglichkeit beeinträchtigen können, selbst wenn die Vorschau akzeptabel erscheint. Behalten Sie das strukturierte PDF immer dann bei, wenn zukünftige Suche, Zugänglichkeit oder Bearbeitung von Bedeutung sein könnten, und erstellen Sie Raster-Derivate als verfügbare Bereitstellungsressourcen und nicht als Ersatz für die Quelle. Benennen Sie diese Ableitungen nach Format und Maßstab, damit niemand ein Bildpaket in Bildschirmauflösung mit dem Dokument verwechselt, das für den Druck oder die Archivierung bestimmt ist.