Français

Documents · PDF Boîte à outils

Ce que signifie réellement la conversion d'un PDF : pixellisation ou réencodage

· Contexte

pdf conversion d'image rastérisation

Une page vectorielle PDF devenant des pixels et des images devenant PDF pages
Illustration vectorielle originale de ToolAcre

« Convertir » couvre des opérations très différentes : dessiner une page en pixels, envelopper une image dans une page ou reconstruire un texte modifiable. Cet article explique ce que chacun implique et pourquoi certaines conversions sont exactes tandis que d'autres sont des approximations.

Le fichier « converti » qui a perdu son texte — pourquoi une page transformée en image ne peut plus être recherchée ou sélectionnée

Une page convertie peut paraître identique tout en perdant sa propriété la plus utile. PDF-to-image restitue chaque page en pixels, de sorte que les mots ne peuvent plus être sélectionnés, recherchés ou lus comme un calque de texte. Le ZIP contient des images de pages, et non des fichiers PDF plus petits ou du contenu de document modifiable.

Cette perte est appropriée lorsqu'une diapositive, une discussion, un catalogue ou un aperçu nécessite une image. Cela est dangereux lorsque l’accessibilité, la recherche, la copie ou l’édition ultérieure sont importantes. Choisissez la conversion basée sur la représentation requise plutôt que sur la similitude rassurante de la première inspection visuelle.

Rastérisation : rendu des instructions vectorielles d'une page sous forme de bitmap à une résolution choisie, et ce qui est gagné et perdu

La rastérisation demande à pdf.js d'interpréter les instructions de dessin vectoriel, les polices et les images, puis de peindre une toile à une échelle sélectionnée. ToolAcre propose PNG pour des bords de documents nets et JPEG pour des sorties photographiques plus petites. Chaque page devient une image nommée séparément dans un ZIP.

Le moteur de rendu vérifie un budget de pixels par appareil avant l'allocation et peut réduire les pages surdimensionnées en dessous de l'échelle demandée. PNG et JPEG préservent l'apparence rendue au niveau de cette grille de pixels, et non les vecteurs sources ou la sémantique du texte. Un zoom au-delà de la résolution choisie révèle finalement le raster fini.

Wrapping : placer une image dans une nouvelle page pour qu'elle devienne un PDF, et pourquoi cela est sans perte pour l'image elle-même

Images-to-PDF parcourt l'autre sens en plaçant une image préparée sur chaque nouvelle page PDF. Faites correspondre chaque taille d'image, la page à l'image plus les marges ; Les préréglages A4 et US Letter contiennent et centrent l’image entière sans recadrage. Le résultat est toujours un contenu d’image et non un texte reconstruit. Les octets

JPEG et PNG sont intégrés directement lorsque cela est possible. WebP, AVIF, GIF, BMP, HEIC et HEIF dépendent du décodage du navigateur et sont réencodés en PNG ; Le GIF animé contribue uniquement à sa première image. Les grandes images peuvent être réduites pour s'adapter au budget de pixels de l'appareil, et chaque image d'entrée est limitée à 30 MB.

Reconstruction : pourquoi transformer un PDF en un document modifiable nécessite de deviner les paragraphes, les colonnes et les tableaux

La reconstruction d'un document de traitement de texte modifiable nécessiterait de déduire l'ordre de lecture, les paragraphes, les colonnes, les tableaux et les styles à partir de l'apparence de la page. ToolAcre ne propose pas cette opération ni cette OCR. PDF-to-image rejette délibérément la structure sémantique, tandis que images-to-PDF enveloppe délibérément les images dans des pages.

L'absence de conversion modifiable est une portée importante, et non une bascule manquante. Une numérisation ne contient aucun texte à moins qu'un autre système ne le reconnaisse, et la reconnaissance ne rétablit toujours pas parfaitement le modèle de création d'origine. Utilisez un flux de travail OCR ou de conversion de documents dédié lorsqu'une structure modifiable est réellement requise.

Résolution, couleur et taille : les paramètres qui déterminent si une page pixellisée s'imprime proprement ou semble douce.

La résolution contrôle les dimensions des pixels de sortie et l'utilisation de la mémoire. Écran, Bon, Élevé et Très élevé correspondent à des échelles croissantes dans l'interface, tandis que le moteur de rendu peut réduire l'échelle d'une page qui dépasse son budget. JPEG utilise une qualité fixe proche de 92 pour cent ; il n'y a pas de curseur de qualité.

PNG convient aux petits textes et aux lignes car il évite les JPEG artefacts de bord, bien qu'il puisse être plus grand. JPEG convient aux pages photographiques lorsque la livraison est plus petite. Les pages source de tailles mixtes produisent des images de tailles mixtes à une seule échelle, et un ZIP utilise les entrées stockées plutôt que de recompresser les données d'image déjà compressées. L'analyse

PDF utilise un travailleur, tandis que l'encodage du canevas et la préparation des images nécessitent des API de navigateur du thread principal.

La conversion locale ne signifie pas que chaque étape s'exécute dans un seul travailleur. pdf.js analyse via son propre travailleur intégré avec l'évaluation JavaScript du document désactivée, tandis que l'encodage du canevas doit rester sur le thread principal. La boucle cède entre les pages afin que la progression et les contrôles continuent à peindre.

Pour les images vers PDF, la préparation des images du navigateur peut décoder et dessiner des formats non pris en charge sur le thread principal, puis pdf-lib assemble les données PNG ou JPEG préparées dans le gestionnaire de la boîte à outils. Ces limites expliquent l’implémentation avec précision et remplacent l’affirmation plus large du plan selon laquelle le rendu et le réencodage se produisent simplement dans un Web Worker.

La boîte à outils propose spécifiquement PDF-to-PNG/JPEG et des images-to-PDF

Les conversions expédiées sont spécifiques. PDF to Image accepte un PDF non crypté jusqu'à 50 MB et renvoie PNG ou JPEG pages dans un ZIP. Les images vers PDF acceptent les formats d'image de navigateur pris en charge jusqu'à 30 MB chacun et renvoie un `images.pdf` avec une image par page.

La boîte à outils ne convertit pas PDF en formats bureautiques modifiables, n'exécute pas l'OCR, n'assemble pas toutes les pages en une seule longue image ou ne préserve pas le texte via un aller-retour PDF-image-PDF. Les sections d'entrée et les contrôles d'opération pris en charge indiquent ces chemins exacts, il n'est donc pas nécessaire de laisser les fonctionnalités ambiguës.

À retenir : sachez de quel type de conversion vous avez besoin avant de commencer, puis utilisez la boîte à outils PDF pour celles qu'elle prend en charge

« Convertir » peut signifier le rendu de pages structurées en pixels ou l'habillage de pixels à l'intérieur de pages nouvellement structurées. Ces directions peuvent sembler réversibles, mais elles ne le sont pas : une fois que le texte de la page devient un raster, placer ce raster dans un autre PDF ne recrée pas les caractères sélectionnables ni les instructions de dessin vectoriel.

Utilisez PDF-to-image lorsque l'artefact requis est véritablement une image, et images-to-PDF lorsque le conteneur requis est véritablement un PDF paginé. Les deux s'exécutent localement avec des responsabilités explicites de travailleur et de thread principal, des limites d'entrée strictes et des gardes de mémoire. Choisir la bonne représentation avant de commencer évite un résultat visuellement réussi mais fonctionnellement erroné. Vérifiez la note de résultat pour une réduction automatique ou une conversion de format, car ces modifications signalées peuvent affecter l'aptitude à l'impression même lorsque l'aperçu semble acceptable. Conservez le PDF structuré chaque fois que la recherche, l'accessibilité ou la modification future pourrait être importante, et créez des dérivés raster en tant qu'actifs de livraison jetables plutôt que des remplacements de la source. Nommez ces dérivés avec leur format et leur échelle afin que personne ne confonde un ensemble d'images en résolution d'écran avec le document destiné à l'impression ou à l'archivage.