Français

Documents · Boîte à outils PDF

Que se passe-t-il sous le capot lorsque vous fusionnez des PDF dans un navigateur

· Comment ça marche

pdf formats de fichiers traitement du navigateur

Deux arborescences de pages PDF alimentant un nouveau document PDF
Illustration vectorielle originale de ToolAcre

Fusionner des PDF ressemble à un agrafage, mais l’outil copie en réalité des objets de page, des polices et des images d’un graphe d’objets vers un autre, puis écrit une nouvelle table de références croisées. Cet article décrit ce processus dans un onglet du navigateur.

L'essentiel qui ne l'est pas : pourquoi deux fichiers PDF ne peuvent pas simplement être concaténés sous forme d'octets et ce qu'un outil de fusion doit reconstruire

Deux PDF possèdent chacun leur en-tête, leurs numéros d’objet, leur arborescence de pages et leurs informations de références croisées. Ajouter les octets du second fichier à la suite du premier n’ajoute pas ses pages à l’arborescence du premier document. Un outil de fusion doit écrire un nouveau PDF dont les références pointent vers ses propres objets.

Lecture de chaque fichier en mémoire — comment le navigateur charge vos PDF sous forme de tableaux d’octets au moyen de l’API File, sans téléverser les fichiers

Le sélecteur de fichiers donne au navigateur des objets de fichier, pas des URL de serveur. L'interface PDF lit chaque fichier sélectionné avec file.arrayBuffer() et transmet les octets Uint8Array à l'opération de traitement. La fusion ne télécharge pas de fichiers. Ceci est différent de l'affirmation selon laquelle la visite du site Web ne fait jamais de requêtes réseau : le chargement du site lui-même nécessite une connexion.

Analyse du graphe d'objets - en-têtes, objets numérotés, arborescence des pages et table de références croisées que l'analyseur doit reconstruire

La bibliothèque PDF charge chaque document source et résout ses index de page. Les pages font référence à des objets ailleurs dans le fichier, y compris les polices, les images et l'état des graphiques. Une section ou un flux de références croisées aide un lecteur à localiser des objets indirects ; ce n'est pas une liste de pages à coller ensemble. Une entrée endommagée ou cryptée peut empêcher l’analyse.

Copie de pages et de leurs ressources : pourquoi chaque état de police, d'image et de graphique, les références d'une page doivent voyager avec elle

L'implémentation appelle PDFDocument.create(), puis out.copyPages(source, source.getPageIndices()) pour chaque entrée dans l'ordre et ajoute chaque page copiée à la sortie. La bibliothèque transfère les structures référencées nécessaires à chaque page ; il ne fait pas de captures d'écran bitmap. Ne présumez pas que chaque fonctionnalité au niveau du document évolue avec les pages.

Écriture du fichier fusionné : renumérotation des objets, création d'une nouvelle arborescence de pages et d'une table de références croisées, puis remise d'un téléchargement

Après avoir ajouté les pages, la bibliothèque enregistre un nouveau tableau d'octets PDF. Son rédacteur gère les références d'objets et la sérialisation, plutôt que de concaténer les fichiers originaux. L'application propose le résultat en téléchargement. Puisqu'il s'agit d'un nouveau document, la taille en octets ne doit pas nécessairement être égale à la somme des entrées.

Exemple concret : fusion d'une lettre de motivation de trois pages et d'un accord numérisé de douze pages, et ce que vous disent l'ordre et la taille des pages du résultat.

Supposons qu'un administrateur de bureau sélectionne d'abord une lettre d'accompagnement de trois pages et ensuite un accord de douze pages. Le résultat doit comporter quinze pages : pages de couverture 1 à 3, puis pages d'accord 4 à 15. Vérifiez les première et dernière pages ainsi que le total avant d'envoyer le fichier. Un accord numérisé peut conserver une sortie volumineuse car ses pages contiennent des ressources d'images.

Ce que cela ne couvre pas : les signets, les champs de formulaire et les métadonnées du document, dont la gestion dépend des propres règles de l'outil et est documentée sur sa page.

La copie de pages ne garantit pas la préservation des signets, des champs de formulaire, des métadonnées ou des signatures. En particulier, ne présumez jamais qu’une signature cryptographique reste valide après une réécriture structurelle. Conservez les originaux et vérifiez séparément toutes les exigences légales de signature ; le nouveau fichier n'est pas un original signé.

À retenir : la fusion est une réécriture structurelle, pas une concaténation, et PDF Toolkit effectue cette réécriture dans l'onglet avec le fichier ne quittant jamais votre appareil.

Une fusion PDF est une réécriture structurelle. La boîte à outils PDF lit les octets sélectionnés dans l'onglet, copie les pages dans l'ordre des fichiers sélectionnés et écrit un nouveau fichier. Pour vérifier la limite de traitement local pendant votre session, inspectez le panneau Réseau du navigateur lors de la fusion ; distinguez les chargements d'actifs du site Web de tout téléchargement de votre document.