Documenti · PDF Toolkit
Cosa significa effettivamente convertire un PDF: rasterizzazione o ricodifica
· Sfondo
pdf conversione delle immagini rasterizzazione
"Converti" copre operazioni molto diverse: disegnare una pagina in pixel, avvolgere un'immagine in una pagina o ricostruire un testo modificabile. Questo post spiega cosa comporta ciascuno e perché alcune conversioni sono esatte mentre altre sono approssimative.
Il file "convertito" che ha perso il testo: perché una pagina trasformata in un'immagine non può più essere cercata o selezionata
Una pagina convertita può sembrare identica e perdere comunque la sua proprietà più utile. PDF-to-image esegue il rendering di ogni pagina in pixel, quindi le parole non possono più essere selezionate, cercate o lette come un livello di testo. ZIP contiene immagini di pagine, non PDF più piccoli o contenuti di documenti modificabili.
Questa perdita è appropriata quando una diapositiva, una chat, un catalogo o un'anteprima necessitano di un'immagine. È dannoso quando l'accessibilità, la ricerca, la copia o la modifica successiva sono importanti. Scegli la conversione in base alla rappresentazione richiesta piuttosto che alla rassicurante somiglianza della prima ispezione visiva.
Rasterizzazione: rendering delle istruzioni vettoriali di una pagina in una bitmap alla risoluzione scelta e cosa si guadagna e cosa si perde
La rasterizzazione richiede a pdf.js di interpretare le istruzioni di disegno vettoriale, i caratteri e le immagini, quindi di dipingere una tela nella scala selezionata. ToolAcre offre PNG per bordi dei documenti nitidi e JPEG per output fotografici più piccoli. Ogni pagina diventa un'immagine con nome separato all'interno di una ZIP.
Il renderer controlla il budget di pixel per dispositivo prima dell'allocazione e può ridurre le pagine di grandi dimensioni al di sotto della scala richiesta. PNG e JPEG preservano l'aspetto renderizzato in quella griglia di pixel, non i vettori di origine o la semantica del testo. Lo zoom oltre la risoluzione scelta alla fine rivela il raster finito.
Wrapping: posizionamento di un'immagine all'interno di una nuova pagina in modo che diventi PDF e perché ciò non comporta perdite per l'immagine stessa
Images-to-PDF viaggia nella direzione opposta posizionando un'immagine preparata su ogni nuova pagina PDF. Abbina le dimensioni di ciascuna immagine alla pagina con l'immagine più i margini; Le preimpostazioni A4 e US Letter contengono e centrano l'intera immagine senza ritagliarla. Il risultato è un fermo immagine, non un testo ricostruito.
I byte JPEG e PNG vengono incorporati direttamente quando possibile. WebP, AVIF, GIF, BMP, HEIC e HEIF dipendono dalla decodifica del browser e vengono ricodificati come PNG; animato GIF contribuisce solo con il primo fotogramma. Le immagini di grandi dimensioni possono essere ridotte per adattarsi al budget di pixel del dispositivo e ogni immagine di input ha un limite di 30 MB.
Ricostruire: perché trasformare un PDF in un documento modificabile richiede indovinare paragrafi, colonne e tabelle
Ricostruire un documento di elaborazione testi modificabile richiederebbe di dedurre l'ordine di lettura, i paragrafi, le colonne, le tabelle e gli stili dall'aspetto della pagina. ToolAcre non offre tale operazione o OCR. PDF-to-image elimina deliberatamente la struttura semantica, mentre images-to-PDF racchiude deliberatamente le immagini nelle pagine.
L'assenza di una conversione modificabile è un ambito importante, non un interruttore mancante. Una scansione non contiene testo a meno che un altro sistema non la riconosca e il riconoscimento non recupera ancora perfettamente il modello di creazione originale. Utilizza un OCR dedicato o un flusso di lavoro di conversione dei documenti quando la struttura modificabile è il requisito effettivo.
Risoluzione, colore e dimensioni: le impostazioni che determinano se una pagina rasterizzata viene stampata in modo pulito o appare morbida
La risoluzione controlla le dimensioni dei pixel di output e l'utilizzo della memoria. Schermo, Buono, Alto e Molto alto corrispondono a scale crescenti nell'interfaccia, mentre il renderer può ridurre una pagina che supera il suo budget. JPEG utilizza la qualità fissa vicino al 92 percento; non esiste un cursore di qualità.
PNG è adatto a testi di piccole dimensioni e lavori al tratto perché evita artefatti sui bordi JPEG, sebbene possa essere più grande. JPEG è adatto alle pagine fotografiche quando è importante una consegna più piccola. Le pagine di origine di dimensioni miste producono immagini di dimensioni miste su una scala e ZIP utilizza le voci memorizzate anziché ricomprimere i dati di immagine già compressi.
L'analisi PDF utilizza un lavoratore, mentre la codifica della tela e la preparazione dell'immagine richiedono API del browser del thread principale
La conversione locale non significa che ogni passaggio viene eseguito in un lavoratore. pdf.js analizza tramite il proprio lavoratore in bundle con la valutazione del documento JavaScript disabilitata, mentre la codifica canvas deve rimanere nel thread principale. Il ciclo si interrompe tra le pagine, quindi i progressi e i controlli continuano a dipingere.
Per images-to-PDF, la preparazione dell'immagine del browser può decodificare e disegnare formati non supportati sul thread principale, quindi pdf-lib assembla i dati PNG o JPEG preparati nel lavoratore del toolkit. Questi limiti spiegano accuratamente l’implementazione e sostituiscono l’affermazione più ampia dello schema secondo cui il rendering e la ricodifica avvengono semplicemente in un Web Worker.
Il toolkit offre specificamente PDF-to-PNG/JPEG e immagini-to-PDF
Le conversioni spedite sono specifiche. PDF to Image accetta una PDF non crittografata fino a 50 MB e restituisce PNG o JPEG pagine in un ZIP. Le immagini su PDF accettano formati di immagine del browser supportati fino a 30 MB ciascuno e restituiscono un `images.pdf` con un'immagine per pagina.
Il toolkit non converte PDF in formati Office modificabili, non esegue OCR, non unisce tutte le pagine in un'unica immagine lunga né conserva il testo attraverso un viaggio di andata e ritorno PDF-immagine-PDF. Le sezioni di input supportate e i controlli operativi indicano questi percorsi esatti, quindi non è necessario lasciare ambigue le funzionalità.
Conclusione: scopri quale tipo di conversione ti serve prima di iniziare, quindi utilizza il PDF Toolkit per quelli che supporta
"Converti" può significare il rendering di pagine strutturate in pixel o l'inserimento di pixel all'interno di pagine appena strutturate. Queste direzioni possono sembrare reversibili, ma non lo sono: una volta che il testo della pagina diventa un raster, inserendo quel raster in un altro PDF non vengono ricreati i caratteri selezionabili o le istruzioni di disegno vettoriale.
Utilizza PDF-to-image quando l'elemento richiesto è realmente un'immagine e images-to-PDF quando il contenitore richiesto è effettivamente un PDF paginato. Entrambi vengono eseguiti localmente con responsabilità esplicite del lavoratore e del thread principale, limiti di input rigidi e protezioni della memoria. Scegliere la rappresentazione corretta prima di iniziare impedisce un risultato visivamente riuscito ma funzionalmente sbagliato. Controlla la nota sui risultati per la riduzione automatica o la conversione del formato, poiché le modifiche segnalate potrebbero influire sull'idoneità alla stampa anche quando l'anteprima sembra accettabile. Preserva il PDF strutturato ogni volta che la ricerca, l'accessibilità o la modifica futura potrebbero avere importanza e crea derivati raster come risorse di consegna usa e getta anziché sostituti della fonte. Assegna un nome a questi derivati con il loro formato e scala in modo che nessuno confonda un pacchetto di immagini con risoluzione dello schermo per il documento destinato alla stampa o all'uso di archiviazione.