Spiegazione della compressione PDF
Il ToolAcre PDF Toolkit non comprime i PDF. Si tratta di un'omissione deliberata, non di una caratteristica mancante: la tecnica a disposizione di un browser rasterizza ogni pagina, il che distrugge il testo selezionabile e spesso rende un documento di testo più grande anziché più piccolo.
Quasi tutte le dimensioni in eccesso in PDF sono immagini incorporate. Riducendoli prima che venga creato PDF o ricostruendo il documento da una fonte più piccola, si ottiene un risparmio reale senza danneggiare il file. Questa pagina spiega come trovare il peso e cosa aiuta effettivamente.
Cosa rende grande un PDF
Un PDF è un contenitore. Il suo testo è memorizzato come istruzioni più sottoinsiemi di caratteri incorporati ed è straordinariamente compatto: un centinaio di pagine di prosa spesso sono ben meno di un megabyte. Le sue immagini sono archiviate come flussi codificati e sono quasi sempre dove si trova la dimensione.
Il solito colpevole è una scansione o una fotografia inserita alla massima risoluzione della fotocamera. Una foto del telefono può essere larga quattromila pixel; stampato su una pagina A4 viene visualizzato a una frazione di tale valore e i pixel extra vengono conservati nel file per sempre, senza fare nulla.
I caratteri incorporati contano ai margini. Un documento che incorpora diverse famiglie di caratteri complete anziché sottoinsiemi può contenere alcune centinaia di kilobyte di caratteri tipografici. Fastidioso, raramente decisivo.
Le tre cose che "comprimere PDF" possono significare
La rasterizzazione è ciò che fanno molti "compressori PDF" basati su browser, perché un browser può già eseguire il rendering di una pagina su una tela e scrivere immagini in un nuovo documento. Produce in modo affidabile un file più piccolo per un documento scansionato. Per un documento di testo distrugge il livello di testo (nessuna selezione, nessuna ricerca, nessun accesso tramite screen reader) e le immagini della pagina risultante sono spesso più grandi delle istruzioni vettoriali che hanno sostituito.
Uno strumento che scambia silenziosamente il tuo contratto ricercabile con una pila di immagini ti ha portato via qualcosa che non eri d'accordo a perdere. Piuttosto che spedirlo dietro un amichevole pulsante "Comprimi", questo toolkit non lo offre e spiega il perché.
- Downsampling delle immagini: ricodifica delle immagini incorporate a una risoluzione o qualità inferiore. È da qui che provengono quasi tutti i risparmi onesti, ed è una perdita per le immagini ma innocua per il testo.
- Compressione del flusso: applicazione o miglioramento della compressione sgonfia sui flussi di contenuto. La maggior parte degli scrittori lo fa già, quindi il risparmio è solitamente piccolo.
- Rasterizzazione: rendering di ogni pagina in un'immagine e ricostruzione di PDF da quelle immagini. Questa è la tecnica facilmente disponibile in un browser ed è quella distruttiva.
Cosa fare invece
Scopri dove si trova il peso prima di fare qualsiasi cosa. Se il numero di pagine è elevato e il file è piccolo per pagina, non c'è nulla da guadagnare. Se un documento di dieci pagine è 40 MB, contiene immagini e quelle immagini sono l'intero problema.
Riduci le immagini prima che PDF esista. Se stai creando il documento da fotografie o scansioni, ridimensionale e ricodificale prima: un 1600 largo pixel JPEG alla qualità 80 è sufficiente per un'immagine a tutta larghezza su una pagina A4 ed è una piccola frazione del file originale della fotocamera. Quindi assembla il PDF da quelli.
Se PDF esiste già e non disponi dei sorgenti, la risposta onesta è che hai bisogno di uno strumento in grado di riscrivere i flussi di immagini sul posto: un editor PDF desktop o uno strumento da riga di comando come Ghostscript o qpdf. Questo è al di fuori di ciò che un browser può fare senza rasterizzare, quindi questo sito te lo indica invece di falsificarlo.
Vale la pena controllare prima due vincite economiche. Esporta nuovamente dall'applicazione originale con la preimpostazione "dimensione file più piccola" o "web", che in genere esegue il downsampling delle immagini in modo corretto. E se il documento è una scansione che devi solo leggere, convertirlo una sola volta a una risoluzione ragionevole batte qualsiasi compressione post-hoc.
Esempio realizzato: una "brochure" 46 MB che dovrebbe essere 3 MB
Una brochure di sei pagine viene esportata in 46 MB. Sei pagine di layout non possono tenerne conto, quindi il peso sono le immagini. Il file sorgente contiene sei fotografie a piena risoluzione, ciascuna di circa 4000 per 3000 pixel direttamente da una fotocamera.
Su una pagina A4 una fotografia al vivo è larga circa 8.3 pollici. A 150 dpi (ampio per tutto ciò che non è una stampa artistica) sono circa 1250 pixel. Le fotografie hanno una risoluzione lineare più di tre volte superiore a quella che la pagina può mostrare, ovvero circa dieci volte il numero di pixel.
- Ridimensiona ciascuna fotografia a 1500 pixel sul lato lungo.
- Esporta ciascuno come JPEG con qualità 80.
- Ricostruisci la brochure dalle immagini ridimensionate.
Risultato: Sei immagini di circa 300-450 KB ciascuna invece di 6-9 MB ciascuna e un PDF in pochi megabyte a una cifra. Il livello del testo è intatto e ancora selezionabile, perché nulla è stato rasterizzato.
Apri lo strumento
Riduci le immagini prima di creare PDF
Il convertitore di immagini ridimensiona e ricodifica JPEG, PNG e WebP nel tuo browser. Non apre i file PDF.
Ciò che questo non copre
- Questa pagina spiega il problema; il ToolAcre PDF Toolkit non ha funzionalità di compressione e non ne otterrà una rasterizzando.
- Il ToolAcre Image Converter può ridurre le immagini che inserisci in un PDF, ma non può raggiungere l'interno di un PDF esistente per sostituirle.
- Ghostscript e qpdf sono qui menzionati come risposte precise, non come prodotti di questo sito. Nessuno qui li mantiene e non esiste alcun rapporto.
- Non c'è OCR da nessuna parte in questo toolkit, quindi una pagina scansionata non può essere riconvertita in testo ricercabile.