Dokumen · PDF Perangkat
Apa Arti Sebenarnya Mengonversi PDF: Rasterisasi vs Pengodean Ulang
· Latar belakang
pdf konversi gambar rasterisasi
'Konversi' mencakup operasi yang sangat berbeda: menggambar halaman menjadi piksel, membungkus gambar dalam halaman, atau merekonstruksi teks yang dapat diedit. Posting ini menjelaskan apa saja yang terlibat dan mengapa beberapa konversi tepat sementara yang lain hanya perkiraan.
File yang 'dikonversi' kehilangan teksnya — alasan halaman berubah menjadi gambar tidak dapat lagi dicari atau dipilih
Halaman yang dikonversi mungkin terlihat sama dan masih kehilangan properti paling bergunanya. PDF-to-image merender setiap halaman menjadi piksel, sehingga kata-kata tidak dapat lagi dipilih, dicari, atau dibaca sebagai lapisan teks. ZIP berisi gambar halaman, bukan PDF yang lebih kecil atau konten dokumen yang dapat diedit.
Kehilangan tersebut wajar terjadi ketika slide, obrolan, katalog, atau pratinjau memerlukan gambar. Ini berbahaya jika aksesibilitas, pencarian, penyalinan, atau pengeditan selanjutnya penting. Pilih konversi berdasarkan representasi yang diperlukan, bukan kesamaan yang meyakinkan dari inspeksi visual pertama.
Rasterisasi — merender instruksi vektor halaman ke bitmap pada resolusi yang dipilih, dan apa yang didapat dan hilang
Rasterisasi meminta pdf.js untuk menafsirkan instruksi gambar vektor, font, dan gambar, lalu melukis kanvas pada skala yang dipilih. ToolAcre menawarkan PNG untuk tepi dokumen yang tajam dan JPEG untuk keluaran fotografi yang lebih kecil. Setiap halaman menjadi gambar dengan nama terpisah di dalam satu ZIP.
Perender memeriksa anggaran piksel per perangkat sebelum alokasi dan dapat mengurangi halaman berukuran besar di bawah skala yang diminta. PNG dan JPEG mempertahankan tampilan yang dirender pada kisi piksel tersebut, bukan vektor sumber atau semantik teks. Memperbesar melebihi resolusi yang dipilih pada akhirnya akan menunjukkan raster yang terbatas.
Pembungkusan — menempatkan gambar di dalam halaman baru sehingga menjadi PDF, dan mengapa hal ini tidak merugikan gambar itu sendiri
Gambar-ke-PDF bergerak ke arah lain dengan menempatkan satu gambar yang telah disiapkan di setiap halaman PDF baru. Cocokkan setiap ukuran gambar halaman dengan gambar ditambah margin; Preset A4 dan US Letter berisi dan memusatkan seluruh gambar tanpa dipotong. Hasilnya adalah konten gambar diam, bukan teks hasil rekonstruksi.
JPEG dan PNG byte disematkan secara langsung jika memungkinkan. WebP, AVIF, GIF, BMP, HEIC, dan HEIF bergantung pada decoding browser dan dikodekan ulang sebagai PNG; animasi GIF hanya menyumbangkan frame pertamanya. Gambar berukuran besar dapat diperkecil agar sesuai dengan anggaran piksel perangkat, dan setiap gambar masukan dibatasi hingga 30 MB.
Rekonstruksi — mengapa mengubah PDF menjadi dokumen yang dapat diedit memerlukan tebakan pada paragraf, kolom, dan tabel
Merekonstruksi dokumen pengolah kata yang dapat diedit memerlukan kesimpulan urutan bacaan, paragraf, kolom, tabel, dan gaya dari tampilan halaman. ToolAcre tidak menawarkan operasi itu atau OCR. PDF-to-image sengaja membuang struktur semantik, sedangkan images-to-PDF sengaja membungkus gambar dalam halaman.
Tidak adanya konversi yang dapat diedit adalah cakupan yang penting, bukan tombol yang hilang. Pemindaian tidak memiliki teks kecuali sistem lain mengenalinya, dan pengenalan masih belum memulihkan model pembuatan asli dengan sempurna. Gunakan OCR khusus atau alur kerja konversi dokumen ketika struktur yang dapat diedit adalah persyaratan sebenarnya.
Resolusi, warna dan ukuran — pengaturan yang menentukan apakah halaman raster akan dicetak dengan bersih atau terlihat lembut
Resolusi mengontrol dimensi piksel keluaran dan penggunaan memori. Layar, Bagus, Tinggi, dan Sangat Tinggi berhubungan dengan peningkatan skala pada antarmuka, sementara penyaji dapat menurunkan skala halaman yang melebihi anggarannya. JPEG menggunakan kualitas tetap mendekati 92 persen; tidak ada penggeser kualitas.
PNG cocok untuk teks kecil dan garis karena menghindari JPEG artefak tepi, meskipun bisa lebih besar. JPEG cocok untuk halaman fotografi ketika pengiriman lebih kecil penting. Halaman sumber berukuran campuran menghasilkan gambar berukuran campuran pada satu skala, dan ZIP menggunakan entri yang disimpan daripada mengompresi ulang data gambar yang sudah dikompresi.
Penguraian PDF menggunakan pekerja, sedangkan pengkodean kanvas dan persiapan gambar memerlukan API browser thread utama
Konversi lokal tidak berarti setiap langkah dijalankan oleh satu pekerja. pdf.js mem-parsing melalui paket pekerjanya sendiri dengan evaluasi dokumen JavaScript dinonaktifkan, sedangkan pengkodean kanvas harus tetap berada di thread utama. Perulangan menghasilkan antar halaman sehingga kemajuan dan kontrol terus berjalan.
Untuk images-to-PDF, persiapan gambar browser dapat mendekode dan menggambar format yang tidak didukung di thread utama, kemudian pdf-lib merakit data PNG atau JPEG yang disiapkan di pekerja toolkit. Batasan ini menjelaskan penerapan secara akurat dan menggantikan klaim garis besar yang lebih luas bahwa rendering dan pengodean ulang hanya terjadi di Web Worker.
Toolkit ini secara khusus menawarkan PDF-ke-PNG/JPEG dan gambar-ke-PDF
Konversi yang dikirimkan bersifat spesifik. PDF ke Gambar menerima satu PDF tidak terenkripsi hingga 50 MB dan mengembalikan halaman PNG atau JPEG dalam ZIP. Gambar ke PDF menerima format gambar browser yang didukung masing-masing hingga 30 MB dan mengembalikan satu `images.pdf` dengan satu gambar per halaman.
Toolkit ini tidak mengonversi PDF menjadi format kantor yang dapat diedit, menjalankan OCR, menggabungkan semua halaman menjadi satu gambar panjang, atau menyimpan teks melalui PDF-image-PDF bolak-balik. Bagian input yang didukung dan kontrol operasi menyatakan jalur yang tepat ini, sehingga kemampuan tidak perlu dibiarkan ambigu.
Kesimpulan — ketahui jenis konversi yang Anda perlukan sebelum memulai, lalu gunakan Perangkat PDF untuk konversi yang didukungnya
“Konversi” dapat berarti merender halaman terstruktur menjadi piksel atau membungkus piksel di dalam halaman terstruktur baru. Arah tersebut mungkin terlihat dapat dibalik, namun sebenarnya tidak: setelah teks halaman menjadi raster, menempatkan raster tersebut ke PDF lain tidak akan membuat ulang karakter yang dapat dipilih atau instruksi gambar vektor.
Gunakan PDF-to-image bila artefak yang diperlukan benar-benar berupa gambar, dan images-to-PDF bila wadah yang diperlukan benar-benar berupa halaman PDF. Keduanya dijalankan secara lokal dengan tanggung jawab pekerja dan thread utama yang eksplisit, batasan input keras, dan pelindung memori. Memilih representasi yang benar sebelum memulai mencegah hasil yang berhasil secara visual namun salah secara fungsional. Periksa catatan hasil untuk pengurangan otomatis atau konversi format, karena perubahan yang dilaporkan tersebut dapat mempengaruhi kesesuaian pencetakan bahkan ketika pratinjau tampak dapat diterima. Pertahankan PDF terstruktur kapan pun penelusuran, aksesibilitas, atau pengeditan di masa mendatang mungkin penting, dan buat turunan raster sebagai aset pengiriman sekali pakai, bukan pengganti sumbernya. Beri nama turunan tersebut dengan format dan skalanya sehingga tidak ada yang salah mengira kumpulan gambar resolusi layar untuk dokumen yang dimaksudkan untuk pencetakan atau penggunaan arsip.