เอกสาร · PDF ชุดเครื่องมือ
การแปลง PDF จริงๆ แล้วหมายถึงอะไร: การแรสเตอร์กับการเข้ารหัสซ้ำ
· พื้นหลัง
pdf การแปลงรูปภาพ การแรสเตอร์
'การแปลง' ครอบคลุมการทำงานที่แตกต่างกันมาก เช่น การวาดหน้าเป็นพิกเซล การล้อมรูปภาพในหน้า หรือการสร้างข้อความที่แก้ไขได้ขึ้นมาใหม่ โพสต์นี้จะอธิบายว่าแต่ละอย่างเกี่ยวข้องกันอย่างไร และเหตุใด Conversion บางรายการจึงตรงกัน ในขณะที่บางรายการเป็นการประมาณค่า
ไฟล์ 'แปลงแล้ว' ที่สูญเสียข้อความ — เหตุใดจึงไม่สามารถค้นหาหรือเลือกหน้าเว็บที่กลายเป็นรูปภาพได้อีกต่อไป
หน้าที่แปลงแล้วอาจดูเหมือนกันและยังคงสูญเสียคุณสมบัติที่เป็นประโยชน์มากที่สุดไป PDF-to-image แสดงผลแต่ละหน้าเป็นพิกเซล ดังนั้นจึงไม่สามารถเลือก ค้นหา หรืออ่านคำเป็นเลเยอร์ข้อความได้อีกต่อไป ZIP มีรูปภาพของหน้า ไม่ใช่ PDF ขนาดเล็กหรือเนื้อหาเอกสารที่แก้ไขได้
การสูญเสียนั้นเหมาะสมเมื่อสไลด์ แชท แค็ตตาล็อก หรือการแสดงตัวอย่างจำเป็นต้องมีรูปภาพ การเข้าถึง การค้นหา คัดลอก หรือการแก้ไขในภายหลังถือเป็นอันตราย เลือกการแปลงโดยพิจารณาจากการแสดงที่ต้องการ แทนที่จะรับประกันความคล้ายคลึงกันของการตรวจสอบด้วยภาพครั้งแรก
การแรสเตอร์ — เรนเดอร์คำสั่งเวกเตอร์ของเพจเป็นบิตแมปตามความละเอียดที่เลือก และสิ่งที่ได้รับและสูญหาย
การแรสเตอร์จะขอให้ pdf.js ตีความคำแนะนำในการวาดภาพเวกเตอร์ แบบอักษร และรูปภาพ จากนั้นวาดภาพบนผืนผ้าใบตามขนาดที่เลือก ToolAcre ให้ PNG สำหรับขอบเอกสารที่คมชัด และ JPEG สำหรับผลงานภาพถ่ายขนาดเล็ก แต่ละหน้าจะกลายเป็นรูปภาพที่มีชื่อแยกกันภายใน ZIP เดียว
ตัวเรนเดอร์จะตรวจสอบงบประมาณพิกเซลต่ออุปกรณ์ก่อนทำการจัดสรร และสามารถลดหน้าที่มีขนาดใหญ่กว่าขนาดที่ร้องขอได้ PNG และ JPEG คงลักษณะการแสดงผลที่ตารางพิกเซลนั้น ไม่ใช่เวกเตอร์ต้นฉบับหรือความหมายของข้อความ การซูมเกินความละเอียดที่เลือกจะเผยให้เห็นแรสเตอร์ที่มีขอบเขตจำกัดในที่สุด
การตัดคำ — การวางรูปภาพในหน้าใหม่เพื่อให้กลายเป็น PDF และเหตุใดจึงไม่สูญเสียรูปภาพนั้นเอง
Images-to-PDF เดินทางไปในทิศทางอื่นโดยการวางรูปภาพที่เตรียมไว้ไว้หนึ่งภาพบน PDF หน้าใหม่แต่ละหน้า จับคู่แต่ละภาพขนาดหน้ากระดาษบวกระยะขอบ; ค่าที่ตั้งไว้ล่วงหน้า A4 และ US Letter จะบรรจุและจัดกึ่งกลางรูปภาพทั้งหมดโดยไม่ต้องครอบตัด ผลลัพธ์ที่ได้คือเนื้อหาภาพนิ่ง ไม่ใช่ข้อความที่สร้างขึ้นใหม่
JPEG และ PNG ไบต์จะถูกฝังโดยตรงเมื่อเป็นไปได้ WebP, AVIF, GIF, BMP, HEIC และ HEIF ขึ้นอยู่กับการถอดรหัสของเบราว์เซอร์และได้รับการเข้ารหัสใหม่เป็น PNG; ภาพเคลื่อนไหว GIF มีส่วนสนับสนุนเฉพาะเฟรมแรกเท่านั้น รูปภาพขนาดใหญ่อาจลดลงเพื่อให้พอดีกับงบประมาณพิกเซลของอุปกรณ์ และรูปภาพที่ป้อนทุกภาพจะถูกจำกัดไว้ที่ 30 MB
การสร้างใหม่ — เหตุใดการเปลี่ยน PDF ให้เป็นเอกสารที่แก้ไขได้จึงต้องอาศัยการเดาย่อหน้า คอลัมน์ และตาราง
การสร้างเอกสารประมวลผลคำที่แก้ไขได้ขึ้นใหม่จะต้องมีการอนุมานลำดับการอ่าน ย่อหน้า คอลัมน์ ตาราง และสไตล์จากลักษณะของหน้า ToolAcre ไม่มีการดำเนินการนั้นหรือ OCR PDF-to-image จงใจละทิ้งโครงสร้างความหมาย ในขณะที่ image-to-PDF จงใจตัดภาพในหน้าต่างๆ
การไม่มีการแปลงที่แก้ไขได้ถือเป็นขอบเขตที่สำคัญ ไม่ใช่การสลับที่หายไป การสแกนจะไม่มีข้อความเว้นแต่ระบบอื่นจะจดจำได้ และการจดจำยังคงไม่สามารถกู้คืนโมเดลการเขียนต้นฉบับได้อย่างสมบูรณ์ ใช้ OCR เฉพาะหรือเวิร์กโฟลว์การแปลงเอกสารเมื่อโครงสร้างที่แก้ไขได้เป็นข้อกำหนดที่แท้จริง
ความละเอียด สี และขนาด — การตั้งค่าที่กำหนดว่าหน้าที่แรสเตอร์จะพิมพ์ออกมาหมดจดหรือดูนุ่มนวล
ความละเอียดจะควบคุมขนาดพิกเซลเอาต์พุตและการใช้หน่วยความจำ หน้าจอ ดี สูง และสูงมาก สอดคล้องกับการเพิ่มขนาดในอินเทอร์เฟซ ในขณะที่ตัวเรนเดอร์อาจลดขนาดหน้าที่เกินงบประมาณ JPEG ใช้คุณภาพคงที่ใกล้ 92 เปอร์เซ็นต์; ไม่มีแถบเลื่อนคุณภาพ
PNG เหมาะกับงานข้อความและบรรทัดขนาดเล็ก เนื่องจากหลีกเลี่ยง JPEG ส่วนขอบ แม้ว่าอาจมีขนาดใหญ่กว่าก็ตาม JPEG เหมาะกับหน้ารูปถ่ายเมื่อการจัดส่งจำนวนน้อยมีความสำคัญ หน้าแหล่งที่มาที่มีขนาดผสมจะสร้างภาพที่มีขนาดผสมในระดับเดียว และ ZIP ใช้รายการที่จัดเก็บไว้แทนที่จะบีบอัดข้อมูลภาพที่บีบอัดแล้วอีกครั้ง
PDF การแยกวิเคราะห์ใช้คนงาน ในขณะที่การเข้ารหัสแคนวาสและการเตรียมรูปภาพต้องใช้ API ของเบราว์เซอร์เธรดหลัก
การแปลงเฉพาะที่ไม่ได้หมายความว่าทุกขั้นตอนจะทำงานโดยใช้พนักงานเพียงคนเดียว pdf.js แยกวิเคราะห์ผ่านกลุ่มผู้ปฏิบัติงานของตัวเองโดยปิดใช้งานการประเมินเอกสาร JavaScript ในขณะที่การเข้ารหัสแคนวาสจะต้องอยู่บนเธรดหลัก การวนซ้ำเกิดขึ้นระหว่างหน้าต่างๆ ดังนั้นความคืบหน้าและการควบคุมจึงลงสีต่อไป
สำหรับ image-to-PDF การเตรียมอิมเมจของเบราว์เซอร์สามารถถอดรหัสและวาดรูปแบบที่ไม่รองรับบนเธรดหลัก จากนั้นแอสเซมบลี pdf-lib จะเตรียมข้อมูล PNG หรือ JPEG ในตัวทำงานชุดเครื่องมือ ขอบเขตเหล่านี้อธิบายการใช้งานอย่างถูกต้อง และแทนที่คำกล่าวอ้างที่กว้างขึ้นของเค้าร่างที่ว่าการแสดงผลและการเข้ารหัสใหม่เกิดขึ้นใน Web Worker
ชุดเครื่องมือนี้นำเสนอ PDF-to-PNG/JPEG และรูปภาพ-to-PDF โดยเฉพาะ
การแปลงที่จัดส่งมีความเฉพาะเจาะจง PDF ไปยัง Image ยอมรับ PDF ที่ไม่ได้เข้ารหัสหนึ่งรายการ สูงสุด 50 MB และส่งคืน PNG หรือ JPEG หน้าใน ZIP รูปภาพที่ PDF ยอมรับรูปแบบรูปภาพของเบราว์เซอร์ที่รองรับสูงสุด 30 MB ต่อรูปแบบ และส่งคืน `images.pdf` หนึ่งภาพพร้อมหนึ่งภาพต่อหน้า
ชุดเครื่องมือจะไม่แปลง PDF เป็นรูปแบบ office ที่แก้ไขได้, เรียกใช้ OCR, ต่อทุกหน้าให้เป็นภาพขนาดยาวภาพเดียว หรือเก็บข้อความไว้ผ่าน PDF-image-PDF ไปกลับ ส่วนอินพุตที่รองรับและการควบคุมการดำเนินการจะระบุเส้นทางที่แน่นอนเหล่านี้ ดังนั้นจึงไม่จำเป็นต้องปล่อยให้ความสามารถคลุมเครือ
นำไปใช้ — รู้ว่าคุณต้องการ Conversion ประเภทใดก่อนที่จะเริ่ม จากนั้นใช้ PDF Toolkit สำหรับรายการที่รองรับ
“แปลง” อาจหมายถึงการแสดงเพจที่มีโครงสร้างเป็นพิกเซลหรือตัดพิกเซลภายในเพจที่มีโครงสร้างใหม่ ทิศทางเหล่านั้นอาจดูย้อนกลับได้ แต่ทำไม่ได้: เมื่อข้อความบนหน้ากลายเป็นแรสเตอร์ การใส่แรสเตอร์นั้นลงใน PDF อีกอันหนึ่งจะไม่สร้างอักขระที่เลือกได้หรือคำแนะนำในการวาดเวกเตอร์ขึ้นมาใหม่
ใช้ PDF-to-image เมื่อส่วนที่ต้องการเป็นรูปภาพจริงๆ และใช้ image-to-PDF เมื่อคอนเทนเนอร์ที่ต้องการเป็นเพจ PDF อย่างแท้จริง ทั้งสองทำงานภายในเครื่องโดยมีความรับผิดชอบของผู้ปฏิบัติงานที่ชัดเจนและความรับผิดชอบของเธรดหลัก ฮาร์ดอินพุตแคป และตัวป้องกันหน่วยความจำ การเลือกการแสดงที่ถูกต้องก่อนเริ่มต้นจะช่วยป้องกันผลลัพธ์ที่มองเห็นได้สำเร็จแต่การทำงานผิดพลาด ตรวจสอบบันทึกผลลัพธ์สำหรับการย่อขนาดอัตโนมัติหรือการแปลงรูปแบบ เนื่องจากการเปลี่ยนแปลงที่รายงานเหล่านั้นอาจส่งผลต่อความเหมาะสมในการพิมพ์ แม้ว่าการแสดงตัวอย่างจะเป็นที่ยอมรับก็ตาม เก็บรักษา PDF ที่มีโครงสร้างไว้เมื่อใดก็ตามที่การค้นหา การเข้าถึง หรือการแก้ไขในอนาคตอาจมีความสำคัญ และสร้างอนุพันธ์แรสเตอร์เป็นเนื้อหาการจัดส่งแบบใช้แล้วทิ้ง แทนที่จะแทนที่แหล่งที่มา ตั้งชื่ออนุพันธ์เหล่านั้นด้วยรูปแบบและขนาด เพื่อไม่ให้ใครเข้าใจผิดเกี่ยวกับชุดรูปภาพที่มีความละเอียดหน้าจอสำหรับเอกสารที่ใช้สำหรับการพิมพ์หรือการเก็บถาวร