ไทย

เอกสาร · PDF ชุดเครื่องมือ

การแยก PDF ตามช่วงหน้าในเบราว์เซอร์: วิธีการทำงาน

· มันทำงานอย่างไร

pdf ช่วงหน้า การประมวลผลเบราว์เซอร์

โครงสร้างออบเจ็กต์ PDF แยกออกเป็นเอกสารช่วงหน้าหลายชุด
ภาพประกอบเวกเตอร์ต้นฉบับ ToolAcre

ช่วงหน้าเช่น 3-7 เป็นคำสั่งเล็กๆ ที่มีผลตามมามากมาย โพสต์นี้จะอธิบายว่าเครื่องมือเบราว์เซอร์เปลี่ยนช่วงนั้นให้เป็น PDF ใหม่ที่มีในตัวเองได้อย่างไร และเหตุใดผลลัพธ์จึงมักจะใหญ่กว่าหรือเล็กกว่าที่คุณคาดไว้

การสแกนแบบยาวหนึ่งครั้ง การจัดแสดงห้าครั้ง — สถานการณ์ทั่วไปที่ PDF ไฟล์เดียวต้องกลายเป็นหลายไฟล์โดยไม่ต้องออกจากเครื่อง

ข้อตกลงที่สแกนมักจะมาในรูปแบบไฟล์ยาวเพียงไฟล์เดียว แม้ว่าการจัดแสดงจะต้องเดินทางไปยังผู้ตรวจสอบหลายคนก็ตาม ตัวแยกยอมรับหนึ่ง PDF สูงสุด 50 MB อ่านลงในแท็บปัจจุบัน และอนุญาตให้แต่ละช่วงที่คั่นด้วยเครื่องหมายจุลภาคกลายเป็นผลลัพธ์แยกกันโดยไม่ต้องส่งสัญญาไปยังบริการอัปโหลด

ขั้นตอนการทำงานนั้นเหมาะสมกับนักกฎหมายชุมชนที่ต้องการเพจ 1-18 เป็นข้อตกลงหลัก 19-25 เป็นกำหนดการ และ 26-40 เป็นลายเซ็น แหล่งที่มายังคงไม่ถูกแตะต้อง การดำเนินการจะสร้างเอกสารใหม่จากหน้าที่เลือก ดังนั้นการตรวจสอบทุกเอาต์พุตมีความสำคัญก่อนที่การสแกนต้นฉบับจะถูกเก็บถาวรหรือแจกจ่าย

วิธีการตีความช่วงของหน้า — ตำแหน่งทางกายภาพของหน้า ช่วงที่รวม และเหตุใดหน้าแรกจึงเป็นหน้า 1 แม้ว่าจะมีป้ายกำกับว่า 'i'

ช่วงใช้ตำแหน่งทางกายภาพและเป็นฐานเดียว: หน้าแรกในไฟล์คือหน้า 1 แม้ว่าส่วนท้ายที่พิมพ์จะระบุว่า “i” หรือไม่มีตัวเลขก็ตาม ตัวเลขธรรมดาจะเลือกหนึ่งหน้า โดยมีปลายทั้งสองของ `2-6` รวมอยู่ด้วย `8-` ไปถึงจุดสิ้นสุด และ `-3` เริ่มต้นที่หน้า 1

โปรแกรมแยกวิเคราะห์จะปฏิเสธโทเค็นที่มีรูปแบบไม่ถูกต้อง ช่วงที่กลับกัน เช่น `7-2` และตำแหน่งที่เกินจำนวนหน้าจริง เครื่องหมายจุลภาคกำหนดเอาต์พุตมากกว่าที่จะรวมการเลือกเท่านั้น ดังนั้น `1-3, 4-6` จึงสร้างไฟล์สองไฟล์ ในขณะที่ `1-6` สร้างหนึ่งไฟล์ ช่วงที่ทับซ้อนกันจงใจคัดลอกเพจที่แชร์ไปมากกว่าหนึ่งส่วน

แยกชุดย่อยของแผนผังหน้า - วิธีที่เครื่องมือสร้างเอกสารใหม่ที่มีเฉพาะหน้าที่คุณขอ

ก่อนที่จะเขียนสิ่งใดใหม่ ตัวแยกวิเคราะห์ช่วงจะแปลงแต่ละกลุ่มที่ร้องขอให้เป็นดัชนีหน้าแบบศูนย์ จากนั้นผู้ปฏิบัติงานจะสร้าง PDF ใหม่สำหรับกลุ่มนั้น คัดลอกเพจที่มีชื่อด้วย pdf-lib และจัดลำดับผลลัพธ์ เพจที่ไม่มีชื่อจะไม่ถูกแจกจ่ายซ้ำที่อื่น ช่องว่างเป็นคำสั่งที่ถูกต้องในการละเนื้อหาออก

การคัดลอกหน้าจะรักษาเนื้อหาของหน้า ขนาด การหมุนที่มีอยู่ ข้อความที่เลือกได้ และภาพที่ฝังไว้ซึ่งใช้โดยหน้าเหล่านั้น มันไม่ได้สร้างบุ๊กมาร์ก สิ่งที่แนบมาระดับเอกสาร หรือคำจำกัดความของแบบฟอร์มขึ้นมาใหม่ แต่ละส่วนเป็นไฟล์ใหม่และลายเซ็นดิจิทัลที่ป้อนเข้าจะไม่รับรองความถูกต้องของไบต์ที่เขียนใหม่เหล่านั้นอีกต่อไป

เหตุใดขนาดเอาต์พุตจึงแตกต่างกันเมื่อแต่ละช่วงกลายเป็นเอกสารใหม่

เวิร์กบุคแอตทริบิวต์ขนาดแตกต่างกันโดยเฉพาะกับทรัพยากรที่ใช้ร่วมกันที่ซ้ำกัน แต่การใช้งานไม่ได้เปิดเผยการบัญชีนั้น ข้อสังเกตที่สามารถป้องกันได้คือทุกช่วงจะถูกบันทึกเป็น PDF ใหม่ และขนาดเอาต์พุตไม่จำเป็นต้องแบ่งตามสัดส่วนของจำนวนหน้า หน้าที่สแกนและหน้าเวกเตอร์จะมีปริมาณข้อมูลที่แตกต่างกันมาก

หลายส่วนถูกวางไว้ใน ZIP พร้อมด้วยรายการที่จัดเก็บและไม่มีการบีบอัด เนื่องจาก PDF มีสตรีมที่บีบอัดอยู่แล้ว ไฟล์เก็บถาวรทำให้การจัดส่งง่ายขึ้น มันไม่ใช่การส่งผ่านการบีบอัด คาดว่ารายการที่รวมกันจะยังคงอยู่ใกล้ขนาดที่บันทึกไว้ และไม่รับประกันว่าการแยกจะทำให้เอกสารขนาดใหญ่มีขนาดเล็กลงอย่างมาก

แยกและแตกไฟล์ — แบ่งไฟล์ออกเป็นส่วนๆ เปรียบเทียบกับการดึงหน้าที่เลือกเป็นไฟล์ใหม่ไฟล์เดียว และเมื่อแต่ละไฟล์มีขนาดพอดี

แยกและแยกคำตอบสำหรับคำถามการจัดส่งที่แตกต่างกัน Split ถือว่าแต่ละกลุ่มที่คั่นด้วยเครื่องหมายจุลภาคเป็นเอกสารที่แยกจากกัน แยกยอมรับรายการหน้าและเขียนหน้าที่ตั้งชื่อทั้งหมดลงใน PDF ใหม่ ใช้การแบ่งสำหรับการจัดแสดงหรือบทต่างๆ ใช้สารสกัดเมื่อผู้รับควรได้รับแพ็คเก็ตกระชับหนึ่งชุดที่ประกอบจากตำแหน่งที่กระจัดกระจาย

ความแตกต่างนี้ยังควบคุมรูปแบบการดาวน์โหลดอีกด้วย ช่วงการแยกหนึ่งช่วงส่งคืน PDF โดยมีคำต่อท้าย `-part-1` สองช่วงขึ้นไปส่งคืนไฟล์เก็บถาวร `-split.zip` สารสกัดจะคืนค่าหนึ่ง `-pages.pdf` เสมอ การเลือกการดำเนินการโดยเจตนาจะป้องกันการรวมกลุ่มที่ไม่คาดคิดก่อนถึงกำหนดเวลายื่น

ตัวอย่างการทำงาน — แบ่งข้อตกลงที่สแกนสี่สิบหน้าออกเป็นหน้าลายเซ็น กำหนดการ และเนื้อหาหลัก

สำหรับข้อตกลงสี่สิบหน้า ข้อกำหนดเชิงปฏิบัติอาจเป็น `1-24, 25-34, 35-40` เครื่องมือจะตรวจสอบความถูกต้องของทั้งสามกลุ่มโดยเทียบกับสี่สิบหน้า สร้าง PDF ใหม่สามไฟล์ตามลำดับที่เป็นลายลักษณ์อักษร และจัดแพคเกจไว้ใน ZIP ไฟล์เดียว หมายเลขชิ้นส่วนเป็นไปตามลำดับช่วง ไม่ใช่หมายเลขหน้าต้นฉบับที่พิมพ์บนแผ่นงาน

เปิดทุกส่วนหลังจากดาวน์โหลด ยืนยันว่าเนื้อหาหลักสิ้นสุดตามที่ตั้งใจไว้ กำหนดการเริ่มต้นด้วยส่วนหัว และหน้าลายเซ็นจะรักษาการวางแนวที่ถูกต้อง หากฉลากที่พิมพ์ออกมาแตกต่างจากตำแหน่งทางกายภาพ ให้กำหนดออฟเซ็ตก่อนดำเนินการแยก เครื่องมือทำงานตามลำดับแผนผังเพจที่สามารถอ่านได้จริง

สิ่งนี้ไม่ครอบคลุม — การแยกตามบุ๊กมาร์กหรือตามเนื้อหาที่ตรวจพบ ซึ่งจำเป็นต้องมีโครงสร้างไฟล์ที่สแกนจำนวนมากไม่มี

ตัวแยกนี้ไม่แบ่งที่บุ๊กมาร์ก ส่วนหัว ข้อความที่ตรวจพบ หรือตัวแยกภาพ คำขอเหล่านั้นจำเป็นต้องมีโครงสร้างที่เชื่อถือได้หรือการจดจำเนื้อหา ในขณะที่การสแกนต้นฉบับจำนวนมากมีเพียงรูปภาพหน้าเท่านั้น นอกจากนี้ยังปฏิเสธไฟล์ PDF ที่เข้ารหัสหรือป้องกันด้วยรหัสผ่าน แทนที่จะข้ามการควบคุมการเข้าถึง ปลดล็อคสำเนาที่ได้รับอนุญาตในแอปพลิเคชันต้นทางก่อน

ไม่มี OCR การจัดประเภทเนื้อหา หรือประวัติฝั่งเซิร์ฟเวอร์ ค่าสูงสุดที่ยอมรับคือ 50 MB สำหรับอินพุต PDF โดยการทำงานจริงยังถูกจำกัดด้วยหน่วยความจำอุปกรณ์เพิ่มเติม ข้อกำหนดการเก็บถาวรหรือการเข้าถึงที่ซับซ้อนควรได้รับการตรวจสอบในซอฟต์แวร์เฉพาะทางหลังจากการเลือกระดับเพจเสร็จสิ้น

การแยกจะสร้างแต่ละช่วงที่เลือกขึ้นใหม่ภายในเครื่อง และละเว้นโครงสร้างระดับเอกสาร

การแยกเป็นลำดับของการสร้างใหม่ที่มีการควบคุม: แยกวิเคราะห์ช่วงรวม คัดลอกแต่ละกลุ่มลงในเอกสารใหม่ ทำให้เป็นอนุกรม และจัดแพคเกจเอาต์พุตหลายรายการเมื่อจำเป็น ซึ่งอธิบายว่าทำไมคุณภาพของหน้ายังคงเหมือนเดิม ในขณะที่การนำทางและลายเซ็นระดับเอกสารไม่เหมือนเดิม นอกจากนี้ยังอธิบายด้วยว่าเหตุใดลูกน้ำจึงมีผลกระทบเชิงโครงสร้าง

ชุดเครื่องมือ PDF ดำเนินการเปลี่ยนแปลงดังกล่าวใน Web Worker บนอุปกรณ์ โค้ดของมันไม่ได้ร้องขอให้มีไบต์ของเอกสาร แม้ว่าการวิเคราะห์ที่ได้รับความยินยอมอาจโหลดบนโฮสต์ที่ใช้งานจริงตามรูปแบบบัญญัติ และไม่รวมชื่อไฟล์และเนื้อหาจากเหตุการณ์ ToolAcre ล้างไฟล์ในภายหลังเพื่อปล่อยบัฟเฟอร์และยุติการทำงานของผู้ปฏิบัติงาน เก็บ ZIP ไว้จนกว่าจะเปิดทุกช่วง เนื่องจากแท็บจะไม่เก็บสำเนาการกู้คืนของเอาต์พุตที่ไม่เคยดาวน์โหลด ตรวจสอบชื่อไฟล์ด้วย