दस्तावेज़ · PDF टूलकिट
ब्राउज़र में पेज रेंज द्वारा PDF को विभाजित करना: यह कैसे काम करता है
· यह काम किस प्रकार करता है
PDF पेज-कैटेगरी ब्राउज़र-प्रसंस्करण
3-7 जैसी पेज कैटेगरी बहुत सारे परिणामों वाला एक छोटा निर्देश है। यह पोस्ट बताती है कि कैसे एक ब्राउज़र टूल उस रेंज को एक नए, स्व-निहित PDF में बदल देता है, और क्यों आउटपुट अक्सर आपकी अपेक्षा से बड़ा या छोटा होता है।
एक लंबा स्कैन, पांच प्रदर्शन - सामान्य स्थिति जहां एक PDF को आपकी मशीन को छोड़े बिना कई फाइलें बननी पड़ती हैं
एक स्कैन किया गया समझौता अक्सर एक लंबी फ़ाइल के रूप में आता है, तब भी जब इसके प्रदर्शन को विभिन्न समीक्षकों के पास जाना पड़ता है। स्प्लिटर 50 MB तक एक PDF को स्वीकार करता है, इसे वर्तमान टैब में पढ़ता है, और अपलोड सेवा को अनुबंध भेजे बिना प्रत्येक अल्पविराम से अलग की गई सीमा को एक अलग परिणाम बनने देता है।
वह वर्कफ़्लो एक पैरालीगल के लिए उपयुक्त है, जिसे मुख्य समझौते के रूप में पेज 1-18, शेड्यूल के रूप में 19-25 और हस्ताक्षर के रूप में 26-40 की आवश्यकता होती है। स्रोत अछूता रहता है. ऑपरेशन चयनित पेजों से नए दस्तावेज़ बनाता है, इसलिए मूल स्कैन को संग्रहीत या वितरित करने से पहले प्रत्येक आउटपुट की जांच करना मायने रखता है।
पेज कैटेगरी की व्याख्या कैसे की जाती है - भौतिक पेज स्थिति, समावेशी कैटेगरी, और पहला पेज पेज 1 क्यों है, भले ही उस पर 'i' लेबल हो
कैटेगरी भौतिक स्थितियों का उपयोग करती हैं और एक-आधारित होती हैं: फ़ाइल में पहला पेज पेज 1 है, भले ही इसके मुद्रित पाद लेख में "i" लिखा हो या कोई संख्या न हो। एक सादा नंबर एक पेज का चयन करता है, `2-6` के दोनों सिरे शामिल होते हैं, `8-` अंत तक पहुंचता है, और `-3` पेज 1 से शुरू होता है।
पार्सर विकृत टोकन, `7-2` जैसे उलटे स्पैन और वास्तविक पेज संख्या से परे की स्थिति को अस्वीकार कर देता है। अल्पविराम केवल चयनों को जोड़ने के बजाय आउटपुट को परिभाषित करते हैं। इस प्रकार `1-3, 4-6` दो फ़ाइलें तैयार करता है, जबकि `1-6` एक फ़ाइल बनाता है; ओवरलैपिंग कैटेगरी जानबूझकर साझा किए गए पेजों को एक से अधिक भागों में कॉपी करती हैं।
पेज ट्री का सबसेट निकालना - कैसे टूल एक नया दस्तावेज़ बनाता है जिसमें केवल आपके द्वारा मांगे गए पेज होते हैं
कुछ भी दोबारा लिखने से पहले, रेंज पार्सर प्रत्येक अनुरोधित समूह को शून्य-आधारित पेज इंडेक्स में परिवर्तित करता है। फिर कार्यकर्ता उस समूह के लिए एक नया PDF बनाता है, नामित पेजों को PDF-लिब के साथ कॉपी करता है, और परिणाम को क्रमबद्ध करता है। अनाम पेजों को अन्यत्र पुनर्वितरित नहीं किया जाता है; सामग्री को बाहर छोड़ने के लिए अंतराल एक वैध निर्देश है।
पेज प्रतिलिपि उन पेजों द्वारा उपयोग की जाने वाली दृश्यमान पेज सामग्री, आयाम, मौजूदा रोटेशन, चयन योग्य पाठ और एम्बेडेड इमेजरी को संरक्षित करती है। यह बुकमार्क, दस्तावेज़-स्तरीय अनुलग्नक, या प्रपत्र परिभाषाओं का पुनर्निर्माण नहीं करता है। प्रत्येक भाग एक नई फ़ाइल है, और इनपुट डिजिटल हस्ताक्षर अब उन नए लिखे गए बाइट्स को प्रमाणित नहीं करता है।
जब प्रत्येक कैटेगरी एक ताज़ा दस्तावेज़ बन जाती है तो आउटपुट आकार भिन्न क्यों होता है?
कार्यपुस्तिका विशेष रूप से डुप्लिकेट किए गए साझा संसाधनों के आकार के अंतर को दर्शाती है, लेकिन कार्यान्वयन उस लेखांकन को उजागर नहीं करता है। रक्षात्मक अवलोकन यह है कि प्रत्येक कैटेगरी को ताज़ा PDF के रूप में सहेजा जाता है और आउटपुट आकार को पेज संख्या के अनुपात में विभाजित करने की आवश्यकता नहीं होती है। स्कैन किए गए पेज और वेक्टर पेज बहुत अलग मात्रा में डेटा ले जाते हैं।
ZIP में संग्रहीत, असंपीड़ित प्रविष्टियों के साथ कई हिस्सों को रखा गया है क्योंकि PDF में पहले से ही संपीड़ित धाराएं होती हैं। पुरालेख वितरण को सरल बनाता है; यह एक संपीड़न पास नहीं है. उम्मीद करें कि संयुक्त प्रविष्टियाँ अपने स्वयं के सहेजे गए आकार के पास रहें, और यह वादा न करें कि विभाजन से एक बड़ा दस्तावेज़ वास्तव में छोटा हो जाएगा।
विभाजित बनाम निकालें - चयनित पेजों को एक नई फ़ाइल में खींचने की तुलना में फ़ाइल को भागों में विभाजित करना, और जब प्रत्येक फिट बैठता है
अलग-अलग डिलीवरी प्रश्नों के उत्तर विभाजित करें और निकालें। स्प्लिट प्रत्येक अल्पविराम से अलग किए गए समूह को एक अलग दस्तावेज़ के रूप में मानता है। एक्स्ट्रैक्ट एक पेज सूची स्वीकार करता है और सभी नामित पेजों को एक नए PDF में लिखता है। कई प्रदर्शनों या अध्यायों के लिए स्प्लिट का उपयोग करें; अर्क का उपयोग तब करें जब प्राप्तकर्ता को बिखरे हुए स्थानों से इकट्ठा किया गया एक संक्षिप्त पैकेट प्राप्त होना चाहिए।
भेद डाउनलोड आकार को भी नियंत्रित करता है। एक विभाजित कैटेगरी `-part-1` प्रत्यय के साथ PDF लौटाती है। दो या अधिक कैटेगरी `-split.zip` संग्रह लौटाती हैं। एक्स्ट्रैक्ट हमेशा एक `-pages.pdf` लौटाता है। ऑपरेशन का चयन जानबूझकर फ़ाइलिंग समय सीमा से ठीक पहले एक अप्रत्याशित बंडल को रोकता है।
कारगर उदाहरण - एक चालीस पेज के स्कैन किए गए समझौते को हस्ताक्षर पेजों, शेड्यूल और मुख्य भाग में विभाजित करना
चालीस पेज के समझौते के लिए, एक व्यावहारिक विशिष्टता `1-24, 25-34, 35-40` हो सकती है। टूल चालीस पेजों के सभी तीन समूहों को मान्य करता है, उस लिखित क्रम में तीन नAPडीएफ बनाता है, और उन्हें एक ZIP में पैकेज करता है। भाग संख्याएँ कैटेगरी क्रम का पालन करती हैं, शीटों पर मुद्रित मूल पेज संख्याओं का नहीं।
डाउनलोड करने के बाद हर भाग को खोलें। पुष्टि करें कि मुख्य भाग वहीं समाप्त होता है जहां इरादा था, शेड्यूल उनके शीर्षकों से शुरू होता है, और हस्ताक्षर पेज सही अभिविन्यास बनाए रखते हैं। यदि मुद्रित लेबल भौतिक स्थिति से भिन्न हैं, तो विभाजन चलाने से पहले ऑफसेट निर्धारित करें; यह टूल पेज ट्री क्रम पर काम करता है जिसे यह वास्तव में पढ़ सकता है।
इसमें क्या शामिल नहीं है - बुकमार्क द्वारा या खोजी गई सामग्री द्वारा विभाजन, जिसके लिए संरचना की आवश्यकता होती है जो कई स्कैन की गई फ़ाइलों में नहीं होती है
यह स्प्लिटर बुकमार्क, शीर्षकों, खोजे गए टेक्स्ट या विज़ुअल सेपरेटर पर विभाजित नहीं होता है। उन अनुरोधों के लिए भरोसेमंद संरचना या सामग्री पहचान की आवश्यकता होती है, जबकि कई स्रोत स्कैन में केवल पेज छवियां होती हैं। यह एक्सेस नियंत्रणों को दरकिनार करने के बजाय एन्क्रिप्टेड या पासवर्ड-संरक्षित PDF को भी अस्वीकार कर देता है; पहले इसके मूल एप्लिकेशन में एक अधिकृत प्रति अनलॉक करें।
कोई OCR, सामग्री वर्गीकरण या सर्वर-साइड इतिहास नहीं है। इनपुट PDF के लिए स्वीकृत अधिकतम 50 MB है, व्यावहारिक कार्य अतिरिक्त रूप से डिवाइस मेमोरी द्वारा सीमित है। पेज-स्तरीय चयन पूरा होने के बाद जटिल अभिलेखीय या पहुंच संबंधी आवश्यकताओं को विशेषज्ञ सॉफ़्टवेयर में मान्य किया जाना चाहिए।
एक विभाजन स्थानीय रूप से प्रत्येक चयनित कैटेगरी का पुनर्निर्माण करता है और दस्तावेज़-स्तरीय संरचनाओं को छोड़ देता है
स्प्लिट नियंत्रित पुनर्निर्माणों का एक क्रम है: समावेशी कैटेगरी को पार्स करें, प्रत्येक समूह को एक नए दस्तावेज़ में कॉपी करें, इसे क्रमबद्ध करें, और आवश्यक होने पर कई आउटपुट पैकेज करें। यह बताता है कि पेज की गुणवत्ता बरकरार रहती है जबकि दस्तावेज़-स्तरीय नेविगेशन और हस्ताक्षर नहीं। यह यह भी बताता है कि अल्पविराम के संरचनात्मक परिणाम क्यों होते हैं।
PDF टूलकिट डिवाइस पर वेब वर्कर में उन परिवर्तनों को निष्पादित करता है। इसका कोड दस्तावेज़ बाइट्स ले जाने का कोई अनुरोध नहीं करता है, हालांकि सहमति प्राप्त विश्लेषण विहित उत्पादन होस्ट पर लोड हो सकता है और फ़ाइल नाम और सामग्री को ToolAcre ईवेंट से बाहर कर देता है। बफ़र्स जारी करने और कार्यकर्ता को समाप्त करने के लिए बाद में फ़ाइलें साफ़ करें। ZIP को तब तक रखें जब तक कि प्रत्येक कैटेगरी खुल न जाए, क्योंकि टैब उस आउटपुट की कोई पुनर्प्राप्ति प्रतिलिपि नहीं रखता है जिसे कभी डाउनलोड नहीं किया गया था। फ़ाइल नाम भी सत्यापित करें.