हिन्दी

टेक्स्ट और रोजमर्रा के टूल · टेक्स्ट टूलकिट

पूर्ण-चौड़ाई विराम चिह्न: वाक्य मामले और गिनती के लिए क्यों 。 और ! मायने रखता है

· पेजभूमि

पाठ टूल यूनिकोड सीजेके-विराम चिह्न

अंग्रेजी और जापानी वाक्यों को ASCII और पूर्ण-चौड़ाई वाले विराम चिह्नों द्वारा अलग किया गया है
मूल ToolAcre वेक्टर चित्रण

समझाता है कि पूर्ण-चौड़ाई और वैचारिक विराम चिह्न क्या हैं, CJK पाठ उनका उपयोग क्यों करता है, और क्यों एक वाक्य-केस कन्वर्टर या वाक्य काउंटर जो केवल ASCII पूर्ण विराम जानता है, द्विभाषी पाठ गलत हो जाता है।

जापानी अनुच्छेद को एक वाक्य के रूप में गिना जाता है - कैसे ASCII-केवल टूल छूट जाते हैं 。 और ! पूरी तरह से

`Release ready. 次の版です。確認してください!` को ऐसे काउंटर में चिपकाएं जो केवल ASCII पूर्ण विराम को पहचानता है और जापानी भाग को एक लंबे शेष में समाहित किया जा सकता है। दिखाई देने वाले निशान सजावटी रूप नहीं हैं: वे पाठक द्वारा उपयोग की जाने वाली सीमाएँ हैं, इसलिए उन्हें अनदेखा करने से कुल मिलाकर एक भ्रामक वाक्य उत्पन्न होता है।

ToolAcre में इसके वाक्य-मिलान सेट में `.`, `!`, `?`, `。`, `!` और `?` शामिल हैं। यह विशिष्ट ASCII-केवल विफलता को ठीक करता है, लेकिन यह काउंटर को जापानी पार्सर नहीं बनाता है। परिणाम अभी भी मान्यता प्राप्त विराम चिह्नों द्वारा विभाजित पाठ के रनों से आता है, जिसमें कोई व्याकरणिक मॉडल यह तय नहीं करता है कि कोई विचार कहाँ समाप्त होता है।

आधी-चौड़ाई और पूरी-चौड़ाई - निश्चित-पिच CJK टाइपसेटिंग की विरासत और यूनिकोड ब्लॉक जो इसे ले जाते हैं

"पूर्ण-चौड़ाई" निश्चित-चौड़ाई वाले पूर्वी एशियाई लेआउट में एक विचारधारा सेल से जुड़ी चौड़ाई पर कब्जा करने के लिए डिज़ाइन किए गए वर्णों का वर्णन करती है। यूनिकोड `!` और `?` जैसे संगतता रूपों को संरक्षित करता है, जबकि जापानी `。` और `、` सहित वैचारिक विराम चिह्न का भी उपयोग करता है। समान उपस्थिति का मतलब समान कोड बिंदु या विनिमेय शब्दार्थ नहीं है।

यूनिकोड मानक हाफविड्थ और फुलविड्थ फॉर्म ब्लॉक में फुलविड्थ ASCII वेरिएंट रखता है, जबकि U+3002 IDEOGRAPHIC FULL STOP और U+3001 IDEOGRAPHIC COMMA CJK प्रतीक और विराम चिह्न से संबंधित हैं। सॉफ़्टवेयर के लिए यह अंतर मायने रखता है: एक रेगुलर एक्सप्रेशन को उन वास्तविक वर्णों का नाम या वर्गीकरण करना चाहिए जिन्हें वह पहचानना चाहता है।

वैचारिक पूर्ण विराम और उसके रिश्तेदार - 。、!? और ASCII विराम चिह्न के पूर्ण-चौड़ाई वाले रूप

`。` आम तौर पर एक जापानी वाक्य को बंद कर देता है, `、` एक के भीतर सामग्री को अलग कर देता है, और `!?` आधुनिक प्रतिलिपि में परिचित प्रश्न और विस्मयादिबोधक रूप प्रदान करता है। पूर्ण-चौड़ाई `!` और `?` दृष्टिगत रूप से ASCII चिह्नों के विस्तृत संस्करणों से मेल खाते हैं; वे केवल इसलिए स्वचालित रूप से परिवर्तित नहीं होते क्योंकि एक एडिटर उन्हें समान आकार में प्रदर्शित करता है।

ToolAcre `。!?` को वाक्य समाप्तिकर्ता मानता है, लेकिन `、` को नहीं, जो इसके संकीर्ण गिनती नियम के लिए उपयुक्त है। दोहराए गए टर्मिनेटरों को पूर्ववर्ती पाठ के साथ एक मिलान किए गए रन के रूप में उपयोग किया जाता है, इसलिए `本当!?` दो के बजाय एक वाक्य का योगदान देता है। उद्धरण, कोष्ठक और एडिटरीय सम्मेलनों की कोई अलग भाषाई व्याख्या नहीं होती है।

वाक्य-जागरूक परिवर्तन के लिए क्या आवश्यक है - पूंजीकरण या गिनती से पहले स्क्रिप्ट में वाक्य के अंत को पहचानना

सेंटेंस केस पहले पूरे इनपुट को लोअर-केस में बदल देता है। इसके बाद यह शुरुआत में या छह मान्यता प्राप्त टर्मिनेटरों में से किCAक के बाद एक लोअर-केस अक्षर को बड़े अक्षरों में लिखता है, जब उस टर्मिनेटर के बाद व्हाइटस्पेस होता है। इसलिए `hello。 world` `Hello。 World` हो जाता है, जबकि `hello。world` दूसरा अंग्रेजी शब्द लोअर-केस छोड़ देता है।

वह रिक्त स्थान की स्थिति रूपरेखा के व्यापक दावे को सही करती है कि अंत को पहचानना पर्याप्त है। जापानी आमतौर पर अगला वाक्य `。` के तुरंत बाद शुरू करते हैं, बिना किसी स्थान के, और जापानी अक्षरों में आमतौर पर कोई अपरकेस रूप नहीं होता है। मिश्रित प्रतिलिपि में, रिक्त स्थान केवल तभी जोड़ें जब एडिटरीय शैली की आवश्यकता हो; इसे केवल रूपांतरण बढ़ाने के लिए न डालें।

यह वाक्य-केस परिवर्तन वास्तव में क्या पहचानता है: एक टर्मिनेटर जिसके बाद रिक्त स्थान आता है

आकृति शब्द रिक्त स्थान-पृथक रन का उपयोग करता है। इसलिए रिक्त स्थान के बिना एक जापानी मार्ग को एक "शब्द" के रूप में गिना जा सकता है, भले ही कोई पाठक कई शाब्दिक इकाइयों की पहचान करता हो। इसके विपरीत, आसपास के खाली स्थान के बिना विराम चिह्न एक रन को विभाजित नहीं करता है: `end,start` इस परिभाषा के तहत एक शब्द है। संख्या यांत्रिक है, भाषा-जागरूक टोकन गिनती नहीं।

वाक्य गिनती भी विराम चिह्न आधारित है। `Dr. Smith` में पूर्ण विराम एक अतिरिक्त वाक्य बना सकता है, जबकि बिना विराम चिह्न वाला लाइन ब्रेक कोई नई वाक्य सीमा नहीं बनाता है। काउंटर CJK टर्मिनेटर और दोहराए गए चिह्नों को पहचानता है, लेकिन उद्धरण, संक्षिप्ताक्षर, दीर्घवृत्त और विकृत विराम चिह्न अभी भी इसके आउटपुट को एडिटरीय निर्णय से भिन्न बना सकते हैं।

रिक्त स्थान, शब्द और विराम चिह्न-आधारित गिनती: स्पष्ट सीमाओं के साथ उपयोगी आंकड़े

टेक्स्ट टूलकिट में `LAUNCH READY. 次の版です。 check names! FINAL PASS?` आज़माएं। वाक्य का मामला `Launch ready. 次の版です。 Check names! Final pass?` उत्पन्न करता है: सभी केस किए गए पाठ को पहले नीचे किया जाता है, फिर टर्मिनेटर-प्लस-स्पेस सीमाओं के बाद शुरुआती अक्षरों को ऊपर उठाया जाता है। जापानी पाठ दृष्टिगत रूप से अपरिवर्तित रहता है क्योंकि इसमें कोई केस भेद नहीं है।

उस परिणाम के बगल में मौजूद आँकड़ों को परिभाषा के रूप में पढ़ें, निर्णय के रूप में नहीं। नमूने में चार विराम चिह्न-सीमांकित वाक्य हैं, जबकि इसका शब्द कुल जापानी आकृति विज्ञान के बजाय पांच रिक्त स्थान-पृथक खंडों का अनुसरण करता है। वर्ण योग ग्रेफेम क्लस्टर का उपयोग करते हैं जहां `Intl.Segmenter` उपलब्ध है, और नो-स्पेस कुल पुनर्गणना से पहले यूनिकोड व्हाइटस्पेस को हटा देता है।

व्यावहारिक उदाहरण: भाषाई विश्लेषण मानने के बजाय परिवर्तन और प्रत्येक गणना का निरीक्षण करें

यह व्यवहार जापानी लाइन-ब्रेकिंग नियमों, ऊर्ध्वाधर संरचना, रूबी एनोटेशन या किंसोकू शोरी प्रतिबंधों को लागू नहीं करता है जहां विराम चिह्न दिखाई दे सकते हैं। यह आधी-चौड़ाई और पूर्ण-चौड़ाई वाले वर्णों को भी सामान्य नहीं करता है। यदि प्रकाशन के लिए टाइपोग्राफी जांच की आवश्यकता होती है, तो पाठ परिवर्तन के बाद स्पष्ट जापानी-भाषा समर्थन वाले एडिटर या लेआउट सिस्टम का उपयोग करें।

स्थानीय-विशिष्ट आवरण भी वादे से बाहर है। कन्वर्टर डिफ़ॉल्ट JavaScript यूनिकोड मैपिंग, लोअर-केस उचित संज्ञा और संक्षिप्ताक्षरों का उपयोग करता है, और जब व्हाइटस्पेस इसका अनुसरण करता है तो वाक्य सीमा के लिए एक संक्षिप्त सीमा की गलती हो सकती है। पूर्ववत करना उपलब्ध है, लेकिन नामों, ब्रांडेड बड़े अक्षरों और द्विभाषी शैली के निर्णयों के लिए एडिटरीय समीक्षा आवश्यक है।

टेकअवे - टेक्स्ट टूलकिट का वाक्य मामला पूर्ण-चौड़ाई वाले CJK वाक्य के अंत को पहचानता है, इसलिए आधे-अधूरे के बजाय द्विभाषी प्रतिलिपि को संभाला जाता है

पूर्ण-चौड़ाई वाले विराम चिह्न मायने रखते हैं क्योंकि कोड वर्णों को देखता है, दृश्य इरादों को नहीं। ToolAcre अपने विराम-आधारित वाक्य मिलान में स्पष्ट रूप से `。!?` शामिल करता है, इसलिए मिश्रित अंग्रेजी-जापानी प्रतिलिपि ASCII अंत तक सीमित नहीं है। इसका वाक्य मामले का नियम संकीर्ण है: पूंजीकरण केवल प्रारंभ में या किसी मान्यता प्राप्त टर्मिनेटर के बाद रिक्त स्थान के बाद होता है।

उन नियमों को शीघ्रता से उजागर करने के लिए टेक्स्ट टूलकिट का उपयोग करें, फिर संदर्भ में प्रत्येक आंकड़े की व्याख्या करें। वाक्य योग सीमांकक अनुमान हैं, शब्द रिक्त स्थान से अलग किए गए रन हैं, और जब ब्राउज़र समर्थन अनुमति देता है तो वर्ण पाठक-कथित ग्रैफेम होते हैं। वे पारदर्शी सीमाएँ आउटपुट को उपयोगी बनाती हैं, बिना यह दिखावा किए कि एक कॉम्पैक्ट ब्राउज़र फ़ंक्शन पूर्ण भाषाई विश्लेषण करता है।