पाठ के लिए केस रूपांतरण, अंतर, गिनती, पलायन और रिक्त स्थान की सफ़ाई।
पाठ की सूचियाँ खराब स्थिति में आती हैं। स्प्रैडशीट से चिपकाए गए ईमेल कॉलम में प्रत्येक पंक्ति में पीछे की ओर रिक्त स्थान होते हैं। एक लॉग अंश में डुप्लिकेट पंक्तियाँ हैं। PDF से कॉपी की गई सूची में वाक्यों के बीच में हार्ड लाइन ब्रेक हैं। इनमें से कोई भी कठिन समस्या नहीं है, लेकिन इन्हें चार सौ लाइनों में हाथ से करना दुखद है, और एक बार की सफाई के लिए स्क्रिप्टिंग भाषा तक पहुंचना जितना लगता है उससे धीमा है।
यहां सब कुछ ऊपर बॉक्स में दिए गए टेक्स्ट पर संचालित होता है। प्रत्येक बटन एक परिवर्तन है, जो पूरे पाठ पर लागू होता है, और उनमें से प्रत्येक को पूर्ववत किया जा सकता है। छोटे-छोटे चरणों में काम करें और आगे बढ़ते हुए गिनती जांचें।
ऑर्डर लोगों की अपेक्षा से अधिक मायने रखता है। डी-डुप्लिकेटिंग से पहले ट्रिम करना लगभग हमेशा सही होता है: दो पंक्तियाँ जो केवल अनुगामी स्थान से भिन्न होती हैं, तब तक डुप्लिकेट नहीं होती हैं जब तक कि आप उन्हें ट्रिम नहीं करते हैं, इसलिए पहले डी-डुप्लिकेट करना चुपचाप उन दोनों को जगह पर छोड़ देता है।
इसी तरह, यदि आप एक संक्षिप्त परिणाम चाहते हैं तो सॉर्ट करने से पहले खाली लाइनें हटा दें, क्योंकि खाली लाइनें एक छोर पर सॉर्ट होती हैं और एक अंतर छोड़ देती हैं, फिर आपको उन्हें किसी भी तरह से हटाना होगा।
आपके टाइप करते ही सांख्यिकी पैनल अपडेट हो जाता है। इसमें से अधिकांश स्व-व्याख्यात्मक है, लेकिन वर्ण गणना ध्यान देने योग्य है, क्योंकि यह वह संख्या है जो अधिकांश टूल गलत हो जाते हैं।
कंप्यूटर टेक्स्ट को कोड इकाइयों के अनुक्रम के रूप में संग्रहीत करते हैं, और एक दृश्यमान वर्ण उनमें से कई पर कब्जा कर सकता है। इमोजी 👩💻 एक ऐसी चीज़ है जिसे आप देख सकते हैं, लेकिन यह एक महिला इमोजी, एक अदृश्य जॉइनर और एक लैपटॉप इमोजी - कुल पांच कोड इकाइयों - से बनाया गया है। एक भोला-भाला काउंटर रिपोर्ट करता है 5। यह टूल ग्रैफ़ेम क्लस्टरों की गणना करता है, जो "एक व्यक्ति एक वर्ण को क्या कहेगा" का तकनीकी नाम है, इसलिए यह 1 रिपोर्ट करता है।
यही तर्क चिह्नों के संयोजन से लिखे गए उच्चारण वर्णों और ध्वजांकित इमोजी पर भी लागू होता है। यदि आप एक सीमा के विरुद्ध गिनती कर रहे हैं जो एक अलग प्रणाली लागू करती है - एक डेटाबेस कॉलम, एक SMS गेटवे, एक सामाजिक मंच - तो ध्यान रखें कि अन्य प्रणाली अलग तरह से गिनती कर सकती है।
निष्कर्षण बटन ईमेल, URL या संख्याओं को असंरचित पाठ से बाहर खींचते हैं और आपको उन्हें एक साफ सूची, डी-डुप्लिकेट और उपस्थिति के क्रम में देते हैं।
URL निष्कर्षण पट्टियां वाक्य विराम चिह्न के पीछे होती हैं, इसलिए "https://example.com." पर जाएं, पूर्ण विराम के बिना URL प्राप्त होता है, और यह एक समापन कोष्ठक पर रुकता है, इसलिए कोष्ठक के अंदर URL साफ़ आता है।
ईमेल मिलान संपूर्ण होने के बजाय जानबूझकर व्यावहारिक है। एक वैध ईमेल पते के लिए संपूर्ण विनिर्देश उन निर्माणों की अनुमति देता है जिनका अनिवार्य रूप से कोई भी उपयोग नहीं करता है, और उन सभी का मिलान वास्तविक पाठ पर एक सख्त पैटर्न की तुलना में खराब परिणाम उत्पन्न करता है।
"हैलो वर्ल्ड" को कैमलकेस में परिवर्तित करना आसान है। ParseHTTPResponse2Json को कन्वर्ट करना वह जगह है जहां टूल असहमत हैं, क्योंकि सीमाएं चिह्नित होने के बजाय निहित हैं।
यह टूल तीन संकेतों पर विभाजित होता है: गैर-अक्षर, गैर-अंकीय वर्णों (रिक्त स्थान, हाइफ़न, अंडरस्कोर, विराम चिह्न) का कोई भी रन; एक छोटा अक्षर या अंक जिसके बाद एक बड़ा अक्षर आता है; और अपरकेस अक्षरों की एक श्रृंखला जिसके बाद अपरकेस-फिर-लोअरकेस जोड़ी आती है। वह अंतिम नियम वह है जो पार्सएचटीटीपी-रिस्पॉन्स उत्पन्न करने या पूरे संक्षिप्त नाम को अगले से चिपके हुए एक शब्द के रूप में मानने के बजाय, पार्सएचटीटीपीरेस्पॉन्स में "प्रतिक्रिया" से "HTTP" को सही ढंग से अलग करता है।
इसका परिणाम यह होता है कि साँप के मामले में parseHTTPResponse, parse_http_response और कबाब के मामले में parse-http-response बन जाता है, जो कि अधिकांश स्टाइल गाइड अपेक्षा करते हैं।
शीर्षक केस प्रत्येक शब्द के पहले अक्षर को बड़ा करता है और बाकी को छोटा करता है, इसलिए "हैलो WORLD" "हैलो वर्ल्ड" बन जाता है। यह स्टाइल-गाइड नियमों के बारे में नहीं जानता है जो "का" और "द" लोअरकेस जैसे छोटे शब्द रखते हैं, क्योंकि वे नियम प्रकाशन के अनुसार भिन्न होते हैं और चुपचाप किCAक को लागू करना एक अनुमान होगा।
वाक्य केस सब कुछ छोटा कर देता है और फिर प्रत्येक वाक्य के पहले अक्षर को बड़े अक्षरों में लिख देता है, यह पता लगाता है कि वाक्य पूर्ण विराम, प्रश्न चिह्न और विस्मयादिबोधक चिह्न पर समाप्त होता है, जिसमें उनके पूर्ण-चौड़ाई वाले CJK समकक्ष शामिल हैं। यह ALL CAPS में आए टेक्स्ट के लिए सही विकल्प है।
स्लग ट्रांसफ़ॉर्म एक URL-सुरक्षित पहचानकर्ता उत्पन्न करता है: लोअरकेस, एक्सेंट्स को उनके आधार अक्षरों में मोड़ दिया जाता है, और गैर-अल्फ़ान्यूमेरिक वर्णों के प्रत्येक रन को एक एकल हाइफ़न के साथ बदल दिया जाता है।
एक्सेंट फोल्डिंग वर्णों को विघटित करके और संयोजन चिह्नों को हटाकर किया जाता है, इसलिए "कैफे क्रीम" "कैफे-CR-मी" के बजाय "कैफे-क्रीम" बन जाता है। उच्चारण अक्षरों को पूरी तरह से हटा देना स्लग जेनरेटर में एक आम बग है और यह नामों को खराब कर देता है।
अग्रणी और अनुगामी विभाजक हटा दिए गए हैं, और इमोजी और अन्य प्रतीक हटा दिए गए हैं, क्योंकि उनके पास कोई उपयोगी URL प्रतिनिधित्व नहीं है।
फाइंड-एंड-रिप्लेस के दो मोड हैं। शाब्दिक मोड - डिफ़ॉल्ट - प्रत्येक विशेष वर्ण से बच जाता है, इसलिए "ए.बी" की खोज करने पर बिल्कुल "ए.बी" मिलता है, न कि "एएक्सबी"। रेगेक्स मोड आपके पैटर्न को वैसे ही पास करता है जैसे वह है।
आपके द्वारा टाइप किया गया प्रत्येक पैटर्न एक गार्ड के अंदर संकलित होता है। यदि यह अमान्य है, तो आपको समस्या समझाने वाला एक संदेश मिलता है और आपका पाठ अछूता रहता है। यह जितना लगता है उससे कहीं अधिक मायने रखता है: एक रेगुलर एक्सप्रेशन टाइप करना एक वृद्धिशील प्रक्रिया है, और एक अकेला "(" एक कामकाजी पैटर्न के रास्ते पर एक पूरी तरह से सामान्य मध्यवर्ती स्थिति है। एक टूल जो उस पल में एक अनहेल्ड त्रुटि फेंकता है - या इससे भी बदतर, बॉक्स को साफ़ करता है - अनुपयोगी है।
रेगेक्स मोड में, प्रतिस्थापन $ के साथ कैप्चर समूहों का समर्थन करता है1, $2 और इसी तरह। तिथियों को पुन: स्वरूपित करना विहित उदाहरण है: ढूंढें (\d{4})-(\डी{2})-(\डी{2}) और $ से बदलें3/$2/$1 चालू करने के लिए 2024-01-02 में 02/01/2024.
"संपूर्ण शब्द" विकल्प आपकी खोज को शब्द सीमाओं में लपेटता है, इसलिए "बिल्ली" की खोज बिल्ली शब्द से मेल खाती है, लेकिन "कॉनकैटनेट" के अंदर "बिल्ली" से नहीं।
यह दोनों मोड के साथ कंपोज करता है। शाब्दिक मोड में आपका टेक्स्ट पहले बच जाता है और फिर सीमित हो जाता है; रेगेक्स मोड में आपका पूरा पैटर्न एक समूह के रूप में घिरा हुआ है, इसलिए बिल्ली | कुत्ते जैसे विकल्प केवल पहली शाखा तक सीमा को बांधने के बजाय आपकी अपेक्षा के अनुरूप व्यवहार करते हैं।