हिन्दी

टेक्स्ट टूलकिट

पाठ के लिए केस रूपांतरण, अंतर, गिनती, पलायन और रिक्त स्थान की सफ़ाई।

इससे समस्या हल हो जाती है

पाठ की सूचियाँ खराब स्थिति में आती हैं। स्प्रैडशीट से चिपकाए गए ईमेल कॉलम में प्रत्येक पंक्ति में पीछे की ओर रिक्त स्थान होते हैं। एक लॉग अंश में डुप्लिकेट पंक्तियाँ हैं। PDF से कॉपी की गई सूची में वाक्यों के बीच में हार्ड लाइन ब्रेक हैं। इनमें से कोई भी कठिन समस्या नहीं है, लेकिन इन्हें चार सौ लाइनों में हाथ से करना दुखद है, और एक बार की सफाई के लिए स्क्रिप्टिंग भाषा तक पहुंचना जितना लगता है उससे धीमा है।

यहां सब कुछ ऊपर बॉक्स में दिए गए टेक्स्ट पर संचालित होता है। प्रत्येक बटन एक परिवर्तन है, जो पूरे पाठ पर लागू होता है, और उनमें से प्रत्येक को पूर्ववत किया जा सकता है। छोटे-छोटे चरणों में काम करें और आगे बढ़ते हुए गिनती जांचें।

एक सामान्य सफ़ाई, क्रम में

ऑर्डर लोगों की अपेक्षा से अधिक मायने रखता है। डी-डुप्लिकेटिंग से पहले ट्रिम करना लगभग हमेशा सही होता है: दो पंक्तियाँ जो केवल अनुगामी स्थान से भिन्न होती हैं, तब तक डुप्लिकेट नहीं होती हैं जब तक कि आप उन्हें ट्रिम नहीं करते हैं, इसलिए पहले डी-डुप्लिकेट करना चुपचाप उन दोनों को जगह पर छोड़ देता है।

इसी तरह, यदि आप एक संक्षिप्त परिणाम चाहते हैं तो सॉर्ट करने से पहले खाली लाइनें हटा दें, क्योंकि खाली लाइनें एक छोर पर सॉर्ट होती हैं और एक अंतर छोड़ देती हैं, फिर आपको उन्हें किसी भी तरह से हटाना होगा।

  1. अपना टेक्स्ट बॉक्स में चिपकाएँ.
  2. अग्रणी और अनुगामी रिक्त स्थान को हटाने के लिए, लाइनों को ट्रिम करें।
  3. खाली पंक्तियाँ हटाएँ.
  4. डुप्लिकेट हटाएं - अब ट्रिमिंग ने वास्तविक डुप्लिकेट को समान बना दिया है।
  5. यदि क्रम मायने नहीं रखता है, तो परिणाम को स्कैन करना आसान बनाने के लिए A→Z को क्रमबद्ध करें।
  6. पंक्ति संख्या जांचें, फिर कॉपी करें या डाउनलोड करें।

चीजों की सही गिनती करना

आपके टाइप करते ही सांख्यिकी पैनल अपडेट हो जाता है। इसमें से अधिकांश स्व-व्याख्यात्मक है, लेकिन वर्ण गणना ध्यान देने योग्य है, क्योंकि यह वह संख्या है जो अधिकांश टूल गलत हो जाते हैं।

कंप्यूटर टेक्स्ट को कोड इकाइयों के अनुक्रम के रूप में संग्रहीत करते हैं, और एक दृश्यमान वर्ण उनमें से कई पर कब्जा कर सकता है। इमोजी 👩‍💻 एक ऐसी चीज़ है जिसे आप देख सकते हैं, लेकिन यह एक महिला इमोजी, एक अदृश्य जॉइनर और एक लैपटॉप इमोजी - कुल पांच कोड इकाइयों - से बनाया गया है। एक भोला-भाला काउंटर रिपोर्ट करता है 5। यह टूल ग्रैफ़ेम क्लस्टरों की गणना करता है, जो "एक व्यक्ति एक वर्ण को क्या कहेगा" का तकनीकी नाम है, इसलिए यह 1 रिपोर्ट करता है।

यही तर्क चिह्नों के संयोजन से लिखे गए उच्चारण वर्णों और ध्वजांकित इमोजी पर भी लागू होता है। यदि आप एक सीमा के विरुद्ध गिनती कर रहे हैं जो एक अलग प्रणाली लागू करती है - एक डेटाबेस कॉलम, एक SMS गेटवे, एक सामाजिक मंच - तो ध्यान रखें कि अन्य प्रणाली अलग तरह से गिनती कर सकती है।

चीजें निकालना

निष्कर्षण बटन ईमेल, URL या संख्याओं को असंरचित पाठ से बाहर खींचते हैं और आपको उन्हें एक साफ सूची, डी-डुप्लिकेट और उपस्थिति के क्रम में देते हैं।

URL निष्कर्षण पट्टियां वाक्य विराम चिह्न के पीछे होती हैं, इसलिए "https://example.com." पर जाएं, पूर्ण विराम के बिना URL प्राप्त होता है, और यह एक समापन कोष्ठक पर रुकता है, इसलिए कोष्ठक के अंदर URL साफ़ आता है।

ईमेल मिलान संपूर्ण होने के बजाय जानबूझकर व्यावहारिक है। एक वैध ईमेल पते के लिए संपूर्ण विनिर्देश उन निर्माणों की अनुमति देता है जिनका अनिवार्य रूप से कोई भी उपयोग नहीं करता है, और उन सभी का मिलान वास्तविक पाठ पर एक सख्त पैटर्न की तुलना में खराब परिणाम उत्पन्न करता है।

केस रूपांतरण से शब्द सीमाएँ कैसे पाई जाती हैं

"हैलो वर्ल्ड" को कैमलकेस में परिवर्तित करना आसान है। ParseHTTPResponse2Json को कन्वर्ट करना वह जगह है जहां टूल असहमत हैं, क्योंकि सीमाएं चिह्नित होने के बजाय निहित हैं।

यह टूल तीन संकेतों पर विभाजित होता है: गैर-अक्षर, गैर-अंकीय वर्णों (रिक्त स्थान, हाइफ़न, अंडरस्कोर, विराम चिह्न) का कोई भी रन; एक छोटा अक्षर या अंक जिसके बाद एक बड़ा अक्षर आता है; और अपरकेस अक्षरों की एक श्रृंखला जिसके बाद अपरकेस-फिर-लोअरकेस जोड़ी आती है। वह अंतिम नियम वह है जो पार्सएचटीटीपी-रिस्पॉन्स उत्पन्न करने या पूरे संक्षिप्त नाम को अगले से चिपके हुए एक शब्द के रूप में मानने के बजाय, पार्सएचटीटीपीरेस्पॉन्स में "प्रतिक्रिया" से "HTTP" को सही ढंग से अलग करता है।

इसका परिणाम यह होता है कि साँप के मामले में parseHTTPResponse, parse_http_response और कबाब के मामले में parse-http-response बन जाता है, जो कि अधिकांश स्टाइल गाइड अपेक्षा करते हैं।

टाइटल केस और वाक्य केस अलग-अलग चीजें हैं

शीर्षक केस प्रत्येक शब्द के पहले अक्षर को बड़ा करता है और बाकी को छोटा करता है, इसलिए "हैलो WORLD" "हैलो वर्ल्ड" बन जाता है। यह स्टाइल-गाइड नियमों के बारे में नहीं जानता है जो "का" और "द" लोअरकेस जैसे छोटे शब्द रखते हैं, क्योंकि वे नियम प्रकाशन के अनुसार भिन्न होते हैं और चुपचाप किCAक को लागू करना एक अनुमान होगा।

वाक्य केस सब कुछ छोटा कर देता है और फिर प्रत्येक वाक्य के पहले अक्षर को बड़े अक्षरों में लिख देता है, यह पता लगाता है कि वाक्य पूर्ण विराम, प्रश्न चिह्न और विस्मयादिबोधक चिह्न पर समाप्त होता है, जिसमें उनके पूर्ण-चौड़ाई वाले CJK समकक्ष शामिल हैं। यह ALL CAPS में आए टेक्स्ट के लिए सही विकल्प है।

मल

स्लग ट्रांसफ़ॉर्म एक URL-सुरक्षित पहचानकर्ता उत्पन्न करता है: लोअरकेस, एक्सेंट्स को उनके आधार अक्षरों में मोड़ दिया जाता है, और गैर-अल्फ़ान्यूमेरिक वर्णों के प्रत्येक रन को एक एकल हाइफ़न के साथ बदल दिया जाता है।

एक्सेंट फोल्डिंग वर्णों को विघटित करके और संयोजन चिह्नों को हटाकर किया जाता है, इसलिए "कैफे क्रीम" "कैफे-CR-मी" के बजाय "कैफे-क्रीम" बन जाता है। उच्चारण अक्षरों को पूरी तरह से हटा देना स्लग जेनरेटर में एक आम बग है और यह नामों को खराब कर देता है।

अग्रणी और अनुगामी विभाजक हटा दिए गए हैं, और इमोजी और अन्य प्रतीक हटा दिए गए हैं, क्योंकि उनके पास कोई उपयोगी URL प्रतिनिधित्व नहीं है।

क्रैश के बिना नियमित अभिव्यक्ति

फाइंड-एंड-रिप्लेस के दो मोड हैं। शाब्दिक मोड - डिफ़ॉल्ट - प्रत्येक विशेष वर्ण से बच जाता है, इसलिए "ए.बी" की खोज करने पर बिल्कुल "ए.बी" मिलता है, न कि "एएक्सबी"। रेगेक्स मोड आपके पैटर्न को वैसे ही पास करता है जैसे वह है।

आपके द्वारा टाइप किया गया प्रत्येक पैटर्न एक गार्ड के अंदर संकलित होता है। यदि यह अमान्य है, तो आपको समस्या समझाने वाला एक संदेश मिलता है और आपका पाठ अछूता रहता है। यह जितना लगता है उससे कहीं अधिक मायने रखता है: एक रेगुलर एक्सप्रेशन टाइप करना एक वृद्धिशील प्रक्रिया है, और एक अकेला "(" एक कामकाजी पैटर्न के रास्ते पर एक पूरी तरह से सामान्य मध्यवर्ती स्थिति है। एक टूल जो उस पल में एक अनहेल्ड त्रुटि फेंकता है - या इससे भी बदतर, बॉक्स को साफ़ करता है - अनुपयोगी है।

रेगेक्स मोड में, प्रतिस्थापन $ के साथ कैप्चर समूहों का समर्थन करता है1, $2 और इसी तरह। तिथियों को पुन: स्वरूपित करना विहित उदाहरण है: ढूंढें (\d{4})-(\डी{2})-(\डी{2}) और $ से बदलें3/$2/$1 चालू करने के लिए 2024-01-02 में 02/01/2024.

  1. अपना पैटर्न टाइप करें और "रेगेक्स" पर टिक करें।
  2. यदि यह अमान्य है, तो त्रुटि पढ़ें और संपादन जारी रखें - कुछ भी नहीं बदला गया था।
  3. संदर्भ कैप्चर समूहों के प्रतिस्थापन में $1, $2 का उपयोग करें।
  4. बाद में रिपोर्ट की गई प्रतिस्थापन गणना की जाँच करें, और यदि यह आपकी अपेक्षा के अनुरूप नहीं है तो इसे पूर्ववत करें।

संपूर्ण शब्द मिलान

"संपूर्ण शब्द" विकल्प आपकी खोज को शब्द सीमाओं में लपेटता है, इसलिए "बिल्ली" की खोज बिल्ली शब्द से मेल खाती है, लेकिन "कॉनकैटनेट" के अंदर "बिल्ली" से नहीं।

यह दोनों मोड के साथ कंपोज करता है। शाब्दिक मोड में आपका टेक्स्ट पहले बच जाता है और फिर सीमित हो जाता है; रेगेक्स मोड में आपका पूरा पैटर्न एक समूह के रूप में घिरा हुआ है, इसलिए बिल्ली | कुत्ते जैसे विकल्प केवल पहली शाखा तक सीमा को बांधने के बजाय आपकी अपेक्षा के अनुरूप व्यवहार करते हैं।

अक्सर पूछे जाने वाले प्रश्नों

क्या मेरा पाठ कहीं भेजा गया है?
नहीं, प्रत्येक परिवर्तन आपके ब्राउज़र में, इस पेज पर चलने वाला एक फ़ंक्शन है। इस टूल में कोई सर्वर नहीं है. आप काम करते समय अपने ब्राउज़र के नेटवर्क पैनल को शांत रहते हुए देख सकते हैं।
क्या यात्राओं के बीच कुछ भी सहेजा गया है?
नहीं, कोई ऑटोसेव नहीं है और कोई इतिहास नहीं है। पेज को पुनः लोड करने या डेटा साफ़ करें दबाने से सब कुछ तुरंत ख़ारिज हो जाता है। यह एक जानबूझकर किया गया समझौता है: इसका मतलब है कि एक साझा या सार्वजनिक कंप्यूटर आपके द्वारा चिपकाए गए को बरकरार नहीं रखता है।
वर्ण गणना अन्य टूल से भिन्न क्यों है?
क्योंकि यह टूल उन वर्णों की गणना करता है जिन्हें आप वर्ण कहते हैं - ग्रेफेम क्लस्टर - जबकि कई टूल UTF-16 कोड इकाइयों की गणना करते हैं। वे स्पष्ट अंग्रेजी के लिए सहमत हैं और इमोजी, चिह्नों के संयोजन से लिखे गए उच्चारण वर्णों और कई गैर-लैटिन लिपियों पर असहमत हैं।
यदि मैं कोई अमान्य रेगुलर एक्सप्रेशन टाइप करूँ तो क्या होगा?
आपको एक स्पष्ट त्रुटि संदेश मिलता है जिसमें बताया गया है कि क्या गलत था, और आपका टेक्स्ट बिल्कुल वैसा ही रह जाता है जैसा वह था। टूल कभी भी क्रैश नहीं होता है और किसी विकृत पैटर्न के कारण आपके इनपुट को कभी भी साफ़ नहीं करता है।
क्या डी-डुप्लीकेटिंग से पहली या आखिरी कॉपी सुरक्षित रहती है?
पहला। प्रारंभिक घटना यथावत रहती है और बाद की प्रतियां हटा दी जाती हैं, इसलिए जो रहता है उसका क्रम अपरिवर्तित रहता है।
यह कितना टेक्स्ट संभाल सकता है?
कम मेगाबाइट में आराम से। सब कुछ टैब में रखा जाता है और मुख्य थ्रेड पर चलता है, इसलिए बहुत बड़े दस्तावेज़ - दसियों मेगाबाइट - परिवर्तन के दौरान इंटरफ़ेस को कुछ समय के लिए रोक सकते हैं।

यह टूल क्या नहीं करेगा