हिन्दी

CSV में डुप्लिकेट पंक्तियाँ कैसे हटाएँ

फ़ाइल को CSV क्लीनर में लोड करें, व्हाइटस्पेस FIRST को ट्रिम करें, फिर डुप्लिकेट पंक्तियाँ हटा दें। प्रत्येक पंक्ति की पहली घटना को रखा जाता है और बाद की प्रतियां हटा दी जाती हैं, इसलिए आपके द्वारा रखे गए डेटा का क्रम नहीं बदलता है।

उन दो चरणों का क्रम ही पूरी चाल है। केवल अनुगामी स्थान से भिन्न होने वाली दो पंक्तियाँ कंप्यूटर के लिए डुप्लिकेट नहीं होती हैं, इसलिए ट्रिमिंग से पहले डिडुप्लिकेट करने से दोनों जगह पर रह जाती हैं और फिर अच्छी तरह से किए गए कार्य की रिपोर्ट करती हैं।

क्यों "समान" पंक्तियाँ डुप्लीकेशन से बची रहती हैं

ट्रिमिंग इनमें से पहले और आखिरी को सीधे संबोधित करती है। दूसरों को आपसे निर्णय की आवश्यकता होती है, यही कारण है कि उन्हें चुपचाप सामान्यीकृत नहीं किया जाता है - उदाहरण के लिए, फोल्डिंग केस ईमेल पते के लिए सही है और उत्पाद कोड के लिए गलत है, और एक टूल यह नहीं बता सकता कि कौन सा कॉलम कौन सा है।

  • अनुगामी या अग्रणी स्थान। स्प्रेडशीट में अदृश्य, तुलना के लिए निर्णायक।
  • मामले में मतभेद. ann@example.com और Ann@example.com अलग-अलग स्ट्रिंग हैं, भले ही वे एक ही मेलबॉक्स हों।
  • अलग-अलग उद्धरण. "स्मिथ, जॉन" और स्मिथ\, जॉन समान मान रख सकते हैं और पार्सिंग से पहले बाइट दर बाइट अलग-अलग कर सकते हैं।
  • न टूटने वाली जगहें. किसी वेब पेज या PDF को कॉपी-पेस्ट करने से अक्सर सामान्य स्थान का स्थान U+00A0 हो जाता है, और इसके बारे में कुछ भी असामान्य नहीं लगता है।
  • एक अनुगामी खाली स्तंभ. एक निर्यात चार फ़ील्ड लिखता है, दूसरा चार फ़ील्ड और एक अनुगामी सीमांकक लिखता है।

वह क्रम जो काम करता है

उनमें से प्रत्येक चरण पिछले बीस ऑपरेशनों तक अलग से पूर्ववत करने योग्य है, इसलिए किCAक को आज़माने और उसे उलटने की कोई कीमत नहीं है।

  1. फ़ाइल लोड करें और पुष्टि करें कि सीमांकक और स्तंभ गणना सही हैं। एक कॉलम के रूप में पार्स की गई फ़ाइल को डीडुप्लिकेट करने से कुछ भी उपयोगी नहीं होता है।
  2. प्रत्येक कोशिका पर रिक्त स्थान को ट्रिम करें।
  3. यदि निर्यात में खाली पंक्तियाँ हैं तो उन्हें हटा दें, ताकि वे एक ही रिक्त स्थान में सिमट न जाएँ।
  4. डुप्लिकेट पंक्तियाँ हटाएँ.
  5. पहले और बाद में पंक्ति संख्या जांचें. अंतर यह है कि कितने डुप्लिकेट थे.

संपूर्ण-पंक्ति डुप्लिकेट, डुप्लिकेट कुंजियाँ नहीं

यह उन पंक्तियों को हटा देता है जो प्रत्येक कॉलम में समान होती हैं। यह कुंजी साझा करने वाली पंक्तियों को हटाने जैसा नहीं है।

यदि एक ही ग्राहक अलग-अलग साइनअप तिथियों के साथ दो बार दिखाई देता है, तो वे डुप्लिकेट पंक्तियाँ नहीं हैं - वे दो अलग-अलग रिकॉर्ड हैं जो एक नाम साझा करते हैं। किसी को हटाने का अर्थ डेटा हटाना होगा, और टूल इसे अनुमान के आधार पर नहीं करेगा।

किसी कुंजी द्वारा डुप्लिकेट करने के लिए, कुंजी को परिभाषित करने वाले कॉलम में निर्यात को कम करें, उसे डुप्लिकेट करें और परिणाम को लुकअप सूची के रूप में उपयोग करें। या किसी स्प्रेडशीट या डेटाबेस में शामिल हों, जहां इस प्रकार का निर्णय होता है।

मानों के एकल कॉलम को डीडुप्लिकेट करना

यदि आपकी वास्तविक समस्या एक तालिका के बजाय एक सूची - ईमेल पते, SKU, URL - है, तो टेक्स्ट टूलकिट तेज़ मार्ग है। यह लाइनों को डीडुप्लिकेट करता है, उन्हें ट्रिम करता है और उन्हें सॉर्ट करता है, और यह फ़ाइल के बजाय पेस्ट लेता है।

वही ऑर्डरिंग नियम वहां लागू होता है: पहले ट्रिम करें, फिर डुप्लिकेट करें।

व्यावहारिक उदाहरण: एक मेलिंग सूची तीन निर्यातों से मर्ज की गई

तीन निर्यातों को नाम, ईमेल और स्रोत कॉलम के साथ एक 4,812-पंक्ति फ़ाइल में संयोजित किया गया है। कुछ संपर्क एक से अधिक स्रोतों में दिखाई देते हैं, और फ़ाइल को कॉपी-पेस्ट द्वारा इकट्ठा किया गया था, इसलिए कुछ पंक्तियों में पीछे की ओर रिक्त स्थान हैं।

डुप्लिकेट को तुरंत हटाने से रिपोर्ट 118 हटा दी गई - तीन ओवरलैपिंग सूचियों के लिए संदिग्ध रूप से कुछ।

  1. डिडुप्लीकेशन पूर्ववत करें.
  2. प्रत्येक कोशिका पर रिक्त स्थान को ट्रिम करें।
  3. डुप्लिकेट पंक्तियाँ फिर से हटाएँ.
  4. पंक्ति संख्या की तुलना मूल पंक्ति से करें।

परिणाम: दूसरा पास पहले की तुलना में काफी अधिक पंक्तियों को हटा देता है, क्योंकि ट्रिमिंग ने वास्तविक डुप्लिकेट को समान बना दिया है। वे पंक्तियाँ जो एक ईमेल पता साझा करती हैं लेकिन स्रोत कॉलम में भिन्न हैं, अभी भी सही ढंग से मौजूद हैं - वे समान पंक्तियाँ नहीं हैं, और यह तय करना कि कौन सा स्रोत जीतता है, उपकरण आप पर छोड़ता है।

टूल खोलें

अपने ब्राउज़र में CSV को डीडुप्लिकेट करें

पहले को रखते हुए, प्रत्येक कॉलम में समान पंक्तियों को हटा देता है। यह अनुमान नहीं लगाएगा कि आप कौन से दो समान रिकॉर्ड रखना चाहते थे।

इसमें क्या शामिल नहीं है

  • केवल संपूर्ण-पंक्ति डुप्लिकेट हटा दिए जाते हैं. किसी कुंजी कॉलम द्वारा डुप्लिकेट बनाना ऐसा कुछ नहीं है जो यह टूल करता है।
  • मामला महत्वपूर्ण है. ANN@example.com और ann@example.com को दो पंक्तियों के रूप में रखा गया है।
  • पहली घटना रखी गयी है. अंतिम को रखने का कोई विकल्प नहीं है.
  • पूरी फ़ाइल मेमोरी में रखी जाती है, जिसे 50 MB पर कैप किया जाता है।
  • पूर्ववत करना अंतिम 20 ऑपरेशन तक सीमित है।
  • पूर्वावलोकन में केवल पहली 100 पंक्तियाँ दिखाई देती हैं, इसलिए स्क्रॉल करने के बजाय पंक्ति गणना के आधार पर परिणामों की पुष्टि करें।