ไทย

วิธีลบแถวที่ซ้ำกันใน CSV

โหลดไฟล์ลงใน CSV Cleaner ตัดช่องว่าง FIRST จากนั้นลบแถวที่ซ้ำกัน การเกิดขึ้นครั้งแรกของแต่ละแถวจะถูกเก็บไว้ และสำเนาในภายหลังจะถูกลบออก ดังนั้นลำดับของข้อมูลที่คุณเก็บไว้จะไม่เปลี่ยนแปลง

การเรียงลำดับสองขั้นตอนนั้นเป็นเคล็ดลับทั้งหมด สองแถวที่แตกต่างกันด้วยช่องว่างต่อท้ายจะไม่ซ้ำกับคอมพิวเตอร์ ดังนั้นการขจัดข้อมูลซ้ำซ้อนก่อนตัดแต่งจะคงตำแหน่งทั้งสองไว้แล้วจึงรายงานงานที่ทำได้ดี

เหตุใดแถวที่ "เหมือนกัน" จึงรอดพ้นจากการขจัดข้อมูลซ้ำซ้อน

การตัดแต่งจะเน้นถึงสิ่งแรกและจุดสุดท้ายโดยตรง คนอื่นๆ ต้องการการตัดสินใจจากคุณ ซึ่งเป็นเหตุผลว่าทำไมพวกเขาถึงไม่ทำให้เป็นมาตรฐานอย่างเงียบๆ เช่น กรณีพับถูกต้องสำหรับที่อยู่อีเมล และผิดสำหรับรหัสผลิตภัณฑ์ และเครื่องมือไม่สามารถบอกได้ว่าคอลัมน์ใดเป็นคอลัมน์ใด

  • ช่องว่างต่อท้ายหรือนำหน้า มองไม่เห็นในสเปรดชีต ตัดสินใจได้ชัดเจนเมื่อเปรียบเทียบ
  • ความแตกต่างกรณี ann@example.com และ Ann@example.com เป็นสตริงที่แตกต่างกัน แม้ว่าจะเป็นกล่องจดหมายเดียวกันก็ตาม
  • การอ้างอิงที่แตกต่างกัน "Smith, John" และ Smith\, John สามารถมีค่าเดียวกันและมีไบต์ที่แตกต่างกันสำหรับไบต์ก่อนที่จะแยกวิเคราะห์
  • พื้นที่ไม่แตกหัก การคัดลอกและวางจากหน้าเว็บหรือ PDF มักจะแทนที่ U+00A0 สำหรับพื้นที่ปกติ และไม่มีสิ่งใดที่ดูผิดปกติเลย
  • คอลัมน์ว่างต่อท้าย การส่งออกรายการหนึ่งเขียนสี่ช่อง อีกรายการหนึ่งเขียนสี่ช่องและตัวคั่นต่อท้าย

คำสั่งที่ทำงาน

แต่ละขั้นตอนเหล่านั้นสามารถเลิกทำได้แยกกัน มากถึง 20 การดำเนินการล่าสุด ดังนั้นจึงไม่มีค่าใช้จ่ายในการลองและย้อนกลับ

  1. โหลดไฟล์และยืนยันว่าจำนวนตัวคั่นและคอลัมน์ถูกต้อง การขจัดไฟล์ที่ซ้ำกันซึ่งแยกวิเคราะห์เป็นคอลัมน์เดียวไม่มีประโยชน์อะไร
  2. ตัดช่องว่างบนทุกเซลล์
  3. ลบแถวว่างออกหากมีการส่งออก เพื่อไม่ให้ยุบลงในแถวว่างที่เก็บไว้เพียงแถวเดียว
  4. ลบแถวที่ซ้ำกัน
  5. ตรวจสอบจำนวนแถวก่อนและหลัง ความแตกต่างคือมีจำนวนรายการที่ซ้ำกัน

ทำซ้ำทั้งแถว ไม่ใช่คีย์ที่ซ้ำกัน

วิธีนี้จะลบแถวที่เหมือนกันในทุกคอลัมน์ นั่นไม่เหมือนกับการลบแถวที่ใช้คีย์ร่วมกัน

หากลูกค้ารายเดียวกันปรากฏขึ้นสองครั้งโดยมีวันที่ลงทะเบียนต่างกัน แถวเหล่านั้นจะไม่ซ้ำกัน เนื่องจากเป็นสองบันทึกที่แตกต่างกันซึ่งบังเอิญใช้ชื่อร่วมกัน การลบอันหนึ่งออกจะเป็นการลบข้อมูล และเครื่องมือนี้ไม่สามารถเดาได้

หากต้องการกรองข้อมูลซ้ำด้วยคีย์ ให้ลดการส่งออกไปยังคอลัมน์ที่กำหนดคีย์ ขจัดข้อมูลซ้ำซ้อนนั้น และใช้ผลลัพธ์เป็นรายการค้นหา หรือเข้าร่วมในสเปรดชีตหรือฐานข้อมูลซึ่งเป็นที่ที่การตัดสินใจแบบนั้น

ขจัดความซ้ำซ้อนของค่าคอลัมน์เดียว

หากปัญหาที่แท้จริงของคุณคือรายการ ที่อยู่อีเมล, SKU, URL แทนที่จะเป็นตาราง ชุดเครื่องมือข้อความคือเส้นทางที่เร็วกว่า มันจะขจัดข้อมูลที่ซ้ำกันของบรรทัด ตัดแต่ง และเรียงลำดับ และใช้การวางแทนที่จะเป็นไฟล์

มีการใช้กฎการเรียงลำดับเดียวกัน: ตัดออกก่อน จากนั้นจึงกรองข้อมูลซ้ำออก

ตัวอย่างการทำงาน: รายชื่อผู้รับจดหมายที่ผสานจากการส่งออกสามรายการ

การส่งออกสามรายการถูกต่อเข้าด้วยกันเป็นไฟล์ 4,812 ไฟล์เดียวซึ่งมีคอลัมน์ชื่อ อีเมล และแหล่งที่มา ผู้ติดต่อบางรายปรากฏในแหล่งข้อมูลมากกว่าหนึ่งแหล่ง และไฟล์ถูกประกอบโดยการคัดลอก-วาง ดังนั้นบางแถวจึงมีช่องว่างต่อท้าย

การลบรายงานที่ซ้ำกันออกทันที รายงาน 118 ถูกลบออก — มีเพียงไม่กี่รายการที่น่าสงสัยสำหรับสามรายการที่ทับซ้อนกัน

  1. ยกเลิกการขจัดข้อมูลซ้ำซ้อน
  2. ตัดช่องว่างบนทุกเซลล์
  3. ลบแถวที่ซ้ำกันอีกครั้ง
  4. เปรียบเทียบจำนวนแถวกับต้นฉบับ

ผลลัพธ์: การผ่านครั้งที่สองจะลบแถวจำนวนมากกว่าครั้งแรกเนื่องจากการตัดแต่งทำให้การซ้ำกันจริงเหมือนกัน แถวที่ใช้ที่อยู่อีเมลร่วมกันแต่แตกต่างกันในคอลัมน์แหล่งที่มาจะยังคงปรากฏอย่างถูกต้อง — แถวเหล่านั้นไม่เหมือนกัน และการตัดสินใจว่าแหล่งที่มาใดจะชนะนั้นถือเป็นการตัดสินที่เครื่องมือจะปล่อยให้คุณ

เปิดเครื่องมือ

กรอง CSV ที่ซ้ำกันในเบราว์เซอร์ของคุณ

ลบแถวที่เหมือนกันในทุกคอลัมน์ โดยคงแถวแรกไว้ จะไม่เดาว่าคุณต้องการเก็บบันทึกใดในสองบันทึกที่คล้ายกัน

สิ่งนี้ไม่ครอบคลุมถึง

  • เฉพาะรายการที่ซ้ำกันทั้งแถวเท่านั้นที่จะถูกลบออก การขจัดข้อมูลซ้ำซ้อนด้วยคอลัมน์หลักไม่ใช่สิ่งที่เครื่องมือนี้ทำ
  • กรณีเป็นสำคัญ ANN@example.com และ ann@example.com ถูกเก็บไว้เป็นสองแถว
  • เหตุการณ์แรกจะถูกเก็บไว้ ไม่มีตัวเลือกให้เก็บอันสุดท้ายไว้
  • ไฟล์ทั้งหมดถูกเก็บไว้ในหน่วยความจำ โดยจำกัดไว้ที่ 50 MB
  • การเลิกทำจะจำกัดอยู่ที่การดำเนินการ 20 ล่าสุดเท่านั้น
  • เฉพาะ 100 แถวแรกเท่านั้นที่ปรากฏในการแสดงตัวอย่าง ดังนั้น โปรดยืนยันผลลัพธ์ตามจำนวนแถวแทนที่จะเลื่อนดู