Deutsch

So entfernen Sie doppelte Zeilen in einer CSV-Datei

Laden Sie die Datei in den CSV-Cleaner, schneiden Sie ZUERST Leerzeichen ab und entfernen Sie dann doppelte Zeilen. Das erste Vorkommen jeder Zeile wird beibehalten und spätere Kopien werden entfernt, sodass sich die Reihenfolge der von Ihnen gespeicherten Daten nicht ändert.

Die Reihenfolge dieser beiden Schritte ist der ganze Trick. Zwei Zeilen, die sich nur durch ein nachgestelltes Leerzeichen unterscheiden, sind keine Duplikate für einen Computer. Wenn Sie also vor dem Zuschneiden deduplizieren, bleiben beide an Ort und Stelle und es wird anschließend gemeldet, dass die Arbeit gut erledigt ist.

Warum „identische“ Zeilen die Deduplizierung überleben

Durch das Trimmen werden der erste und der letzte davon direkt angegangen. Die anderen benötigen eine Entscheidung von Ihnen, weshalb sie nicht stillschweigend normalisiert werden – Faltschachtel ist beispielsweise für E-Mail-Adressen korrekt und für Produktcodes falsch, und ein Tool kann nicht erkennen, welche Spalte welche ist.

  • Nachgestellte oder führende Leerzeichen. Unsichtbar in einer Tabellenkalkulation, entscheidend für einen Vergleich.
  • Fallunterschiede. ann@example.com und Ann@example.com sind unterschiedliche Zeichenfolgen, obwohl es sich um dasselbe Postfach handelt.
  • Anderes Zitat. „Smith, John“ und Smith\, John können den gleichen Wert haben und sich vor dem Parsen Byte für Byte unterscheiden.
  • Geschützte Leerzeichen. Beim Kopieren und Einfügen aus einer Webseite oder einem PDF wird häufig U+00A0 durch ein normales Leerzeichen ersetzt, und nichts daran sieht ungewöhnlich aus.
  • Eine nachgestellte leere Spalte. Ein Export schreibt vier Felder, ein anderer schreibt vier Felder und ein abschließendes Trennzeichen.

Die Reihenfolge, die funktioniert

Jeder dieser Schritte kann bis zu den letzten zwanzig Vorgängen einzeln rückgängig gemacht werden, es fallen also keine Kosten an, einen einzelnen Schritt auszuprobieren und dann rückgängig zu machen.

  1. Laden Sie die Datei und bestätigen Sie, dass das Trennzeichen und die Spaltenanzahl richtig sind. Das Deduplizieren einer Datei, die als eine Spalte analysiert wurde, hat keinen Sinn.
  2. Leerzeichen in jeder Zelle entfernen.
  3. Entfernen Sie leere Zeilen, wenn sie im Export vorhanden sind, damit sie nicht zu einem einzigen beibehaltenen Leerzeichen zusammenfallen.
  4. Entfernen Sie doppelte Zeilen.
  5. Überprüfen Sie die Zeilenanzahl vorher und nachher. Der Unterschied besteht darin, wie viele Duplikate es gab.

Duplikate ganzer Zeilen, keine doppelten Schlüssel

Dadurch werden Zeilen entfernt, die in jeder Spalte identisch sind. Das ist nicht dasselbe wie das Entfernen von Zeilen, die einen gemeinsamen Schlüssel haben.

Wenn derselbe Kunde zweimal mit unterschiedlichen Anmeldedaten erscheint, handelt es sich nicht um doppelte Zeilen, sondern um zwei verschiedene Datensätze, die zufällig denselben Namen haben. Das Entfernen würde bedeuten, dass Daten gelöscht würden, und das Tool führt dies nicht auf Vermutung aus.

Um nach einem Schlüssel zu deduplizieren, reduzieren Sie den Export auf die Spalten, die den Schlüssel definieren, deduplizieren Sie diesen und verwenden Sie das Ergebnis als Nachschlageliste. Oder führen Sie den Join in einer Tabellenkalkulation oder einer Datenbank durch, wo diese Art von Entscheidung hingehört.

Deduplizieren einer einzelnen Wertespalte

Wenn Ihr eigentliches Problem eine Liste – E-Mail-Adressen, SKUs, URLs – und nicht eine Tabelle ist, ist das Text Toolkit der schnellere Weg. Es dedupliziert Zeilen, schneidet sie zu und sortiert sie und erfordert ein Einfügen statt einer Datei.

Dort gilt die gleiche Reihenfolgeregel: Erst trimmen, dann deduplizieren.

Ausgearbeitetes Beispiel: eine aus drei Exporten zusammengeführte Mailingliste

Drei Exporte wurden in einer Datei mit 4.812 Zeilen und einer Spalte „Name“, „E-Mail“ und „Quelle“ zusammengefasst. Einige Kontakte erscheinen in mehr als einer Quelle und die Datei wurde durch Kopieren und Einfügen zusammengestellt, sodass einige Zeilen nachgestellte Leerzeichen enthalten.

Durch das sofortige Entfernen von Duplikaten werden 118 Berichte entfernt – verdächtig wenige für drei überlappende Listen.

  1. Machen Sie die Deduplizierung rückgängig.
  2. Leerzeichen in jeder Zelle entfernen.
  3. Entfernen Sie doppelte Zeilen erneut.
  4. Vergleichen Sie die Zeilenanzahl mit dem Original.

Ergebnis: Beim zweiten Durchgang werden wesentlich mehr Zeilen entfernt als beim ersten, da durch das Trimmen die tatsächlichen Duplikate identisch wurden. Zeilen, die eine gemeinsame E-Mail-Adresse haben, sich aber in der Spalte „Quelle“ unterscheiden, sind korrekterweise immer noch vorhanden – es handelt sich nicht um identische Zeilen, und die Entscheidung, welche Quelle gewinnt, ist ein Urteil, das das Tool Ihnen überlässt.

Öffnen Sie das Tool

Deduplizieren Sie eine CSV-Datei in Ihrem Browser

Entfernt Zeilen, die in jeder Spalte identisch sind, wobei die erste beibehalten wird. Es lässt sich nicht erraten, welche der beiden ähnlichen Aufzeichnungen Sie aufbewahren wollten.

Was dies nicht abdeckt

  • Es werden nur Duplikate ganzer Zeilen entfernt. Eine Deduplizierung nach einer Schlüsselspalte ist mit diesem Tool nicht möglich.
  • Der Fall ist bedeutsam. ANN@example.com und ann@example.com werden als zwei Zeilen gespeichert.
  • Das erste Vorkommen wird beibehalten. Es gibt keine Möglichkeit, den Leisten zu behalten.
  • Die gesamte Datei wird im Speicher gehalten und ist auf 50 MB begrenzt.
  • Das Rückgängigmachen ist auf die letzten 20 Vorgänge beschränkt.
  • In der Vorschau werden nur die ersten 100 Zeilen angezeigt. Bestätigen Sie die Ergebnisse daher anhand der Zeilenanzahl und nicht durch Scrollen.