Comment supprimer les lignes en double dans un CSV
Chargez le fichier dans CSV Cleaner, coupez d'abord les espaces, puis supprimez les lignes en double. La première occurrence de chaque ligne est conservée et les copies ultérieures sont supprimées, de sorte que l'ordre des données que vous conservez ne change pas.
L’ordre de ces deux étapes est tout le truc. Deux lignes ne différant que par un espace de fin ne sont pas des doublons sur un ordinateur, donc la déduplication avant le découpage laisse les deux en place et signale ensuite un travail bien fait.
Pourquoi les lignes « identiques » survivent à la déduplication
Le découpage s’adresse directement au premier et au dernier d’entre eux. Les autres ont besoin d’une décision de votre part, c’est pourquoi ils ne sont pas normalisés en silence – le boîtier pliable, par exemple, est correct pour les adresses e-mail et incorrect pour les codes de produits, et un outil ne peut pas déterminer quelle colonne correspond à quelle colonne.
- Espaces de fin ou de début. Invisible dans un tableur, déterminant pour une comparaison.
- Différences de cas. ann@example.com et Ann@example.com sont des chaînes différentes, même s'il s'agit de la même boîte aux lettres.
- Citation différente. "Smith, John" et Smith\, John peuvent avoir la même valeur et différer octet par octet avant l'analyse.
- Espaces insécables. Le copier-coller à partir d'une page Web ou d'un PDF remplace fréquemment U+00A0 par un espace normal, et cela n'a rien d'inhabituel.
- Une colonne vide de fin. Une exportation écrit quatre champs, une autre écrit quatre champs et un délimiteur de fin.
L'ordre qui fonctionne
Chacune de ces étapes est annulable séparément, jusqu'aux vingt dernières opérations, il n'y a donc aucun coût pour en essayer une et l'annuler.
- Chargez le fichier et confirmez que le délimiteur et le nombre de colonnes sont corrects. La déduplication d'un fichier analysé comme une seule colonne ne sert à rien.
- Coupez les espaces sur chaque cellule.
- Supprimez les lignes vides si l'exportation en contient, afin qu'elles ne se réduisent pas en un seul espace conservé.
- Supprimez les lignes en double.
- Vérifiez le nombre de lignes avant et après. La différence réside dans le nombre de doublons.
Doublons de lignes entières, pas de clés en double
Cela supprime les lignes identiques dans chaque colonne. Ce n'est pas la même chose que de supprimer les lignes qui partagent une clé.
Si le même client apparaît deux fois avec des dates d’inscription différentes, il ne s’agit pas de lignes en double : ce sont deux enregistrements différents qui partagent un nom. En supprimer un reviendrait à supprimer des données, et l’outil ne le fera pas par hasard.
Pour dédoublonner par une clé, réduisez l'exportation aux colonnes qui définissent la clé, dédupliquez-la et utilisez le résultat comme liste de recherche. Ou effectuez la jointure dans une feuille de calcul ou une base de données, c'est là que ce type de décision appartient.
Déduplication d'une seule colonne de valeurs
Si votre problème réel est une liste (adresses e-mail, SKU, URL) plutôt qu'un tableau, Text Toolkit est la voie la plus rapide. Il déduplique les lignes, les coupe et les trie, et nécessite un collage plutôt qu'un fichier.
La même règle de classement s'applique ici : coupez d'abord, puis dupliquez.
Exemple concret : une liste de diffusion fusionnée à partir de trois exports
Trois exportations ont été concaténées dans un fichier de 4 812 lignes avec une colonne Nom, Email et Source. Certains contacts apparaissent dans plusieurs sources et le fichier a été assemblé par copier-coller, de sorte que certaines lignes comportent des espaces de fin.
La suppression immédiate des doublons signale la suppression de 118 - un nombre suspect pour trois listes qui se chevauchent.
- Annulez la déduplication.
- Coupez les espaces sur chaque cellule.
- Supprimez à nouveau les lignes en double.
- Comparez le nombre de lignes avec l'original.
Résultat : Le deuxième passage supprime beaucoup plus de lignes que le premier, car le découpage rend les vrais doublons identiques. Les lignes qui partagent une adresse e-mail mais diffèrent dans la colonne Source sont toujours présentes à juste titre – ce ne sont pas des lignes identiques, et décider quelle source gagne est un jugement que l'outil vous laisse.
Ouvrez l'outil
Dédupliquez un CSV dans votre navigateur
Supprime les lignes identiques dans chaque colonne, en conservant la première. Il ne pourra pas deviner lequel des deux enregistrements similaires vous vouliez conserver.
Ce que cela ne couvre pas
- Seuls les doublons de lignes entières sont supprimés. La déduplication par colonne clé n'est pas quelque chose que cet outil fait.
- L’affaire est significative. ANN@example.com et ann@example.com sont conservés sur deux lignes.
- La première occurrence est conservée. Il n'y a pas d'option pour conserver le dernier.
- L'ensemble du fichier est conservé en mémoire, limité à 50 MB.
- L'annulation est limitée aux 20 dernières opérations.
- Seules les 100 premières lignes apparaissent dans l'aperçu, confirmez donc les résultats par le nombre de lignes plutôt que par le défilement.