Come rimuovere le righe duplicate in CSV
Carica il file nel CSV Cleaner, ritaglia gli spazi bianchi FIRST, quindi rimuovi le righe duplicate. Viene mantenuta la prima occorrenza di ogni riga e le copie successive vengono rimosse, pertanto l'ordine dei dati conservati non cambia.
L'ordine di questi due passaggi è l'intero trucco. Due righe che differiscono solo per uno spazio finale non sono duplicate su un computer, quindi la deduplicazione prima del taglio lascia entrambe al loro posto e quindi segnala un lavoro ben fatto.
Perché le righe "identiche" sopravvivono alla deduplicazione
Il taglio affronta direttamente il primo e l'ultimo di questi. Gli altri hanno bisogno di una tua decisione, motivo per cui non vengono normalizzati silenziosamente: la custodia pieghevole, ad esempio, è corretta per gli indirizzi e-mail e sbagliata per i codici prodotto, e uno strumento non può dire quale colonna è quale.
- Spazi finali o iniziali. Invisibile in un foglio di calcolo, decisivo per un confronto.
- Differenze di caso. ann@example.com e Ann@example.com sono stringhe diverse, anche se sono la stessa casella di posta.
- Citazione diversa. "Smith, John" e Smith\, John possono contenere lo stesso valore e differire byte per byte prima dell'analisi.
- Spazi unificatori. Il copia-incolla di una pagina Web o di un PDF sostituisce spesso U+00A0 con uno spazio normale e nulla sembra insolito.
- Una colonna vuota finale. Un'esportazione scrive quattro campi, un'altra scrive quattro campi e un delimitatore finale.
L'ordine che funziona
Ciascuno di questi passaggi è annullabile separatamente, fino alle ultime venti operazioni, quindi non vi è alcun costo per provarne uno e invertirlo.
- Caricare il file e verificare che il delimitatore e il conteggio delle colonne siano corretti. La deduplicazione di un file analizzato come una colonna non fa nulla di utile.
- Taglia gli spazi bianchi su ogni cella.
- Rimuovi le righe vuote se presenti nell'esportazione, in modo che non vengano compresse in un unico spazio vuoto mantenuto.
- Rimuovi le righe duplicate.
- Controlla il conteggio delle righe prima e dopo. La differenza sta nel numero di duplicati presenti.
Duplicati di righe intere, non chiavi duplicate
Ciò rimuove le righe identiche in ogni colonna. Non è la stessa cosa che rimuovere righe che condividono una chiave.
Se lo stesso cliente appare due volte con date di registrazione diverse, non si tratta di righe duplicate: si tratta di due record diversi che condividono un nome. Rimuoverne uno significherebbe eliminare i dati e lo strumento non lo farà a caso.
Per deduplicare in base a una chiave, ridurre l'esportazione alle colonne che definiscono la chiave, deduplicarla e utilizzare il risultato come elenco di ricerca. Oppure esegui l'unione in un foglio di calcolo o in un database, che è il luogo in cui appartiene questo tipo di decisione.
Deduplicazione di una singola colonna di valori
Se il tuo problema reale è un elenco (indirizzi email, SKU, URL) anziché una tabella, Text Toolkit è la strada più veloce. Deduplica le linee, le taglia e le ordina e richiede un incolla anziché un file.
Anche in questo caso si applica la stessa regola di ordinamento: prima ritaglia, poi deduplica.
Esempio realizzato: una mailing list unita da tre esportazioni
Tre esportazioni sono state concatenate in un file 4,812-row con una colonna Nome, Email e Origine. Alcuni contatti appaiono in più di una fonte e il file è stato assemblato tramite copia e incolla, quindi alcune righe hanno spazi finali.
Rimuovendo immediatamente i duplicati, i rapporti 118 sono stati rimossi: sospettosamente pochi per tre elenchi sovrapposti.
- Annulla la deduplicazione.
- Taglia gli spazi bianchi su ogni cella.
- Rimuovi nuovamente le righe duplicate.
- Confronta il conteggio delle righe con l'originale.
Risultato: Il secondo passaggio rimuove sostanzialmente più righe del primo, perché il taglio ha reso identici i duplicati reali. Le righe che condividono un indirizzo email ma differiscono nella colonna Sorgente sono ancora correttamente presenti: non sono righe identiche e decidere quale Sorgente vince è un giudizio che lo strumento lascia a te.
Apri lo strumento
Deduplica un CSV nel tuo browser
Rimuove le righe identiche su ogni colonna, mantenendo la prima. Non indovinerà quale dei due record simili volevi conservare.
Ciò che questo non copre
- Vengono rimossi solo i duplicati dell'intera riga. La deduplicazione tramite una colonna chiave non è qualcosa che fa questo strumento.
- Il caso è significativo. ANN@example.com e ann@example.com vengono mantenuti su due righe.
- Viene mantenuta la prima occorrenza. Non è possibile conservare l'ultimo.
- L'intero file viene mantenuto in memoria, limitato a 50 MB.
- L'annullamento è limitato alle ultime operazioni 20.
- Nell'anteprima vengono visualizzate solo le prime 100 righe, quindi conferma i risultati tramite il conteggio delle righe anziché scorrendo.