Elimina le righe ripetute dall'esportazione di un foglio di calcolo, conservando la prima copia di ciascuna
Lo strumento viene caricato qui. Ha bisogno di JavaScript, perché il lavoro avviene sul tuo dispositivo.
I tuoi file e la tua privacy
Le righe confrontate non lasciano mai il tuo dispositivo. Il file viene letto dal browser, analizzato
da un Web Worker in questa scheda, deduplicato in memoria e riscritto dal browser
meccanismo di download. Il codice dello strumento non richiede il trasporto del file, del testo incollato o
output generato. Le richieste di script di analisi divulgate sono separate e sono descritte in
la Privacy Policy del sito.
Cosa fa questo strumento
Rimuovi le righe che ripetono una riga già vista in precedenza nel file. Il confronto copre
ogni colonna, utilizza i valori della cella analizzati, fa distinzione tra maiuscole e minuscole e tratta gli spazi bianchi come
significativo. La prima occorrenza sopravvive e l'ordine delle righe sopravvissute è
invariato.
La deduplicazione percorre le righe di dati in ordine e mantiene solo la prima apparizione di ciascuna. A
la riga è un duplicato quando ciascuna delle sue celle corrisponde esattamente a una riga precedente, rispetto
dopo l'analisi, quindi un campo scritto tra virgolette equivale allo stesso campo scritto senza
loro. Contano sia maiuscole che spazi: Ada, ada e Ada con uno spazio finale sono tre
righe distinte. Non è necessario che i duplicati siano adiacenti e le righe che sopravvivono rimangono dove sono
erano.
Come usarlo
Seleziona Scegli un file CSV o JSON e carica l'esportazione.
Prendi nota innanzitutto del conteggio delle righe, poiché lo strumento segnala quante righe rimangono anziché come
molti ne ha rimossi.
Seleziona Taglia gli spazi bianchi se le celle possono essere riempite, poiché le righe che differiscono solo per uno spazio lo sono
non duplicati.
Seleziona Rimuovi righe duplicate, leggi il conteggio rimanente nel messaggio, quindi seleziona
Scarica CSV o Annulla.
Casi d'uso di esempio
Una mailing list raccolta da diverse esportazioni, a cui è stato fornito lo stesso indirizzo
due volte.
Un report scaricato due volte e concatenato, quindi viene visualizzato nuovamente un intero blocco di righe
più in basso.
Record reinseriti da un processo di sincronizzazione eseguito due volte prima che qualcuno se ne accorgesse.
Ingresso e uscita supportati
Accetta
CSV, TSV o testo normale separato da virgola, punto e virgola, tabulazione o barra verticale, fino a 50 MB
JSON contenente una serie di oggetti
Produce
CSV, UTF-8, CRLF terminazioni di riga, righe sopravvissute nell'ordine originale
JSON, un array di oggetti con rientro di due spazi
Cosa non farà questo strumento
Il confronto copre ogni colonna, quindi sopravvivono due righe che descrivono la stessa persona
se una colonna è diversa, ad esempio un ID di riga o un timestamp di esportazione. Deseleziona quella colonna
con Applica prima la selezione della colonna.
In questa pagina non è presente alcun controllo per colonna o senza distinzione tra maiuscole e minuscole, quindi Ada e ada sono due
righe.
Gli spazi bianchi fanno parte del valore, quindi ritaglia o comprimi gli spazi prima o le copie imbottite
sopravvivere.
La riga di intestazione non viene mai confrontata né rimossa. Una seconda riga di intestazione all'interno di a
il file concatenato è una normale riga di dati: è unica, quindi rimane.
Una riga breve riempita con spazi vuoti dal parser può risultare identica a una riga più lunga il cui
le celle finali sono vuote e una delle due viene eliminata.
Errori comuni
Deduplicazione prima del taglio. Uno spazio finale forma due righe dall'aspetto identico
distinti, entrambi vengono mantenuti e nulla dice che rimangano duplicati.
Mi aspetto che vinca la copia più recente. La prima occorrenza sopravvive, quindi se compaiono righe successive
riporti i valori corretti mantieni la versione obsoleta.
Utilizzare questo pulsante per cancellare le righe vuote. Le righe vuote sono identiche tra loro, quindi
esattamente uno sopravvive; Rimuovere le righe vuote è ciò che le cancella.
Successivamente controllo a campione dell'anteprima: vengono mostrate solo le prime 100 righe, quindi duplicate
al di sotto di quella linea vengono rimossi o mantenuti invisibili.
Note tecniche
Ogni riga viene ridotta a una chiave di identità unendo le sue celle con un carattere NUL, che
non può apparire legalmente nel testo CSV. Unirsi invece su una virgola lascerebbe una cella
contenenti a,b si scontrano con due celle contenenti aeb, che è come un deduplicatore
elimina silenziosamente la riga sbagliata. Le chiavi entrano in un set di hash, quindi la scansione è lineare
pass e duplicati si trovano ovunque si trovino anziché solo quando adiacenti, e il
la trasformazione restituisce un nuovo array quindi Annulla ripristina esattamente la tabella precedente.
Domande frequenti
Conserva la prima o l'ultima copia?
Il primo. La riga originale rimane al suo posto e le copie successive vengono eliminate, quindi l'ordine di
i dati che conservi rimangono invariati. Se le copie successive sono quelle corrette, ordinale o modificale
il file in modo che la versione desiderata venga prima.
Posso deduplicare per una colonna, ad esempio l'e-mail?
Non direttamente; il pulsante confronta intere righe. Puoi spuntare solo quella colonna, seleziona
Applica la selezione della colonna e quindi deduplica, ma ciò mantiene solo la colonna selezionata, quindi
annulla in seguito se hai bisogno degli altri campi.
Perché è ancora presente un duplicato evidente?
Qualcosa nella riga è diverso: uno spazio finale, uno spazio unificatore incollato da una rete
pagina, una lettera maiuscola diversa o una colonna che hai dimenticato come un ID di riga o un
timestamp di esportazione.