Eliminar linhas repetidas de uma exportação de planilha, mantendo a primeira cópia de cada
A ferramenta é carregada aqui. Precisa de JavaScript, pois o trabalho acontece no seu dispositivo.
Seus arquivos e sua privacidade
As linhas comparadas nunca saem do seu dispositivo. O arquivo é lido pelo navegador, analisado
por um Web Worker nesta guia, desduplicado na memória e gravado de volta pelo navegador
mecanismo de download. O código da ferramenta não faz nenhuma solicitação carregando o arquivo, texto colado ou
saída gerada. As solicitações de script de análise divulgadas são separadas e descritas em
a Política de Privacidade do site.
O que esta ferramenta faz
Remova linhas que repetem uma linha já vista anteriormente no arquivo. A comparação cobre
cada coluna, usa os valores das células analisadas, diferencia maiúsculas de minúsculas e trata os espaços em branco como
significativo. A primeira ocorrência sobrevive e a ordem das linhas sobreviventes é
inalterado.
A desduplicação percorre as linhas de dados em ordem e mantém apenas a primeira aparição de cada uma. Um
linha é uma duplicata quando cada uma de suas células corresponde exatamente a uma linha anterior, comparada
após a análise, portanto, um campo escrito entre aspas é igual ao mesmo campo escrito sem
eles. Caso e espaço em branco contam: Ada, ada e Ada com um espaço à direita são três
linhas distintas. As duplicatas não precisam ser adjacentes e as linhas que sobrevivem permanecem onde
eram.
Como usar
Selecione Escolher um arquivo CSV ou JSON e carregue a exportação.
Observe primeiro a contagem de linhas, porque a ferramenta informa quantas linhas restam, em vez de quantas
muitos foram removidos.
Selecione Cortar espaços em branco se as células puderem ser preenchidas, pois as linhas que diferem apenas por um espaço são
não duplicatas.
Selecione Remover linhas duplicadas, leia a contagem restante na mensagem e selecione
Baixe CSV ou desfaça.
Exemplos de casos de uso
Uma lista de discussão montada a partir de diversas exportações, onde o mesmo endereço foi contribuído
duas vezes.
Um relatório baixado duas vezes e concatenado, de forma que um bloco inteiro de linhas apareça novamente
mais abaixo.
Registros reinseridos por um trabalho de sincronização executado duas vezes antes que alguém percebesse.
Entrada e saída suportadas
Aceita
CSV, TSV ou texto simples separado por vírgula, ponto e vírgula, tabulação ou barra vertical, até 50 MB
JSON contendo uma matriz de objetos
Produz
CSV, UTF-8, CRLF finais de linha, linhas sobreviventes em sua ordem original
JSON, uma matriz de objetos recuada com dois espaços
O que esta ferramenta não fará
A comparação abrange todas as colunas, portanto, duas linhas que descrevem a mesma pessoa sobrevivem
se alguma coluna for diferente, como um ID de linha ou um carimbo de data/hora de exportação. Desmarque essa coluna
com Aplicar seleção de coluna primeiro.
Não há controle por coluna ou que não diferencia maiúsculas de minúsculas nesta página, então Ada e ada são dois
linhas.
O espaço em branco faz parte do valor, portanto, corte ou recolha os espaços primeiro ou as cópias preenchidas
sobreviver.
A linha do cabeçalho nunca é comparada e nunca removida. Uma segunda linha de cabeçalho dentro de um
arquivo concatenado é uma linha de dados comum: é único, portanto permanece.
Uma linha curta preenchida pelo analisador com espaços em branco pode acabar idêntica a uma linha mais longa cujo
as células finais estão vazias e uma das duas é descartada.
Erros comuns
Desduplicando antes de aparar. Um espaço à direita forma duas linhas de aparência idêntica
distintos, ambos são mantidos e nada indica que as duplicatas permanecem.
Esperando que a cópia mais recente vença. A primeira ocorrência sobrevive, portanto, se as linhas posteriores
carrega valores corrigidos e você mantém a versão obsoleta.
Usando este botão para limpar linhas em branco. As linhas em branco são idênticas entre si, então
exatamente um sobrevive; Remover linhas vazias é o que as limpa.
Verificando a visualização posteriormente: apenas as primeiras 100 linhas são mostradas, portanto, duplicatas
abaixo dessa linha são removidos ou mantidos invisíveis.
Notas técnicas
Cada linha é reduzida a uma chave de identidade unindo suas células com um caractere NUL, que
não pode aparecer legalmente no texto CSV. Unir uma vírgula deixaria uma célula
contendo a, b colidem com duas células contendo a e b, que é como um desduplicador
exclui silenciosamente a linha errada. As chaves vão para um conjunto de hash, então a varredura é linear
passagem e duplicatas são encontradas onde quer que estejam, e não apenas quando adjacentes, e o
transformação retorna um novo array, então Undo restaura exatamente a tabela anterior.
Perguntas frequentes
Mantém a primeira ou a última cópia?
O primeiro. A linha original permanece no lugar e as cópias posteriores são descartadas, portanto a ordem das
os dados que você mantém permanecem inalterados. Se as cópias posteriores forem as corrigidas, classifique ou edite
o arquivo para que a versão desejada venha primeiro.
Posso desduplicar em uma coluna, como e-mail?
Não diretamente; o botão compara linhas inteiras. Você pode marcar apenas essa coluna, selecione
Aplicar seleção de coluna e desduplicar, mas isso mantém apenas a coluna marcada, então
desfaça depois se precisar dos outros campos.
Por que uma duplicata óbvia ainda existe?
Algo na linha difere: um espaço à direita, um espaço ininterrupto colado de uma teia
página, uma caixa de letras diferente ou uma coluna que você esqueceu, como um ID de linha ou um
carimbo de data/hora de exportação.