Español

Cómo eliminar filas duplicadas en un CSV

Cargue el archivo en CSV Cleaner, recorte los espacios en blanco PRIMERO y luego elimine las filas duplicadas. La primera aparición de cada fila se conserva y las copias posteriores se eliminan, por lo que el orden de los datos que se conservan no cambia.

El orden de esos dos pasos es el truco. Dos filas que difieren sólo por un espacio final no son duplicados para una computadora, por lo que la deduplicación antes de recortar deja ambas en su lugar y luego informa un trabajo bien hecho.

Por qué las filas "idénticas" sobreviven a la deduplicación

Trimming aborda directamente el primero y el último de ellos. Los demás necesitan una decisión tuya, razón por la cual no se normalizan silenciosamente: el caso plegable, por ejemplo, es correcto para las direcciones de correo electrónico y incorrecto para los códigos de productos, y una herramienta no puede decir qué columna es cuál.

  • Espacios finales o iniciales. Invisible en una hoja de cálculo, decisivo para una comparación.
  • Diferencias de casos. ann@example.com y Ann@example.com son cadenas diferentes, aunque sean el mismo buzón.
  • Citas diferentes. "Smith, John" y Smith\, John pueden tener el mismo valor y diferir byte a byte antes del análisis.
  • Espacios no rompibles. Copiar y pegar una página web o un PDF con frecuencia sustituye a U+00A0 por un espacio normal, y nada parece inusual.
  • Una columna vacía al final. Una exportación escribe cuatro campos, otra escribe cuatro campos y un delimitador final.

El orden que funciona

Cada uno de esos pasos se puede deshacer por separado, hasta las últimas veinte operaciones, por lo que no tiene ningún costo intentar uno y revertirlo.

  1. Cargue el archivo y confirme que el delimitador y el recuento de columnas sean correctos. Desduplicar un archivo analizado como una columna no sirve de nada.
  2. Recorta los espacios en blanco en cada celda.
  3. Elimine las filas vacías si la exportación las tiene, para que no se colapsen en un único espacio en blanco retenido.
  4. Eliminar filas duplicadas.
  5. Verifique el recuento de filas antes y después. La diferencia es cuántos duplicados hubo.

Duplicados de fila completa, no claves duplicadas

Esto elimina filas que son idénticas en cada columna. Eso no es lo mismo que eliminar filas que comparten una clave.

Si el mismo cliente aparece dos veces con diferentes fechas de registro, esas no son filas duplicadas: son dos registros diferentes que comparten un nombre. Eliminar uno sería eliminar datos y la herramienta no lo hará por suposición.

Para deduplicar por clave, reduzca la exportación a las columnas que definen la clave, deduplica eso y use el resultado como una lista de búsqueda. O unirse en una hoja de cálculo o en una base de datos, que es donde pertenece ese tipo de decisión.

Deduplicar una sola columna de valores

Si su problema real es una lista (direcciones de correo electrónico, SKU, URL) en lugar de una tabla, Text Toolkit es la ruta más rápida. Elimina líneas duplicadas, las recorta y las clasifica, y requiere pegar en lugar de un archivo.

Allí se aplica la misma regla de orden: recortar primero y luego deduplicar.

Ejemplo resuelto: una lista de correo fusionada a partir de tres exportaciones

Se han concatenado tres exportaciones en un archivo de 4812 filas con una columna Nombre, Correo electrónico y Fuente. Algunos contactos aparecen en más de una fuente y el archivo se compiló copiando y pegando, por lo que algunas filas tienen espacios al final.

La eliminación de duplicados de inmediato informa que se eliminaron 118, sospechosamente pocos para tres listas superpuestas.

  1. Deshacer la deduplicación.
  2. Recorta los espacios en blanco en cada celda.
  3. Elimine las filas duplicadas nuevamente.
  4. Compare el recuento de filas con el original.

Resultado: La segunda pasada elimina sustancialmente más filas que la primera, porque el recorte hizo que los duplicados reales fueran idénticos. Las filas que comparten una dirección de correo electrónico pero que difieren en la columna Fuente todavía están presentes correctamente; no son filas idénticas y decidir qué Fuente gana es un juicio que la herramienta le deja a usted.

Abre la herramienta

Deduplicar un CSV en su navegador

Elimina filas idénticas en cada columna, manteniendo la primera. No adivinará cuál de dos registros similares pretendía conservar.

Lo que esto no cubre

  • Sólo se eliminan los duplicados de filas completas. La deduplicación por una columna clave no es algo que hace esta herramienta.
  • El caso es significativo. ANN@example.com y ann@example.com se mantienen como dos filas.
  • Se mantiene la primera aparición. No hay opción de conservar el último.
  • Todo el archivo se guarda en la memoria, con un límite de 50 MB.
  • Deshacer está limitado a las últimas 20 operaciones.
  • Solo las primeras 100 filas aparecen en la vista previa, así que confirme los resultados mediante el recuento de filas en lugar de desplazándose.