Datos y hojas de cálculo · CSV Limpiador
Cómo funciona la eliminación de filas duplicadas: coincidencias exactas, espacios en blanco y casos
· Cómo funciona
csv limpieza de datos duplicados
Dos filas pueden parecer idénticas y aun así no coincidir byte por byte. Esta publicación explica qué significa "duplicar" para una herramienta de limpieza, cómo los espacios en blanco, las mayúsculas y las minúsculas y el formato crean falsas no coincidencias y cómo preparar los datos para que la deduplicación detecte lo que desea.
'Eliminar duplicados' dejó repeticiones obvias: por qué un espacio final o una letra mayúscula hacen que dos filas sean diferentes
Una exportación de contacto puede mostrar dos filas que parecen idénticas, mientras que un correo electrónico termina con un espacio o un apellido usa una letra mayúscula. El botón duplicar no aplica similitud humana. En la página enviada, compara el valor completo de la cadena de cada celda, y las mayúsculas y minúsculas y los espacios en blanco siguen siendo significativos en ese momento.
Eso explica por qué puede quedar una repetición aparentemente obvia después del primer clic. La herramienta evita una decisión más arriesgada: cambiar el caso o ignorar los campos seleccionados podría fusionar registros que solo parecen relacionados. Revise la fuente, elija la normalización que realmente desea y vuelva a ejecutar la eliminación exacta después de esas ediciones.
Qué comparación exacta se compara: cada campo y cada carácter, incluidos los invisibles, como los espacios que no se separan y los bytes de lista de materiales extraviados.
Cada fila recibe una identidad construida a partir de todas sus celdas. La implementación los une con un carácter nulo que no es texto CSV legal, evitando el error común donde una celda que contiene una coma choca con dos celdas separadas. Se omite una segunda identidad idéntica; la primera fila se mantiene sin cambios.
El esquema menciona espacios invisibles que no se separan y bytes de lista de materiales extraviados como si todos recibieran un tratamiento especial. El recorte de JavaScript puede eliminar los espacios en blanco Unicode circundantes cuando elige Recortar, pero la regla BOM explícita del analizador solo elimina U+FEFF al comienzo del archivo. No escanea cada celda en busca de bytes ocultos arbitrarios.
La comparación exacta cubre cadenas de celdas completas; solo se elimina especialmente una lista de materiales principal del archivo
El pedido importa. Recortar espacios en blanco elimina los espacios iniciales y finales en cada celda, mientras que Contraer espacios también convierte los espacios en blanco internos en un espacio normal. Aplicar cualquiera de los dos antes de la eliminación de duplicados puede hacer que las filas previamente distintas sean iguales. Ejecutar primero la eliminación conserva ambos, porque sus cadenas originales difieren.
El panel no expone el plegado de la caja, la reparación de Windows-1252 ni la normalización de Unicode. Aunque la biblioteca subyacente tiene una opción para la comparación que no distingue entre mayúsculas y minúsculas, la ruta llama a la función exacta predeterminada. Por lo tanto, afirmar que esta página estandariza el caso o la codificación excedería los controles que un visitante realmente puede utilizar.
Recorte o contraiga los espacios en blanco primero; el panel no normaliza codificaciones de casos o heredadas
La igualdad de filas completas no es lo mismo que identificar a un cliente. Se mantienen dos filas que comparten un correo electrónico pero que llevan marcas de tiempo diferentes porque al menos una celda difiere. La biblioteca puede comparar columnas seleccionadas, pero la página duplicada publicada no expone un selector de columna clave, por lo que no puede adjudicar ese par.
Este es un límite valioso más que un truco de magia faltante. Elegir el registro más nuevo, fusionar campos o tratar los alias como una sola persona requiere una regla comercial y, a menudo, un seguimiento de auditoría. Exporte esos conflictos para su revisión o utilice el flujo de trabajo de combinación documentado del sistema de destino en lugar de disfrazarlos como duplicados exactos.
Orden y supervivencia: qué copia se conserva cuando se eliminan los duplicados y por qué eso es importante para los datos de la "última actualización"
Cuando se producen duplicados exactos, la primera aparición sobrevive y las copias posteriores se eliminan. Las filas supervivientes mantienen su orden original. Si una versión más nueva aparece más adelante pero difiere incluso en un campo, no es un duplicado y permanece; si es igual byte por byte a nivel de celda, conservar cualquiera de las copias produce los mismos datos.
La regla de la primera copia sigue siendo importante operativamente cuando el orden de las filas registra la procedencia fuera de las celdas. Mantenga una exportación intacta antes de limpiar e inspeccione los recuentos después de cada acción. La pila de deshacer de ToolAcre conserva veinte transformaciones en la pestaña actual, pero un original descargado es la referencia duradera si se cierra la sesión.
Ejemplo resuelto: una exportación de contactos con casi duplicados, normalizada para que la deduplicación exacta los detecte, con las filas que aún necesitan revisión humana enumeradas
Cree una pequeña prueba con Ada@example.com, Ada en una fila, exactamente las mismas dos celdas en una segunda y ada@example.com más Ada seguida de un espacio en una tercera. La eliminación exacta cae solo en la segunda fila. Luego, al recortar se elimina el espacio final, pero el correo electrónico en minúscula aún mantiene la tercera fila distinta.
Ese resultado distingue la certeza mecánica del juicio humano. Si se sabe que las direcciones no distinguen entre mayúsculas y minúsculas en su sistema, aplique esa regla en otro lugar y documentela. La evidencia del limpiador es más simple: puede demostrar que matrices de filas idénticas se reducen a su primera aparición sin mutar los valores retenidos.
Lo que esto no cubre: coincidencia aproximada, tolerancia a errores tipográficos y fusión de registros en conflicto
Los nombres confusos, la tolerancia a errores tipográficos, la coincidencia fonética y la fusión de conflictos están fuera de esta operación. No reconoce que “Robert” y “Bob” puedan referirse a una persona, ni califica dos direcciones por similitud. Esas técnicas pueden generar falsos positivos y requerir un contexto que no está disponible en una exportación plana.
La deduplicación de columnas clave tampoco está presente en esta página a pesar de la compatibilidad con la función de nivel inferior. Los artículos deben describir la ruta que puede utilizar un lector, no parámetros latentes sin control. Para la resolución de identidad, seleccione un proceso de revisión diseñado específicamente donde las pruebas de coincidencia y las reglas de superviviente sean visibles.
La deduplicación es tan buena como la normalización anterior: cómo encaja la eliminación de duplicados del limpiador ToolAcre CSV después de su codificación y reparación del encabezado
La secuencia confiable de ToolAcre es inspeccionar, normalizar los espacios en blanco elegidos y luego eliminar las repeticiones exactas. La reparación de codificación y la reparación automática de encabezados no son etapas preliminares ocultas. El analizador elimina una lista de materiales UTF-8 inicial, detecta un delimitador e informa problemas estructurales; no reinterpreta codificaciones de caracteres dañadas.
Después de la eliminación, compare el recuento de filas y obtenga una vista previa de los supervivientes antes de la descarga. Lo que desapareció fue probablemente igual en todas las celdas debajo de las cuerdas presentes en ese momento. Lo que queda puede incluir casi duplicados legítimos, y mantener esos registros inciertos es más seguro que fusionar silenciosamente datos de clientes basándose en una suposición.