Outils de développement · Comparaison de texte
Recherche d'entrées ajoutées et supprimées entre deux listes ou exportations de données
· Pourquoi c'est important
texte-diff data-cleaning listes
Montre comment transformer deux exportations en texte trié, un élément par ligne et les comparer pour trouver exactement quelles entrées sont apparues ou ont disparu.
Quelles vingt lignes ont changé entre ces deux exportations ? — s'ouvre avec le problème de réconciliation
Une question de rapprochement commence souvent par deux exports et aucun journal des modifications utile : quelles entrées ont disparu et lesquelles sont arrivées ? Une différence de ligne brute peut répondre, mais uniquement lorsque des éléments identiques peuvent s'aligner. Différents ordres de tri créent un mouvement apparent plutôt qu'une vue claire semblable à un ensemble.
Préparez des copies plutôt que de modifier les preuves. Conservez les exportations originales, extrayez le champ en cours de rapprochement et triez les deux copies avec la même règle. La comparaison rapporte ensuite les lignes de gauche supprimées et les lignes de droite ajoutées autour des entrées partagées stables.
Pourquoi le tri transforme d'abord une différence en une comparaison définie – explique qu'un ordre identique permet à une différence de ligne de signaler des ajouts et des suppressions purs
Le tri place les valeurs égales dans les quartiers correspondants, permettant au LCS ordonné de les conserver. Sans tri, le même élément à une position différente peut apparaître supprimé et inséré car la comparaison de lignes préserve l'ordre relatif. Le tri change la question du changement de séquence vers le changement d'appartenance.
Ce n'est toujours pas une opération mathématique d'ensemble. Les lignes en double restent des unités de séquence en double et l'algorithme peut signaler les modifications de leurs décomptes. Décidez si les doublons sont significatifs avant de les dédupliquer, car les supprimer pendant la préparation supprimerait les preuves des enregistrements répétés.
Un élément par ligne, mise en forme cohérente : couvre le découpage, la mise en correspondance de la casse et la suppression des en-têtes afin que les entrées s'alignent
Utilisez un élément par ligne et une représentation par élément. Supprimez uniquement un en-tête de la copie de comparaison jetable et enregistrez cette décision. La correspondance manuelle de la casse ou du remplissage peut masquer les distinctions, alors commencez par une comparaison stricte et inspectez les variantes avant d'appliquer les options.
Si les valeurs contiennent des nouvelles lignes intégrées ou plusieurs colonnes CSV, la comparaison en ligne simple n'est pas le bon modèle. Un outil compatible CSV comprend les devis et les enregistrements. Text diff ne voit que les chaînes séparées après la normalisation de la nouvelle ligne et ne peut pas conserver les champs tabulaires associés par une clé.
Exemple concret : deux listes de SKU – trie les deux listes, les compare et lit trois entrées supprimées et cinq entrées ajoutées.
Supposons qu'hier contienne les SKU A100, B210, C300 et E900, alors qu'aujourd'hui contient A100, C300, D450 et F800. Triez chaque liste, comparez et lisez B210 et E900 comme suppressions avec D450 et F800 comme ajouts. Les lignes partagées ancrent le rapport.
Vérifiez les décomptes par rapport à chaque source avant d'agir. Un sous-ensemble copié, une exportation filtrée ou un en-tête modifié peuvent imiter le mouvement des stocks. Le diff identifie l'appartenance textuelle aux listes préparées ; cela ne prouve pas un événement d'entrepôt, une demande de suppression ou un état de catalogue valide.
Utilisation d'ignorer la casse et d'ignorer les espaces pour les exportations compliquées : affiche les options absorbant les majuscules et le remplissage incohérents sans modifier les données
Ignorer la casse peut faire correspondre `sku-a` avec `SKU-A`, et Ignorer les espaces peut correspondre aux variantes rembourrées après découpage et condensation. Ces options sont utiles pour diagnostiquer les exportations incohérentes, mais elles peuvent également masquer des identifiants distincts lorsque la casse ou l'espacement est important.
Exécutez chaque option séparément et enregistrez les résultats stricts. Si les résultats normalisés réduisent le nombre de modifications, acheminez ces entrées vers un examen de la qualité des données plutôt que de les traiter silencieusement comme identiques. Les lignes originales restent la source de vérité pour correction.
Lorsqu'une feuille de calcul est le meilleur outil : reconnaît que les recherches sur plusieurs colonnes sont un travail pour une feuille de calcul, pas une différence de texte
Une feuille de calcul ou une base de données est préférable lorsque les enregistrements doivent correspondre sur une clé tandis que les autres colonnes changent. Il peut joindre des lignes, comparer des champs et conserver les valeurs saisies. Une différence de ligne ne peut pas savoir que deux lignes CSV partagent un e-mail alors que leurs horodatages diffèrent.
Utilisez ToolAcre pour une liste à une seule colonne, une exportation rédigée ou une vérification rapide des enregistrements ordonnés. Passez à la réconciliation basée sur les tables lorsque des délimiteurs entre guillemets, des clés composites, des tolérances numériques ou des politiques de résolution en double entrent dans l'exigence.
Ce que cela ne couvre pas : faire correspondre les enregistrements sur une clé tandis que d'autres colonnes changent, ou comparer les fichiers CSV en tant que tables
Ce flux de travail ne compare pas CSV en tant que tableaux, ne déduit pas les entrées renommées et ne choisit pas la source faisant autorité. Une ligne supprimée peut être due à une suppression, à un changement de filtre ou à une incompatibilité de format. Une ligne ajoutée peut être nouvelle, dupliquée ou simplement normalisée différemment.
Il ne télécharge pas non plus de fichier car il n'en accepte pas ; les utilisateurs collent des chaînes dans les éditeurs. Ce chemin d'appel local est utile pour les listes rédigées, mais la politique opérationnelle détermine toujours si les données sources peuvent être copiées dans un onglet du navigateur.
À retenir : trier, puis comparer - résume la technique et comment la comparaison de texte de ToolAcre gère les listes dans le navigateur sans rien télécharger
Triez, conservez les doublons, comparez strictement et expliquez chaque normalisation. Ces quatre étapes transforment une différence d’exportation opaque en une liste révisable sans exagérer ce que sait l’algorithme. Conservez la recette de préparation à côté du résultat afin qu'une autre personne puisse la reproduire.
L'outil de navigation fournit les numéros de ligne, les types de lignes et les décomptes récapitulatifs. Votre processus de réconciliation fournit la provenance, la signification clé et l’approbation. Lorsque ces responsabilités restent séparées, une simple différence de ligne devient un premier passage fiable plutôt qu'une politique de nettoyage accidentel des données.