Dữ liệu & bảng tính · CSV Trình dọn dẹp
Cách hoạt động của tính năng loại bỏ hàng trùng lặp: So khớp chính xác, khoảng trắng và viết hoa chữ thường
· Cách thức hoạt động
csv data-cleaning trùng lặp
Hai hàng có thể trông giống hệt nhau nhưng vẫn không khớp từng byte. Bài đăng này giải thích ý nghĩa của 'sao chép' đối với một công cụ dọn dẹp, cách khoảng trắng, cách viết hoa và định dạng tạo ra các kết quả không khớp sai cũng như cách chuẩn bị dữ liệu để việc loại bỏ trùng lặp nắm bắt được những gì bạn dự định.
'Xóa các bản sao' để lại các lỗi lặp lại rõ ràng — tại sao dấu cách ở cuối hoặc chữ in hoa lại khiến hai hàng khác nhau
Xuất liên hệ có thể hiển thị hai hàng trông giống hệt nhau trong khi một email kết thúc bằng dấu cách hoặc một họ sử dụng chữ in hoa. Nút trùng lặp không áp dụng tính tương tự của con người. Trên trang được vận chuyển, nó so sánh giá trị chuỗi hoàn chỉnh của mỗi ô, với chữ hoa và khoảng trắng vẫn có ý nghĩa tại thời điểm đó.
Điều đó giải thích tại sao sự lặp lại rõ ràng có thể vẫn tồn tại sau lần nhấp chuột đầu tiên. Công cụ này đang tránh đưa ra quyết định rủi ro hơn: việc thay đổi chữ hoa chữ thường hoặc bỏ qua các trường đã chọn có thể hợp nhất các bản ghi chỉ trông có vẻ liên quan. Xem lại nguồn, chọn chuẩn hóa mà bạn thực sự muốn và chạy lại quá trình xóa chính xác sau những chỉnh sửa đó.
So sánh chính xác những gì — mọi trường và mọi ký tự, bao gồm cả những trường vô hình như dấu cách không ngắt và BOM byte đi lạc
Mỗi hàng nhận được một danh tính được xây dựng từ tất cả các ô của nó. Việc triển khai kết hợp chúng với một ký tự rỗng không phải là văn bản CSV hợp pháp, tránh lỗi phổ biến khi một ô chứa dấu phẩy va chạm với hai ô riêng biệt. Danh tính giống hệt thứ hai bị bỏ qua; hàng đầu tiên được giữ nguyên không thay đổi.
Đề cương đã đề cập đến các khoảng trắng vô hình, không bị phá vỡ và BOM byte đi lạc như thể tất cả đều được xử lý đặc biệt. Việc cắt xén JavaScript có thể xóa khoảng trắng Unicode xung quanh khi bạn chọn Cắt, nhưng quy tắc BOM rõ ràng của trình phân tích cú pháp chỉ loại bỏ U+FEFF ở đầu tệp. Nó không quét mọi ô để tìm các byte ẩn tùy ý.
So sánh chính xác bao gồm các chuỗi ô hoàn chỉnh; chỉ có tệp hàng đầu BOM bị xóa đặc biệt
Thứ tự quan trọng. Cắt bỏ khoảng trắng sẽ loại bỏ khoảng trắng ở đầu và cuối trong mỗi ô, trong khi Thu gọn khoảng trắng cũng biến các khoảng trắng bên trong thành một khoảng trắng thông thường. Việc áp dụng trước khi loại bỏ trùng lặp có thể làm cho các hàng riêng biệt trước đó trở nên bằng nhau. Việc chạy loại bỏ trước tiên sẽ bảo toàn cả hai, vì chuỗi ban đầu của chúng khác nhau.
Bảng điều khiển không hiển thị việc gập vỏ, sửa chữa Windows-1252 hoặc chuẩn hóa Unicode. Mặc dù thư viện cơ bản có tùy chọn so sánh không phân biệt chữ hoa chữ thường, nhưng tuyến gọi hàm chính xác mặc định. Do đó, tuyên bố rằng trang này tiêu chuẩn hóa kiểu chữ hoặc mã hóa sẽ vượt quá khả năng kiểm soát mà khách truy cập thực sự có thể sử dụng.
Trước tiên hãy cắt bớt hoặc thu gọn khoảng trắng; bảng điều khiển không chuẩn hóa kiểu mã hóa kiểu chữ hoặc kiểu cũ
Sự bình đẳng trong cả hàng không giống như việc xác định một khách hàng. Cả hai hàng chia sẻ một email nhưng mang dấu thời gian khác nhau đều được giữ lại vì có ít nhất một ô khác nhau. Thư viện có thể so sánh các cột đã chọn, tuy nhiên trang trùng lặp đã xuất bản không hiển thị bộ chọn cột khóa nên không thể xét xử cặp đó.
Đây là một ranh giới có giá trị hơn là một trò ảo thuật còn thiếu. Việc chọn bản ghi mới nhất, hợp nhất các trường hoặc coi bí danh là một người cần có quy tắc kinh doanh và thường là dấu vết kiểm tra. Xuất những xung đột đó để xem xét hoặc sử dụng quy trình hợp nhất tài liệu của hệ thống đích thay vì ngụy trang chúng thành các bản sao chính xác.
Trật tự và khả năng tồn tại - bản sao nào được giữ lại khi xóa các bản sao và tại sao điều đó lại quan trọng đối với dữ liệu 'cập nhật lần cuối'
Khi xảy ra sự trùng lặp chính xác, lần xuất hiện đầu tiên vẫn tồn tại và các bản sao sau đó sẽ bị xóa. Các hàng còn lại giữ nguyên thứ tự ban đầu. Nếu một phiên bản mới hơn xuất hiện sau đó nhưng khác nhau dù chỉ một trường thì đó không phải là bản sao và vẫn giữ nguyên; nếu nó bằng nhau ở cấp độ ô, thì việc giữ lại một trong hai bản sao sẽ mang lại cùng một dữ liệu.
Quy tắc sao chép đầu tiên vẫn có tác dụng quan trọng khi thứ tự hàng ghi lại nguồn gốc bên ngoài các ô. Giữ nguyên bản xuất trước khi làm sạch và kiểm tra số lượng sau mỗi hành động. Ngăn xếp hoàn tác của ToolAcre giữ lại 20 phép biến đổi trong tab hiện tại nhưng bản gốc được tải xuống là tham chiếu lâu bền nếu phiên đóng.
Ví dụ đã hoạt động - xuất liên hệ với các mục gần như trùng lặp, được chuẩn hóa để loại bỏ trùng lặp chính xác sẽ phát hiện được chúng, với các hàng vẫn cần được con người xem xét được liệt kê
Tạo một thử nghiệm nhỏ với Ada@example.com, Ada trong một hàng, hai ô giống hệt nhau trong một giây và ada@example.com cộng với Ada, theo sau là khoảng trắng trong ô thứ ba. Loại bỏ chính xác chỉ giảm hàng thứ hai. Sau đó, việc cắt bớt sẽ loại bỏ khoảng trắng ở cuối, nhưng email viết thường vẫn giữ được hàng thứ ba khác biệt.
Kết quả đó phân biệt sự chắc chắn về mặt cơ học với phán đoán của con người. Nếu các địa chỉ được biết là không phân biệt chữ hoa chữ thường trong hệ thống của bạn, hãy áp dụng quy tắc đó ở nơi khác và ghi lại quy tắc đó. Bằng chứng của trình dọn dẹp đơn giản hơn: nó có thể chứng minh các mảng hàng giống hệt nhau được giảm xuống lần xuất hiện đầu tiên mà không làm thay đổi các giá trị được giữ lại.
Điều này không bao gồm những gì - kết hợp mờ, lỗi đánh máy và hợp nhất các bản ghi xung đột
Tên mờ, khả năng chịu lỗi đánh máy, khớp ngữ âm và hợp nhất xung đột nằm ngoài hoạt động này. Nó không nhận ra rằng “Robert” và “Bob” có thể đề cập đến một người, cũng như không ghi được hai địa chỉ giống nhau. Những kỹ thuật đó có thể tạo ra kết quả dương tính giả và yêu cầu ngữ cảnh không có sẵn khi xuất phẳng.
Tính năng chống trùng lặp cột khóa cũng không có trên trang này mặc dù được hỗ trợ ở chức năng cấp thấp hơn. Các bài viết nên mô tả lộ trình mà người đọc có thể sử dụng, không phải các thông số tiềm ẩn không có sự kiểm soát. Để giải quyết danh tính, hãy chọn quy trình đánh giá được xây dựng có mục đích trong đó hiển thị bằng chứng trùng khớp và quy tắc của người sống sót.
Việc loại bỏ trùng lặp chỉ hiệu quả như việc chuẩn hóa trước đó — cách loại bỏ trùng lặp của ToolAcre CSV Cleaner phù hợp như thế nào sau khi sửa chữa mã hóa và tiêu đề của nó
Trình tự đáng tin cậy của ToolAcre là kiểm tra, chuẩn hóa khoảng trắng đã chọn, sau đó xóa các lần lặp lại chính xác. Sửa chữa mã hóa và sửa chữa tiêu đề tự động không phải là giai đoạn sơ bộ ẩn. Trình phân tích cú pháp loại bỏ UTF-8 BOM ở đầu, phát hiện dấu phân cách và báo cáo các vấn đề về cấu trúc; nó không diễn giải lại các mã hóa ký tự bị hỏng.
Sau khi xóa, hãy so sánh số lượng hàng và xem trước những người sống sót trước khi tải xuống. Những gì đã biến mất được chứng minh là bằng nhau trên mọi ô dưới dây hiện tại. Những gì còn lại có thể bao gồm các bản sao hợp pháp gần như trùng lặp và việc lưu giữ những hồ sơ không chắc chắn đó sẽ an toàn hơn việc âm thầm hợp nhất dữ liệu khách hàng theo một giả định.