Русский

Удаление повторяющихся строк из CSV

Удалите повторяющиеся строки из экспортированной таблицы, сохранив первую копию каждой.

Инструмент загружается здесь. Требуется JavaScript, потому что работа происходит на вашем устройстве.

Ваши файлы и ваша конфиденциальность

Сравниваемые строки никогда не покидают ваше устройство. Файл читается браузером, анализируется веб-работником на этой вкладке, дедуплицируется в памяти и записывается обратно браузером механизм загрузки. Код инструмента не отправляет запрос на передачу файла, вставленного текста или сгенерированный вывод. Запросы сценариев раскрытой аналитики являются отдельными и описаны в разделе Политику конфиденциальности сайта.

Что делает этот инструмент

Удалите строки, повторяющие строку, уже замеченную ранее в файле. Сравнение охватывает каждый столбец использует проанализированные значения ячеек, чувствителен к регистру и обрабатывает пробелы как значительный. Первое вхождение сохраняется, а порядок сохранившихся строк следующий: без изменений.

Дедупликация обрабатывает строки данных по порядку и сохраняет только первое появление каждой из них. А строка является дубликатом, если каждая из ее ячеек точно соответствует предыдущей строке по сравнению после синтаксического анализа, поэтому поле, записанное в кавычках, равно тому же полю, записанному без их. Регистр и пробел учитываются: Ада, Ада и Ада с конечным пробелом — три. отдельные ряды. Дубликаты не обязательно должны быть соседними, а оставшиеся строки остаются на своих местах. были.

Как его использовать

  1. Выберите «Выбрать файл CSV» или «JSON» и загрузите экспорт.
  2. Сначала обратите внимание на количество строк, поскольку инструмент сообщает, сколько строк осталось, а не сколько строк. многих это удалило.
  3. Выберите «Обрезать пробелы», если ячейки могут быть заполнены, поскольку строки, отличающиеся только пробелом, не дубликаты.
  4. Выберите «Удалить повторяющиеся строки», прочитайте оставшееся количество в сообщении, затем выберите Загрузите CSV или отмените действие.

Примеры использования

Поддерживаемый ввод и вывод

Принимает

Производит

Чего этот инструмент не сделает

Распространенные ошибки

Технические примечания

Каждая строка сводится к идентификационному ключу путем объединения ее ячеек с помощью символа NUL, который не может легально появляться в тексте CSV. Вместо этого соединение по запятой позволит одной ячейке содержащие a,b, сталкиваются с двумя ячейками, содержащими a и b, так работает дедупликатор. молча удаляет не ту строку. Ключи попадают в хеш-набор, поэтому сканирование представляет собой одно линейное сканирование. проход и дубликаты обнаруживаются везде, где они находятся, а не только когда они находятся рядом, и преобразование возвращает новый массив, поэтому функция «Отменить» точно восстанавливает предыдущую таблицу.

Часто задаваемые вопросы

Сохраняется ли первая или последняя копия?
Первый. Исходная строка остается на месте, а последующие копии удаляются, поэтому порядок данные, которые вы сохраняете, не изменяются. Если более поздние копии являются исправленными, отсортируйте или отредактируйте их. файл, поэтому нужная версия будет первой.
Могу ли я выполнить дедупликацию по одному столбцу, например по электронной почте?
Не напрямую; кнопка сравнивает целые строки. Вы можете отметить только этот столбец, выберите Примените выбор столбца, а затем дедупликацию, но при этом сохранится только отмеченный столбец, поэтому отмените действие впоследствии, если вам нужны другие поля.
Почему очевидный дубликат все еще существует?
Что-то в строке отличается: конечный пробел, неразрывный пробел, вставленный из паутины. страница, другой регистр букв или столбец, который вы забыли, например идентификатор строки или временная метка экспорта.