Удалите повторяющиеся строки из экспортированной таблицы, сохранив первую копию каждой.
Инструмент загружается здесь. Требуется JavaScript, потому что работа происходит на вашем устройстве.
Ваши файлы и ваша конфиденциальность
Сравниваемые строки никогда не покидают ваше устройство. Файл читается браузером, анализируется
веб-работником на этой вкладке, дедуплицируется в памяти и записывается обратно браузером
механизм загрузки. Код инструмента не отправляет запрос на передачу файла, вставленного текста или
сгенерированный вывод. Запросы сценариев раскрытой аналитики являются отдельными и описаны в разделе
Политику конфиденциальности сайта.
Что делает этот инструмент
Удалите строки, повторяющие строку, уже замеченную ранее в файле. Сравнение охватывает
каждый столбец использует проанализированные значения ячеек, чувствителен к регистру и обрабатывает пробелы как
значительный. Первое вхождение сохраняется, а порядок сохранившихся строк следующий:
без изменений.
Дедупликация обрабатывает строки данных по порядку и сохраняет только первое появление каждой из них. А
строка является дубликатом, если каждая из ее ячеек точно соответствует предыдущей строке по сравнению
после синтаксического анализа, поэтому поле, записанное в кавычках, равно тому же полю, записанному без
их. Регистр и пробел учитываются: Ада, Ада и Ада с конечным пробелом — три.
отдельные ряды. Дубликаты не обязательно должны быть соседними, а оставшиеся строки остаются на своих местах.
были.
Как его использовать
Выберите «Выбрать файл CSV» или «JSON» и загрузите экспорт.
Сначала обратите внимание на количество строк, поскольку инструмент сообщает, сколько строк осталось, а не сколько строк.
многих это удалило.
Выберите «Обрезать пробелы», если ячейки могут быть заполнены, поскольку строки, отличающиеся только пробелом,
не дубликаты.
Выберите «Удалить повторяющиеся строки», прочитайте оставшееся количество в сообщении, затем выберите
Загрузите CSV или отмените действие.
Примеры использования
Список рассылки, собранный из нескольких экспортов, в которых был указан один и тот же адрес.
дважды.
Отчет загружен дважды и объединен, поэтому снова появляется целый блок строк.
дальше вниз.
Записи были повторно вставлены заданием синхронизации, которое выполнялось дважды, прежде чем кто-либо заметил.
Поддерживаемый ввод и вывод
Принимает
CSV, TSV или обычный текст, разделенный запятой, точкой с запятой, символом табуляции или вертикальной чертой, до 50 MB
JSON, содержащий массив объектов
Производит
CSV, UTF-8, CRLF окончания строк, сохранившиеся строки в исходном порядке
JSON, массив объектов с отступом в два пробела.
Чего этот инструмент не сделает
Сравнение охватывает каждый столбец, поэтому сохраняются две строки, описывающие одного и того же человека.
если какой-либо столбец отличается, например идентификатор строки или отметка времени экспорта. Отмените выбор этого столбца
сначала выберите Применить столбец.
На этой странице нет элементов управления по столбцам или без учета регистра, поэтому Ada и ada — это два
ряды.
Пробелы являются частью значения, поэтому сначала обрезайте или сворачивайте пробелы или дополняемые копии.
выжить.
Строка заголовка никогда не сравнивается и никогда не удаляется. Вторая строка заголовка внутри
объединенный файл представляет собой обычную строку данных: он уникален, поэтому он остается.
Короткая строка, заполненная синтаксическим анализатором пробелами, может оказаться идентичной более длинной строке, чья
конечные ячейки пусты, и одна из двух удаляется.
Распространенные ошибки
Удаление дубликатов перед обрезкой. Завершающий пробел образует две одинаково выглядящие строки.
различны, оба сохраняются, и ничто не говорит о том, что дубликаты остаются.
Ожидаем, что победит самая последняя копия. Первое вхождение сохраняется, поэтому, если последующие строки
переносите исправленные значения, вы сохраняете устаревшую версию.
Используйте эту кнопку для очистки пустых строк. Пустые строки идентичны друг другу, поэтому
выживает ровно один; Удаление пустых строк — это их очистка.
После этого выборочная проверка предварительного просмотра: отображаются только первые 100 строки, поэтому дублируются
ниже этой линии удаляются или остаются невидимыми.
Технические примечания
Каждая строка сводится к идентификационному ключу путем объединения ее ячеек с помощью символа NUL, который
не может легально появляться в тексте CSV. Вместо этого соединение по запятой позволит одной ячейке
содержащие a,b, сталкиваются с двумя ячейками, содержащими a и b, так работает дедупликатор.
молча удаляет не ту строку. Ключи попадают в хеш-набор, поэтому сканирование представляет собой одно линейное сканирование.
проход и дубликаты обнаруживаются везде, где они находятся, а не только когда они находятся рядом, и
преобразование возвращает новый массив, поэтому функция «Отменить» точно восстанавливает предыдущую таблицу.
Часто задаваемые вопросы
Сохраняется ли первая или последняя копия?
Первый. Исходная строка остается на месте, а последующие копии удаляются, поэтому порядок
данные, которые вы сохраняете, не изменяются. Если более поздние копии являются исправленными, отсортируйте или отредактируйте их.
файл, поэтому нужная версия будет первой.
Могу ли я выполнить дедупликацию по одному столбцу, например по электронной почте?
Не напрямую; кнопка сравнивает целые строки. Вы можете отметить только этот столбец, выберите
Примените выбор столбца, а затем дедупликацию, но при этом сохранится только отмеченный столбец, поэтому
отмените действие впоследствии, если вам нужны другие поля.
Почему очевидный дубликат все еще существует?
Что-то в строке отличается: конечный пробел, неразрывный пробел, вставленный из паутины.
страница, другой регистр букв или столбец, который вы забыли, например идентификатор строки или
временная метка экспорта.