Удаление дубликатов строк онлайн

Онлайн-инструмент убирает повторяющиеся строки из списка и оставляет только уникальные. Удалить дубликаты онлайн можно с учётом регистра или без, с подсчётом повторов и сортировкой результата.

Список

0 строк

Без дубликатов

0 строк
Скопировано ✓ Уникальных:0Удалено:0

Пример: вход → результат

Вход
москва
спб
москва
казань
спб
Результат
москва
спб
казань

Удаляет повторяющиеся строки, сохраняя исходный порядок. С учётом регистра или без — на выбор.

Когда пригодится

Убрать повторы из списка ключей

Семантика из разных источников всегда полна дублей. Инструмент оставляет только уникальные строки — с учётом регистра или без, с обрезкой пробелов по краям.

Со списком в таблице вместо текста те же дубли убираются средствами Excel и Google Таблиц, разобрал четыре способа с мокапами. Как это встроить в работу над сайтом — в разборе Как собрать семантическое ядро.

Точные и неявные дубли ключевых слов

Инструмент убирает точные дубли — строки, совпадающие символ в символ (с поправкой на регистр и пробелы по краям). Для чистки ядра после объединения выгрузок этого хватает в большинстве случаев.

Но в семантике живут и неявные дубли — фразы одного смысла с разным порядком или формой слов: «купить диван» и «диван купить», «угловые шкафы» и «шкаф угловой». Как строки они различаются, поэтому дедуп по точному совпадению их не схлопнет.

Вход
купить диван диван купить диван недорого
Точный дедуп
купить диван диван купить диван недорого

Все три строки уникальны посимвольно — точный дедуп оставит их как есть.

Чтобы схлопнуть неявные дубли и дубли ключевых слов по нормальной форме, перейдите в удаление неявных дублей: там фразы приводятся к начальной форме и сравниваются по составу слов, без привязки к написанию — «купить диван» и «диван купить» становятся одним ключом.

Что считается повтором и почему «одинаковые» строки остаются

Инструмент идёт по списку сверху вниз и запоминает каждую строку, которую уже видел. Строка, которая встречается впервые, попадает в результат; повтор пропускается, а счётчик у первой строки растёт. Поэтому порядок первых появлений сохраняется, и первая «Москва» остаётся на своём месте, сколько бы «Москв» ни шло дальше. Сравнение посимвольное: две строки равны, только если совпадает каждый знак.

Переключатели меняют, что считать «каждым знаком». Без учёта регистра «Москва» и «МОСКВА» перед сравнением приводятся к одному виду, с игнорированием краёв срезаются пробелы и табуляции по концам. Всё остальное различие остаётся: неразрывный пробел вместо обычного, буква «ё» вместо «е», латинская «а» вместо русской в слове «Москва» делают строки разными, хотя на экране они одинаковы.

Такие невидимые различия — главная причина, по которой после дедупа список всё ещё выглядит с повторами. Они приходят из Excel, из копирования с сайтов и из выгрузок разных систем, и вылавливать их приходится отдельным проходом.

Таблица со столбцами данных
Повторы в выгрузке видны глазом, невидимые отличия между «одинаковыми» строками — нет. Фото: Jasozh, CC BY-SA 4.0.
ОтличиеКак выглядитЧто делать
Пробел в конце«ключ » и «ключ»включить игнорирование краёв
Неразрывный пробелкак обычный пробелпрогнать через чистку пробелов
«ё» и «е»«ёлка» и «елка»заменить ё на е заранее
Латиница вместо кириллицы«Mосква» с латинской Mискать по латинским буквам

От перфокарт до кнопки в Excel

Удаление повторов — одна из первых задач, которые поручили машинам. Табуляторы Холлерита конца XIX века и сортировщики перфокарт IBM раскладывали карты по значению колонки, и одинаковые карты оказывались рядом: оператору оставалось вынуть лишние. В Unix начала семидесятых появилась команда uniq, которая делает ровно это с текстом: удаляет подряд идущие одинаковые строки, поэтому перед ней список сортируют. Связка sort и uniq живёт в терминалах до сих пор.

Базы данных получили слово DISTINCT вместе с языком SQL в семидесятые, и с тех пор «выбрать без повторов» стало одной строкой запроса. Электронные таблицы шли медленнее: в Excel кнопка «Удалить дубликаты» появилась только в версии 2007 года, до этого повторы искали расширенным фильтром и формулами. В Google Таблицах ту же работу делает функция UNIQUE.

Способ, который работает в браузере на этой странице, называют хеш-множеством: каждая строка превращается в короткий отпечаток, и проверка «видел ли я это» занимает одинаковое время хоть на сотне строк, хоть на миллионе. Поэтому список из выгрузки на десятки тысяч ключей чистится за доли секунды.

Руководства по Unix
Команда uniq из первых версий Unix: повторы убирают уже полвека одной строкой. Фото: Викисклад, общественное достояние.
Сортировщик перфокарт IBM
Сортировщик раскладывал карты по значению, и одинаковые оказывались рядом. Фото: Joe Mabel, CC BY-SA 3.0.

Подготовка списка и правила для адресов

Готовьте список до дедупа. Сначала чистка пробелов уберёт неразрывные пробелы и двойные пробелы внутри строк, затем смена регистра приведёт всё к строчным, если регистр не важен. После этого дедуп снимет настоящие повторы целиком, без половинчатого результата. Сколько строк ушло, покажет подсчёт строк до и после.

У адресов и почты свои правила равенства. Адреса с http и https, со слешем на конце и без него, с метками utm и без — для сервера одна страница, для дедупа четыре строки. Приведите их к одному виду заранее: уберите протокол, хвосты после знака вопроса и завершающий слеш. У почтовых адресов домен регистра не различает, поэтому весь список опускайте в строчные.

Включайте счётчик повторов, когда список пришёл из нескольких источников: число рядом со строкой показывает, сколько выгрузок её содержали, и это готовая оценка важности. Фразы одного смысла в разных формах дедуп не схлопнет, для них есть удаление неявных дублей, а разложить результат по алфавиту или по длине умеет сортировка списка.

Сравнениепосимвольное
Порядокпервых появлений
Регистрпо выбору
Края строкпо выбору
Счётчик повторовесть
Команда uniqначало 1970-х
DISTINCT в SQL1970-е
Кнопка в Excel2007

Настройки удаления дубликатов

Четыре переключателя над полем меняют логику сравнения строк — включайте под свою задачу:

  • Не учитывать регистр — «Москва», «москва» и «МОСКВА» считаются одной строкой. Включайте, когда регистр для вас не важен.
  • Игнорировать пробелы по краям — «ключ» и «ключ » (с лишним пробелом) считаются одинаковыми. Спасает при вставке из Excel, где часто остаются хвостовые пробелы.
  • Показать число повторов — рядом с каждой строкой появится «(×N)»: сколько раз она встречалась в исходном списке.
  • Сортировать результат — уникальные строки выстроятся по алфавиту. Без этой опции сохраняется исходный порядок первых появлений.
Инструмент удаления дубликатов в работе: список из 7 строк с включёнными «не учитывать регистр» и «игнорировать пробелы» превращается в 4 уникальные строки, удалено 3 повтора
Тот же список с опциями «не учитывать регистр» и «игнорировать пробелы»: 7 строк → 4 уникальные, 3 повтора удалены.

Как пользоваться

Вставьте список из Excel, Google Таблиц или текстового файла — удалить дубли онлайн получится за секунду, бесплатно и без регистрации.

  1. Скопируйте список в левое поле — по одному значению на строку.
  2. При необходимости включите «без учёта регистра» и «игнорировать пробелы по краям», чтобы «Москва» и «москва » считались одинаковыми.
  3. Справа останутся только уникальные строки. Включите «показать число повторов», чтобы видеть, сколько раз встречалась каждая. Нажмите «Скопировать результат».
СпособСохраняет порядокДля чего удобнееО чём помнить
Этот инструментдасписки ключей, адресов, почтработает в браузере, список никуда не отправляется
Excel, «Удалить дубликаты»датаблицы с несколькими столбцамименяет исходный лист, отменяется только откатом
Google Таблицы, UNIQUEдатаблицы, где нужен живой пересчётрезультат живёт в отдельном диапазоне
Notepad++нетбольшие текстовые файлыв старых сборках убирает только подряд идущие, список нужно сортировать
Pythonда, через dict.fromkeysразовые скрипты и автоматизациючерез set порядок теряется
SQLпо сортировке запросаданные, которые лежат в базеDISTINCT только выбирает; удаление — через ROW_NUMBER()

Частые вопросы

Что делает инструмент?

Оставляет в списке только уникальные строки, удаляя все повторы. Порядок первых появлений сохраняется.

Как считать «Москва» и «москва» одинаковыми?

Включите опцию «не учитывать регистр». Опция «игнорировать пробелы по краям» дополнительно убирает лишние пробелы в начале и конце строки перед сравнением.

Можно увидеть, сколько раз повторялась строка?

Да, включите «показать число повторов» — рядом с каждой строкой появится «(×N)».

Есть ли ограничение по количеству строк?

Жёсткого лимита нет — инструмент обрабатывает списки в десятки тысяч строк прямо в браузере. Скорость зависит только от вашего устройства, потому что данные никуда не отправляются.

Работает ли инструмент без интернета?

Сама обработка идёт офлайн — в браузере, без обращений к серверу. Но страницу нужно сначала открыть, поэтому для первого захода интернет всё же требуется.

Чем отличается от удаления дубликатов в Excel?

Результат тот же, но быстрее для разовой задачи: не нужно открывать таблицу, выделять диапазон и искать пункт меню. Вставил список — забрал уникальные строки. Для постоянной работы с большими таблицами удобнее Excel, для быстрой чистки списка — этот инструмент.

Умеет убирать неявные дубли — с разным порядком слов?

Нет, этот инструмент сравнивает строки по точному совпадению (с поправкой на регистр и пробелы), поэтому «купить диван» и «диван купить» останутся обе. Для неявных дублей и дублей ключевых слов по нормальной форме используйте инструмент лемматизации — он приводит фразы к начальной форме и сравнивает по составу слов.

Как удалить повторяющиеся строки в Word?

Отдельной кнопки для этого в Word нет. Список обычно переносят в таблицу и сортируют, а дубли убирают вручную, либо пишут макрос на VBA. Быстрее вставить список сюда и вернуть в документ уже без повторов.

Как в SQL убрать повторяющиеся строки?

Для выборки достаточно SELECT DISTINCT — он вернёт уникальные строки, ничего не меняя в таблице. Чтобы удалить дубли физически, строки нумеруют оконной функцией ROW_NUMBER() OVER (PARTITION BY нужные_поля ORDER BY id) и удаляют всё, где номер больше единицы.

Как удалить дубликаты строк в Notepad++?

В меню «Правка → Операции со строками» есть удаление подряд идущих дубликатов, а в свежих сборках — и удаление всех дублей сразу. Если пункт только про последовательные, список сначала сортируют, иначе повторы, разбросанные по файлу, останутся.

Как убрать дубли из списка в Python?

list(dict.fromkeys(lines)) убирает повторы и сохраняет исходный порядок. Через set(lines) короче, но порядок теряется — для списков ключевых слов и адресов это обычно мешает.

Где этому учат

Удалить дубликаты в Excel, Google Таблицах и LibreOffice

Если список уже в таблице, чистить дубли удобнее на месте. Разберём встроенные способы — а для быстрой разовой чистки текста инструмент на этой странице обходится без открытия файла.

Удаление дубликатов — Excel
Столбцы, по которым искать повторы:
ОтменаОК
Найдено и удалено 3 повтора; осталось 12 уникальных значений.
Excel: выдели диапазон → вкладка ДанныеУдалить дубликаты → отметь столбцы → ОК. Чтобы почистить один столбец, оставь галочку только на нём.

Google Таблицы. Выдели диапазон → ДанныеОчистка данныхУдалить повторяющиеся строки. Сравнивает строки по выбранным столбцам.

LibreOffice Calc. Готовой кнопки нет: примени Стандартный фильтр с опцией «Без повторений» и скопируй результат — либо выгрузи список и почисти его инструментом выше.

Быстрая чистка списка. Когда данные в тексте — выгрузка ключей, список URL, строки из лога — инструмент выше уберёт дубликаты онлайн, без открытия файла и поиска пункта меню.

Что включено над полемЧто считается одной строкойОстанется из 7Что в результате
ничегоразличается всё, включая пробел в конце строки6строки идут в порядке первого появления
игнорировать пробелы по краям«москва» и та же строка с пробелом в конце5пробелы по краям срезаются и в самом результате
не учитывать регистр«Москва», «москва» и «МОСКВА»5остаётся написание, которое встретилось первым
обе галочки сразурегистр и хвостовые пробелы перестают мешать4москва, санкт-петербург, казань, СПБ
Считано на списке кнопки «Демо-данные»: москва, Москва, санкт-петербург, москва с пробелом в конце, казань, СПБ, казань. Галочка «показать число повторов» допишет к результату «москва (×3)» и «казань (×2)», а «сортировать результат» выстроит итог по алфавиту вместо порядка первого появления.

Похожие инструменты

Лемматизация и нормализация

Приводит ключи к основе (стемминг) и схлопывает словоформы. Умный дедуп семантики: ловит дубли по падежам, числу и порядку слов.

Открыть
Обернуть строки

Добавляет кавычки, скобки или теги вокруг каждой строки и соединяет разделителем — готовый SQL IN(...), массив, <li>.

Открыть
Форматирование телефонов

Приводит список номеров к одному виду: +7 (999) 123-45-67, E.164, только цифры и хеши MD5 и SHA-256. Убирает дубли, отбраковывает битые.

Открыть
Разделить на столбцы

Разбивает список по разделителю: запятая, точка с запятой, табуляция, свой символ. Учитывает кавычки, отдаёт готовые столбцы для Excel.

Открыть
Проверка email списком

Синтаксис, дубли, опечатки в доменах вроде gmail.ru, одноразовые почты, ролевые адреса и кириллица в латинском написании.

Открыть
Нумерация строк

Нумерует строки списка: точкой, скобкой или пробелом, с ведущими нулями. Для оформления списков, ТЗ и нумерованных перечней.

Открыть

Как применять это в продвижении — в разборе Семантическое ядро и других материалах блога.

Ещё инструменты для списков

Удаление дубликатов и сравнение двух списков, сортировка, столбец в строку и обратно, нумерация, частотность и шаблонизатор — в разделе 17 инструментов.