Поиск нечётких дубликатов Находит похожие записи в списках из тысяч строк, ничего не пропуская

Шаг 1: Вставьте или загрузите список

💡 Обрабатывает списки из тысяч и даже десятков тысяч записей: сравнение идёт по блокам длины с индикатором прогресса, браузер не зависает.

Поддерживаются .txt (одна запись на строку) и .csv (берётся первый столбец каждой строки); загрузка заменяет текущий ввод

Введено записей: 0

Шаг 2: Настройте порог сходства

Чем выше значение, тем строже сравнение — в одну группу попадут только очень похожие строки. Рекомендуем начать с 80%.

⚙️ Оптимизация производительности: записи сначала безопасно распределяются по блокам длины (пары, которые теоретически не могут достичь порога, пропускаются без потерь), затем сравниваются алгоритмом расстояния Левенштейна с досрочным завершением, что резко снижает объём вычислений для больших списков. Обработка выполняется в фоновом Web Worker, поэтому страница не зависает.

Что такое поиск нечётких дубликатов?

Это бесплатный онлайн-инструмент, созданный специально для очистки больших списков. Вставьте или загрузите названия компаний, клиентов, адреса или email — и инструмент автоматически найдёт записи, которые «похожи, но не идентичны», например «Acme Corp.», «Acme Corporation» и «Acme Crop» — три варианта написания одной и той же компании, — и сгруппирует их для удобной проверки и очистки данных.

Почему нельзя просто спросить ИИ?

Для списка из нескольких десятков строк ИИ действительно может найти очевидные дубликаты благодаря пониманию смысла. Но когда список вырастает до тысяч или десятков тысяч строк, ИИ не может гарантированно надёжно проверить каждую строку за один ответ — записи пропускаются или суммируются. Этот инструмент выполняет настоящий алгоритм попарного сравнения прямо в вашем браузере с предварительной фильтрацией по длине, гарантируя, что каждая запись действительно сравнивается — то, что чисто смысловой ИИ структурно не может обещать в таком масштабе.

Как работает алгоритм сравнения?

Инструмент использует классический алгоритм расстояния Левенштейна для измерения сходства двух строк: чем меньше вставок, удалений или замен нужно, чтобы превратить одну строку в другую, тем выше сходство. Это расстояние переводится в оценку сходства от 0 до 100%, и только пары выше выбранного «порога сходства» объединяются в группу нечётких дубликатов.

Как обрабатываются огромные списки без зависания браузера?

  • Фильтрация по блокам длины: записи сортируются по длине; две строки с слишком большой разницей в длине математически не могут достичь высокого сходства, поэтому безопасно пропускаются без риска упустить настоящее совпадение.
  • Досрочное завершение вычисления расстояния: сравнение прерывается, как только становится ясно, что строки слишком разные, без построения полной матрицы расстояний.
  • Обработка в фоновом потоке: вычисления выполняются в Web Worker с индикатором прогресса в реальном времени, поэтому даже тысячи строк обрабатываются без зависания страницы.

Типичные сценарии использования

  • Очистка клиентских баз: объединение списков клиентов из разных источников с выявлением дубликатов из-за опечаток при вводе.
  • Сравнение названий компаний-поставщиков: унификация разных вариантов написания одного поставщика в учётных системах.
  • Дедупликация email и адресов: поиск записей одного человека с немного различающимся написанием перед маркетинговой рассылкой.
  • Проверка перед миграцией базы данных: очистка нечётких дубликатов перед импортом в новую систему.

Часто задаваемые вопросы (FAQ)

В1: Какой порог сходства выбрать?

Универсального ответа нет — рекомендуем начать с 80% и проверить, насколько логичны получившиеся группы, затем скорректировать. Слишком низкий порог (менее 60%) может объединить несвязанные записи, слишком высокий (более 95%) — упустить настоящие дубликаты.

В2: Отправляются ли мои данные на сервер?

Нет. Все вычисления выполняются полностью в вашем браузере, данные никуда не передаются — можно безопасно обрабатывать списки с информацией о клиентах.

В3: Действительно ли обрабатываются десятки тысяч записей?

Да. Благодаря фильтрации по длине, досрочному завершению вычислений и фоновой обработке большие списки просто требуют немного больше времени, но каждая запись обязательно сравнивается полностью, а индикатор прогресса показывает статус.

Другие полезные инструменты: