Пошук нечітких дублікатів Знаходить схожі записи у списках із тисяч рядків, нічого не пропускаючи
Крок 1: Вставте або завантажте список
💡 Обробляє списки з тисячами й навіть десятками тисяч записів: порівняння відбувається блоками за довжиною з індикатором прогресу, браузер не зависає.
Підтримуються .txt (один запис на рядок) або .csv (береться перший стовпець кожного рядка); завантаження замінює поточний вміст
Наразі введено записів: 0
Крок 2: Налаштуйте порогове значення подібності
Чим вище значення, тим суворіше порівняння — лише дуже подібні рядки будуть об'єднані в групу. Рекомендуємо почати з 80%.
⚙️ Примітка щодо продуктивності: записи спочатку безпечно розподіляються на блоки за довжиною (пари, які теоретично не можуть досягти порогу, безпечно пропускаються без ризику втратити справжній збіг), потім порівнюються алгоритмом відстані Левенштейна з достроковим завершенням, що суттєво зменшує обсяг обчислень для великих списків. Обробка виконується у фоновому Web Worker, тому сторінка ніколи не зависає.
Що таке пошук нечітких дублікатів?
Цей безкоштовний онлайн-інструмент створено спеціально для очищення великих списків. Вставте або завантажте назви компаній, клієнтів, адреси чи email — і інструмент автоматично знайде записи, які «схожі, але не ідентичні», наприклад «Acme Corp.», «Acme Corporation» та «Acme Crop» — три варіанти написання однієї компанії — та згрупує їх для зручної перевірки й очищення даних.
Чому не можна просто запитати ШІ?
Для списку з кількох десятків рядків ШІ дійсно може знайти очевидні дублікати завдяки розумінню змісту. Але коли список зростає до тисяч чи десятків тисяч рядків, здатність ШІ надійно перевірити кожен рядок за одну відповідь обмежена — записи пропускаються або узагальнюються. Цей інструмент виконує справжній алгоритм попарного порівняння прямо у вашому браузері в поєднанні з попередньою фільтрацією за довжиною, гарантуючи, що кожен запис справді порівнюється — гарантія, яку чисто семантичний ШІ структурно не може забезпечити в такому масштабі.
Як працює алгоритм порівняння?
Інструмент використовує класичний алгоритм відстані Левенштейна для вимірювання подібності двох рядків: чим менше вставок, видалень чи замін потрібно, щоб перетворити один рядок на інший, тим вища подібність. Ця відстань перетворюється на оцінку подібності від 0 до 100%, і лише пари вище обраного порогу групуються як нечіткі дублікати.
Як обробляються величезні списки без зависання браузера?
- Попередня фільтрація за довжиною: записи сортуються за довжиною; два рядки із занадто великою різницею довжини математично не можуть досягти високої подібності, тому безпечно пропускаються без ризику втратити справжній збіг.
- Достроково завершений розрахунок відстані: порівняння зупиняється, щойно стає зрозуміло, що два рядки надто різні, без обчислення повної матриці відстаней.
- Обробка у фоновому потоці: обчислення виконуються у Web Worker з індикатором прогресу в реальному часі, тому навіть тисячі рядків обробляються без зависання сторінки.
Поширені запитання (FAQ)
З1: Який порог подібності обрати?
Універсальної відповіді немає — рекомендуємо почати з 80% і перевірити, чи логічними є отримані групи, а потім налаштувати. Занадто низький порог (менше 60%) може об'єднати непов'язані записи; занадто високий (понад 95%) може пропустити справжні дублікати.
З2: Чи надсилає цей інструмент мій список на сервер?
Ні. Усе порівняння відбувається повністю у вашому власному браузері, дані ніколи не передаються на жоден сервер — тож можна безпечно обробляти списки з інформацією про клієнтів.
З3: Чи справді обробляються десятки тисяч рядків?
Так. Завдяки попередній фільтрації за довжиною та достроковому завершенню розрахунку обсяг обчислень значно скорочується, а обробка у фоновому потоці не дає сторінці зависати. Чим більше даних, тим довше триває обробка, але вона завжди завершується повністю, а індикатор прогресу показує стан виконання.