Buscador de Duplicados Aproximados Encuentra registros casi duplicados en listas de miles de líneas, sin perder ninguno

Paso 1: Pega o Sube tu Lista

💡 Admite listas de miles o incluso decenas de miles de registros: la comparación se hace por bloques de longitud con una barra de progreso, sin bloquear el navegador.

Admite .txt (un registro por línea) o .csv (usa la primera columna de cada fila); al subir el archivo se reemplaza el contenido actual

0 registros introducidos actualmente

Paso 2: Configura el Umbral de Similitud

Un valor más alto significa una comparación más estricta: solo las cadenas muy similares se agruparán. Recomendamos empezar con 80%.

⚙️ Nota de rendimiento: los registros se agrupan primero de forma segura por longitud (los pares que teóricamente no pueden alcanzar el umbral se descartan sin riesgo de perder coincidencias válidas), y luego se comparan con un algoritmo de distancia de Levenshtein con salida anticipada para reducir el cálculo en listas grandes. El procesamiento se ejecuta en un Web Worker en segundo plano para que la página nunca se congele.

¿Qué es el Buscador de Duplicados Aproximados?

Esta herramienta gratuita en línea está diseñada específicamente para limpiar listas grandes. Pega o sube nombres de empresas, clientes, direcciones o correos electrónicos, y la herramienta encuentra automáticamente registros "similares pero no idénticos" — por ejemplo, "Acme Corp.", "Acme Corporation" y "Acme Crop" como tres variantes de la misma empresa — y los agrupa para facilitar tu revisión y limpieza de datos.

¿Por qué no simplemente preguntarle a una IA?

Para una lista de unas pocas decenas de líneas, una IA con comprensión semántica puede detectar duplicados obvios. Pero cuando la lista alcanza miles o decenas de miles de líneas, la capacidad de una IA para revisar de forma fiable cada línea en una sola respuesta es limitada: se omiten o resumen registros. Esta herramienta ejecuta un verdadero algoritmo de comparación por pares directamente en tu navegador, combinado con un prefiltrado por longitud, garantizando que cada registro sea realmente comparado, algo que una IA puramente semántica no puede garantizar estructuralmente a esta escala.

¿Cómo funciona el algoritmo de comparación?

La herramienta utiliza la clásica distancia de Levenshtein para medir la similitud entre dos cadenas: cuantas menos inserciones, eliminaciones o sustituciones se necesiten para convertir una cadena en otra, más similares son. Esta distancia se convierte en una puntuación de similitud de 0 a 100%, y solo los pares por encima del umbral elegido se agrupan como duplicados aproximados.

¿Cómo procesa listas enormes sin bloquear el navegador?

  • Prefiltrado por longitud: los registros se ordenan por longitud; dos cadenas con una diferencia de longitud demasiado grande no pueden alcanzar matemáticamente una alta similitud, por lo que se omiten de forma segura sin riesgo de perder una coincidencia real.
  • Cálculo de distancia con salida anticipada: la comparación se detiene en el momento en que se confirma que dos cadenas son demasiado diferentes, sin calcular toda la matriz de distancias.
  • Procesamiento en segundo plano: el cálculo se ejecuta en un Web Worker con una barra de progreso en tiempo real, por lo que incluso miles de líneas se procesan sin bloquear la página.

Preguntas frecuentes (FAQ)

P1: ¿Qué umbral de similitud debería usar?

No hay una respuesta universal: te recomendamos empezar con 80% y comprobar si los grupos resultantes tienen sentido, ajustando después. Un umbral demasiado bajo (menos del 60%) puede agrupar registros no relacionados; uno demasiado alto (más del 95%) puede pasar por alto duplicados reales.

P2: ¿Esta herramienta sube mi lista a un servidor?

No. Toda la comparación ocurre completamente en tu propio navegador; los datos nunca se envían a ningún servidor, por lo que puedes procesar con tranquilidad listas que contengan información de clientes.

P3: ¿Realmente puede procesar decenas de miles de líneas?

Sí. Gracias al prefiltrado por longitud y al cálculo de distancia con salida anticipada, las listas más grandes simplemente tardan un poco más, pero cada registro se compara siempre por completo, con una barra de progreso para seguir el estado.