Localizador de Duplicados Aproximados Encontre registros quase duplicados em listas com milhares de linhas, sem perder nenhum
Passo 1: Cole ou Envie sua Lista
💡 Suporta listas com milhares ou até decenas de milhares de registros: a comparação é feita em blocos por tamanho com barra de progresso, sem travar o navegador.
Suporta .txt (um registro por linha) ou .csv (usa a primeira coluna de cada linha); o envio substitui o conteúdo atual
0 registros inseridos atualmente
Passo 2: Defina o Limite de Similaridade
Um valor mais alto significa uma comparação mais rigorosa — apenas strings muito semelhantes serão agrupadas. Recomendamos começar com 80%.
⚙️ Nota sobre desempenho: os registros são primeiro agrupados de forma segura por tamanho (pares que teoricamente não podem atingir o limite são descartados sem risco de perder correspondências válidas), depois comparados com um algoritmo de distância de Levenshtein com interrupção antecipada, reduzindo bastante o processamento em listas grandes. O processamento ocorre em um Web Worker em segundo plano, para que a página nunca trave.
O que é o Localizador de Duplicados Aproximados?
Esta ferramenta online gratuita foi criada especificamente para limpar listas grandes. Cole ou envie nomes de empresas, clientes, endereços ou emails, e a ferramenta encontra automaticamente registros "parecidos, mas não idênticos" — por exemplo, a mesma empresa escrita como "Acme Corp.", "Acme Corporation" e "Acme Crop" — agrupando-os para facilitar sua revisão e limpeza de dados.
Por que não simplesmente perguntar a uma IA?
Para uma lista de algumas dezenas de linhas, uma IA com compreensão semântica pode realmente detectar duplicados evidentes. Mas quando a lista chega a milhares ou decenas de milhares de linhas, a capacidade da IA de verificar de forma confiável cada linha em uma única resposta é limitada — registros são pulados ou resumidos. Esta ferramenta executa um verdadeiro algoritmo de comparação par a par diretamente no seu navegador, combinado com pré-filtragem por tamanho, garantindo que cada registro seja realmente comparado — uma garantia que uma IA puramente semântica não pode oferecer estruturalmente nessa escala.
Como funciona o algoritmo de comparação?
A ferramenta usa o clássico algoritmo de distância de Levenshtein para medir a similaridade entre duas strings: quanto menos inserções, exclusões ou substituições forem necessárias para transformar uma string na outra, mais semelhantes elas são. Essa distância é convertida em uma pontuação de similaridade de 0 a 100%, e apenas os pares acima do limite escolhido são agrupados como duplicados aproximados.
Como listas enormes são processadas sem travar o navegador?
- Pré-filtragem por tamanho: os registros são ordenados por tamanho; duas strings com diferença de tamanho muito grande matematicamente não podem atingir alta similaridade, então são descartadas com segurança, sem risco de perder uma correspondência real.
- Cálculo de distância com interrupção antecipada: a comparação para no momento em que fica claro que duas strings são muito diferentes, sem calcular toda a matriz de distâncias.
- Processamento em segundo plano: o cálculo é executado em um Web Worker com uma barra de progresso em tempo real, para que até milhares de linhas sejam processadas sem travar a página.
Perguntas frequentes (FAQ)
P1: Qual limite de similaridade devo usar?
Não há uma resposta universal — recomendamos começar com 80% e verificar se os grupos resultantes fazem sentido, ajustando depois. Um limite muito baixo (menos de 60%) pode agrupar registros não relacionados; um muito alto (mais de 95%) pode deixar passar duplicados reais.
P2: Esta ferramenta envia minha lista para um servidor?
Não. Toda a comparação ocorre inteiramente no seu próprio navegador, os dados nunca são enviados para nenhum servidor — assim, você pode processar com tranquilidade listas que contenham informações de clientes.
P3: Ela realmente consegue processar decenas de milhares de linhas?
Sim. Graças à pré-filtragem por tamanho e ao cálculo de distância com interrupção antecipada, listas maiores simplesmente demoram um pouco mais, mas cada registro é sempre comparado por completo, com uma barra de progresso para acompanhar o status.