Localizador de Duplicados Aproximados Encontre registros quase duplicados em listas com milhares de linhas, sem perder nenhum

Passo 1: Cole ou Envie sua Lista

💡 Suporta listas com milhares ou até decenas de milhares de registros: a comparação é feita em blocos por tamanho com barra de progresso, sem travar o navegador.

Suporta .txt (um registro por linha) ou .csv (usa a primeira coluna de cada linha); o envio substitui o conteúdo atual

0 registros inseridos atualmente

Passo 2: Defina o Limite de Similaridade

Um valor mais alto significa uma comparação mais rigorosa — apenas strings muito semelhantes serão agrupadas. Recomendamos começar com 80%.

⚙️ Nota sobre desempenho: os registros são primeiro agrupados de forma segura por tamanho (pares que teoricamente não podem atingir o limite são descartados sem risco de perder correspondências válidas), depois comparados com um algoritmo de distância de Levenshtein com interrupção antecipada, reduzindo bastante o processamento em listas grandes. O processamento ocorre em um Web Worker em segundo plano, para que a página nunca trave.

O que é o Localizador de Duplicados Aproximados?

Esta ferramenta online gratuita foi criada especificamente para limpar listas grandes. Cole ou envie nomes de empresas, clientes, endereços ou emails, e a ferramenta encontra automaticamente registros "parecidos, mas não idênticos" — por exemplo, a mesma empresa escrita como "Acme Corp.", "Acme Corporation" e "Acme Crop" — agrupando-os para facilitar sua revisão e limpeza de dados.

Por que não simplesmente perguntar a uma IA?

Para uma lista de algumas dezenas de linhas, uma IA com compreensão semântica pode realmente detectar duplicados evidentes. Mas quando a lista chega a milhares ou decenas de milhares de linhas, a capacidade da IA de verificar de forma confiável cada linha em uma única resposta é limitada — registros são pulados ou resumidos. Esta ferramenta executa um verdadeiro algoritmo de comparação par a par diretamente no seu navegador, combinado com pré-filtragem por tamanho, garantindo que cada registro seja realmente comparado — uma garantia que uma IA puramente semântica não pode oferecer estruturalmente nessa escala.

Como funciona o algoritmo de comparação?

A ferramenta usa o clássico algoritmo de distância de Levenshtein para medir a similaridade entre duas strings: quanto menos inserções, exclusões ou substituições forem necessárias para transformar uma string na outra, mais semelhantes elas são. Essa distância é convertida em uma pontuação de similaridade de 0 a 100%, e apenas os pares acima do limite escolhido são agrupados como duplicados aproximados.

Como listas enormes são processadas sem travar o navegador?

  • Pré-filtragem por tamanho: os registros são ordenados por tamanho; duas strings com diferença de tamanho muito grande matematicamente não podem atingir alta similaridade, então são descartadas com segurança, sem risco de perder uma correspondência real.
  • Cálculo de distância com interrupção antecipada: a comparação para no momento em que fica claro que duas strings são muito diferentes, sem calcular toda a matriz de distâncias.
  • Processamento em segundo plano: o cálculo é executado em um Web Worker com uma barra de progresso em tempo real, para que até milhares de linhas sejam processadas sem travar a página.

Perguntas frequentes (FAQ)

P1: Qual limite de similaridade devo usar?

Não há uma resposta universal — recomendamos começar com 80% e verificar se os grupos resultantes fazem sentido, ajustando depois. Um limite muito baixo (menos de 60%) pode agrupar registros não relacionados; um muito alto (mais de 95%) pode deixar passar duplicados reais.

P2: Esta ferramenta envia minha lista para um servidor?

Não. Toda a comparação ocorre inteiramente no seu próprio navegador, os dados nunca são enviados para nenhum servidor — assim, você pode processar com tranquilidade listas que contenham informações de clientes.

P3: Ela realmente consegue processar decenas de milhares de linhas?

Sim. Graças à pré-filtragem por tamanho e ao cálculo de distância com interrupção antecipada, listas maiores simplesmente demoram um pouco mais, mas cada registro é sempre comparado por completo, com uma barra de progresso para acompanhar o status.