Rilevatore di Duplicati Approssimativi Trova voci quasi duplicate in elenchi di migliaia di righe, senza perderne nessuna
Passo 1: Incolla o Carica l'Elenco
💡 Supporta elenchi con migliaia o decine di migliaia di voci: il confronto avviene per blocchi di lunghezza con barra di avanzamento, il browser non si blocca.
Supporta .txt (una voce per riga) o .csv (usa la prima colonna di ogni riga); il caricamento sovrascrive il contenuto attuale
0 voci inserite attualmente
Passo 2: Imposta la Soglia di Similarità
Un valore più alto significa un confronto più rigoroso: solo le stringhe molto simili verranno raggruppate. Consigliamo di iniziare con l'80%.
⚙️ Nota sulle prestazioni: le voci vengono prima raggruppate in modo sicuro per lunghezza (le coppie che teoricamente non possono raggiungere la soglia vengono escluse senza rischio di perdere corrispondenze valide), poi confrontate con un algoritmo di distanza di Levenshtein a interruzione anticipata per ridurre il carico di calcolo sugli elenchi di grandi dimensioni. L'elaborazione avviene in un Web Worker in background, così la pagina non si blocca mai.
Cos'è il Rilevatore di Duplicati Approssimativi?
Questo strumento online gratuito è pensato specificamente per pulire grandi elenchi. Incolla o carica nomi di aziende, clienti, indirizzi o email, e lo strumento trova automaticamente le voci "simili ma non identiche" — ad esempio la stessa azienda scritta come "Acme Corp.", "Acme Corporation" e "Acme Crop" — raggruppandole per facilitarne la revisione e la pulizia.
Perché non chiedere semplicemente a un'IA?
Per un elenco di poche decine di righe, un'IA con comprensione semantica può effettivamente individuare i duplicati evidenti. Ma quando l'elenco raggiunge migliaia o decine di migliaia di righe, la capacità dell'IA di controllare in modo affidabile ogni riga in un'unica risposta è limitata: le voci vengono saltate o riassunte. Questo strumento esegue un vero algoritmo di confronto a coppie direttamente nel tuo browser, combinato con un pre-filtro per lunghezza, garantendo che ogni voce venga davvero confrontata — una garanzia che un'IA puramente semantica non può offrire strutturalmente a questa scala.
Come funziona l'algoritmo di confronto?
Lo strumento utilizza la classica distanza di Levenshtein per misurare la similarità tra due stringhe: minori sono gli inserimenti, le eliminazioni o le sostituzioni necessarie per trasformare una stringa nell'altra, maggiore è la loro similarità. Questa distanza viene convertita in un punteggio di similarità dallo 0 al 100%, e solo le coppie sopra la soglia scelta vengono raggruppate come duplicati approssimativi.
Come vengono gestiti elenchi enormi senza bloccare il browser?
- Pre-filtro per lunghezza: le voci vengono ordinate per lunghezza; due stringhe con una differenza di lunghezza troppo grande non possono matematicamente raggiungere un'alta similarità, quindi vengono escluse in modo sicuro senza rischio di perdere una corrispondenza reale.
- Calcolo della distanza a interruzione anticipata: il confronto si interrompe non appena è certo che due stringhe siano troppo diverse, senza calcolare l'intera matrice delle distanze.
- Elaborazione in un thread in background: il calcolo viene eseguito in un Web Worker con una barra di avanzamento in tempo reale, così anche migliaia di righe vengono elaborate senza bloccare la pagina.
Domande frequenti (FAQ)
D1: Quale soglia di similarità dovrei usare?
Non esiste una risposta universale: consigliamo di iniziare con l'80% e verificare se i gruppi risultanti hanno senso, per poi regolare il valore. Una soglia troppo bassa (sotto il 60%) rischia di raggruppare voci non correlate; una troppo alta (sopra il 95%) può far perdere duplicati reali.
D2: Questo strumento carica il mio elenco su un server?
No. Tutto il confronto avviene interamente nel tuo browser, i dati non vengono mai inviati a nessun server — puoi quindi elaborare in tutta sicurezza elenchi contenenti informazioni sui clienti.
D3: Può davvero elaborare decine di migliaia di righe?
Sì. Grazie al pre-filtro per lunghezza e al calcolo della distanza a interruzione anticipata, gli elenchi più grandi richiedono semplicemente un po' più di tempo, ma ogni voce viene sempre confrontata per intero, con una barra di avanzamento per seguire lo stato.
Potresti aver bisogno anche di