Fuzzy Duplicaten Zoeker Vindt bijna-duplicaten in lijsten van duizenden regels, zonder iets te missen

Stap 1: Plak of Upload je Lijst

💡 Ondersteunt lijsten met duizenden of zelfs tienduizenden items: vergelijking gebeurt in lengte-blokken met een voortgangsbalk, je browser loopt nooit vast.

Ondersteunt .txt (één item per regel) of .csv (eerste kolom van elke rij); uploaden vervangt de huidige inhoud

Momenteel 0 items ingevoerd

Stap 2: Stel de Gelijkenisdrempel In

Een hogere waarde betekent strengere vergelijking — alleen zeer vergelijkbare tekenreeksen worden gegroepeerd. We raden aan om met 80% te beginnen.

⚙️ Prestatie-opmerking: items worden eerst veilig gegroepeerd op lengte (paren die theoretisch de drempel niet kunnen bereiken worden overgeslagen zonder risico op het missen van een geldige match), vervolgens vergeleken met een Levenshtein-afstandsalgoritme met vroege afbreking om de rekenlast bij grote lijsten sterk te verminderen. De verwerking draait op de achtergrond in een Web Worker, zodat de pagina nooit vastloopt.

Wat is de Fuzzy Duplicaten Zoeker?

Deze gratis online tool is speciaal ontworpen om grote lijsten op te schonen. Plak of upload bedrijfsnamen, klantgegevens, adressen of e-mails, en de tool vindt automatisch items die "op elkaar lijken maar niet identiek zijn" — bijvoorbeeld hetzelfde bedrijf geschreven als "Acme Corp.", "Acme Corporation" en "Acme Crop" — en groepeert deze zodat je ze eenvoudig kunt controleren en opschonen.

Waarom niet gewoon een AI vragen?

Bij een lijst van een paar dozijn regels kan een AI met semantisch begrip inderdaad duidelijke duplicaten opsporen. Maar zodra een lijst duizenden of tienduizenden regels bevat, is het vermogen van een AI om elke regel betrouwbaar in één antwoord te controleren beperkt — items worden overgeslagen of samengevat. Deze tool voert een echt paarsgewijs vergelijkingsalgoritme direct in je browser uit, gecombineerd met voorfiltering op lengte, en garandeert zo dat elk item werkelijk wordt vergeleken — een garantie die een puur semantische AI op deze schaal structureel niet kan bieden.

Hoe werkt het vergelijkingsalgoritme?

De tool gebruikt het klassieke Levenshtein-afstand-algoritme om de gelijkenis tussen twee tekenreeksen te meten: hoe minder invoegingen, verwijderingen of vervangingen nodig zijn om de ene tekenreeks in de andere te veranderen, hoe groter de gelijkenis. Deze afstand wordt omgezet in een gelijkenisscore van 0-100%, en alleen paren boven de gekozen drempel worden gegroepeerd als fuzzy duplicaten.

Hoe worden enorme lijsten verwerkt zonder de browser te blokkeren?

  • Voorfiltering op lengte: items worden gesorteerd op lengte; twee tekenreeksen met een te groot lengteverschil kunnen wiskundig gezien nooit een hoge gelijkenis bereiken en worden daarom veilig overgeslagen zonder risico op het missen van een echte match.
  • Vroege afbreking van de afstandsberekening: de vergelijking stopt zodra vaststaat dat twee tekenreeksen te veel verschillen, zonder de volledige afstandsmatrix te berekenen.
  • Verwerking op de achtergrond: de berekening draait in een Web Worker met een live voortgangsbalk, zodat zelfs duizenden regels worden verwerkt zonder de pagina te blokkeren.

Veelgestelde vragen (FAQ)

V1: Welke gelijkenisdrempel moet ik gebruiken?

Er is geen universeel antwoord — we raden aan om met 80% te beginnen en te controleren of de resulterende groepen logisch zijn, en dan aan te passen. Een te lage drempel (onder 60%) kan ongerelateerde items groeperen; een te hoge (boven 95%) kan echte duplicaten missen.

V2: Stuurt deze tool mijn lijst naar een server?

Nee. Alle vergelijking gebeurt volledig in je eigen browser, gegevens worden nooit naar een server verzonden — je kunt dus veilig lijsten met klantinformatie verwerken.

V3: Kan het echt tienduizenden regels verwerken?

Ja. Dankzij voorfiltering op lengte en vroege afbreking van de berekening duren grotere lijsten gewoon iets langer, maar elk item wordt altijd volledig vergeleken, met een voortgangsbalk om de status te volgen.