Fuzzy-Duplikat-Finder Findet ähnliche Duplikate in Listen mit Tausenden Zeilen – ganz ohne Lücken

Schritt 1: Liste einfügen oder hochladen

💡 Verarbeitet Listen mit Tausenden oder sogar Zehntausenden Einträgen: Der Abgleich erfolgt in Längen-Blöcken mit Fortschrittsanzeige, ohne den Browser einzufrieren.

Unterstützt .txt (ein Eintrag pro Zeile) oder .csv (erste Spalte jeder Zeile); der Upload überschreibt den aktuellen Inhalt

Aktuell 0 Einträge eingegeben

Schritt 2: Ähnlichkeitsschwelle einstellen

Je höher der Wert, desto strenger der Abgleich – nur sehr ähnliche Zeichenketten werden gruppiert. Wir empfehlen, mit 80% zu starten.

⚙️ Hinweis zur Performance: Einträge werden zunächst sicher nach Länge in Blöcke eingeteilt (Paare, die den Schwellenwert theoretisch nicht erreichen können, werden verlustfrei übersprungen), anschließend mit einem Levenshtein-Distanz-Algorithmus mit vorzeitigem Abbruch verglichen, was den Rechenaufwand bei großen Listen deutlich senkt. Die Verarbeitung läuft in einem Web Worker im Hintergrund, sodass die Seite nie einfriert.

Was ist der Fuzzy-Duplikat-Finder?

Dieses kostenlose Online-Tool wurde speziell zum Bereinigen großer Listen entwickelt. Fügen Sie Firmennamen, Kundendaten, Adressen oder E-Mails ein oder laden Sie sie hoch, und das Tool findet automatisch Einträge, die „ähnlich, aber nicht identisch" sind – zum Beispiel „Acme Corp.", „Acme Corporation" und „Acme Crop" als drei Schreibweisen derselben Firma – und gruppiert sie zur einfachen Überprüfung und Bereinigung.

Warum nicht einfach eine KI fragen?

Bei einer Liste mit ein paar Dutzend Zeilen kann eine KI durch semantisches Verständnis tatsächlich offensichtliche Duplikate erkennen. Doch sobald eine Liste Tausende oder Zehntausende Zeilen umfasst, kann eine KI in einer einzigen Antwort nicht mehr zuverlässig jede Zeile prüfen – Einträge werden übersprungen oder zusammengefasst. Dieses Tool führt einen echten paarweisen Vergleichsalgorithmus direkt in Ihrem Browser aus, kombiniert mit einer Längen-Vorfilterung, und garantiert so, dass wirklich jeder Eintrag verglichen wird – eine Garantie, die eine rein semantische KI in diesem Umfang strukturell nicht geben kann.

Wie funktioniert der Vergleichsalgorithmus?

Das Tool nutzt die klassische Levenshtein-Distanz, um die Ähnlichkeit zweier Zeichenketten zu messen: Je weniger Einfügungen, Löschungen oder Ersetzungen nötig sind, um eine Zeichenkette in die andere umzuwandeln, desto ähnlicher sind sie. Diese Distanz wird in einen Ähnlichkeitswert von 0–100% umgerechnet, und nur Paare oberhalb Ihres gewählten Schwellenwerts werden als unscharfe Duplikate gruppiert.

Wie werden riesige Listen verarbeitet, ohne den Browser zu blockieren?

  • Vorfilterung nach Länge: Einträge werden nach Länge sortiert; zwei Zeichenketten mit zu großem Längenunterschied können mathematisch nie eine hohe Ähnlichkeit erreichen und werden daher sicher übersprungen, ohne echte Übereinstimmungen zu verpassen.
  • Vorzeitiger Abbruch der Distanzberechnung: Der Vergleich stoppt, sobald feststeht, dass zwei Zeichenketten zu unterschiedlich sind, ohne die gesamte Distanzmatrix zu berechnen.
  • Verarbeitung im Hintergrund: Die Berechnung läuft in einem Web Worker mit einer Echtzeit-Fortschrittsanzeige, sodass selbst Tausende Zeilen die Seite nicht blockieren.

Häufig gestellte Fragen (FAQ)

F1: Welchen Ähnlichkeitsschwellenwert sollte ich wählen?

Es gibt keine allgemeingültige Antwort – starten Sie am besten bei 80% und passen Sie den Wert je nach Sinnhaftigkeit der Gruppen an. Ein zu niedriger Schwellenwert (unter 60%) fasst möglicherweise unabhängige Einträge zusammen; ein zu hoher (über 95%) kann echte Duplikate übersehen.

F2: Werden meine Daten an einen Server gesendet?

Nein. Der gesamte Vergleich läuft ausschließlich in Ihrem eigenen Browser, es werden keine Daten an einen Server übertragen – Sie können also auch Listen mit Kundendaten bedenkenlos verarbeiten.

F3: Kann das Tool wirklich Zehntausende Zeilen verarbeiten?

Ja. Durch die Längen-Vorfilterung, den vorzeitigen Abbruch der Berechnung und die Verarbeitung im Hintergrund dauert es bei größeren Listen einfach etwas länger, aber jeder Eintrag wird garantiert vollständig verglichen, während eine Fortschrittsanzeige den Status anzeigt.