Détecteur de doublons approximatifs Trouvez les quasi-doublons dans des listes de milliers de lignes, sans rien manquer
Étape 1 : Collez ou importez votre liste
💡 Traite des listes de plusieurs milliers, voire dizaines de milliers de lignes : la comparaison s'effectue par lots de longueur avec une barre de progression, sans jamais bloquer votre navigateur.
Formats .txt (une entrée par ligne) ou .csv (première colonne de chaque ligne) ; l'import remplace le contenu actuel
0 entrées actuellement saisies
Étape 2 : Définissez le seuil de similarité
Plus la valeur est élevée, plus la comparaison est stricte : seules les chaînes très similaires seront regroupées. Nous recommandons de commencer à 80%.
⚙️ Optimisation des performances : les entrées sont d'abord réparties en lots selon leur longueur (filtrage sûr qui ne fait jamais manquer une correspondance valide), puis comparées avec un algorithme de distance de Levenshtein à arrêt anticipé pour réduire le calcul sur les grandes listes. Le traitement s'exécute dans un Web Worker en arrière-plan afin que la page ne se bloque jamais.
Qu'est-ce que le détecteur de doublons approximatifs ?
Cet outil gratuit est conçu pour nettoyer de grandes listes. Collez ou importez des noms d'entreprises, de clients, des adresses ou des emails, et l'outil détecte automatiquement les entrées « similaires mais pas identiques » — par exemple « Acme Corp. », « Acme Corporation » et « Acme Crop » désignant la même société — puis les regroupe pour faciliter votre relecture et le nettoyage des données.
Pourquoi ne pas simplement demander à une IA ?
Pour une liste de quelques dizaines de lignes, une IA conversationnelle peut effectivement repérer les doublons évidents grâce à sa compréhension sémantique. Mais dès que la liste atteint plusieurs milliers ou dizaines de milliers de lignes, une IA ne peut plus garantir un examen fiable de chaque ligne en une seule réponse : des entrées sont sautées ou résumées. Cet outil exécute un véritable algorithme de comparaison deux à deux directement dans votre navigateur, avec un pré-filtrage par longueur, garantissant que chaque entrée est réellement comparée — une garantie qu'une IA purement sémantique ne peut structurellement pas offrir à cette échelle.
Comment fonctionne l'algorithme de comparaison ?
L'outil utilise la célèbre distance de Levenshtein pour mesurer la similarité entre deux chaînes : moins il faut d'insertions, de suppressions ou de substitutions pour transformer l'une en l'autre, plus elles sont similaires. Cette distance est convertie en un score de similarité de 0 à 100%, et seules les paires dépassant le seuil choisi sont regroupées comme quasi-doublons.
Comment traiter d'énormes listes sans bloquer le navigateur ?
- Pré-filtrage par longueur : les entrées sont triées par longueur ; deux chaînes dont la différence de longueur est trop grande ne peuvent mathématiquement pas atteindre une similarité élevée, elles sont donc ignorées sans aucun risque de manquer une vraie correspondance.
- Calcul de distance à arrêt anticipé : la comparaison s'arrête dès qu'il est certain que deux chaînes sont trop différentes, sans calculer toute la matrice de distance.
- Traitement en arrière-plan : le calcul s'exécute dans un Web Worker avec une barre de progression en temps réel, ce qui permet de traiter des milliers de lignes sans que la page ne se bloque.
Cas d'usage courants
- Nettoyage de listes clients : fusionner des listes provenant de plusieurs sources et repérer les doublons dus à des erreurs de saisie.
- Comparaison de noms de fournisseurs : uniformiser les libellés incohérents dans les systèmes d'achat ou de comptabilité.
- Déduplication d'emails/adresses : repérer les fiches désignant la même personne avant un envoi marketing.
- Contrôle qualité avant migration : nettoyer les quasi-doublons avant import dans une nouvelle base de données.
Foire aux questions (FAQ)
Q1 : Quel seuil de similarité choisir ?
Il n'y a pas de réponse universelle : commencez à 80% et ajustez selon la pertinence des groupes obtenus. Un seuil trop bas (moins de 60%) risque de regrouper des entrées sans rapport ; un seuil trop élevé (plus de 95%) peut manquer de vrais doublons.
Q2 : Mes données sont-elles envoyées à un serveur ?
Non. Toute la comparaison s'effectue entièrement dans votre navigateur, aucune donnée n'est jamais transmise à un serveur — vous pouvez donc traiter des listes contenant des informations clients en toute sécurité.
Q3 : L'outil peut-il vraiment traiter des dizaines de milliers de lignes ?
Oui. Grâce au pré-filtrage par longueur, à l'arrêt anticipé du calcul et au traitement en arrière-plan, les listes plus volumineuses prennent simplement un peu plus de temps, mais chaque entrée est toujours comparée intégralement, avec une barre de progression pour suivre l'avancement.
Vous aurez peut-être besoin de