模糊重复比对工具 批量名单一键找出近似重复项,上千条数据也不遗漏
第一步:粘贴或上传名单
💡 支持粘贴或上传上千条甚至上万条名单,浏览器会自动分桶比对并显示处理进度,不用担心卡死。
支持.txt(每行一条)或.csv(取每行第一列),上传后会覆盖当前输入内容
当前已输入 0 条名单
第二步:设置相似度阈值
数值越高比对越严格,只有非常相似的字符串才会被归为同一组近似重复;建议先从80%开始尝试
⚙️ 性能优化说明:本工具会先依字符串长度做安全分桶预过滤,只比对「理论上有可能达到阈值」的配对,再用提前中断的Levenshtein距离算法计算精确相似度,大幅降低上千条数据的运算量,比对过程采用浏览器后台线程(Web Worker)处理,避免页面卡死。
什么是模糊重复比对工具?
这是一款专为处理「批量名单」设计的在线工具。只要粘贴或上传公司名、客户名、地址、邮箱等名单,就能自动找出彼此「很像但不完全一样」的近似重复项——例如同一家公司写成「Acme Corp.」「Acme Corporation」「Acme Crop」三种形式,本工具会判断三者高度相似并归为同一组,方便你人工复核与清理数据。
为什么不直接问AI就好?
当名单只有几十条时,AI用语义理解确实能抓出几个明显的重复项。但当名单规模来到上千条甚至上万条,AI单次能稳定处理与逐一核对的范围有限,容易漏算、漏比对或处理到一半就摘要跳过。本工具改用浏览器JavaScript执行真正的两两比对算法,搭配长度分桶预过滤,保证把每一条数据都完整比对过一次,不会因为数据量大就偷懒跳过。
比对算法怎么运作?
本工具采用经典的Levenshtein编辑距离(Levenshtein Distance)计算两个字符串的相似度:把一个字符串改成另一个字符串所需要的最少新增、删除、替换次数越少,代表两者越相似。系统会把编辑距离换算成0~100%的相似度分数,只有超过你设置的「相似度阈值」才会被归为同一组近似重复。
如何做到大批量数据也不卡死?
- 长度分桶预过滤:先依字符串长度排序,数学上长度差太多的两条数据绝不可能达到高相似度,直接跳过不比对,大幅减少需要精算的配对数量。
- 提前中断计算:比对过程中若已确定两字符串差异过大,会提前停止计算,不需要跑完整个编辑距离矩阵。
- 后台线程处理:比对运算交由浏览器的Web Worker后台线程执行,并即时显示处理进度,避免页面卡死,让上千条数据也能顺利跑完。
适合什么场景使用?
- 客户名单清理:整合多个来源的客户名单时,抓出因手动输入造成的拼写差异重复。
- 公司名/供应商名比对:采购或财务系统常见同一供应商多种写法,找出来统一格式。
- 邮箱/地址去重:营销名单合并时抓出格式略有差异但其实是同一人的记录。
- 数据库上线前健检:导入新系统前先清理近似重复数据,避免污染正式数据库。
常见问题 FAQ
Q1:相似度阈值该设多少比较好?
没有绝对答案,建议先从80%开始,观察分组结果是否合理,再依需求调整。阈值设太低(如60%以下)容易把根本不相关的数据也归在一起;设太高(如95%以上)则可能漏掉真正的重复项。
Q2:这个工具会把我的名单上传到服务器吗?
不会。所有比对运算都在你自己的浏览器里完成,数据不会上传到任何服务器,可以放心处理包含客户信息的名单。
Q3:上万条数据真的跑得完吗?
可以。本工具通过长度分桶预过滤与提前中断计算大幅降低运算量,并采用后台线程处理机制避免页面卡死;数据量越大处理时间会越长,但都会完整跑完不遗漏,过程中会显示处理进度让你掌握状况。
Q4:可以比对中文名单吗?
可以,Levenshtein距离算法本身不限语言,中文、英文、数字混合的名单都能正常比对相似度。