模糊重複比對工具 大量名單一鍵抓出近似重複項,上千筆資料也不遺漏
Step 1:貼上或上傳名單
💡 支援貼上或上傳上千筆甚至上萬筆名單,瀏覽器會自動分桶比對並顯示處理進度,不用擔心卡死。
支援.txt(每行一筆)或.csv(取每行第一欄),上傳後會覆蓋目前輸入內容
目前已輸入 0 筆名單
Step 2:設定相似度閾值
數值越高代表比對越嚴格,只有非常相似的字串才會被歸為同一組近似重複;建議先從80%開始嘗試
⚙️ 效能優化說明:本工具會先依字串長度做安全分桶預過濾,只比對「理論上有可能達到閾值」的配對,再用提前中斷的Levenshtein距離演算法計算精確相似度,大幅減少上千筆資料的運算量,比對過程採用瀏覽器背景執行緒(Web Worker)處理,避免頁面凍結。
什麼是模糊重複比對工具?
這是一款專為處理「大量名單」設計的線上工具。只要貼上或上傳公司名、客戶名、地址、Email等名單,就能自動找出彼此「很像但不完全一樣」的近似重複項——例如同一家公司打成「Acme Corp.」、「Acme Corporation」、「Acme Crop」三種寫法,本工具會判斷這三者其實高度相似並歸為同一組,方便你人工複核與清理資料。
為什麼不直接問AI就好?
當名單只有幾十筆時,AI用語意理解確實能抓出幾個明顯的重複項。但當名單規模來到上千筆甚至上萬筆,AI單次能穩定處理與逐一核對的範圍有限,容易漏算、漏比對或處理到一半就摘要跳過。本工具改用瀏覽器JavaScript執行真正的兩兩比對演算法,搭配長度分桶預過濾,保證把每一筆資料都完整比對過一次,不會因為資料量大就偷懶跳過,這是純語意理解工具做不到的「保證跑完」。
比對演算法怎麼運作?
本工具採用經典的Levenshtein 編輯距離(Levenshtein Distance)計算兩個字串的相似度:把一個字串改成另一個字串所需要的最少新增、刪除、替換次數越少,代表兩者越相似。系統會把編輯距離換算成0~100%的相似度分數,只有超過你設定的「相似度閾值」才會被歸為同一組近似重複。
如何做到大量資料也不卡死?
- 長度分桶預過濾:先依字串長度排序,數學上長度差太多的兩筆資料絕不可能達到高相似度,直接跳過不比對,大幅減少需要精算的配對數量。
- 提前中斷計算:比對過程中若已確定兩字串差異過大,會提前停止計算,不需要跑完整個編輯距離矩陣。
- 背景執行緒處理:比對運算交由瀏覽器的Web Worker背景執行緒處理,並即時顯示處理進度,避免頁面凍結,讓上千筆資料也能順利跑完。
適合什麼情境使用?
- 客戶名單清理:整合多個來源的客戶名單時,抓出因手動輸入造成的拼字差異重複。
- 公司名/廠商名比對:採購或財務系統常見同一廠商多種寫法,找出來統一格式。
- Email/地址去重:行銷名單合併時抓出格式略有差異但其實是同一人的紀錄。
- 資料庫上線前健檢:匯入新系統前先清理近似重複資料,避免污染正式資料庫。
常見問題 FAQ
Q1:相似度閾值該設多少比較好?
沒有絕對答案,建議先從80%開始,觀察分組結果是否合理,再依需求調整。閾值設太低(如60%以下)容易把根本不相關的資料也歸在一起;設太高(如95%以上)則可能漏掉真正的重複項。
Q2:這個工具會把我的名單上傳到伺服器嗎?
不會。所有比對運算都在你自己的瀏覽器裡完成,資料不會上傳到任何伺服器,可以放心處理包含客戶資訊的名單。
Q3:上萬筆資料真的跑得完嗎?
可以。本工具透過長度分桶預過濾與提前中斷計算大幅降低運算量,並採用背景執行緒處理機制避免頁面凍結;資料量越大處理時間會越長,但都會100%跑完不遺漏,過程中會顯示處理進度讓你掌握狀況。
Q4:可以比對中文名單嗎?
可以,Levenshtein距離演算法本身不限語言,中文、英文、數字混合的名單都能正常比對相似度。