模糊重複比對工具 大量名單一鍵抓出近似重複項,上千筆資料也不遺漏

Step 1:貼上或上傳名單

💡 支援貼上或上傳上千筆甚至上萬筆名單,瀏覽器會自動分桶比對並顯示處理進度,不用擔心卡死。

支援.txt(每行一筆)或.csv(取每行第一欄),上傳後會覆蓋目前輸入內容

目前已輸入 0 筆名單

Step 2:設定相似度閾值

數值越高代表比對越嚴格,只有非常相似的字串才會被歸為同一組近似重複;建議先從80%開始嘗試

⚙️ 效能優化說明:本工具會先依字串長度做安全分桶預過濾,只比對「理論上有可能達到閾值」的配對,再用提前中斷的Levenshtein距離演算法計算精確相似度,大幅減少上千筆資料的運算量,比對過程採用瀏覽器背景執行緒(Web Worker)處理,避免頁面凍結。

什麼是模糊重複比對工具?

這是一款專為處理「大量名單」設計的線上工具。只要貼上或上傳公司名、客戶名、地址、Email等名單,就能自動找出彼此「很像但不完全一樣」的近似重複項——例如同一家公司打成「Acme Corp.」、「Acme Corporation」、「Acme Crop」三種寫法,本工具會判斷這三者其實高度相似並歸為同一組,方便你人工複核與清理資料。

為什麼不直接問AI就好?

當名單只有幾十筆時,AI用語意理解確實能抓出幾個明顯的重複項。但當名單規模來到上千筆甚至上萬筆,AI單次能穩定處理與逐一核對的範圍有限,容易漏算、漏比對或處理到一半就摘要跳過。本工具改用瀏覽器JavaScript執行真正的兩兩比對演算法,搭配長度分桶預過濾,保證把每一筆資料都完整比對過一次,不會因為資料量大就偷懶跳過,這是純語意理解工具做不到的「保證跑完」。

比對演算法怎麼運作?

本工具採用經典的Levenshtein 編輯距離(Levenshtein Distance)計算兩個字串的相似度:把一個字串改成另一個字串所需要的最少新增、刪除、替換次數越少,代表兩者越相似。系統會把編輯距離換算成0~100%的相似度分數,只有超過你設定的「相似度閾值」才會被歸為同一組近似重複。

如何做到大量資料也不卡死?

  • 長度分桶預過濾:先依字串長度排序,數學上長度差太多的兩筆資料絕不可能達到高相似度,直接跳過不比對,大幅減少需要精算的配對數量。
  • 提前中斷計算:比對過程中若已確定兩字串差異過大,會提前停止計算,不需要跑完整個編輯距離矩陣。
  • 背景執行緒處理:比對運算交由瀏覽器的Web Worker背景執行緒處理,並即時顯示處理進度,避免頁面凍結,讓上千筆資料也能順利跑完。

適合什麼情境使用?

  • 客戶名單清理:整合多個來源的客戶名單時,抓出因手動輸入造成的拼字差異重複。
  • 公司名/廠商名比對:採購或財務系統常見同一廠商多種寫法,找出來統一格式。
  • Email/地址去重:行銷名單合併時抓出格式略有差異但其實是同一人的紀錄。
  • 資料庫上線前健檢:匯入新系統前先清理近似重複資料,避免污染正式資料庫。

常見問題 FAQ

Q1:相似度閾值該設多少比較好?

沒有絕對答案,建議先從80%開始,觀察分組結果是否合理,再依需求調整。閾值設太低(如60%以下)容易把根本不相關的資料也歸在一起;設太高(如95%以上)則可能漏掉真正的重複項。

Q2:這個工具會把我的名單上傳到伺服器嗎?

不會。所有比對運算都在你自己的瀏覽器裡完成,資料不會上傳到任何伺服器,可以放心處理包含客戶資訊的名單。

Q3:上萬筆資料真的跑得完嗎?

可以。本工具透過長度分桶預過濾與提前中斷計算大幅降低運算量,並採用背景執行緒處理機制避免頁面凍結;資料量越大處理時間會越長,但都會100%跑完不遺漏,過程中會顯示處理進度讓你掌握狀況。

Q4:可以比對中文名單嗎?

可以,Levenshtein距離演算法本身不限語言,中文、英文、數字混合的名單都能正常比對相似度。