亂碼修復工具(多語言編碼)自動偵測並還原因編碼錯誤造成的文字亂碼

看到「氪╡窐蝑¸箸」這種亂碼,到底是什麼原因造成的?

亂碼(Mojibake)幾乎都是「用錯編碼去解讀文字」造成的:一份原本用 Big5 編碼儲存的繁體中文檔案,如果被瀏覽器或程式誤判成 UTF-8 打開,每個中文字就會被拆解成好幾個無意義的符號組合,變成像「氪╡窐蝑¸箸」這種亂碼;反過來,UTF-8 檔案被誤判成 Big5 或 Windows-1252 開啟,也會出現類似「é」(本來是 é)這種亂碼。本工具的做法是反過來操作:把你的亂碼文字或檔案,依序嘗試用 20 多種常見編碼重新解碼,看哪一種解碼後的結果最像正常的自然語言文字,並依可信度排序給你選擇。

工具怎麼判斷哪個候選答案最準?

每嘗試一種編碼重新解碼後,工具會分析結果文字:是否出現大量無法識別的替代字元(如 �)、文字是否符合常見語言的字元分布規律、標點符號是否合理等,綜合這些指標算出一個可信度分數,分數最高的候選會排在最前面。支援18種語言相關的主要編碼系統:繁中(Big5、CP950)、簡中(GBK、GB2312、GB18030)、日文(Shift-JIS、EUC-JP)、韓文(EUC-KR、CP949)、西里爾語系(Windows-1251、KOI8-R)、阿拉伯語(Windows-1256)、希伯來語(Windows-1255)及各歐洲語言的 ISO-8859 與 Windows-125x 系列。

上傳檔案 vs 貼上文字,該選哪個?

如果你有原始檔案(如 .txt、.csv、.log),建議用「上傳檔案」模式——工具能讀取檔案最原始的位元組資料,還原準確度最高。如果你只是從別處複製貼上一段已經顯示在畫面上的亂碼文字,某些編碼資訊在複製過程中可能已經遺失,這種情況請用「貼上文字」模式,此模式對於「UTF-8 被誤判成 Latin-1/Windows-1252」這類西歐語言亂碼的修復效果較好,但對中日韓文字亂碼的還原能力有限。工具最多顯示5個候選結果,選擇正確的版本後可複製或下載。

一旦文字被複製貼上(而非直接讀取原始檔案位元組),部分編碼資訊可能已經永久遺失,此時即使工具嘗試所有編碼組合也未必能100%還原,請盡量以原始檔案上傳的方式操作以取得最佳結果。

其他實用工具: