乱码修复工具(多语言编码)自动检测并还原因编码错误造成的文字乱码

看到「氪╡窐蝑¸箸」这种乱码,到底是什么原因造成的?

乱码(Mojibake)几乎都是「用错编码去解读文字」造成的:一份原本用Big5编码保存的繁体中文文件,如果被浏览器或程序误判成UTF-8打开,每个中文字就会被拆解成好几个无意义的符号组合,变成像「氪╡窐蝑¸箸」这种乱码;反过来,UTF-8文件被误判成Big5或Windows-1252打开,也会出现类似「é」(本来是é)这种乱码。本工具的做法是反过来操作:把你的乱码文字或文件,依次尝试用20多种常见编码重新解码,看哪一种解码后的结果最像正常的自然语言文字,并按可信度排序供你选择。

工具怎么判断哪个候选答案最准?

每尝试一种编码重新解码后,工具会分析结果文字:是否出现大量无法识别的替代字符(如�)、文字是否符合常见语言的字符分布规律、标点符号是否合理等,综合这些指标算出一个可信度分数,分数最高的候选会排在最前面。支持18种语言相关的主要编码系统:繁中(Big5、CP950)、简中(GBK、GB2312、GB18030)、日文(Shift-JIS、EUC-JP)、韩文(EUC-KR、CP949)、西里尔语系(Windows-1251、KOI8-R)、阿拉伯语(Windows-1256)、希伯来语(Windows-1255)及各欧洲语言的ISO-8859与Windows-125x系列。

上传文件 vs 粘贴文字,该选哪个?

如果你有原始文件(如.txt、.csv、.log),建议用「上传文件」模式——工具能读取文件最原始的字节数据,还原准确度最高。如果你只是从别处复制粘贴一段已经显示在屏幕上的乱码文字,某些编码信息在复制过程中可能已经丢失,这种情况请用「粘贴文字」模式,此模式对于「UTF-8被误判成Latin-1/Windows-1252」这类西欧语言乱码的修复效果较好,但对中日韩文字乱码的还原能力有限。工具最多显示5个候选结果,选择正确的版本后可复制或下载。

一旦文字被复制粘贴(而非直接读取原始文件字节),部分编码信息可能已经永久丢失,此时即使工具尝试所有编码组合也未必能100%还原,请尽量以原始文件上传的方式操作以获得最佳结果。

其他实用工具: