Alat Perbaikan Encoding (Multibahasa)Deteksi dan perbaiki kesalahan encoding teks secara otomatis

Apa sebenarnya yang menyebabkan karakter aneh seperti 'é' atau deretan simbol acak?

Mojibake (teks rusak) hampir selalu terjadi karena teks didekode dengan encoding yang salah. File berbahasa Tionghoa Tradisional yang disimpan dalam Big5, jika dibuka secara tidak sengaja sebagai UTF-8, membuat setiap karakter Tionghoa terpecah menjadi beberapa kelompok simbol yang tidak bermakna. Sebaliknya, file UTF-8 yang dibuka sebagai Windows-1252 atau Latin-1 menghasilkan hal seperti 'é' pada tempat yang seharusnya 'é'. Alat ini bekerja dengan cara terbalik: mengambil teks atau file rusak Anda dan mencoba mendekodenya kembali menggunakan lebih dari 20 encoding umum, memeriksa hasil mana yang terbaca seperti teks bahasa alami yang sebenarnya, lalu mengurutkan kandidat berdasarkan tingkat kepercayaan agar Anda dapat memilih yang benar.

Bagaimana alat ini menentukan kandidat mana yang benar?

Untuk setiap encoding yang dicoba, alat ini menganalisis teks hasilnya: berapa banyak karakter pengganti yang tidak dapat dikenali (seperti �) muncul, apakah distribusi karakter cocok dengan bahasa yang masuk akal, apakah tanda baca terlihat wajar, dan sebagainya — menggabungkan sinyal-sinyal ini menjadi skor kepercayaan, dengan kandidat bernilai tertinggi ditampilkan pertama. Mendukung encoding untuk semua 18 bahasa: Tionghoa Tradisional (Big5, CP950), Tionghoa Sederhana (GBK, GB2312, GB18030), Jepang (Shift-JIS, EUC-JP), Korea (EUC-KR, CP949), Sirilik (Windows-1251, KOI8-R), Arab (Windows-1256), Ibrani (Windows-1255), serta seri ISO-8859 / Windows-125x untuk bahasa-bahasa Eropa.

Unggah file atau tempel teks — mana yang sebaiknya digunakan?

Jika Anda memiliki file asli (.txt, .csv, .log, dll.), gunakan mode 'Unggah file' — alat ini dapat membaca byte mentah secara langsung, memberikan hasil pemulihan paling akurat. Jika Anda hanya menempelkan teks yang sudah tampak rusak di layar (disalin dari tempat lain), beberapa informasi encoding mungkin sudah hilang saat proses penyalinan itu — dalam kasus ini gunakan mode 'Tempel teks', yang bekerja baik untuk mojibake UTF-8 berbasis Latin (kesalahan bertipe 'é') tetapi memiliki kemampuan terbatas untuk memulihkan teks Tionghoa, Jepang, atau Korea yang sudah disalin-tempel. Alat ini menampilkan hingga 5 kandidat yang diurutkan; pilih yang benar lalu salin atau unduh.

Setelah teks disalin dan ditempel (bukan dibaca langsung dari byte file asli), beberapa informasi encoding mungkin hilang secara permanen — bahkan mencoba semua encoding pun tidak selalu menghasilkan pemulihan yang sempurna. Unggah file asli kapan pun memungkinkan untuk mendapatkan hasil terbaik.

Alat lain yang bermanfaat: