Інструмент Відновлення Кодування (Багатомовний)Автоматично виявляти та виправляти помилки кодування тексту
Що насправді спричиняє незрозумілі символи, як «Ã©», або стіну випадкових знаків?
Пошкоджений текст (mojibake) майже завжди виникає через декодування тексту в неправильному кодуванні. Файл традиційної китайської мови, збережений у Big5, якщо його помилково відкрити як UTF-8, розпадається — кожен китайський ієрогліф перетворюється на кілька безглуздих груп символів. І навпаки, файл UTF-8, відкритий як Windows-1252 або Latin-1, дає щось на зразок «Ã©» там, де мало бути «é». Цей інструмент іде у зворотному напрямку: бере ваш пошкоджений текст або файл і намагається перекодувати його за допомогою понад 20 поширених кодувань, перевіряючи, який результат читається як справжній, природний текст, а потім ранжує варіанти за рівнем впевненості, щоб ви могли вибрати правильний.
Як інструмент визначає, який варіант правильний?
Для кожного випробуваного кодування інструмент аналізує отриманий текст: скільких нерозпізнаваних символів-заповнювачів (як �) з'являється, чи відповідає розподіл символів правдоподібній мові, чи виглядає пунктуація логічною тощо — поєднуючи ці сигнали в оцінку впевненості, показуючи спочатку варіант із найвищим балом. Підтримує кодування для всіх 18 мов: традиційна китайська (Big5, CP950), спрощена китайська (GBK, GB2312, GB18030), японська (Shift-JIS, EUC-JP), корейська (EUC-KR, CP949), кирилиця (Windows-1251, KOI8-R), арабська (Windows-1256), іврит (Windows-1255) та серії ISO-8859 / Windows-125x для європейських мов.
Завантажити файл чи вставити текст — що обрати?
Якщо у вас є оригінальний файл (.txt, .csv, .log тощо), скористайтеся режимом «Завантажити файл» — інструмент може читати необроблені байти безпосередньо, що дає найточніше відновлення. Якщо ви просто вставляєте текст, який уже виглядає пошкодженим на екрані (скопійований звідкись), частина інформації про кодування могла бути втрачена ще під час копіювання — у такому разі скористайтеся режимом «Вставити текст», який добре працює з mojibake на основі латиниці в UTF-8 (помилки типу «Ã©»), але має обмежені можливості для відновлення вже скопійованого й вставленого китайського, японського чи корейського тексту. Інструмент показує до 5 ранжованих варіантів — виберіть правильний і скопіюйте або завантажте його.
Щойно текст було скопійовано та вставлено (а не прочитано безпосередньо з байтів оригінального файлу), частина інформації про кодування може бути втрачена назавжди — навіть перебір усіх кодувань не завжди дає ідеальне відновлення. Завантажуйте оригінальний файл, коли це можливо, щоб отримати найкращий результат.
Вам також може знадобитися