Исправление кодировки (восстановление текста на разных языках)Автоматически определяет и исправляет «кракозябры» из-за неверной кодировки
Что на самом деле вызывает «кракозябры» вроде «Ã©» или стену случайных символов?
«Кракозябры» (mojibake) почти всегда возникают из-за декодирования текста в неверной кодировке. Файл традиционного китайского в Big5, если его случайно открыть как UTF-8, превращает каждый иероглиф в набор бессмысленных символов. И наоборот, файл UTF-8, открытый как Windows-1252 или Latin-1, даёт «Ã©» там, где должно быть «é». Этот инструмент работает в обратном направлении: берёт ваш испорченный текст или файл и пробует перекодировать его через 20+ распространённых кодировок, проверяя, какой результат больше похож на настоящий, естественный текст, а затем ранжирует варианты по уверенности, чтобы вы могли выбрать правильный.
Как инструмент решает, какой вариант правильный?
Для каждой пробуемой кодировки инструмент анализирует результат: сколько появляется нераспознаваемых символов-заменителей (например, �), соответствует ли распределение символов правдоподобному языку, выглядит ли пунктуация разумно — и объединяет эти признаки в оценку уверенности, показывая наверху вариант с наивысшим баллом. Поддерживает кодировки для всех 18 языков: традиционный китайский (Big5, CP950), упрощённый китайский (GBK, GB2312, GB18030), японский (Shift-JIS, EUC-JP), корейский (EUC-KR, CP949), кириллица (Windows-1251, KOI8-R), арабский (Windows-1256), иврит (Windows-1255), а также серия ISO-8859 / Windows-125x для европейских языков.
Загрузить файл или вставить текст — что выбрать?
Если у вас есть оригинальный файл (.txt, .csv, .log и т. д.), используйте режим «Загрузить файл» — инструмент может читать байты напрямую, что даёт максимально точное восстановление. Если вы просто вставляете уже испорченный текст, скопированный откуда-то ещё, часть информации о кодировке могла быть утрачена при копировании — в этом случае используйте режим «Вставить текст», который хорошо работает с «кракозябрами» UTF-8 на основе латиницы (в духе «Ã©»), но имеет ограниченную способность восстанавливать уже скопированный текст на китайском/японском/корейском. Инструмент показывает до 5 ранжированных вариантов исправления — выберите правильный и скопируйте или скачайте результат.
Как только текст был скопирован и вставлен (а не прочитан напрямую из байтов оригинального файла), часть информации о кодировке может быть утрачена безвозвратно — даже перебор всех кодировок не всегда даёт идеальное восстановление. По возможности загружайте оригинальный файл для лучшего результата.
Вам также может понадобиться