Narzędzie do Naprawy Kodowania (Wielojęzyczne)Automatyczne wykrywanie i naprawianie błędów kodowania tekstu

Co właściwie powoduje bełkot w stylu „é” albo ścianę losowych symboli?

Mojibake (zniekształcony tekst) prawie zawsze powstaje wtedy, gdy tekst zostaje zdekodowany przy użyciu niewłaściwego kodowania. Plik z tekstem w tradycyjnym chińskim zapisany w Big5, otwarty przez przypadek jako UTF-8, sprawia, że każdy chiński znak rozpada się na kilka bezsensownych grup symboli. I odwrotnie — plik UTF-8 otwarty jako Windows-1252 lub Latin-1 tworzy takie ciągi jak „é” w miejscu, gdzie powinno być „é”. To narzędzie działa w odwrotną stronę: bierze Twój zniekształcony tekst lub plik i próbuje go ponownie zdekodować przy użyciu ponad 20 popularnych kodowań, sprawdzając, który wynik wygląda jak naturalny, sensowny tekst, a następnie sortuje kandydatów według poziomu pewności, żebyś mógł wybrać właściwy.

Jak narzędzie ocenia, który kandydat jest prawidłowy?

Dla każdego wypróbowanego kodowania narzędzie analizuje otrzymany tekst: ile pojawia się nierozpoznawalnych znaków zastępczych (takich jak �), czy rozkład znaków odpowiada wiarygodnemu językowi, czy interpunkcja wygląda sensownie i tak dalej — te sygnały są łączone w wynik pewności, a kandydat z najwyższym wynikiem wyświetlany jest jako pierwszy. Obsługuje kodowania dla wszystkich 18 języków: chiński tradycyjny (Big5, CP950), chiński uproszczony (GBK, GB2312, GB18030), japoński (Shift-JIS, EUC-JP), koreański (EUC-KR, CP949), cyrylica (Windows-1251, KOI8-R), arabski (Windows-1256), hebrajski (Windows-1255) oraz serie ISO-8859 / Windows-125x dla języków europejskich.

Wgrać plik czy wkleić tekst — co wybrać?

Jeśli masz oryginalny plik (.txt, .csv, .log itd.), użyj trybu „Wgraj plik” — narzędzie może odczytać surowe bajty bezpośrednio, co daje najdokładniejsze odzyskanie tekstu. Jeśli natomiast wklejasz tekst, który już wyświetla się zniekształcony na ekranie (skopiowany skądinąd), część informacji o kodowaniu mogła zostać utracona już podczas kopiowania — w takim przypadku użyj trybu „Wklej tekst”, który dobrze działa w przypadku mojibake UTF-8 opartego na alfabecie łacińskim (błędy w stylu „é”), ale ma ograniczoną skuteczność w odzyskiwaniu już skopiowanego i wklejonego tekstu chińskiego, japońskiego czy koreańskiego. Narzędzie pokazuje do 5 posortowanych kandydatów — wybierz właściwy i skopiuj go lub pobierz.

Gdy tekst zostanie skopiowany i wklejony (a nie odczytany bezpośrednio z bajtów oryginalnego pliku), część informacji o kodowaniu może zostać nieodwracalnie utracona — nawet wypróbowanie wszystkich kodowań nie zawsze pozwala na pełne odzyskanie. Kiedy tylko jest to możliwe, wgraj oryginalny plik, aby uzyskać najlepszy wynik.

Inne przydatne narzędzia: