Kodierungs-Reparatur-Tool (Mehrsprachig)Fehlerhafte Zeichenkodierung automatisch erkennen und reparieren
Was verursacht eigentlich Zeichensalat wie „é“ oder eine Wand aus wirren Symbolen?
Mojibake (Zeichensalat) entsteht fast immer dadurch, dass Text mit der falschen Zeichenkodierung dekodiert wird. Eine Datei mit traditionellem Chinesisch, die in Big5 gespeichert wurde, zerfällt beim versehentlichen Öffnen als UTF-8 in jedem chinesischen Zeichen zu mehreren bedeutungslosen Symbolgruppen. Umgekehrt erzeugt eine UTF-8-Datei, die als Windows-1252 oder Latin-1 geöffnet wird, Dinge wie „é“ dort, wo eigentlich „é“ stehen sollte. Dieses Tool geht den Weg zurück: Es nimmt Ihren fehlerhaften Text oder Ihre Datei und versucht, ihn erneut mit über 20 gängigen Kodierungen zu dekodieren. Dabei prüft es, welches Ergebnis wie echter, natürlicher Text aussieht, und ordnet die Kandidaten nach Vertrauenswert, damit Sie den richtigen auswählen können.
Wie entscheidet das Tool, welcher Kandidat richtig ist?
Für jede versuchte Kodierung analysiert das Tool den resultierenden Text: wie viele nicht erkennbare Ersatzzeichen (wie �) auftauchen, ob die Zeichenverteilung zu einer plausiblen Sprache passt, ob die Zeichensetzung sinnvoll aussieht und so weiter — all diese Signale werden zu einem Vertrauenswert kombiniert, wobei der am höchsten bewertete Kandidat zuerst angezeigt wird. Unterstützt Kodierungen für alle 18 Sprachen: traditionelles Chinesisch (Big5, CP950), vereinfachtes Chinesisch (GBK, GB2312, GB18030), Japanisch (Shift-JIS, EUC-JP), Koreanisch (EUC-KR, CP949), Kyrillisch (Windows-1251, KOI8-R), Arabisch (Windows-1256), Hebräisch (Windows-1255) sowie die ISO-8859- / Windows-125x-Reihe für europäische Sprachen.
Datei hochladen oder Text einfügen — was sollten Sie wählen?
Wenn Sie die Originaldatei besitzen (.txt, .csv, .log usw.), verwenden Sie den Modus „Datei hochladen“ — das Tool kann die Rohbytes direkt lesen und liefert so die genaueste Wiederherstellung. Wenn Sie hingegen nur Text einfügen, der bereits auf Ihrem Bildschirm fehlerhaft dargestellt wird (von woanders kopiert), können beim Kopieren bereits einige Kodierungsinformationen verloren gegangen sein — verwenden Sie in diesem Fall den Modus „Text einfügen“. Er funktioniert gut bei lateinbasiertem UTF-8-Zeichensalat (Fehler im Stil von „é“), hat aber nur begrenzte Möglichkeiten, bereits kopierten chinesischen, japanischen oder koreanischen Text wiederherzustellen. Das Tool zeigt bis zu 5 bewertete Kandidaten an; wählen Sie den richtigen aus und kopieren oder laden Sie ihn herunter.
Sobald Text kopiert und eingefügt wurde (statt direkt aus den Bytes der Originaldatei gelesen zu werden), können einige Kodierungsinformationen unwiderruflich verloren sein — selbst das Ausprobieren aller Kodierungen führt dann nicht immer zu einer perfekten Wiederherstellung. Laden Sie wann immer möglich die Originaldatei hoch, um das beste Ergebnis zu erzielen.
Das könnten Sie auch brauchen