Coderingshersteltool (Meertalig)Coderingfouten in tekst automatisch detecteren en herstellen

Wat veroorzaakt eigenlijk rare tekens zoals 'é' of een muur van willekeurige symbolen?

Mojibake (verminkte tekst) komt bijna altijd door het decoderen van tekst met de verkeerde codering. Een bestand in Traditioneel Chinees dat is opgeslagen in Big5, valt bij het per ongeluk openen als UTF-8 uiteen in meerdere betekenisloze symboolgroepjes per Chinees teken. Omgekeerd levert een UTF-8-bestand dat als Windows-1252 of Latin-1 wordt geopend dingen op zoals 'é' waar 'é' had moeten staan. Deze tool werkt de andere kant op: het neemt uw verminkte tekst of bestand en probeert dit opnieuw te decoderen met meer dan 20 gangbare coderingen, waarbij wordt gecontroleerd welk resultaat leest als echte, natuurlijke taal, en rangschikt de kandidaten vervolgens op betrouwbaarheid zodat u de juiste kunt kiezen.

Hoe bepaalt de tool welke kandidaat de juiste is?

Voor elke geprobeerde codering analyseert de tool de resulterende tekst: hoeveel onherkenbare vervangingstekens (zoals �) er voorkomen, of de tekenverdeling overeenkomt met een plausibele taal, of de leestekens logisch aandoen, enzovoort — deze signalen worden gecombineerd tot een betrouwbaarheidsscore, waarbij de hoogst scorende kandidaat als eerste wordt getoond. Ondersteunt coderingen voor alle 18 talen: Traditioneel Chinees (Big5, CP950), Vereenvoudigd Chinees (GBK, GB2312, GB18030), Japans (Shift-JIS, EUC-JP), Koreaans (EUC-KR, CP949), Cyrillisch (Windows-1251, KOI8-R), Arabisch (Windows-1256), Hebreeuws (Windows-1255), en de ISO-8859- / Windows-125x-reeksen voor Europese talen.

Bestand uploaden of tekst plakken — wat kiest u het beste?

Als u het originele bestand heeft (.txt, .csv, .log, enz.), gebruik dan de modus 'Bestand uploaden' — de tool kan de ruwe bytes direct lezen, wat het nauwkeurigste herstel oplevert. Als u alleen tekst plakt die al verminkt op uw scherm staat (van elders gekopieerd), is er bij dat kopiëren mogelijk al enige coderingsinformatie verloren gegaan — gebruik in dat geval de modus 'Tekst plakken', die goed werkt voor op Latijnse tekens gebaseerde UTF-8-mojibake (fouten in de stijl van 'é'), maar beperkt is in het herstellen van al gekopieerde en geplakte Chinese, Japanse of Koreaanse tekst. De tool toont maximaal 5 gerangschikte kandidaten; kies de juiste en kopieer of download deze.

Zodra tekst is gekopieerd en geplakt (in plaats van rechtstreeks uit de bytes van het originele bestand gelezen), kan sommige coderingsinformatie permanent verloren zijn gegaan — zelfs het proberen van alle coderingen leidt dan niet altijd tot een perfect herstel. Upload waar mogelijk het originele bestand voor het beste resultaat.

Andere handige tools: