Strumento di Riparazione Codifica (Multilingue)Rilevare e correggere automaticamente gli errori di codifica del testo
Cosa causa davvero caratteri strani come «Ã©» o un muro di simboli casuali?
Il mojibake (testo corrotto) deriva quasi sempre dalla decodifica del testo con la codifica sbagliata. Un file in cinese tradizionale salvato in Big5, se aperto per errore come UTF-8, fa sì che ogni carattere cinese si scomponga in diversi gruppi di simboli senza senso. Al contrario, un file UTF-8 aperto come Windows-1252 o Latin-1 produce cose come «Ã©» dove dovrebbe apparire «é». Questo strumento percorre la strada inversa: prende il tuo testo o file corrotto e cerca di decodificarlo di nuovo usando oltre 20 codifiche comuni, verificando quale risultato si legga come testo naturale e coerente, e classifica poi i candidati in base al livello di affidabilità così puoi scegliere quello corretto.
Come decide lo strumento quale candidato è quello corretto?
Per ogni codifica provata, lo strumento analizza il testo risultante: quanti caratteri sostitutivi non riconoscibili (come �) compaiono, se la distribuzione dei caratteri corrisponde a una lingua plausibile, se la punteggiatura sembra sensata e così via — combinando questi segnali in un punteggio di affidabilità, mostrando prima il candidato con il punteggio più alto. Supporta le codifiche per tutte le 18 lingue: cinese tradizionale (Big5, CP950), cinese semplificato (GBK, GB2312, GB18030), giapponese (Shift-JIS, EUC-JP), coreano (EUC-KR, CP949), cirillico (Windows-1251, KOI8-R), arabo (Windows-1256), ebraico (Windows-1255) e le serie ISO-8859 / Windows-125x per le lingue europee.
Caricare un file o incollare il testo: cosa scegliere?
Se hai il file originale (.txt, .csv, .log, ecc.), usa la modalità «Carica file» — lo strumento può leggere direttamente i byte grezzi, offrendo il recupero più accurato. Se invece stai solo incollando un testo già corrotto visibile sullo schermo (copiato da altrove), parte delle informazioni di codifica potrebbe essere già andata persa durante la copia — in tal caso usa la modalità «Incolla testo», che funziona bene per il mojibake UTF-8 basato su caratteri latini (errori del tipo «Ã©») ma ha capacità limitate nel recuperare testo cinese, giapponese o coreano già copiato e incollato. Lo strumento mostra fino a 5 candidati classificati; scegli quello corretto e copialo o scaricalo.
Una volta che un testo è stato copiato e incollato (invece di essere letto direttamente dai byte del file originale), alcune informazioni di codifica potrebbero essere perse permanentemente — anche provando tutte le codifiche non si ottiene sempre un recupero perfetto. Carica il file originale ogni volta che è possibile per ottenere il miglior risultato.
Potresti aver bisogno anche di