Ferramenta de Reparação de Codificação (Multilíngue)Detectar e corrigir automaticamente erros de codificação de texto

O que realmente causa caracteres estranhos como «Ã©» ou uma parede de símbolos aleatórios?

O mojibake (texto corrompido) quase sempre resulta de decodificar o texto com a codificação errada. Um arquivo em chinês tradicional salvo em Big5, se aberto por engano como UTF-8, faz com que cada caractere chinês se divida em vários grupos de símbolos sem sentido. Por outro lado, um arquivo UTF-8 aberto como Windows-1252 ou Latin-1 produz algo como «Ã©» onde deveria aparecer «é». Esta ferramenta faz o caminho inverso: pega seu texto ou arquivo corrompido e tenta decodificá-lo novamente usando mais de 20 codificações comuns, verificando qual resultado se lê como texto natural e coerente, e então classifica os candidatos por nível de confiança para que você escolha o correto.

Como a ferramenta decide qual candidato está correto?

Para cada codificação testada, a ferramenta analisa o texto resultante: quantos caracteres de substituição não reconhecíveis (como �) aparecem, se a distribuição de caracteres corresponde a um idioma plausível, se a pontuação parece razoável, e assim por diante — combinando esses sinais em uma pontuação de confiança, com o candidato de maior pontuação exibido primeiro. Suporta codificações para os 18 idiomas: chinês tradicional (Big5, CP950), chinês simplificado (GBK, GB2312, GB18030), japonês (Shift-JIS, EUC-JP), coreano (EUC-KR, CP949), cirílico (Windows-1251, KOI8-R), árabe (Windows-1256), hebraico (Windows-1255) e as séries ISO-8859 / Windows-125x para idiomas europeus.

Enviar um arquivo ou colar texto — qual usar?

Se você tem o arquivo original (.txt, .csv, .log etc.), use o modo «Enviar arquivo» — a ferramenta pode ler os bytes brutos diretamente, oferecendo a recuperação mais precisa. Se você está apenas colando um texto que já aparece corrompido na sua tela (copiado de outro lugar), parte da informação de codificação já pode ter se perdido nessa cópia — nesse caso, use o modo «Colar texto», que funciona bem para mojibake de UTF-8 baseado em latim (erros do tipo «Ã©»), mas tem capacidade limitada para recuperar texto em chinês, japonês ou coreano que já foi copiado e colado. A ferramenta mostra até 5 candidatos classificados; escolha o correto e copie ou baixe.

Depois que um texto é copiado e colado (em vez de lido diretamente dos bytes do arquivo original), parte da informação de codificação pode se perder permanentemente — mesmo testando todas as codificações, nem sempre é possível obter uma recuperação perfeita. Envie o arquivo original sempre que possível para obter o melhor resultado.

Outras ferramentas úteis: