Herramienta de Reparación de Codificación (Multilingüe)Detectar y corregir automáticamente errores de codificación de texto

¿Qué provoca realmente galimatías como «Ã©» o una pared de símbolos aleatorios?

El mojibake (texto corrupto) casi siempre se debe a decodificar el texto con una codificación incorrecta. Un archivo en chino tradicional guardado en Big5, si se abre por error como UTF-8, hace que cada carácter chino se divida en varios grupos de símbolos sin sentido. Por el contrario, un archivo UTF-8 abierto como Windows-1252 o Latin-1 produce cosas como «Ã©» donde debería aparecer «é». Esta herramienta hace el camino inverso: toma su texto o archivo corrupto e intenta decodificarlo de nuevo con más de 20 codificaciones comunes, comprobando cuál de los resultados se lee como texto natural y coherente, y luego clasifica los candidatos por nivel de confianza para que pueda elegir el correcto.

¿Cómo decide la herramienta qué candidato es el correcto?

Para cada codificación que prueba, la herramienta analiza el texto resultante: cuántos caracteres de sustitución no reconocibles (como �) aparecen, si la distribución de caracteres coincide con un idioma plausible, si la puntuación parece razonable, etc. — combinando estas señales en una puntuación de confianza, mostrando primero el candidato con la puntuación más alta. Admite codificaciones para los 18 idiomas: chino tradicional (Big5, CP950), chino simplificado (GBK, GB2312, GB18030), japonés (Shift-JIS, EUC-JP), coreano (EUC-KR, CP949), cirílico (Windows-1251, KOI8-R), árabe (Windows-1256), hebreo (Windows-1255), y las series ISO-8859 / Windows-125x para idiomas europeos.

¿Subir un archivo o pegar texto? ¿Cuál deberías usar?

Si tienes el archivo original (.txt, .csv, .log, etc.), usa el modo «Subir archivo»: la herramienta puede leer los bytes crudos directamente, lo que ofrece la recuperación más precisa. Si solo estás pegando un texto que ya aparece corrupto en tu pantalla (copiado de otro lugar), es posible que ya se haya perdido algo de información de codificación durante esa copia; en ese caso usa el modo «Pegar texto», que funciona bien con el mojibake de UTF-8 basado en latín (errores tipo «Ã©») pero tiene capacidad limitada para recuperar texto chino, japonés o coreano que ya se ha copiado y pegado. La herramienta muestra hasta 5 candidatos clasificados; elige el correcto y cópialo o descárgalo.

Una vez que un texto se ha copiado y pegado (en lugar de leerse directamente de los bytes del archivo original), es posible que parte de la información de codificación se haya perdido de forma permanente; incluso probando todas las codificaciones no siempre se logra una recuperación perfecta. Sube el archivo original siempre que sea posible para obtener el mejor resultado.

Otras herramientas prácticas: