Outil de Réparation d'Encodage (Multilingue)Détecter et corriger automatiquement les erreurs d'encodage
Qu'est-ce qui provoque vraiment des caractères comme « é » ou un mur de symboles incompréhensibles ?
Le mojibake (texte déformé) provient presque toujours du décodage d'un texte avec un mauvais encodage. Un fichier en chinois traditionnel enregistré en Big5, s'il est ouvert par erreur en UTF-8, voit chaque caractère chinois se décomposer en plusieurs groupes de symboles dénués de sens. À l'inverse, un fichier UTF-8 ouvert en Windows-1252 ou Latin-1 produit des séquences comme « é » là où l'on attendrait « é ». Cet outil fait le chemin inverse : il prend votre texte ou fichier déformé et essaie de le redécoder avec plus de 20 encodages courants, en vérifiant lequel des résultats ressemble à un texte naturel et cohérent, puis classe les candidats par niveau de confiance pour que vous puissiez choisir le bon.
Comment l'outil détermine-t-il quel candidat est correct ?
Pour chaque encodage essayé, l'outil analyse le texte obtenu : le nombre de caractères de remplacement non reconnus (comme �), si la répartition des caractères correspond à une langue plausible, si la ponctuation semble cohérente, etc. — ces signaux sont combinés en un score de confiance, le candidat le mieux noté étant affiché en premier. Prend en charge les encodages des 18 langues : chinois traditionnel (Big5, CP950), chinois simplifié (GBK, GB2312, GB18030), japonais (Shift-JIS, EUC-JP), coréen (EUC-KR, CP949), cyrillique (Windows-1251, KOI8-R), arabe (Windows-1256), hébreu (Windows-1255), ainsi que les séries ISO-8859 / Windows-125x pour les langues européennes.
Importer un fichier ou coller du texte : que choisir ?
Si vous disposez du fichier d'origine (.txt, .csv, .log, etc.), utilisez le mode « Importer un fichier » — l'outil peut lire directement les octets bruts, ce qui donne la restauration la plus fiable. Si vous ne faites que coller un texte déjà déformé à l'écran (copié depuis ailleurs), certaines informations d'encodage peuvent déjà avoir été perdues lors de la copie — dans ce cas, utilisez le mode « Coller le texte », qui fonctionne bien pour le mojibake UTF-8 à base latine (erreurs du type « é ») mais dispose de capacités limitées pour restaurer un texte chinois, japonais ou coréen déjà copié-collé. L'outil affiche jusqu'à 5 candidats classés ; choisissez le bon puis copiez-le ou téléchargez-le.
Une fois qu'un texte a été copié puis collé (plutôt que lu directement depuis les octets du fichier d'origine), certaines informations d'encodage peuvent être définitivement perdues — même en essayant tous les encodages, une restauration parfaite n'est pas toujours possible. Importez le fichier d'origine dès que possible pour obtenir le meilleur résultat.
Vous aurez peut-être besoin de