Guides documents

Pourquoi le texte chinois s’affiche en cases ou en caractères illisibles

Google Ad Placeholder

Les gens disent souvent qu’un fichier « a besoin d’une conversion » lorsque le vrai problème est l’encodage ou les polices. Les symptômes se ressemblent si vous ne lisez pas le chinois tous les jours. Les correctifs non. Lancer OpenCC sur un fichier cassé ne récupérera pas les caractères de l’auteur. Il mappera du non-sens vers un autre non-sens.

Parcourez les symptômes ci-dessous avant de téléverser quoi que ce soit.

Carrés (tofu)

Un carré creux ou un tofu signifie en général que le caractère existe comme point de code mais que la police actuelle n’a pas de glyphe. Les données peuvent déjà être correctes. Changez la police pour une qui a une couverture CJK. Voir polices chinoises et Unicode.

Si chaque caractère chinois est un carré, la police est le premier suspect. Si seulement certains caractères sont des carrés, vous pouvez avoir un mélange de graphèmes rares, un sous-ensemble de police, ou un glyphe régional que la police n’a jamais inclus.

Ne convertissez pas encore. Si les carrés cachent des caractères traditionnels que vous vouliez déjà, la conversion est le mauvais levier.

Points d’interrogation

Un ? qui a remplacé un caractère signifie souvent que le texte a été forcé à travers un jeu de caractères qui ne pouvait pas le stocker. Enregistrer une phrase chinoise UTF-8 en Latin-1, ou coller via une ancienne passerelle SMS, est un chemin typique. Le caractère d’origine peut déjà être parti. La conversion ne peut pas le reconstruire.

Si vous avez encore l’e-mail source ou le .docx d’origine, revenez-y. La copie avec des points d’interrogation est un cadavre.

Mojibake

Des chaînes telles que 涓浗 au lieu de 中国 sont des octets UTF-8 lus avec le mauvais encodage, ou l’inverse. La page est pleine de caractères rares ou absurdes qu’un lecteur chinois rejette immédiatement.

Rouvrez le fichier en UTF-8 si vous avez encore la source. Dans Word, essayez la boîte de dialogue d’encodage à l’ouverture d’un fichier texte brut. Dans un navigateur, essayez le menu d’encodage si vous regardez un ancien site.

Si seule la copie cassée existe, la réparation automatique est aléatoire. Certains outils devinent UTF-8 contre GBK contre Big5. Deviner peut empirer les choses. Travaillez sur une copie.

Le mojibake figure dans les problèmes courants de conversion parce que les gens le convertissent par accident et ont ensuite deux problèmes.

Écritures mélangées qui ont « presque l’air chinoises »

Les phrases japonaises peuvent avoir un air de parenté. Elles ne sont pas une entrée OpenCC sûre. Si un fichier est bilingue, extrayez la partie chinoise. Le hanja coréen est le même avertissement.

Un PDF d’une photographie n’est pas illisible au sens de l’encodage. Ce n’est pas du texte. Voir le guide PDF.

Quand la conversion est la bonne étape suivante

Si vous pouvez lire le chinois, et que vous voulez seulement des formes simplifiées ou traditionnelles, utilisez le convertisseur de documents ou le convertisseur de texte. Si vous ne pouvez pas le lire, corrigez d’abord l’encodage ou les polices.

Un court test : copiez une phrase dans le convertisseur de texte. Si la zone de saisie montre déjà des déchets, arrêtez-vous. Si la saisie est lisible et que le résultat est l’autre norme, le fichier était bon et vous pouvez convertir le reste.

Un ordre de diagnostic

  1. Pouvez-vous surligner et copier une vraie phrase chinoise ? Si non, vous avez une numérisation, des contours, ou une police si cassée que vous ne pouvez pas voir le texte.
  2. Changer la police fait-il apparaître la phrase ? Si oui, vous aviez des carrés, pas un travail de conversion.
  3. La copie a-t-elle l’air de caractères rares aléatoires ? Si oui, vous avez du mojibake.
  4. Y a-t-il des points d’interrogation au milieu des mots ? Si oui, les données étaient déjà perdues.
  5. Alors seulement, choisissez un type OpenCC et convertissez.

Questions fréquentes

Mon collègue voit du chinois et je vois des carrés. Qui a raison ? Les deux. Le fichier peut être correct et votre couverture de police peut être fausse. Installez une police CJK avant de leur demander de reconvertir.

Ce site peut-il réparer le mojibake ? Non. Il convertit des normes chinoises lisibles.

Pourquoi une page web avait-elle l’air bien et le fichier téléchargé a-t-il l’air faux ? Le navigateur a deviné un encodage. Le fichier enregistré a figé la mauvaise conjecture.

Big5 est-il la même chose que le chinois traditionnel ? Big5 est un ancien encodage utilisé pour beaucoup de texte traditionnel. Les caractères traditionnels Unicode sont le stockage moderne. Un fichier Big5 mal ouvert comme UTF-8 devient du mojibake.

Dois-je convertir un fichier pour « corriger » des points d’interrogation ? Non. Récupérez la source.

Google Ad Placeholder