Conversion chinoise

Problèmes courants de conversion entre chinois simplifié et traditionnel

Google Ad Placeholder

La conversion automatique est rapide. Elle est aussi littérale. Le moteur remplace des caractères (et parfois des mots) à partir de dictionnaires. Il ne connaît pas votre client, votre généalogie ni vos consignes de marque. Voici les problèmes que les gens rencontrent le plus souvent après avoir appuyé sur Convertir.

Aucun d’eux ne signifie « n’utilisez jamais un convertisseur ». Ils signifient : connaissez les modes de défaillance, puis relisez les endroits où ces modes se concentrent.

Une forme simplifiée, plusieurs formes traditionnelles

后, 发, 面 et 干 sont des exemples célèbres. En chinois simplifié, une forme couvre des sens que le chinois traditionnel sépare encore. Le convertisseur choisit à partir de dictionnaires et d’une courte fenêtre de contexte. Il peut encore choisir le mauvais caractère traditionnel dans un nom, une citation classique ou une cellule de tableau d’un seul mot.

C’est l’erreur linguistique la plus importante, parce que le résultat a l’air fluide. Un lecteur peut ne pas remarquer qu’un nom personnel a été réécrit en un adverbe courant. Voir un caractère simplifié, plusieurs formes traditionnelles pour des exemples et une liste de recherche.

L’autre sens, traditionnel vers simplifié, cache la scission au lieu de l’inventer. Cela paraît plus propre et est plus facile à manquer comme problème. Le coût apparaît plus tard, lorsque quelqu’un reconvertit le fichier simplifié et ne peut pas récupérer les distinctions traditionnelles d’origine.

Le fichier était déjà cassé

Si la source est du mojibake — soupe de æ, salade de å, ou des carrés à la place des caractères — la conversion multiplie le désordre. OpenCC mappera volontiers des déchets vers d’autres déchets si les octets ont l’air de caractères.

Ouvrez d’abord la source dans Word ou un éditeur de texte. Si vous ne pouvez pas copier une phrase chinoise lisible, arrêtez-vous. Réparez le texte illisible et confirmez une vraie police Unicode avant de convertir.

Un piège lié est un PDF qui a seulement l’air d’être du texte. Si vous ne pouvez pas surligner une phrase, la page est une image. La conversion n’en extraira que peu ou rien d’utile. C’est un travail d’OCR, pas un travail OpenCC.

Japonais ou coréen mélangé

Les kanji et le hanja ont un air de parenté avec les caractères chinois. Ils ne sont pas une entrée OpenCC interchangeable. Les simplifications shinjitai japonaises ont suivi une autre histoire que le chinois simplifié du continent. Un paragraphe japonais passé dans un convertisseur chinois peut endommager les particules, les kanji proches des kana, et des mots qui n’existent qu’en japonais.

Si un document mélange chinois et japonais — un programme de colloque, un manuel bilingue, une liste de noms — convertissez seulement les portions chinoises, ou scindez le fichier. La même prudence s’applique au texte coréen qui inclut du hanja. Les types de conversion OpenCC sont des normes chinoises, pas un réécrivain CJK général.

Mots régionaux et mauvaise cible

Une table de locutions taïwanaise ne fera pas se sentir chez eux les lecteurs de Hong Kong, et l’inverse est aussi vrai. Le résultat peut être lisible et pourtant « à côté », comme un lecteur britannique remarque l’américain truck et apartment.

Ce n’est pas toujours un bogue. C’est un mauvais type de conversion. Choisissez Taïwan ou Hong Kong exprès. Si vous n’aviez besoin que des caractères et que le vocabulaire est devenu étonnamment local, vous avez peut-être choisi un type à locutions par accident.

Noms, marques et chaînes protégées

Les convertisseurs ne connaissent pas votre liste « ne pas traduire ». Un nom d’entreprise, un nom de médicament, un nom de temple, ou une marque romanisée qui se trouve contenir des caractères chinois peut changer. Il en va de même pour le prénom d’une personne qui utilise un caractère rare.

Avant un gros travail, rassemblez les chaînes qui doivent rester en place. Après la conversion, cherchez-les. Si une chaîne doit rester simplifiée dans un document traditionnel, ou l’inverse, sortez-la de la passe automatique et recollez-la.

Mise en page, retour à la ligne et polices

Les caractères traditionnels sont souvent plus larges. Un titre de diapositive, un bouton ou une colonne de tableur qui tenait tout juste les libellés simplifiés peut déborder, revenir à la ligne ou heurter un logo. C’est une vérification de mise en page, pas toujours un bogue de conversion.

Les polices causent une deuxième fausse alerte visuelle. Si la police de sortie n’a pas les glyphes traditionnels, vous verrez des carrés ou des formes de repli même lorsque les points de code sont corrects. Installez ou intégrez une police qui couvre la norme cible. Les détails sont dans polices chinoises et Unicode.

Excel a sa propre variante : les formules doivent rester des formules. Si un libellé à l’intérieur d’une formule était chinois, il peut se convertir. Les valeurs de cellules qui ressemblent à des nombres ne devraient pas. Si une feuille a l’air vide après la conversion, regardez les polices et si le texte source était bien stocké comme texte.

Parties cachées du fichier

Word stocke du texte dans les en-têtes, pieds de page, commentaires, notes de bas de page, zones de texte et tableaux. PowerPoint le stocke dans les notes et les masques. Excel le stocke dans les commentaires, les noms de feuilles et les noms définis. Un convertisseur qui n’aurait touché que le corps laisserait un désordre bilingue.

ChineseDocConverter est conçu pour lire ces parties des formats bureautiques qu’il prend en charge. Vous devez tout de même ouvrir le téléchargement et parcourir en-têtes, notes et onglets de feuilles. Le texte caché est l’endroit où se cachent les caractères simplifiés ou traditionnels oubliés.

Un ordre de réparation qui fait gagner du temps

  1. Confirmez que la source est du chinois lisible, pas du mojibake ni une numérisation.
  2. Confirmez que vous avez choisi le bon type régional.
  3. Convertissez un échantillon, puis le fichier entier.
  4. Cherchez les caractères de fusion et les noms protégés.
  5. Vérifiez la mise en page et les polices.
  6. Alors seulement, envoyez le fichier.

Si vous convertissez, remarquez un problème, et reconvertissez à partir du fichier déjà converti, vous rendez le diagnostic plus difficile. Revenez à l’original.

Questions fréquentes

Le résultat a l’air fluide. Puis-je sauter la relecture ? Fluide, c’est exactement l’aspect d’un 後 erroné dans un nom. Parcourez au moins les noms et les titres.

Pourquoi une partie seulement de mon PDF a-t-elle changé ? Le reste est probablement des contours, des images, ou un sous-ensemble de police qui ne s’est pas extrait comme texte.

Puis-je annuler une mauvaise conversion ? Seulement si vous avez conservé le fichier d’origine. Ne comptez pas sur une reconversion.

Un document plus long échoue-t-il plus souvent ? Il échoue en plus d’endroits, pas à un taux plus élevé par phrase. Les pages d’échantillon prédisent encore la plupart des problèmes de dictionnaire. Elles ne prédisent pas chaque nom.

Google Ad Placeholder