Unicode attribue un numéro à chaque caractère. 国 et 國 sont des points de code différents. Une police est un dessin de ces points de code. Si le fichier a le bon caractère mais que la police n’a pas de glyphe, vous voyez un carré. Si le fichier a les mauvais octets, vous voyez du mojibake.
C’est pourquoi la conversion et les polices sont liées mais ne sont pas le même travail. OpenCC peut changer 国 en 國. Il ne peut pas installer 微软雅黑, Songti TC ou Noto Serif CJK sur l’ordinateur de quelqu’un d’autre. Les gens envoient un fichier converti, le collègue voit des carrés tofu, et les deux côtés blâment le convertisseur. Les carrés sont en général un problème de couverture de police.
Les points de code ne sont pas des dessins
Un fichier Word stocke les caractères comme des nombres. Le fichier de police stocke des dessins indexés par ces nombres. Lorsque le dessin manque, le système d’exploitation peut :
- montrer un carré
- se rabattre sur une autre police pour ce seul caractère
- montrer le glyphe d’une autre région pour un point de code qui a des variantes localisées
Le repli peut faire qu’une phrase ait l’air d’une note de rançon : un caractère en Song, le suivant dans une police système sans empattement. C’est laid et encore lisible. Un carré dur est pire, parce que vous ne pouvez pas dire si la conversion a eu lieu.
Certains points de code ont des variantes de glyphes propres à la région. Le numéro est le même ; le dessin préféré diffère pour les sources de Taïwan, de Hong Kong ou du continent. Une police conçue pour une région peut dessiner 骨 ou 起 légèrement autrement. Les lecteurs le remarquent. Ce n’est pas OpenCC qui change le mauvais caractère. Ce sont les tables de locale de la police. Voir chinois traditionnel à Taïwan et à Hong Kong pour les différences au niveau des caractères qui sont des points de code différents.
Un système d’écriture, beaucoup de polices
- Les polices centrées sur le simplifié peuvent manquer de formes traditionnelles peu courantes.
- Les polices centrées sur le traditionnel peuvent manquer de certaines formes simplifiées.
- Une grande police CJK, ou une paire de polices SC/TC, est le correctif habituel.
Les systèmes d’exploitation expédient déjà des polices de repli telles que Microsoft YaHei, PingFang, Source Han / Noto CJK et Songti. Ce site utilise ces polices système en CSS plutôt que d’embarquer des fichiers de polices. Votre document devrait faire quelque chose de similaire : choisir une famille de polices qui contient réellement la norme cible.
Lorsque vous intégrez des polices dans PowerPoint ou PDF, vous n’intégrez parfois que les glyphes que vous avez utilisés. Après la conversion, de nouveaux glyphes sont requis. Un fichier qui était « autonome » en simplifié peut cesser de l’être en traditionnel. Réintégrez une police CJK complète, ou dites aux destinataires quelle police installer.
Documents après conversion
Lorsque vous convertissez un fichier Word, Excel ou PowerPoint, les caractères dans le fichier changent. Les destinataires ont encore besoin d’une police qui peut les dessiner. Si un collègue ouvre votre fichier et voit des carrés, envoyez-lui cette page et la liste du chinois illisible avant de reconvertir.
Une machine de relecture pratique a :
- une police capable du simplifié
- une police capable du traditionnel
- la même version Office que vous utiliserez pour présenter
Si vous ne relisez que sur l’ordinateur portable qui a créé l’original simplifié, vous pouvez ne pas voir les échecs de repli traditionnel que votre client verra.
Unicode est la raison pour laquelle les convertisseurs peuvent exister
Parce que 门 et 門 sont des numéros différents, un dictionnaire peut remplacer l’un par l’autre sans se soucier de la façon dont un pinceau les écrirait. Chinois simplifié et traditionnel est une norme sociale. Unicode est la norme technique. OpenCC se situe entre les deux.
Les encodages plus anciens — Big5, GB2312, GBK — stockaient le chinois dans des cartes plus petites. Des fichiers des années 1990 apparaissent encore en pièces jointes. Si ces octets sont lus comme UTF-8, vous obtenez des déchets, pas des carrés. Les déchets sont de l’encodage. Les carrés sont des polices. Ne lancez pas OpenCC sur des déchets.
Questions fréquentes
Existe-t-il une police qui couvre tout le chinois ? De grandes familles CJK telles que Noto CJK / Source Han couvrent beaucoup. « Tout Unicode » reste beaucoup. Pour le travail bureautique, une police SC actuelle plus une police TC actuelle suffisent.
Dois-je convertir en images pour que les polices ne comptent pas ? Cela défait l’édition, la recherche et une conversion plus tardive. Corrigez plutôt les polices.
Pourquoi mon navigateur a-t-il l’air bien et Word a-t-il l’air faux ? Le navigateur et Word ne partagent pas la même liste de repli. Testez dans l’application que le destinataire utilisera.
Ce site intègre-t-il des polices chinoises dans les téléchargements ? Les fichiers bureautiques convertis gardent les informations de police qu’ils avaient déjà, plus les nouveaux caractères. Ils n’installent pas une police sur votre ordinateur.
国 et 國 sont-ils le même caractère en Unicode ? Non. C’est une paire simplifié/traditionnel avec des points de code différents. C’est ce qui fait de la conversion une opération réelle.