中文转换

简繁转换的常见问题

Google Ad Placeholder

自动转换很快。它也很字面。引擎依据词典替换汉字(有时也包括词)。它不认识你的客户、你的家谱或你的品牌规范。这些是人们按下“转换”之后最常碰到的问题。

它们都不意味着“永远不要用转换器”。它们意味着:知道失败模式,然后校对这些模式聚集的地方。

一个简体形体,多种繁体写法

后、发、面 和 干 是著名例子。在简体中文里,一个形状覆盖了繁体中文仍分开写的含义。转换器从词典和一小段上下文窗口里挑选。在姓名、古文引文或单字表格单元格里,它仍可能选错繁体字。

这是最重要的语言错误,因为结果看起来通顺。读者可能注意不到一个人名被改写成了常见副词。例子和搜索清单见一个简体字对应多种繁体写法

另一个方向,繁体转简体,是把区分藏起来,而不是发明区分。这感觉更干净,也更容易被当成不是问题。代价出现得更晚:有人把简体文件转回去,却无法恢复原来的繁体区分。

文件本来就已经坏了

若来源是乱码——æ 汤、å 沙拉,或方框而不是字——转换会把乱摊子放大。若这些字节碰巧看起来像字,OpenCC 会乐意把垃圾映射成另一种垃圾。

先在 Word 或文本编辑器里打开源文件。若你复制不出一句可读的中文,请停下来。先修乱码,并确认真正的 Unicode 字体,再转换。

一个相关陷阱是只看起来像文字的 PDF。若你无法选中一句话,那一页就是图片。转换几乎提取不出有用的东西。那是 OCR 工作,不是 OpenCC 工作。

夹杂日文或韩文

汉字和韩文汉字看起来与中文字相关。它们不是即插即用的 OpenCC 输入。日文新字体的简化走了与大陆简体不同的历史。一段日文经过中文转换器,可能损坏助词、与假名相邻的汉字,以及只存在于日语的词。

若文档混有中文和日文——会议日程、双语手册、名单——只转换中文部分,或拆开文件。包含韩文汉字的韩语文本也适用同样的谨慎。OpenCC 转换类型是中文标准,不是通用的中日韩改写器。

地区用词和错误的目标

台湾短语表不会让香港读者觉得自在,反过来也一样。结果可能可读,却仍然“不对劲”,就像英国读者会注意到美式 truckapartment

这并不总是缺陷。这是选错了转换类型。有意选择台湾或香港。若你只要字形,措辞却变得出奇本地,你可能碰巧选了短语类型。

姓名、品牌和受保护的字符串

转换器不知道你的“请勿翻译”清单。公司名、药名、庙名,或碰巧包含汉字的罗马化品牌都可能被改。使用生僻字的人名也可能。

大工程之前,先收集必须保持不动的字符串。转换之后搜索它们。若某个字符串必须在繁体文档里保持简体,或反过来,把它留在自动处理之外,再贴回去。

版式、换行和字体

繁体字往往更宽。勉强装得下简体标签的幻灯片标题、按钮或表格列,可能溢出、换行,或撞上标志。那是版式检查,并不总是转换错误。

字体造成第二种视觉虚惊。若输出字体缺少繁体字形,即使码位正确,你也会看到方框或回退形状。请安装或嵌入覆盖目标标准的字体。细节见中文字体与 Unicode

Excel 有自己的变体:公式应当仍是公式。若公式里的标签是中文,它可能被转换。看起来像数字的单元格值不该被转换。若工作表转换后看起来是空的,看字体,也看来源文字究竟是否作为文字存储。

文件的隐藏部分

Word 把文字存在页眉、页脚、批注、脚注、文本框和表格里。PowerPoint 把它存在备注和母版里。Excel 把它存在批注、工作表名和定义名称里。只碰正文的转换器会留下双语乱摊子。

ChineseDocConverter 被做成会读取它所支持的办公格式的这些部分。你仍应打开下载文件,点进页眉、备注和工作表标签。隐藏文字是残留简体或繁体字藏身的地方。

能省时间的修复顺序

  1. 确认来源是可读的中文,不是乱码或扫描件。
  2. 确认你选对了地区类型。
  3. 先转样本,再转整份文件。
  4. 搜索合并字和受保护的姓名。
  5. 检查版式和字体。
  6. 然后再把文件送出去。

若你转换了,发现了问题,又从已经转换过的文件再转一次,诊断会更难。请回到原文。

常见问题

结果看起来通顺。我能跳过校对吗? 通顺恰恰是姓名里错写成 後 时的样子。至少浏览姓名和标题。

为什么我的 PDF 只有一部分变了? 其余部分大概是轮廓、图像,或没有作为文字提取出来的字体子集。

我能撤销一次糟糕的转换吗? 只有你保留了原文件才行。不要指望转回去。

更长的文档会更常失败吗? 它在更多地方失败,而不是每一句的失败率更高。样本页仍能预测大多数词典问题。它们预测不了每一个姓名。

Google Ad Placeholder