把简体中文转换成繁体中文,是中文出版里最常见的工作之一。大陆写成的草稿需要台湾版。产品界面需要香港字符串。用简体字打的家谱,需要和繁体字族谱对得上。可靠的方法是基于词典的转换器,再加一轮人工,而不是在文字处理软件里查找替换。
查找替换会失败,因为对应关系不是一字对一字。有些简体形体对应多种繁体形体。即使两边都用繁体字,有些词也会因地区而不同。懂得这些对照表的转换器,仍然需要你点明读者是谁。
从读者出发,而不是从文件扩展名出发
先问谁会读结果。
- 台湾读者预期台湾用字。软件、交通和政府机关的词汇,他们也可能预期台湾说法。
- 香港读者预期香港用字。有些文本还会带受粤语书面语影响的措辞。
- 混合的海外读者也许能接受通用繁体,但学校、教会或报纸往往已有自家标准。猜之前先问。
“繁体中文”不是一份清单。只提供一个繁体开关的软件,总会对某个人是错的。ChineseDocConverter 提供 OpenCC 类型,例如简体转繁体、简体转繁体(台湾)、台湾加短语,以及简体转繁体(香港)。通用繁体选项是你还不知道地区时的退路。一旦知道,就选台湾或香港。见 OpenCC 转换类型和台湾与香港繁体中文。
转换器改什么
OpenCC 用词典遍历文本。在普通散文里,它把 国 变成 國,书 变成 書,门 变成 門,学习 变成 學習。这是看得见的工作。
它也会尝试拆开简体中文合并过的字。后 在周围词语表示“以后”时,可能变成 後。发 在 头发 里可能变成 髮,在 发展 里变成 發。短语表是转换器胜过一对一字形表的原因。它们仍然是根据附近词语的猜测,不是读心术。人名、诗歌和古文引文,是猜测最先失败的地方。转换名单之前,请先读一对多对应。
能识别短语的类型还会再进一步,替换部分地区用词。这能让台湾界面少一点“大陆文件加了更花的笔画”的感觉。它不会本地化幽默、俚语或法律条款。若文档必须听起来像在台北或香港写成,转换之后请为编辑预留预算。
文本还是文档
用与文字存储方式相符的工具。
从 Word 里复制出来,在纯文本框里转换,再贴回去,标题样式和表格版式就会丢。若来源是扫描件,只有中文已经作为文字存在之后,才转换文件。一页照片不是字符串。
较旧的 .doc 应先另存为 .docx。若源文件里的简体中文已经像垃圾,请停下来先修乱码。转换无法凭空补出缺失的字。
一套可操作的步骤
- 保留原来的简体文件。转换不是存档格式。
- 选择台湾、香港,或通用繁体。
- 决定要短语替换,还是只要字形。
- 文件很长时,先转换一页样本。
- 在结果里搜索已知的合并字,例如 后、发、面 和 干。
- 读标题、姓名、按钮和法律脚注。
- 检查幻灯片和窄表格单元格的换行。繁体形体往往更宽。
最后一点是版式,不是词典错误。勉强装得下简体标签的幻灯片,转换后可能溢出。
之后
把下载文件当作字形层的初稿。目标标准的母语读者会抓住词典漏掉的词汇。博客文章也许仔细浏览就够。合同、用户界面或印刷书籍,请安排真正的校对。
若以后需要另一个方向,不要假定转回去就能恢复原来的简体。合并字和短语替换可能改变文本。两份文件都要留。
常见问题
我是否总该选台湾繁体? 只有台湾读者才是受众时才该选。香港和许多海外社区使用不同的首选字形,以及部分不同的词。
“含短语”增加了什么? 在字形转换之上加入部分地区用词。它仍然不是翻译。
我能转换扫描的 PDF 吗? 要等页面已经变成真正的文字才行。本转换器改的是字,不是字的图片。
姓名会转对吗? 常常会,但不可靠。自动转换后请亲手搜索姓名。
有没有一种繁体中文能让每位读者都满意? 没有。选定一套地区标准,若文件稍后还会再编辑,请说明你用的是哪一套。