中文转换

为什么一个简体字会对应多种繁体写法

Google Ad Placeholder

当中华人民共和国简化汉字时,一些原本有区别的繁体字被合并成一个简体形状。学习者把它当作书写上的方便:要记的形体更少。软件把它当作路上的分岔。回到繁体中文需要做选择。

这个选择,是人们说“转换器把我的名字弄错了”、而其余段落看起来都还好的主要原因。引擎并不是在随机丢掉笔画。它是在只用附近几个词当证据的情况下,试图撤销一次合并。

合并为何发生

二十世纪中叶的改革有几种方法:更少笔画、流行的手写形状,以及取消教师当作多余的异体。把两个罕见或相关的字合并成一个课堂形体,缩短了学生必须学的清单。汉字如何简化把这些方法放进历史。

合并不是 Unicode 的缺陷。Unicode 既编码简体形状,也编码繁体形状。歧义存在于简体码位的含义里,当你想退回一项较老的区分时。

并非每个简体字都是合并。国 / 國 本质上是同一个词的两种标准画法。你可以几乎没有波折地来回转换这一对。危险的是那些繁体中文在严谨书写里仍使用两个(或更多)字的情况。

人们实际碰到的例子

后 和 後。 在简体中文里,后 可以是称号里的尊称,也可以是“以后”或“后面”那个词,而繁体书写通常写成 後。转换器利用周围词语来猜。在人名、庙名或两个字的标题里,猜测可能错。结果看起来仍然像真正的中文。

发、發 和 髮。 发 是 發(发出、发展、发射)和 髮(头发)共同的简体。短语表对常用词有帮助:头发 极有可能变成 頭髮,发展 变成 發展。包含 发 的姓或自造产品名没有这张安全网。

面。 简体 面 覆盖“脸 / 表面”这个词,在许多文本里也覆盖繁体书写可能区分为 麵(面条)的食物词。菜单是经典失败案例:转换器几乎没有句法可依据,而公开场合用错字很尴尬。

干。 简体 干 收进了若干繁体写法,包括不同词里的 乾 和 幹。短标签和动词清单是它出错的地方。

这些是教学例子,不是完整词典。不同的内部体例也会把 台 / 臺 以及若干地名用字当作政策决定,而不是纯自动决定。

简体你可能需要的繁体形体软件容易滑倒的地方
后, 後姓名对“以后”
發, 髮头发类词对“发展 / 发出”
面, 麵菜单和食品包装
干, 乾, 幹短动词和技术标签
復, 複, 覆正式散文和标题

知道这个词的人可以在一秒钟内选定。词典按统计和短语长度选定。

这对软件意味着什么

OpenCC 在普通散文上好,因为普通散文包含坐在短语表里的常见双音节和三音节词。它在这些地方较弱:

  • 罕见人名
  • 诗歌和对联
  • 夹杂的文言文
  • 只有一个字的表格单元格
  • 周围没有句子的幻灯片标题
  • 自造的品牌拼写

这是词典的限度,不是用手一个字形一个字形转换 200 页文件的理由。它确实是在结果里搜索你关心的合并集合的理由。

来回转换会让问题更糟。若你把繁体转成简体,合并就发生了。若你再转回去,引擎必须猜。若你还会再用繁体原文,请保留它。转换与翻译是另一回事;本页谈的是中文内部的分岔。

你该做什么

  1. 选择匹配的地区类型,因为台湾和香港在边缘情况下甚至可能不想要同一个繁体字。见 OpenCC 转换类型
  2. 文本文档工具转换。
  3. 在结果里搜索 后、发、面、干、复,以及你这类文档常用的任何合并(食品文件需要 面;传记文件需要 后 和 发)。
  4. 用手改正姓名。不要为了修好一个单元格再跑一次完整转换。
  5. 发布前使用更完整的校对清单

若你维护公司词汇表,请保留一列“请勿自动转换”。自动处理之后,把那些字符串从源文件贴回去。

常见问题

这就是人们说转换不可逆的原因吗? 这是主要的语言原因。编码损坏是主要的技术原因。它们是不同的失败。

更聪明的模型能解决每一种合并吗? 更好的上下文对句子有帮助。孤立的姓名将永远需要一个人或一份可信清单。

繁体转简体时,我需要担心吗? 你较少需要担心选错拆分,而较多需要担心毁掉你以后可能还想要的区分。请保留源文件。

为什么一个常用词转对了,旁边的姓名却失败了? 因为常用词在短语表里,姓名不在。

合并字和减少笔画的简化是一回事吗? 不是。减少笔画可以是一对一。合并是多对一,而这才是难撤销的方向。

Google Ad Placeholder