OpenCC(Open Chinese Convert)是一个在中文书写标准之间转换的开源项目。它是词典引擎,不是翻译器,也不是拼写检查。ChineseDocConverter 在文本和文档工具里使用这些转换类型,让你可以选定来源和目标,而不是指望一个“中文”按钮就够。
下拉菜单里的名称对应常见的 OpenCC 配置。若你用过命令行 OpenCC 工具,思路是一样的:一串词典先识别来源标准,再写出目标标准,并可选择地做短语替换。
每一项是做什么的
| 应用中的选项 | 典型用途 | 它不会做什么 |
|---|---|---|
| 简体 → 繁体 | 地区仍未知时的通用繁体输出 | 它不会替你选定台湾或香港写法 |
| 简体 → 繁体(台湾) | 面向台湾读者的文档 | 它不会把文章改写成台湾普通话文体 |
| 简体 → 繁体(台湾,含短语) | 台湾用字再加上部分措辞 | 它仍然不是本地化服务 |
| 简体 → 繁体(香港) | 面向香港或相近书写习惯的文档 | 它不会把文本变成口语粤语 |
| 繁体 → 简体 | 通用简体输出 | 它不会恢复丢失的编码 |
| 繁体 → 繁体(台湾) | 把已经是繁体的文本规范到台湾 | 它不会简化笔画 |
| 繁体 → 繁体(香港) | 把已经是繁体的文本规范到香港 | 它不会简化笔画 |
| 繁体(台湾)→ 简体 | 已知台湾来源、面向简体读者 | 它不会翻译成英文 |
| 繁体(台湾)→ 简体(含短语) | 台湾来源加上短语表 | 它不会让散文听起来像北京报纸 |
| 繁体(香港)→ 简体 | 已知香港来源、面向简体读者 | 若作者写了粤语语法,它不会去掉 |
若两项看起来相似,优先选点明了你实际拥有的地区的那一项。“通用”是为混杂或未知文件准备的。它是起点,不是金标准。
字形与短语
字形转换把 门 变成 門,国 变成 國,书 变成 書。这一层就是多数人说的简体对繁体。
短语表也可能改一个地区用词,例如台湾和大陆并不共用的软件术语或日常名词。短语类型对用户界面和普通新闻散文有用。它们仍然不是翻译器。它们不会决定一个笑话是否成立、一份法律免责声明在另一法域是否有效,或一个产品名是否应保持原来的字。
若只要字形,选不含短语的类型。若需要略微更本地的词表,选短语类型,然后读结果。短语表可能在碰巧包含常用词的姓名里让人意外。
OpenCC 如何决定
OpenCC 并不像人那样“理解”一句话。它尽量匹配最长的词典条目,再退回到单字。所以 头发 很有机会变成 頭髮:这个双音节词在表里。一个包含 发 的罕见人名,做对的机会就弱得多。
这种设计也是文件转两次会漂移的原因。第二次看到的是第一次的选择,而不是作者原来的意图。请保留源文件。为一位读者只跑一次转换。
上下文窗口对 后 / 後 这类常见合并有帮助,但在短标签上会失败。一个只写着 后 的单元格,几乎没给引擎任何东西可依据。一对多对应列出了常见问题字。
OpenCC 不是什么
- 它不是手写识别或 OCR。字的图片仍然是图片。
- 它不是日文转换。新字体和旧字体是另一段历史,即使某个汉字看起来眼熟。
- 它不是韩文汉字转换。
- 它不是语法检查,也不是拼音标注。读音拼写请用拼音转换器。
- 它不是关于哪一套标准才是“真正中文”的政治声明。它是已公布标准之间的映射。
两套系统的教育背景,见简体与繁体中文。二十世纪改革所用的方法,见汉字如何简化。
实际选择一项
- 点明读者:中国大陆、新加坡、台湾、香港,还是混合。
- 知道来源就点明来源。台湾文件转简体,和香港文件转简体,不是同一项工作。
- 决定要不要短语替换。
- 先转样本,再转整份文档。
- 校对姓名、标题和法律文句。
若在比较台湾和香港输出,把同一段粘贴进文本转换器两次。差别比死记更容易看见。
常见问题
全球公司该把哪一种设为默认? 没有一种默认能同时满足台湾和香港。许多产品把 zh-CN、zh-TW 和 zh-HK 作为分开的区域。
为什么会有繁体转繁体? 因为文件可以已经是繁体,却仍使用另一地区的首选字形。规范化是真实的出版任务。
若文字处理软件已有中文转换按钮,我还需要 OpenCC 吗? 办公软件按钮质量不一,很少以同样方式暴露台湾对香港。它们也往往只转换选区,而不是文档的隐藏部分。本站转换整个文件,以便样式保持原位。
我能加入自己的词吗? 公开的网页工具使用标准 OpenCC 词典。它们不加载公司私有词汇表。若你有受保护的术语,转换后搜索它。
OpenCC 会修好乱码吗? 不会。请先修复乱码中文。