OpenCC(Open Chinese Convert)是一個在中文書寫標準之間轉換的開源項目。它是詞典引擎,不是翻譯器,也不是拼寫檢查。ChineseDocConverter 在文本和文檔工具裏使用這些轉換類型,讓你可以選定來源和目標,而不是指望一個“中文”按鈕就夠。
下拉菜單裏的名稱對應常見的 OpenCC 配置。若你用過命令行 OpenCC 工具,思路是一樣的:一串詞典先識別來源標準,再寫出目標標準,並可選擇地做短語替換。
每一項是做什麼的
| 应用中的选项 | 典型用途 | 它不会做什么 |
|---|---|---|
| 简体 → 繁体 | 地区仍未知时的通用繁体输出 | 它不会替你选定台湾或香港写法 |
| 简体 → 繁体(台湾) | 面向台湾读者的文档 | 它不会把文章改写成台湾普通话文体 |
| 简体 → 繁体(台湾,含短语) | 台湾用字再加上部分措辞 | 它仍然不是本地化服务 |
| 简体 → 繁体(香港) | 面向香港或相近书写习惯的文档 | 它不会把文本变成口语粤语 |
| 繁体 → 简体 | 通用简体输出 | 它不会恢复丢失的编码 |
| 繁体 → 繁体(台湾) | 把已经是繁体的文本规范到台湾 | 它不会简化笔画 |
| 繁体 → 繁体(香港) | 把已经是繁体的文本规范到香港 | 它不会简化笔画 |
| 繁体(台湾)→ 简体 | 已知台湾来源、面向简体读者 | 它不会翻译成英文 |
| 繁体(台湾)→ 简体(含短语) | 台湾来源加上短语表 | 它不会让散文听起来像北京报纸 |
| 繁体(香港)→ 简体 | 已知香港来源、面向简体读者 | 若作者写了粤语语法,它不会去掉 |
若兩項看起來相似,優先選點明瞭你實際擁有的地區的那一項。“通用”是為混雜或未知文件準備的。它是起點,不是金標準。
字形與短語
字形轉換把 門 變成 門,國 變成 國,書 變成 書。這一層就是多數人説的簡體對繁體。
短語表也可能改一個地區用詞,例如台灣和大陸並不共用的軟件術語或日常名詞。短語類型對用户界面和普通新聞散文有用。它們仍然不是翻譯器。它們不會決定一個笑話是否成立、一份法律免責聲明在另一法域是否有效,或一個產品名是否應保持原來的字。
若只要字形,選不含短語的類型。若需要略微更本地的詞表,選短語類型,然後讀結果。短語表可能在碰巧包含常用詞的姓名裏讓人意外。
OpenCC 如何決定
OpenCC 並不像人那樣“理解”一句話。它儘量匹配最長的詞典條目,再退回到單字。所以 頭髮 很有機會變成 頭髮:這個雙音節詞在表裏。一個包含 發 的罕見人名,做對的機會就弱得多。
這種設計也是文件轉兩次會漂移的原因。第二次看到的是第一次的選擇,而不是作者原來的意圖。請保留源文件。為一位讀者只跑一次轉換。
上下文窗口對 後 / 後 這類常見合併有幫助,但在短標籤上會失敗。一個只寫着 後 的單元格,幾乎沒給引擎任何東西可依據。一對多對應列出了常見問題字。
OpenCC 不是什麼
- 它不是手寫識別或 OCR。字的圖片仍然是圖片。
- 它不是日文轉換。新字體和舊字體是另一段歷史,即使某個漢字看起來眼熟。
- 它不是韓文漢字轉換。
- 它不是語法檢查,也不是拼音標註。讀音拼寫請用拼音轉換器。
- 它不是關於哪一套標準才是“真正中文”的政治聲明。它是已公佈標準之間的映射。
兩套系統的教育背景,見簡體與繁體中文。二十世紀改革所用的方法,見漢字如何簡化。
實際選擇一項
- 點明讀者:中國大陸、新加坡、台灣、香港,還是混合。
- 知道來源就點明來源。台灣文件轉簡體,和香港文件轉簡體,不是同一項工作。
- 決定要不要短語替換。
- 先轉樣本,再轉整份文檔。
- 校對姓名、標題和法律文句。
若在比較台灣和香港輸出,把同一段粘貼進文本轉換器兩次。差別比死記更容易看見。
常見問題
全球公司該把哪一種設為默認? 沒有一種默認能同時滿足台灣和香港。許多產品把 zh-CN、zh-TW 和 zh-HK 作為分開的區域。
為什麼會有繁體轉繁體? 因為文件可以已經是繁體,卻仍使用另一地區的首選字形。規範化是真實的出版任務。
若文字處理軟件已有中文轉換按鈕,我還需要 OpenCC 嗎? 辦公軟件按鈕質量不一,很少以同樣方式暴露台灣對香港。它們也往往只轉換選區,而不是文檔的隱藏部分。本站轉換整個文件,以便樣式保持原位。
我能加入自己的詞嗎? 公開的網頁工具使用標準 OpenCC 詞典。它們不加載公司私有詞彙表。若你有受保護的術語,轉換後搜索它。
OpenCC 會修好亂碼嗎? 不會。請先修復亂碼中文。