中文轉換

OpenCC 中文轉換類型説明

Google Ad Placeholder

OpenCC(Open Chinese Convert)是一個在中文書寫標準之間轉換的開源項目。它是詞典引擎,不是翻譯器,也不是拼寫檢查。ChineseDocConverter 在文本文檔工具裏使用這些轉換類型,讓你可以選定來源和目標,而不是指望一個“中文”按鈕就夠。

下拉菜單裏的名稱對應常見的 OpenCC 配置。若你用過命令行 OpenCC 工具,思路是一樣的:一串詞典先識別來源標準,再寫出目標標準,並可選擇地做短語替換。

每一項是做什麼的

应用中的选项典型用途它不会做什么
简体 → 繁体地区仍未知时的通用繁体输出它不会替你选定台湾或香港写法
简体 → 繁体(台湾)面向台湾读者的文档它不会把文章改写成台湾普通话文体
简体 → 繁体(台湾,含短语)台湾用字再加上部分措辞它仍然不是本地化服务
简体 → 繁体(香港)面向香港或相近书写习惯的文档它不会把文本变成口语粤语
繁体 → 简体通用简体输出它不会恢复丢失的编码
繁体 → 繁体(台湾)把已经是繁体的文本规范到台湾它不会简化笔画
繁体 → 繁体(香港)把已经是繁体的文本规范到香港它不会简化笔画
繁体(台湾)→ 简体已知台湾来源、面向简体读者它不会翻译成英文
繁体(台湾)→ 简体(含短语)台湾来源加上短语表它不会让散文听起来像北京报纸
繁体(香港)→ 简体已知香港来源、面向简体读者若作者写了粤语语法,它不会去掉

若兩項看起來相似,優先選點明瞭你實際擁有的地區的那一項。“通用”是為混雜或未知文件準備的。它是起點,不是金標準。

字形與短語

字形轉換把 門 變成 門,國 變成 國,書 變成 書。這一層就是多數人説的簡體對繁體。

短語表也可能改一個地區用詞,例如台灣和大陸並不共用的軟件術語或日常名詞。短語類型對用户界面和普通新聞散文有用。它們仍然不是翻譯器。它們不會決定一個笑話是否成立、一份法律免責聲明在另一法域是否有效,或一個產品名是否應保持原來的字。

若只要字形,選不含短語的類型。若需要略微更本地的詞表,選短語類型,然後讀結果。短語表可能在碰巧包含常用詞的姓名裏讓人意外。

OpenCC 如何決定

OpenCC 並不像人那樣“理解”一句話。它儘量匹配最長的詞典條目,再退回到單字。所以 頭髮 很有機會變成 頭髮:這個雙音節詞在表裏。一個包含 發 的罕見人名,做對的機會就弱得多。

這種設計也是文件轉兩次會漂移的原因。第二次看到的是第一次的選擇,而不是作者原來的意圖。請保留源文件。為一位讀者只跑一次轉換。

上下文窗口對 後 / 後 這類常見合併有幫助,但在短標籤上會失敗。一個只寫着 後 的單元格,幾乎沒給引擎任何東西可依據。一對多對應列出了常見問題字。

OpenCC 不是什麼

  • 它不是手寫識別或 OCR。字的圖片仍然是圖片。
  • 它不是日文轉換。新字體和舊字體是另一段歷史,即使某個漢字看起來眼熟。
  • 它不是韓文漢字轉換。
  • 它不是語法檢查,也不是拼音標註。讀音拼寫請用拼音轉換器
  • 它不是關於哪一套標準才是“真正中文”的政治聲明。它是已公佈標準之間的映射。

兩套系統的教育背景,見簡體與繁體中文。二十世紀改革所用的方法,見漢字如何簡化

實際選擇一項

  1. 點明讀者:中國大陸、新加坡、台灣、香港,還是混合。
  2. 知道來源就點明來源。台灣文件轉簡體,和香港文件轉簡體,不是同一項工作。
  3. 決定要不要短語替換。
  4. 先轉樣本,再轉整份文檔。
  5. 校對姓名、標題和法律文句。

若在比較台灣和香港輸出,把同一段粘貼進文本轉換器兩次。差別比死記更容易看見。

常見問題

全球公司該把哪一種設為默認? 沒有一種默認能同時滿足台灣和香港。許多產品把 zh-CNzh-TWzh-HK 作為分開的區域。

為什麼會有繁體轉繁體? 因為文件可以已經是繁體,卻仍使用另一地區的首選字形。規範化是真實的出版任務。

若文字處理軟件已有中文轉換按鈕,我還需要 OpenCC 嗎? 辦公軟件按鈕質量不一,很少以同樣方式暴露台灣對香港。它們也往往只轉換選區,而不是文檔的隱藏部分。本站轉換整個文件,以便樣式保持原位。

我能加入自己的詞嗎? 公開的網頁工具使用標準 OpenCC 詞典。它們不加載公司私有詞彙表。若你有受保護的術語,轉換後搜索它。

OpenCC 會修好亂碼嗎? 不會。請先修復亂碼中文

Google Ad Placeholder