中文轉換

為什麼一個簡體字會對應多種繁體寫法

Google Ad Placeholder

當中華人民共和國簡化漢字時,一些原本有區別的繁體字被合併成一個簡體形狀。學習者把它當作書寫上的方便:要記的形體更少。軟體把它當作路上的分岔。回到繁體中文需要做選擇。

這個選擇,是人們說“轉換器把我的名字弄錯了”、而其餘段落看起來都還好的主要原因。引擎並不是在隨機丟掉筆畫。它是在只用附近幾個詞當證據的情況下,試圖撤銷一次合併。

合併為何發生

二十世紀中葉的改革有幾種方法:更少筆畫、流行的手寫形狀,以及取消教師當作多餘的異體。把兩個罕見或相關的字合併成一個課堂形體,縮短了學生必須學的清單。漢字如何簡化把這些方法放進歷史。

合併不是 Unicode 的缺陷。Unicode 既編碼簡體形狀,也編碼繁體形狀。歧義存在於簡體碼位的含義裡,當你想退回一項較老的區分時。

並非每個簡體字都是合併。國 / 國 本質上是同一個詞的兩種標準畫法。你可以幾乎沒有波折地來回轉換這一對。危險的是那些繁體中文在嚴謹書寫裡仍使用兩個(或更多)字的情況。

人們實際碰到的例子

後 和 後。 在簡體中文裡,後 可以是稱號裡的尊稱,也可以是“以後”或“後面”那個詞,而繁體書寫通常寫成 後。轉換器利用周圍詞語來猜。在人名、廟名或兩個字的標題裡,猜測可能錯。結果看起來仍然像真正的中文。

發、發 和 髮。 發 是 發(發出、發展、發射)和 髮(頭髮)共同的簡體。短語表對常用詞有幫助:頭髮 極有可能變成 頭髮,發展 變成 發展。包含 發 的姓或自造產品名沒有這張安全網。

面。 簡體 面 覆蓋“臉 / 表面”這個詞,在許多文字里也覆蓋繁體書寫可能區分為 麵(麵條)的食物詞。選單是經典失敗案例:轉換器幾乎沒有句法可依據,而公開場合用錯字很尷尬。

幹。 簡體 幹 收進了若干繁體寫法,包括不同詞裡的 乾 和 幹。短標籤和動詞清單是它出錯的地方。

這些是教學例子,不是完整詞典。不同的內部體例也會把 臺 / 臺 以及若干地名用字當作政策決定,而不是純自動決定。

简体你可能需要的繁体形体软件容易滑倒的地方
后, 後姓名对“以后”
發, 髮头发类词对“发展 / 发出”
面, 麵菜单和食品包装
干, 乾, 幹短动词和技术标签
復, 複, 覆正式散文和标题

知道這個詞的人可以在一秒鐘內選定。詞典按統計和短語長度選定。

這對軟體意味著什麼

OpenCC 在普通散文上好,因為普通散文包含坐在短語表裡的常見雙音節和三音節詞。它在這些地方較弱:

  • 罕見人名
  • 詩歌和對聯
  • 夾雜的文言文
  • 只有一個字的表格單元格
  • 周圍沒有句子的幻燈片標題
  • 自造的品牌拼寫

這是詞典的限度,不是用手一個字形一個字形轉換 200 頁檔案的理由。它確實是在結果裡搜尋你關心的合併集合的理由。

來回轉換會讓問題更糟。若你把繁體轉成簡體,合併就發生了。若你再轉回去,引擎必須猜。若你還會再用繁體原文,請保留它。轉換與翻譯是另一回事;本頁談的是中文內部的分岔。

你該做什麼

  1. 選擇匹配的地區型別,因為臺灣和香港在邊緣情況下甚至可能不想要同一個繁體字。見 OpenCC 轉換型別
  2. 文字文件工具轉換。
  3. 在結果裡搜尋 後、發、面、幹、復,以及你這類文件常用的任何合併(食品檔案需要 面;傳記檔案需要 後 和 發)。
  4. 用手改正姓名。不要為了修好一個單元格再跑一次完整轉換。
  5. 釋出前使用更完整的校對清單

若你維護公司詞彙表,請保留一列“請勿自動轉換”。自動處理之後,把那些字串從原始檔貼回去。

常見問題

這就是人們說轉換不可逆的原因嗎? 這是主要的語言原因。編碼損壞是主要的技術原因。它們是不同的失敗。

更聰明的模型能解決每一種合併嗎? 更好的上下文對句子有幫助。孤立的姓名將永遠需要一個人或一份可信清單。

繁體轉簡體時,我需要擔心嗎? 你較少需要擔心選錯拆分,而較多需要擔心毀掉你以後可能還想要的區分。請保留原始檔。

為什麼一個常用詞轉對了,旁邊的姓名卻失敗了? 因為常用詞在短語表裡,姓名不在。

合併字和減少筆畫的簡化是一回事嗎? 不是。減少筆畫可以是一對一。合併是多對一,而這才是難撤銷的方向。

Google Ad Placeholder