當中華人民共和國簡化漢字時,一些原本有區別的繁體字被合併成一個簡體形狀。學習者把它當作書寫上的方便:要記的形體更少。軟體把它當作路上的分岔。回到繁體中文需要做選擇。
這個選擇,是人們說“轉換器把我的名字弄錯了”、而其餘段落看起來都還好的主要原因。引擎並不是在隨機丟掉筆畫。它是在只用附近幾個詞當證據的情況下,試圖撤銷一次合併。
合併為何發生
二十世紀中葉的改革有幾種方法:更少筆畫、流行的手寫形狀,以及取消教師當作多餘的異體。把兩個罕見或相關的字合併成一個課堂形體,縮短了學生必須學的清單。漢字如何簡化把這些方法放進歷史。
合併不是 Unicode 的缺陷。Unicode 既編碼簡體形狀,也編碼繁體形狀。歧義存在於簡體碼位的含義裡,當你想退回一項較老的區分時。
並非每個簡體字都是合併。國 / 國 本質上是同一個詞的兩種標準畫法。你可以幾乎沒有波折地來回轉換這一對。危險的是那些繁體中文在嚴謹書寫裡仍使用兩個(或更多)字的情況。
人們實際碰到的例子
後 和 後。 在簡體中文裡,後 可以是稱號裡的尊稱,也可以是“以後”或“後面”那個詞,而繁體書寫通常寫成 後。轉換器利用周圍詞語來猜。在人名、廟名或兩個字的標題裡,猜測可能錯。結果看起來仍然像真正的中文。
發、發 和 髮。 發 是 發(發出、發展、發射)和 髮(頭髮)共同的簡體。短語表對常用詞有幫助:頭髮 極有可能變成 頭髮,發展 變成 發展。包含 發 的姓或自造產品名沒有這張安全網。
面。 簡體 面 覆蓋“臉 / 表面”這個詞,在許多文字里也覆蓋繁體書寫可能區分為 麵(麵條)的食物詞。選單是經典失敗案例:轉換器幾乎沒有句法可依據,而公開場合用錯字很尷尬。
幹。 簡體 幹 收進了若干繁體寫法,包括不同詞裡的 乾 和 幹。短標籤和動詞清單是它出錯的地方。
這些是教學例子,不是完整詞典。不同的內部體例也會把 臺 / 臺 以及若干地名用字當作政策決定,而不是純自動決定。
| 简体 | 你可能需要的繁体形体 | 软件容易滑倒的地方 |
|---|---|---|
| 后 | 后, 後 | 姓名对“以后” |
| 发 | 發, 髮 | 头发类词对“发展 / 发出” |
| 面 | 面, 麵 | 菜单和食品包装 |
| 干 | 干, 乾, 幹 | 短动词和技术标签 |
| 复 | 復, 複, 覆 | 正式散文和标题 |
知道這個詞的人可以在一秒鐘內選定。詞典按統計和短語長度選定。
這對軟體意味著什麼
OpenCC 在普通散文上好,因為普通散文包含坐在短語表裡的常見雙音節和三音節詞。它在這些地方較弱:
- 罕見人名
- 詩歌和對聯
- 夾雜的文言文
- 只有一個字的表格單元格
- 周圍沒有句子的幻燈片標題
- 自造的品牌拼寫
這是詞典的限度,不是用手一個字形一個字形轉換 200 頁檔案的理由。它確實是在結果裡搜尋你關心的合併集合的理由。
來回轉換會讓問題更糟。若你把繁體轉成簡體,合併就發生了。若你再轉回去,引擎必須猜。若你還會再用繁體原文,請保留它。轉換與翻譯是另一回事;本頁談的是中文內部的分岔。
你該做什麼
- 選擇匹配的地區型別,因為臺灣和香港在邊緣情況下甚至可能不想要同一個繁體字。見 OpenCC 轉換型別。
- 用文字或文件工具轉換。
- 在結果裡搜尋 後、發、面、幹、復,以及你這類文件常用的任何合併(食品檔案需要 面;傳記檔案需要 後 和 發)。
- 用手改正姓名。不要為了修好一個單元格再跑一次完整轉換。
- 釋出前使用更完整的校對清單。
若你維護公司詞彙表,請保留一列“請勿自動轉換”。自動處理之後,把那些字串從原始檔貼回去。
常見問題
這就是人們說轉換不可逆的原因嗎? 這是主要的語言原因。編碼損壞是主要的技術原因。它們是不同的失敗。
更聰明的模型能解決每一種合併嗎? 更好的上下文對句子有幫助。孤立的姓名將永遠需要一個人或一份可信清單。
繁體轉簡體時,我需要擔心嗎? 你較少需要擔心選錯拆分,而較多需要擔心毀掉你以後可能還想要的區分。請保留原始檔。
為什麼一個常用詞轉對了,旁邊的姓名卻失敗了? 因為常用詞在短語表裡,姓名不在。
合併字和減少筆畫的簡化是一回事嗎? 不是。減少筆畫可以是一對一。合併是多對一,而這才是難撤銷的方向。