把簡體中文轉換成繁體中文,是中文出版裡最常見的工作之一。大陸寫成的草稿需要臺灣版。產品介面需要香港字串。用簡體字打的家譜,需要和繁體字族譜對得上。可靠的方法是基於詞典的轉換器,再加一輪人工,而不是在文書處理軟體裡查詢替換。
查詢替換會失敗,因為對應關係不是一字對一字。有些簡體形體對應多種繁體形體。即使兩邊都用繁體字,有些詞也會因地區而不同。懂得這些對照表的轉換器,仍然需要你點明讀者是誰。
從讀者出發,而不是從副檔名出發
先問誰會讀結果。
- 臺灣讀者預期臺灣用字。軟體、交通和政府機關的詞彙,他們也可能預期臺灣說法。
- 香港讀者預期香港用字。有些文字還會帶受粵語書面語影響的措辭。
- 混合的海外讀者也許能接受通用繁體,但學校、教會或報紙往往已有自家標準。猜之前先問。
“繁體中文”不是一份清單。只提供一個繁體開關的軟體,總會對某個人是錯的。ChineseDocConverter 提供 OpenCC 型別,例如簡體轉繁體、簡體轉繁體(臺灣)、臺灣加短語,以及簡體轉繁體(香港)。通用繁體選項是你還不知道地區時的退路。一旦知道,就選臺灣或香港。見 OpenCC 轉換型別和臺灣與香港繁體中文。
轉換器改什麼
OpenCC 用詞典遍歷文字。在普通散文裡,它把 國 變成 國,書 變成 書,門 變成 門,學習 變成 學習。這是看得見的工作。
它也會嘗試拆開簡體中文合併過的字。後 在周圍詞語表示“以後”時,可能變成 後。發 在 頭髮 裡可能變成 髮,在 發展 裡變成 發。短語表是轉換器勝過一對一字形表的原因。它們仍然是根據附近詞語的猜測,不是讀心術。人名、詩歌和古文引文,是猜測最先失敗的地方。轉換名單之前,請先讀一對多對應。
能識別短語的型別還會再進一步,替換部分地區用詞。這能讓臺灣介面少一點“大陸檔案加了更花的筆畫”的感覺。它不會本地化幽默、俚語或法律條款。若文件必須聽起來像在臺北或香港寫成,轉換之後請為編輯預留預算。
文字還是文件
用與文字儲存方式相符的工具。
從 Word 裡複製出來,在純文字框裡轉換,再貼回去,標題樣式和表格版式就會丟。若來源是掃描件,只有中文已經作為文字存在之後,才轉換檔案。一頁照片不是字串。
較舊的 .doc 應先另存為 .docx。若原始檔裡的簡體中文已經像垃圾,請停下來先修亂碼。轉換無法憑空補出缺失的字。
一套可操作的步驟
- 保留原來的簡體檔案。轉換不是存檔格式。
- 選擇臺灣、香港,或通用繁體。
- 決定要短語替換,還是隻要字形。
- 檔案很長時,先轉換一頁樣本。
- 在結果裡搜尋已知的合併字,例如 後、發、面 和 幹。
- 讀標題、姓名、按鈕和法律腳註。
- 檢查幻燈片和窄表格單元格的換行。繁體形體往往更寬。
最後一點是版式,不是詞典錯誤。勉強裝得下簡體標籤的幻燈片,轉換後可能溢位。
之後
把下載檔案當作字形層的初稿。目標標準的母語讀者會抓住詞典漏掉的詞彙。部落格文章也許仔細瀏覽就夠。合同、使用者介面或印刷書籍,請安排真正的校對。
若以後需要另一個方向,不要假定轉回去就能恢復原來的簡體。合併字和短語替換可能改變文字。兩份檔案都要留。
常見問題
我是否總該選臺灣繁體? 只有臺灣讀者才是受眾時才該選。香港和許多海外社羣使用不同的首選字形,以及部分不同的詞。
“含短語”增加了什麼? 在字形轉換之上加入部分地區用詞。它仍然不是翻譯。
我能轉換掃描的 PDF 嗎? 要等頁面已經變成真正的文字才行。本轉換器改的是字,不是字的圖片。
姓名會轉對嗎? 常常會,但不可靠。自動轉換後請親手搜尋姓名。
有沒有一種繁體中文能讓每位讀者都滿意? 沒有。選定一套地區標準,若檔案稍後還會再編輯,請說明你用的是哪一套。