自動轉換很快。它也很字面。引擎依據詞典替換漢字(有時也包括詞)。它不認識你的客户、你的家譜或你的品牌規範。這些是人們按下“轉換”之後最常碰到的問題。
它們都不意味着“永遠不要用轉換器”。它們意味着:知道失敗模式,然後校對這些模式聚集的地方。
一個簡體形體,多種繁體寫法
後、發、面 和 幹 是著名例子。在簡體中文裏,一個形狀覆蓋了繁體中文仍分開寫的含義。轉換器從詞典和一小段上下文窗口裏挑選。在姓名、古文引文或單字表格單元格里,它仍可能選錯繁體字。
這是最重要的語言錯誤,因為結果看起來通順。讀者可能注意不到一個人名被改寫成了常見副詞。例子和搜索清單見一個簡體字對應多種繁體寫法。
另一個方向,繁體轉簡體,是把區分藏起來,而不是發明區分。這感覺更乾淨,也更容易被當成不是問題。代價出現得更晚:有人把簡體文件轉回去,卻無法恢復原來的繁體區分。
文件本來就已經壞了
若來源是亂碼——æ 湯、å 沙拉,或方框而不是字——轉換會把亂攤子放大。若這些字節碰巧看起來像字,OpenCC 會樂意把垃圾映射成另一種垃圾。
先在 Word 或文本編輯器裏打開源文件。若你複製不出一句可讀的中文,請停下來。先修亂碼,並確認真正的 Unicode 字體,再轉換。
一個相關陷阱是隻看起來像文字的 PDF。若你無法選中一句話,那一頁就是圖片。轉換幾乎提取不出有用的東西。那是 OCR 工作,不是 OpenCC 工作。
夾雜日文或韓文
漢字和韓文漢字看起來與中文字相關。它們不是即插即用的 OpenCC 輸入。日文新字體的簡化走了與大陸簡體不同的歷史。一段日文經過中文轉換器,可能損壞助詞、與假名相鄰的漢字,以及只存在於日語的詞。
若文檔混有中文和日文——會議日程、雙語手冊、名單——只轉換中文部分,或拆開文件。包含韓文漢字的韓語文本也適用同樣的謹慎。OpenCC 轉換類型是中文標準,不是通用的中日韓改寫器。
地區用詞和錯誤的目標
台灣短語表不會讓香港讀者覺得自在,反過來也一樣。結果可能可讀,卻仍然“不對勁”,就像英國讀者會注意到美式 truck 和 apartment。
這並不總是缺陷。這是選錯了轉換類型。有意選擇台灣或香港。若你只要字形,措辭卻變得出奇本地,你可能碰巧選了短語類型。
姓名、品牌和受保護的字符串
轉換器不知道你的“請勿翻譯”清單。公司名、藥名、廟名,或碰巧包含漢字的羅馬化品牌都可能被改。使用生僻字的人名也可能。
大工程之前,先收集必須保持不動的字符串。轉換之後搜索它們。若某個字符串必須在繁體文檔裏保持簡體,或反過來,把它留在自動處理之外,再貼回去。
版式、換行和字體
繁體字往往更寬。勉強裝得下簡體標籤的幻燈片標題、按鈕或表格列,可能溢出、換行,或撞上標誌。那是版式檢查,並不總是轉換錯誤。
字體造成第二種視覺虛驚。若輸出字體缺少繁體字形,即使碼位正確,你也會看到方框或回退形狀。請安裝或嵌入覆蓋目標標準的字體。細節見中文字體與 Unicode。
Excel 有自己的變體:公式應當仍是公式。若公式裏的標籤是中文,它可能被轉換。看起來像數字的單元格值不該被轉換。若工作表轉換後看起來是空的,看字體,也看來源文字究竟是否作為文字存儲。
文件的隱藏部分
Word 把文字存在頁眉、頁腳、批註、腳註、文本框和表格裏。PowerPoint 把它存在備註和母版裏。Excel 把它存在批註、工作表名和定義名稱裏。只碰正文的轉換器會留下雙語亂攤子。
ChineseDocConverter 被做成會讀取它所支持的辦公格式的這些部分。你仍應打開下載文件,點進頁眉、備註和工作表標籤。隱藏文字是殘留簡體或繁體字藏身的地方。
能省時間的修復順序
- 確認來源是可讀的中文,不是亂碼或掃描件。
- 確認你選對了地區類型。
- 先轉樣本,再轉整份文件。
- 搜索合併字和受保護的姓名。
- 檢查版式和字體。
- 然後再把文件送出去。
若你轉換了,發現了問題,又從已經轉換過的文件再轉一次,診斷會更難。請回到原文。
常見問題
結果看起來通順。我能跳過校對嗎? 通順恰恰是姓名裏錯寫成 後 時的樣子。至少瀏覽姓名和標題。
為什麼我的 PDF 只有一部分變了? 其餘部分大概是輪廓、圖像,或沒有作為文字提取出來的字體子集。
我能撤銷一次糟糕的轉換嗎? 只有你保留了原文件才行。不要指望轉回去。
更長的文檔會更常失敗嗎? 它在更多地方失敗,而不是每一句的失敗率更高。樣本頁仍能預測大多數詞典問題。它們預測不了每一個姓名。