中文轉換

簡繁轉換的常見問題

Google Ad Placeholder

自動轉換很快。它也很字面。引擎依據詞典替換漢字(有時也包括詞)。它不認識你的客戶、你的家譜或你的品牌規範。這些是人們按下“轉換”之後最常碰到的問題。

它們都不意味著“永遠不要用轉換器”。它們意味著:知道失敗模式,然後校對這些模式聚集的地方。

一個簡體形體,多種繁體寫法

後、發、面 和 幹 是著名例子。在簡體中文裡,一個形狀覆蓋了繁體中文仍分開寫的含義。轉換器從詞典和一小段上下文視窗裡挑選。在姓名、古文引文或單字表格單元格里,它仍可能選錯繁體字。

這是最重要的語言錯誤,因為結果看起來通順。讀者可能注意不到一個人名被改寫成了常見副詞。例子和搜尋清單見一個簡體字對應多種繁體寫法

另一個方向,繁體轉簡體,是把區分藏起來,而不是發明區分。這感覺更乾淨,也更容易被當成不是問題。代價出現得更晚:有人把簡體檔案轉回去,卻無法恢復原來的繁體區分。

檔案本來就已經壞了

若來源是亂碼——æ 湯、å 沙拉,或方框而不是字——轉換會把亂攤子放大。若這些位元組碰巧看起來像字,OpenCC 會樂意把垃圾對映成另一種垃圾。

先在 Word 或文字編輯器裡開啟原始檔。若你複製不出一句可讀的中文,請停下來。先修亂碼,並確認真正的 Unicode 字型,再轉換。

一個相關陷阱是隻看起來像文字的 PDF。若你無法選中一句話,那一頁就是圖片。轉換幾乎提取不出有用的東西。那是 OCR 工作,不是 OpenCC 工作。

夾雜日文或韓文

漢字和韓文漢字看起來與中文字相關。它們不是即插即用的 OpenCC 輸入。日文新字型的簡化走了與大陸簡體不同的歷史。一段日文經過中文轉換器,可能損壞助詞、與假名相鄰的漢字,以及只存在於日語的詞。

若文件混有中文和日文——會議日程、雙語手冊、名單——只轉換中文部分,或拆開檔案。包含韓文漢字的韓語文字也適用同樣的謹慎。OpenCC 轉換型別是中文標準,不是通用的中日韓改寫器。

地區用詞和錯誤的目標

臺灣短語表不會讓香港讀者覺得自在,反過來也一樣。結果可能可讀,卻仍然“不對勁”,就像英國讀者會注意到美式 truckapartment

這並不總是缺陷。這是選錯了轉換型別。有意選擇臺灣或香港。若你只要字形,措辭卻變得出奇本地,你可能碰巧選了短語型別。

姓名、品牌和受保護的字串

轉換器不知道你的“請勿翻譯”清單。公司名、藥名、廟名,或碰巧包含漢字的羅馬化品牌都可能被改。使用生僻字的人名也可能。

大工程之前,先收集必須保持不動的字串。轉換之後搜尋它們。若某個字串必須在繁體文件裡保持簡體,或反過來,把它留在自動處理之外,再貼回去。

版式、換行和字型

繁體字往往更寬。勉強裝得下簡體標籤的幻燈片標題、按鈕或表格列,可能溢位、換行,或撞上標誌。那是版式檢查,並不總是轉換錯誤。

字型造成第二種視覺虛驚。若輸出字型缺少繁體字形,即使碼位正確,你也會看到方框或回退形狀。請安裝或嵌入覆蓋目標標準的字型。細節見中文字型與 Unicode

Excel 有自己的變體:公式應當仍是公式。若公式裡的標籤是中文,它可能被轉換。看起來像數字的單元格值不該被轉換。若工作表轉換後看起來是空的,看字型,也看來源文字究竟是否作為文字儲存。

檔案的隱藏部分

Word 把文字存在頁首、頁尾、批註、腳註、文字框和表格裡。PowerPoint 把它存在備註和母版裡。Excel 把它存在批註、工作表名和定義名稱裡。只碰正文的轉換器會留下雙語亂攤子。

ChineseDocConverter 被做成會讀取它所支援的辦公格式的這些部分。你仍應開啟下載檔案,點進頁首、備註和工作表標籤。隱藏文字是殘留簡體或繁體字藏身的地方。

能省時間的修復順序

  1. 確認來源是可讀的中文,不是亂碼或掃描件。
  2. 確認你選對了地區型別。
  3. 先轉樣本,再轉整份檔案。
  4. 搜尋合併字和受保護的姓名。
  5. 檢查版式和字型。
  6. 然後再把檔案送出去。

若你轉換了,發現了問題,又從已經轉換過的檔案再轉一次,診斷會更難。請回到原文。

常見問題

結果看起來通順。我能跳過校對嗎? 通順恰恰是姓名裡錯寫成 後 時的樣子。至少瀏覽姓名和標題。

為什麼我的 PDF 只有一部分變了? 其餘部分大概是輪廓、影象,或沒有作為文字提取出來的字型子集。

我能撤銷一次糟糕的轉換嗎? 只有你保留了原檔案才行。不要指望轉回去。

更長的文件會更常失敗嗎? 它在更多地方失敗,而不是每一句的失敗率更高。樣本頁仍能預測大多數詞典問題。它們預測不了每一個姓名。

Google Ad Placeholder