人們常常說一份檔案“需要轉換”,而真正的問題是編碼或字型。若你並不每天讀中文,症狀看起來相似。修法並不相似。在壞掉的檔案上跑 OpenCC,恢復不了作者的字。它會把無意義對映成另一種無意義。
上傳任何東西之前,先按下面的症狀走一遍。
方框(豆腐)
空心方框或豆腐方塊通常意味著字作為碼位存在,但當前字型沒有字形。資料可能已經正確。把字型改成有 CJK 覆蓋的那種。見中文字型與 Unicode。
若每一個漢字都是方框,字型是第一嫌疑。若只有部分字是方框,你可能混有生僻字、字型子集,或字型從未包含的地區字形。
先不要轉換。若方框藏著你已經想要的繁體字,轉換是錯誤的槓桿。
問號
一個替換了字的 ?,往往意味著文字被強迫經過無法儲存它的字符集。把一句 UTF-8 中文存成 Latin-1,或經過舊簡訊閘道器貼上,是典型路徑。原來的字可能已經沒了。轉換無法重建它。
若你仍有源郵件或原來的 .docx,回到那裡。帶問號的副本是屍體。
亂碼
涓浗 而不是 中國 這樣的字串,是把 UTF-8 位元組當成錯誤編碼來讀,或反過來。頁面充滿中文讀者立刻拒絕的生僻或無意義字。
若你仍有原始檔,用 UTF-8 重新開啟。在 Word 裡開啟純文字檔案時,試試編碼對話方塊。在瀏覽器裡看舊站點時,試試編碼選單。
若只有壞掉的副本存在,自動修復成敗參半。一些工具猜測 UTF-8、GBK 或 Big5。猜測可能讓事情更糟。在副本上工作。
亂碼列在常見轉換問題裡,因為人們會碰巧轉換它,然後有兩個問題。
看起來“幾乎是中文”的混合文字
日語句子可能看起來相關。它們不是安全的 OpenCC 輸入。若檔案是雙語的,抽出中文部分。韓文漢字是同樣的警告。
一頁照片的 PDF 在編碼意義上不是亂碼。它不是文字。見 PDF 指南。
何時轉換是正確的下一步
若你能讀這些中文,並且只要簡體或繁體形體,使用文件轉換器或文字轉換器。若你讀不了,先修編碼或字型。
一個短測試:把一句複製進文字轉換器。若輸入框已經顯示垃圾,停下來。若輸入可讀、輸出是另一套標準,檔案沒問題,你可以轉換其餘部分。
一套診斷順序
- 你能選中並複製一句真正的中文嗎?若不能,你有掃描件、輪廓,或字型壞到看不見文字。
- 改字型能讓這句話出現嗎?若能,你有的是方框,不是轉換工作。
- 複製看起來像隨機生僻字嗎?若是,你有亂碼。
- 詞中間有問號嗎?若有,資料已經丟失。
- 然後再選一種 OpenCC 型別並轉換。
常見問題
同事看見中文,我看見方框。誰對? 都對。檔案可以正確,而你的字型覆蓋可以是錯的。先安裝 CJK 字型,再請他們再轉換一次。
本站能修復亂碼嗎? 不能。它轉換可讀的中文標準。
為什麼網頁看起來沒問題,下載的檔案看起來不對? 瀏覽器猜了一種編碼。儲存的檔案凍結了錯誤的猜測。
Big5 就是繁體中文嗎? Big5 是大量繁體文字使用過的舊編碼。Unicode 繁體字是現代儲存。一份被誤當成 UTF-8 開啟的 Big5 檔案會變成亂碼。
我該轉換檔案來“修好”問號嗎? 不該。找回原始檔。