文件指南

中文字型、Unicode、簡體與繁體說明

Google Ad Placeholder

Unicode 給每個字分配一個數字。國 和 國 是不同的碼位。字型是那些碼位的畫法。若檔案有正確的字而字型沒有字形,你看見方框。若檔案有錯誤的位元組,你看見亂碼。

這就是轉換和字型相關卻不是同一項工作的原因。OpenCC 可以把 國 變成 國。它不能在別人的電腦上安裝 微軟雅黑、Songti TC 或 Noto Serif CJK。人們寄出轉換後的檔案,同事看見豆腐方塊,兩邊都怪轉換器。方塊通常是字型覆蓋問題。

碼位不是圖畫

Word 檔案把字存成數字。字型檔案把按那些數字索引的畫法存起來。當畫法缺失時,作業系統可能:

  • 顯示方框
  • 為那一個字回退到另一種字型
  • 為一個有地區變體的碼位顯示另一地區的字形

回退可以讓一句話看起來像勒索信:一個字是宋體,下一個是無襯線系統字型。那難看,仍可讀。硬方框更糟,因為你無法判斷轉換是否發生過。

有些碼位有地區特有的字形變體。數字相同;臺灣、香港或大陸來源的首選畫法不同。為某一地區設計的字型可能把 骨 或 起 畫得略有不同。讀者會注意到。這不是 OpenCC 改錯了字。這是字型的區域表。真正是不同碼位的字形差別,見臺灣與香港繁體中文

一套書寫系統,許多字型

  • 面向簡體的字型可能缺少不常見的繁體形體。
  • 面向繁體的字型可能缺少一些簡體形體。
  • 大型 CJK 字型,或一對簡體/繁體字型,是通常的修復。

作業系統已經附帶回退字型,例如微軟雅黑、蘋方、思源 / Noto CJK,以及宋體。本站在 CSS 裡使用那些系統字型,而不是打包字型檔案。你的文件應當做類似的事:挑選真正包含目標標準的字型族。

當你在 PowerPoint 或 PDF 裡嵌入字型時,你可能只嵌入用過的字形。轉換之後,需要新字形。在簡體裡“自包含”的檔案,在繁體裡可能不再自包含。重新嵌入完整的 CJK 字型,或告訴接收方安裝哪種字型。

轉換之後的文件

當你轉換 Word、Excel 或 PowerPoint 檔案時,檔案裡的字變了。接收方仍需要能畫出它們的字型。若同事開啟你的檔案看見方框,先把本頁和亂碼中文清單發給他們,再轉換一次。

一臺實用的審閱機器有:

  • 一種能覆蓋簡體的字型
  • 一種能覆蓋繁體的字型
  • 你將用來演示的同一 Office 版本

若你只在建立簡體原文的那臺筆記本上審閱,你可能看不見客戶會看見的繁體回退失敗。

Unicode 是轉換器能存在的原因

因為 門 和 門 是不同的數字,詞典可以用一個替換另一個,而不關心毛筆會怎麼寫它們。簡體與繁體中文是社會標準。Unicode 是技術標準。OpenCC 坐在它們之間。

較舊的編碼——Big5、GB2312、GBK——把中文存在更小的對映裡。1990 年代的檔案仍出現在附件裡。若那些位元組被當成 UTF-8 來讀,你得到的是垃圾,不是方框。垃圾是編碼。方框是字型。不要在垃圾上跑 OpenCC。

常見問題

有沒有一種字型覆蓋全部中文? Noto CJK / 思源這類大型 CJK 家族覆蓋很多。“全部 Unicode”仍然很多。對辦公工作,一種當前的簡體字型加一種當前的繁體字型就夠。

我該轉成影象,好讓字型不再重要嗎? 那毀掉了編輯、搜尋和以後的轉換。修好字型。

為什麼瀏覽器看起來沒問題,Word 看起來不對? 瀏覽器和 Word 不共享同一份回退清單。在接收方將使用的應用程式裡測試。

本站會在下載裡嵌入中文字型嗎? 轉換後的辦公檔案保留它們已有的字型資訊,加上新的字。它們不會在你的電腦上安裝字型。

國 和 國 在 Unicode 裡是同一個字嗎? 不是。它們是碼位不同的簡繁成對。這才讓轉換成為真正的操作。

Google Ad Placeholder