文件指南

中文字體、Unicode、簡體與繁體説明

Google Ad Placeholder

Unicode 給每個字分配一個數字。國 和 國 是不同的碼位。字體是那些碼位的畫法。若文件有正確的字而字體沒有字形,你看見方框。若文件有錯誤的字節,你看見亂碼。

這就是轉換和字體相關卻不是同一項工作的原因。OpenCC 可以把 國 變成 國。它不能在別人的電腦上安裝 微軟雅黑、Songti TC 或 Noto Serif CJK。人們寄出轉換後的文件,同事看見豆腐方塊,兩邊都怪轉換器。方塊通常是字體覆蓋問題。

碼位不是圖畫

Word 文件把字存成數字。字體文件把按那些數字索引的畫法存起來。當畫法缺失時,操作系統可能:

  • 顯示方框
  • 為那一個字回退到另一種字體
  • 為一個有地區變體的碼位顯示另一地區的字形

回退可以讓一句話看起來像勒索信:一個字是宋體,下一個是無襯線系統字體。那難看,仍可讀。硬方框更糟,因為你無法判斷轉換是否發生過。

有些碼位有地區特有的字形變體。數字相同;台灣、香港或大陸來源的首選畫法不同。為某一地區設計的字體可能把 骨 或 起 畫得略有不同。讀者會注意到。這不是 OpenCC 改錯了字。這是字體的區域表。真正是不同碼位的字形差別,見台灣與香港繁體中文

一套書寫系統,許多字體

  • 面向簡體的字體可能缺少不常見的繁體形體。
  • 面向繁體的字體可能缺少一些簡體形體。
  • 大型 CJK 字體,或一對簡體/繁體字體,是通常的修復。

操作系統已經附帶回退字體,例如微軟雅黑、蘋方、思源 / Noto CJK,以及宋體。本站在 CSS 裏使用那些系統字體,而不是打包字體文件。你的文檔應當做類似的事:挑選真正包含目標標準的字體族。

當你在 PowerPoint 或 PDF 裏嵌入字體時,你可能只嵌入用過的字形。轉換之後,需要新字形。在簡體裏“自包含”的文件,在繁體裏可能不再自包含。重新嵌入完整的 CJK 字體,或告訴接收方安裝哪種字體。

轉換之後的文檔

當你轉換 Word、Excel 或 PowerPoint 文件時,文件裏的字變了。接收方仍需要能畫出它們的字體。若同事打開你的文件看見方框,先把本頁和亂碼中文清單發給他們,再轉換一次。

一台實用的審閲機器有:

  • 一種能覆蓋簡體的字體
  • 一種能覆蓋繁體的字體
  • 你將用來演示的同一 Office 版本

若你只在創建簡體原文的那台筆記本上審閲,你可能看不見客户會看見的繁體回退失敗。

Unicode 是轉換器能存在的原因

因為 門 和 門 是不同的數字,詞典可以用一個替換另一個,而不關心毛筆會怎麼寫它們。簡體與繁體中文是社會標準。Unicode 是技術標準。OpenCC 坐在它們之間。

較舊的編碼——Big5、GB2312、GBK——把中文存在更小的映射裏。1990 年代的文件仍出現在附件裏。若那些字節被當成 UTF-8 來讀,你得到的是垃圾,不是方框。垃圾是編碼。方框是字體。不要在垃圾上跑 OpenCC。

常見問題

有沒有一種字體覆蓋全部中文? Noto CJK / 思源這類大型 CJK 家族覆蓋很多。“全部 Unicode”仍然很多。對辦公工作,一種當前的簡體字體加一種當前的繁體字體就夠。

我該轉成圖像,好讓字體不再重要嗎? 那毀掉了編輯、搜索和以後的轉換。修好字體。

為什麼瀏覽器看起來沒問題,Word 看起來不對? 瀏覽器和 Word 不共享同一份回退清單。在接收方將使用的應用程序裏測試。

本站會在下載裏嵌入中文字體嗎? 轉換後的辦公文件保留它們已有的字體信息,加上新的字。它們不會在你的電腦上安裝字體。

國 和 國 在 Unicode 裏是同一個字嗎? 不是。它們是碼位不同的簡繁成對。這才讓轉換成為真正的操作。

Google Ad Placeholder