文档指南

为什么中文显示成方框或乱码

Google Ad Placeholder

人们常常说一份文件“需要转换”,而真正的问题是编码或字体。若你并不每天读中文,症状看起来相似。修法并不相似。在坏掉的文件上跑 OpenCC,恢复不了作者的字。它会把无意义映射成另一种无意义。

上传任何东西之前,先按下面的症状走一遍。

方框(豆腐)

空心方框或豆腐方块通常意味着字作为码位存在,但当前字体没有字形。数据可能已经正确。把字体改成有 CJK 覆盖的那种。见中文字体与 Unicode

每一个汉字都是方框,字体是第一嫌疑。若只有部分字是方框,你可能混有生僻字、字体子集,或字体从未包含的地区字形。

先不要转换。若方框藏着你已经想要的繁体字,转换是错误的杠杆。

问号

一个替换了字的 ?,往往意味着文本被强迫经过无法存储它的字符集。把一句 UTF-8 中文存成 Latin-1,或经过旧短信网关粘贴,是典型路径。原来的字可能已经没了。转换无法重建它。

若你仍有源邮件或原来的 .docx,回到那里。带问号的副本是尸体。

乱码

涓浗 而不是 中国 这样的字符串,是把 UTF-8 字节当成错误编码来读,或反过来。页面充满中文读者立刻拒绝的生僻或无意义字。

若你仍有源文件,用 UTF-8 重新打开。在 Word 里打开纯文本文件时,试试编码对话框。在浏览器里看旧站点时,试试编码菜单。

若只有坏掉的副本存在,自动修复成败参半。一些工具猜测 UTF-8、GBK 或 Big5。猜测可能让事情更糟。在副本上工作。

乱码列在常见转换问题里,因为人们会碰巧转换它,然后有两个问题。

看起来“几乎是中文”的混合文字

日语句子可能看起来相关。它们不是安全的 OpenCC 输入。若文件是双语的,抽出中文部分。韩文汉字是同样的警告。

一页照片的 PDF 在编码意义上不是乱码。它不是文字。见 PDF 指南

何时转换是正确的下一步

若你能读这些中文,并且只要简体或繁体形体,使用文档转换器文本转换器。若你读不了,先修编码或字体。

一个短测试:把一句复制进文本转换器。若输入框已经显示垃圾,停下来。若输入可读、输出是另一套标准,文件没问题,你可以转换其余部分。

一套诊断顺序

  1. 你能选中并复制一句真正的中文吗?若不能,你有扫描件、轮廓,或字体坏到看不见文字。
  2. 改字体能让这句话出现吗?若能,你有的是方框,不是转换工作。
  3. 复制看起来像随机生僻字吗?若是,你有乱码。
  4. 词中间有问号吗?若有,数据已经丢失。
  5. 然后再选一种 OpenCC 类型并转换。

常见问题

同事看见中文,我看见方框。谁对? 都对。文件可以正确,而你的字体覆盖可以是错的。先安装 CJK 字体,再请他们再转换一次。

本站能修复乱码吗? 不能。它转换可读的中文标准。

为什么网页看起来没问题,下载的文件看起来不对? 浏览器猜了一种编码。保存的文件冻结了错误的猜测。

Big5 就是繁体中文吗? Big5 是大量繁体文本使用过的旧编码。Unicode 繁体字是现代存储。一份被误当成 UTF-8 打开的 Big5 文件会变成乱码。

我该转换文件来“修好”问号吗? 不该。找回源文件。

Google Ad Placeholder