少数汉字开始时是图画。多数日常汉字是合体。若你只记得课堂上的故事——汉字书写是太阳和月亮的画——你就会同时误解历史和软件。一旦你需要语法词、姓名和抽象动词,图画就用尽了。书写系统长出了其他方法。
通常的现代模式是意符加声旁。河 使用水旁加上一个声音线索。湖 用不同的声旁做同一件事。一旦你看见那个模式,一页中文看起来就不那么像数千幅独特的素描,而更像一大套可重复使用的零件。
传统工具箱,谨慎使用
教师仍会提到六书。它是历史工具箱,不是你可以在每一个 Unicode 字符上运行的实验室程序。日常有用的桶是:
象形。 开始时是物体图画的字形。象形字谈这一类的限度。日、月、木 和 马 / 馬 是通常的课本集合。即使这些也被楷书方正化了。它们不是照片。
简单指事和会意。 指向一个想法的记号:上 和 下,或 休 作为人在树旁。这些解释是教学故事。有些在历史上整齐。有些是后来的记忆术。
形声。 清单的大多数。一部分提示含义,一部分在造字时提示声音。读音已经变了两千年,所以声旁常常只是现代读音的表亲。这就是学习者说“声旁是错的”的原因。它是旧的,不是随机的。
假借和其他剩余。 有些字形被借去写一个声音相近的词,然后原来的含义得到一个新字形。专业书会争论个别情形。转换一份文件不需要那些争论。
部首是字典为了检索、通常给意符那一边起的名字。它们不是对立的理论。
为什么多数字是合体
口语的词比一个人能画出的多。汉字书写为许多词保留了语素大小的字形,而不是改用字母。为了让书吏仍学得够下来,字形必须共享部件。形声是生产力技巧。一旦 青 可以作为声音线索,就可以围着它建造一个字族。
这也是为什么笔画数和“看起来像那个东西”是难度的糟糕指南。一个合体可以视觉上很忙,却仍比一幅任意图画更好记,因为你已经认识零件。
甲骨文已经显示组合,而不只是图画。现代纸页是同一个想法,经过隶书、楷书、印刷,以及在一些地区的简化。
这对转换为何重要
简体形体有时保留声旁、在意符部分丢掉笔画,或反过来。有时它们合并两个原本有区别的合体。这是一对一心智地图失败的原因之一。你不能可靠地从第一原理“补上缺失的笔画”来发明繁体。词典做映射。
它也解释一种校对本能。若一个转换后的字在明显与河流有关的词里丢掉了水旁,你再看一眼。若一个姓名选了 後 而不是 后,你再看一眼是出于不同的原因:合并,而不是缺失的象形。见一对多对应。
OpenCC 并不像语言学家那样解析意符和声旁。它匹配整字和短语。结构是为了你的理解,不是为了引擎。
如何在不被淹没的情况下研究结构
- 学几个老实的象形字,让课本故事有例子。
- 学常见意符(通常的部首)。
- 当声旁系列仍有帮助时注意它们,没有帮助时忽略它们。
- 不要等到你能给每个字形分类,才开始读真正的句子。
关于仍在使用的标准,请回到简体与繁体中文。对转换器来说,结构是背景知识。工作仍然是:选定目标,转换,校对。
常见问题
中文是象形语言吗? 不是。它是字符语言,象形是少数,合体是多数。
若我学会所有部首,就能读任何字吗? 你往往能猜一个意义领域,有时也能猜一个读音。你仍必须学这个词。
为什么声旁和拼音对不上? 因为造字时的读音不同,或因为当时声旁就只是近似。
简体字使用不同的构造系统吗? 不是。它们使用同一套组合想法,配上一份不同的官方清单。
汉字结构会影响拼音工具吗? 只是间接地。拼音工具读的是现代读音,不是古代的声旁提示。