字符编码
虽然我们将文本文档看作一行行文字,但计算机实际上将其看作二进制数据,也就是由一串 1 和 0 组成的数据。因此,文本文档中的字符必须用数字代码表示。为此,文本会使用多种字符编码中的一种进行保存。
最常见的字符编码类型是ASCII和 Unicode。虽然几乎所有文本编辑器仍支持 ASCII,但 Unicode 更常用,因为它支持更大的字符集。Unicode 通常表示为 UTF-8、UTF-16 或 UTF-32,这些名称分别对应不同的 Unicode 标准。UTF 代表 "Unicode Transformation Format",数字表示用于表示每个字符的位数。从计算机发展的早期开始,字符就至少使用一个字节(8 位)表示,这也是不同 Unicode 标准以 8 位的倍数保存字符的原因。
虽然 ASCII 和 Unicode 是最常见的字符编码类型,但也可以使用其他编码标准来编码文本文件。例如,存在多种特定语言的字符编码标准,如西欧、拉丁-美国、日文、韩文和中文编码。虽然西方语言使用相似的字符,但东方语言需要完全不同的字符集。因此,拉丁编码无法支持表示中文文本字符串所需的符号。幸运的是,UTF-16 等现代标准支持足够大的字符集,可以表示西方和东方语言中的字母与符号。
测试你的知识