Unicode
Unicodeは、汎用的な文字コードの標準規格です。テキストファイル、Webページ、その他の種類のドキュメントで、個々の文字をどのように表現するかを定めています。
基本的な英語の文字だけを表現するために設計されたASCIIとは異なり、Unicodeは世界中のあらゆる言語の文字をサポートするために設計されました。標準のASCII文字セットがサポートする文字数は128文字だけですが、Unicodeはおよそ1,000,000文字をサポートできます。ASCIIが各文字の表現に1バイトだけを使うのに対し、Unicodeは各文字に最大4バイトを使用できます。
Unicodeにはいくつかの異なるエンコード方式がありますが、最も一般的なのはUTF-8とUTF-16です。UTF-8はWebで使われる標準的な文字コードになっており、多くのソフトウェアプログラムでデフォルトのエンコード方式としても使われています。UTF-8は1文字あたり最大4バイトをサポートしますが、頻繁に使われる文字を表すために4バイトを使うのは非効率的です。そのため、UTF-8は一般的な英語の文字の表現には1バイトだけを使います。ヨーロッパの文字(ラテン文字)、ヘブライ文字、アラビア文字は2バイトで表現され、中国語、日本語、韓国語などのアジアの文字には3バイトが使われます。その他のUnicode文字は4バイトで表現できます。
知識をテストする