UTF
「Unicode Transformation Format」の略です。UTFは、UTF-7、UTF-8、UTF-16、UTF-32など、Unicodeの複数の文字コード方式を指します。
- UTF-7 - 各文字に7ビットを使用します。Unicodeの文字コードが必要なメールメッセージでASCII文字を表すために設計されました。
- UTF-8 - 最も広く使われているUnicodeの文字コード方式です。標準的な英字と記号には1バイト、その他のラテン文字と中東の文字には2バイト、アジアの文字には3バイトを使用します。追加の文字は4バイトで表すことができます。最初の128文字が同じ値に割り当てられているため、UTF-8にはASCIIとの下位互換性があります。
- UTF-16 - 65,536文字を表すために2バイトを使用する「UCS-2」Unicode文字コード方式を拡張したものです。ただし、UTF-16は100万文字までの追加の文字に対して4バイトもサポートしています。
- UTF-32 - 各文字を4バイトで表すマルチバイト文字コード方式です。
文書やWebページのほとんどのテキストは、上記のUTF文字コード方式のいずれかを使用してエンコードされています。多くのワープロソフトウェアでは、開いている文書の文字コードを表示できませんが、文書ウィンドウの下部やファイルのプロパティ内に文字コードを表示するものもあります。Webページで使用されている文字コードの種類を確認したい場合は、を選択してページのHTMLを表示できます。文字コードが定義されている場合は、HTMLの上部付近にあるヘッダーセクションに記載されています。UTF-8エンコードを使用するページには、HTMLのバージョンに応じて、以下のいずれかのテキストが含まれていることがあります。
XHTML: <meta http-equiv="Content-Type" content="text/html; charset=utf-8" />
HTML 5: <meta charset="UTF-8">
知識をテストする