UTF
Steht für „Unicode Transformation Format“. UTF bezeichnet mehrere Arten von Unicode-Zeichenkodierungen, darunter UTF-7, UTF-8, UTF-16 und UTF-32.
- UTF-7 – verwendet 7 Bits für jedes Zeichen. Es wurde entwickelt, um ASCII-Zeichen in E-Mail-Nachrichten darzustellen, für die eine Unicode-Kodierung erforderlich war.
- UTF-8 – die verbreitetste Art der Unicode-Kodierung. Sie verwendet ein Byte für englische Standardbuchstaben und Symbole, zwei Bytes für zusätzliche lateinische und nahöstliche Zeichen und drei Bytes für asiatische Zeichen. Zusätzliche Zeichen können mit vier Bytes dargestellt werden. UTF-8 ist abwärtskompatibel mit ASCII, da die ersten 128 Zeichen denselben Werten zugeordnet sind.
- UTF-16 – eine Erweiterung der Unicode-Kodierung „UCS-2“, die zwei Bytes verwendet, um 65.536 Zeichen darzustellen. UTF-16 unterstützt jedoch auch vier Bytes für zusätzliche Zeichen bis zu einer Million.
- UTF-32 – eine Mehrbyte-Kodierung, bei der jedes Zeichen mit 4 Bytes dargestellt wird.
Der meiste Text in Dokumenten und Webseiten wird mit einer der oben genannten UTF-Kodierungen kodiert. Viele Textverarbeitungsprogramme ermöglichen es nicht, die Zeichenkodierung geöffneter Dokumente anzuzeigen, manche zeigen die Kodierung jedoch am unteren Rand des Dokumentfensters oder in den Dateieigenschaften an. Wenn Sie sehen möchten, welche Zeichenkodierung eine Webseite verwendet, können Sie auswählen, um den HTML-Code der Seite anzuzeigen. Die Zeichenkodierung wird, sofern sie definiert ist, im Kopfbereich nahe dem Anfang des HTML-Codes angegeben. Eine Seite, die UTF-8-Kodierung verwendet, kann abhängig von der HTML-Version einen der folgenden Textausschnitte enthalten.
XHTML: <meta http-equiv="Content-Type" content="text/html; charset=utf-8" />
HTML 5: <meta charset="UTF-8">
Testen Sie Ihr Wissen