UTF
Signifie « Unicode Transformation Format ». UTF désigne plusieurs types d’encodage de caractères Unicode, notamment UTF-7, UTF-8, UTF-16 et UTF-32.
- UTF-7 : utilise 7 bits pour chaque caractère. Il a été conçu pour représenter les caractères ASCII dans les messages électroniques nécessitant un encodage Unicode.
- UTF-8 : le type d’encodage Unicode le plus répandu. Il utilise un octet pour les lettres et symboles anglais standard, deux octets pour les caractères latins et moyen-orientaux supplémentaires, et trois octets pour les caractères asiatiques. Les caractères supplémentaires peuvent être représentés sur quatre octets. UTF-8 est rétrocompatible avec ASCII, car les 128 premiers caractères sont associés aux mêmes valeurs.
- UTF-16 : une extension de l’encodage Unicode « UCS-2 », qui utilise deux octets pour représenter 65 536 caractères. Toutefois, UTF-16 prend également en charge quatre octets pour les caractères supplémentaires, jusqu’à un million.
- UTF-32 : un encodage multioctet qui représente chaque caractère sur 4 octets.
La plupart des textes des documents et des pages Web sont encodés à l’aide de l’un des encodages UTF ci-dessus. De nombreux programmes de traitement de texte ne permettent pas d’afficher l’encodage des caractères des documents ouverts, même si certains affichent l’encodage en bas de la fenêtre du document ou dans les propriétés du fichier. Pour voir le type d’encodage utilisé par une page Web, vous pouvez sélectionner afin d’afficher le HTML de la page. Si l’encodage des caractères est défini, il se trouvera dans la section d’en-tête, vers le début du code HTML. Une page qui utilise l’encodage UTF-8 peut contenir l’un des extraits de texte suivants, selon la version du HTML.
XHTML : <meta http-equiv="Content-Type" content="text/html; charset=utf-8" />
HTML 5 : <meta charset="UTF-8">
Testez vos connaissances