Unicode
Unicode est une norme universelle d’encodage des caractères. Elle définit la manière dont les différents caractères sont représentés dans les fichiers texte, les pages Web et d’autres types de documents.
Contrairement à l’ASCII, qui a été conçu pour représenter uniquement les caractères anglais de base, Unicode a été conçu pour prendre en charge les caractères de toutes les langues du monde. Le jeu de caractères ASCII standard ne prend en charge que 128 caractères, tandis qu’Unicode peut en prendre en charge environ 1 000 000. Alors que l’ASCII utilise un seul octet pour représenter chaque caractère, Unicode prend en charge jusqu’à 4 octets par caractère.
Il existe plusieurs types d’encodage Unicode, mais UTF-8 et UTF-16 sont les plus courants. UTF-8 est devenu l’encodage des caractères standard utilisé sur le Web et constitue également l’encodage par défaut de nombreux programmes logiciels. Bien qu’UTF-8 prenne en charge jusqu’à quatre octets par caractère, il serait inefficace d’utiliser quatre octets pour représenter les caractères fréquemment utilisés. Par conséquent, UTF-8 utilise un seul octet pour représenter les caractères anglais courants. Les caractères européens (latins), hébreux et arabes sont représentés avec deux octets, tandis que trois octets sont utilisés pour les caractères chinois, japonais, coréens et d’autres langues asiatiques. Les caractères Unicode supplémentaires peuvent être représentés avec quatre octets.
Testez vos connaissances