Codage des caractères
Alors que nous voyons les documents texte comme des lignes de texte, les ordinateurs les voient en réalité comme des données binaires, c’est-à-dire une série de uns et de zéros. Par conséquent, les caractères d’un document texte doivent être représentés par des codes numériques. Pour ce faire, le texte est enregistré à l’aide de l’un des différents types de codage des caractères.
Les types de codage des caractères les plus populaires sont ASCII et Unicode. Bien qu’ASCII soit encore pris en charge par presque tous les éditeurs de texte, Unicode est plus couramment utilisé, car il prend en charge un jeu de caractères plus vaste. Unicode est souvent défini comme UTF-8, UTF-16 ou UTF-32, qui correspondent à différentes normes Unicode. UTF signifie « Unicode Transformation Format » et le nombre indique le nombre de bits utilisés pour représenter chaque caractère. Depuis les débuts de l’informatique, les caractères sont représentés par au moins un octet (8 bits), ce qui explique pourquoi les différentes normes Unicode enregistrent les caractères par multiples de 8 bits.
Bien qu’ASCII et Unicode soient les types de codage des caractères les plus courants, d’autres normes de codage peuvent également être utilisées pour encoder des fichiers texte. Il existe par exemple plusieurs types de normes de codage des caractères propres à certaines langues, comme les normes occidentale, Latin-US, japonaise, coréenne et chinoise. Alors que les langues occidentales utilisent des caractères similaires, les langues orientales nécessitent un jeu de caractères complètement différent. Par conséquent, un codage latin ne prendrait pas en charge les symboles nécessaires pour représenter une chaîne de caractères texte en chinois. Heureusement, les normes modernes telles qu’UTF-16 prennent en charge un jeu de caractères suffisamment vaste pour représenter à la fois les lettres et les symboles occidentaux et orientaux.
Testez vos connaissances