Unicode
Unicode es un estándar universal de codificación de caracteres. Define la forma en que se representan los caracteres individuales en archivos de texto, páginas web y otros tipos de documentos.
A diferencia de ASCII, que se diseñó para representar únicamente caracteres básicos del inglés, Unicode se diseñó para admitir caracteres de todos los idiomas del mundo. El conjunto de caracteres ASCII estándar solo admite 128 caracteres, mientras que Unicode puede admitir aproximadamente 1.000.000 de caracteres. Mientras que ASCII solo usa un byte para representar cada carácter, Unicode admite hasta 4 bytes para cada carácter.
Existen varios tipos diferentes de codificaciones Unicode, aunque UTF-8 y UTF-16 son las más comunes. UTF-8 se ha convertido en la codificación de caracteres estándar utilizada en la Web y también es la codificación predeterminada de muchos programas de software. Aunque UTF-8 admite hasta cuatro bytes por carácter, sería ineficiente usar cuatro bytes para representar los caracteres de uso frecuente. Por lo tanto, UTF-8 usa solo un byte para representar los caracteres comunes del inglés. Los caracteres europeos (latinos), hebreos y árabes se representan con dos bytes, mientras que se usan tres bytes para representar los caracteres chinos, japoneses, coreanos y de otros idiomas asiáticos. Los caracteres Unicode adicionales se pueden representar con cuatro bytes.
Pon a prueba tu conocimiento