Unicode
Unicode é um padrão universal de codificação de caracteres. Ele define a forma como caracteres individuais são representados em arquivos de texto, páginas da Web e outros tipos de documentos.
Diferentemente do ASCII, que foi criado para representar apenas caracteres básicos do inglês, o Unicode foi criado para oferecer suporte a caracteres de todos os idiomas do mundo. O conjunto de caracteres ASCII padrão oferece suporte a apenas 128 caracteres, enquanto o Unicode pode oferecer suporte a aproximadamente 1.000.000 de caracteres. Enquanto o ASCII usa apenas um byte para representar cada caractere, o Unicode oferece suporte a até 4 bytes para cada caractere.
Há vários tipos diferentes de codificações Unicode, mas UTF-8 e UTF-16 são os mais comuns. O UTF-8 tornou-se o padrão de codificação de caracteres usado na Web e também é a codificação padrão usada por muitos programas de software. Embora o UTF-8 ofereça suporte a até quatro bytes por caractere, seria ineficiente usar quatro bytes para representar caracteres usados com frequência. Por isso, o UTF-8 usa apenas um byte para representar caracteres comuns do inglês. Caracteres europeus (latinos), hebraicos e árabes são representados com dois bytes, enquanto três bytes são usados para representar caracteres chineses, japoneses, coreanos e de outros idiomas asiáticos. Caracteres Unicode adicionais podem ser representados com quatro bytes.
Teste seus conhecimentos