Codificação de caracteres
Embora vejamos documentos de texto como linhas de texto, os computadores na verdade os veem como dados binários, ou uma série de uns e zeros. Portanto, os caracteres dentro de um documento de texto precisam ser representados por códigos numéricos. Para fazer isso, o texto é salvo usando um dos vários tipos de codificação de caracteres.
Os tipos mais populares de codificação de caracteres são ASCII e Unicode. Embora o ASCII ainda seja compatível com quase todos os editores de texto, o Unicode é usado com mais frequência porque é compatível com um conjunto maior de caracteres. O Unicode costuma ser definido como UTF-8, UTF-16 ou UTF-32, que correspondem a diferentes padrões Unicode. UTF significa "Unicode Transformation Format" e o número indica a quantidade de bits usada para representar cada caractere. Desde os primeiros dias da computação, os caracteres são representados por pelo menos um byte (8 bits), e é por isso que os diferentes padrões Unicode salvam os caracteres em múltiplos de 8 bits.
Embora ASCII e Unicode sejam os tipos mais comuns de codificação de caracteres, outros padrões de codificação também podem ser usados para codificar arquivos de texto. Por exemplo, existem vários tipos de padrões de codificação de caracteres específicos para determinados idiomas, como ocidental, latino-americano, japonês, coreano e chinês. Embora os idiomas ocidentais usem caracteres semelhantes, os idiomas orientais exigem um conjunto de caracteres completamente diferente. Portanto, uma codificação latina não seria compatível com os símbolos necessários para representar uma string de texto em chinês. Felizmente, padrões modernos como UTF-16 são compatíveis com um conjunto de caracteres grande o suficiente para representar letras e símbolos ocidentais e orientais.
Teste seus conhecimentos