Codificación de caracteres
Aunque vemos los documentos de texto como líneas de texto, las computadoras en realidad los ven como datos binarios, o como una serie de unos y ceros. Por lo tanto, los caracteres de un documento de texto deben representarse mediante códigos numéricos. Para lograrlo, el texto se guarda mediante uno de varios tipos de codificación de caracteres.
Los tipos de codificación de caracteres más populares son ASCII y Unicode. Aunque casi todos los editores de texto todavía admiten ASCII, Unicode se usa con más frecuencia porque admite un conjunto de caracteres más amplio. Unicode suele definirse como UTF-8, UTF-16 o UTF-32, que hacen referencia a distintos estándares de Unicode. UTF significa "Unicode Transformation Format" (formato de transformación Unicode), y el número indica la cantidad de bits usados para representar cada carácter. Desde los primeros días de la computación, los caracteres se han representado mediante al menos un byte (8 bits), por lo que los distintos estándares de Unicode guardan los caracteres en múltiplos de 8 bits.
Aunque ASCII y Unicode son los tipos de codificación de caracteres más comunes, también pueden usarse otros estándares de codificación para codificar archivos de texto. Por ejemplo, existen varios tipos de estándares de codificación de caracteres específicos de determinados idiomas, como los occidentales, el latino-estadounidense, el japonés, el coreano y el chino. Aunque los idiomas occidentales usan caracteres similares, los idiomas orientales requieren un conjunto de caracteres completamente diferente. Por lo tanto, una codificación latina no admitiría los símbolos necesarios para representar una cadena de texto en chino. Afortunadamente, los estándares modernos, como UTF-16, admiten un conjunto de caracteres lo suficientemente amplio como para representar letras y símbolos occidentales y orientales.
Pon a prueba tu conocimiento