Codifica dei caratteri
Sebbene visualizziamo i documenti di testo come righe di testo, i computer li vedono in realtà come dati binari, ovvero come una serie di uno e zero. Pertanto, i caratteri all'interno di un documento di testo devono essere rappresentati da codici numerici. Per ottenere questo risultato, il testo viene salvato utilizzando uno dei diversi tipi di codifica dei caratteri.
I tipi di codifica dei caratteri più diffusi sono ASCII e Unicode. Sebbene ASCII sia ancora supportato da quasi tutti gli editor di testo, Unicode è usato più comunemente perché supporta un set di caratteri più ampio. Unicode è spesso definito come UTF-8, UTF-16 o UTF-32, che fanno riferimento a diversi standard Unicode. UTF significa "Unicode Transformation Format" e il numero indica la quantità di bit utilizzati per rappresentare ogni carattere. Fin dagli inizi dell'informatica, i caratteri sono stati rappresentati da almeno un byte (8 bit), motivo per cui i diversi standard Unicode salvano i caratteri in multipli di 8 bit.
Sebbene ASCII e Unicode siano i tipi di codifica dei caratteri più comuni, per codificare i file di testo possono essere utilizzati anche altri standard di codifica. Ad esempio, esistono diversi tipi di standard di codifica dei caratteri specifici per determinate lingue, come quelli occidentali, Latin-US, giapponesi, coreani e cinesi. Sebbene le lingue occidentali usino caratteri simili, quelle orientali richiedono un set di caratteri completamente diverso. Pertanto, una codifica Latin non supporterebbe i simboli necessari per rappresentare una stringa di testo in cinese. Fortunatamente, gli standard moderni come UTF-16 supportano un set di caratteri abbastanza ampio da rappresentare sia le lettere sia i simboli occidentali e orientali.
Metti alla prova le tue conoscenze