Unicode
Unicode è uno standard universale di codifica dei caratteri. Definisce il modo in cui i singoli caratteri vengono rappresentati nei file di testo, nelle pagine web e in altri tipi di documenti.
A differenza di ASCII, progettato per rappresentare solo i caratteri inglesi di base, Unicode è stato progettato per supportare i caratteri di tutte le lingue del mondo. Il set di caratteri ASCII standard supporta solo 128 caratteri, mentre Unicode può supportarne circa 1.000.000. Mentre ASCII usa un solo byte per rappresentare ogni carattere, Unicode supporta fino a 4 byte per ogni carattere.
Esistono diversi tipi di codifica Unicode, anche se UTF-8 e UTF-16 sono i più comuni. UTF-8 è diventata la codifica dei caratteri standard utilizzata sul Web ed è anche la codifica predefinita usata da molti programmi software. Sebbene UTF-8 supporti fino a quattro byte per carattere, sarebbe inefficiente usare quattro byte per rappresentare i caratteri usati più frequentemente. Per questo motivo, UTF-8 usa un solo byte per rappresentare i caratteri inglesi comuni. I caratteri europei (latini), ebraici e arabi sono rappresentati con due byte, mentre per i caratteri cinesi, giapponesi, coreani e di altre lingue asiatiche vengono usati tre byte. I caratteri Unicode aggiuntivi possono essere rappresentati con quattro byte.
Metti alla prova le tue conoscenze