UTF
È l'acronimo di "Unicode Transformation Format". UTF indica diversi tipi di codifica dei caratteri Unicode, tra cui UTF-7, UTF-8, UTF-16 e UTF-32.
- UTF-7: usa 7 bit per ogni carattere. È stato progettato per rappresentare i caratteri ASCII nei messaggi di posta elettronica che richiedevano la codifica Unicode.
- UTF-8: il tipo di codifica Unicode più diffuso. Usa un byte per le lettere e i simboli inglesi standard, due byte per altri caratteri latini e mediorientali e tre byte per i caratteri asiatici. I caratteri aggiuntivi possono essere rappresentati usando quattro byte. UTF-8 è compatibile con le versioni precedenti di ASCII, poiché i primi 128 caratteri sono associati agli stessi valori.
- UTF-16: un'estensione della codifica Unicode "UCS-2", che usa due byte per rappresentare 65.536 caratteri. Tuttavia, UTF-16 supporta anche quattro byte per i caratteri aggiuntivi, fino a un milione.
- UTF-32: una codifica multibyte che rappresenta ogni carattere con 4 byte.
La maggior parte del testo nei documenti e nelle pagine web è codificata usando una delle codifiche UTF sopra indicate. Molti programmi di elaborazione testi non consentono di visualizzare la codifica dei caratteri dei documenti aperti, anche se alcuni mostrano la codifica nella parte inferiore della finestra del documento o nelle proprietà del file. Se vuoi vedere il tipo di codifica dei caratteri usato da una pagina web, puoi selezionare per visualizzare il codice HTML della pagina. Se definita, la codifica dei caratteri si trova nella sezione dell'intestazione, vicino all'inizio dell'HTML. Una pagina che usa la codifica UTF-8 può contenere uno dei seguenti frammenti di testo, a seconda della versione dell'HTML.
XHTML: <meta http-equiv="Content-Type" content="text/html; charset=utf-8" />
HTML 5: <meta charset="UTF-8">
Metti alla prova le tue conoscenze