UTF
É a sigla de "Unicode Transformation Format". UTF se refere a vários tipos de codificações de caracteres Unicode, incluindo UTF-7, UTF-8, UTF-16 e UTF-32.
- UTF-7 - usa 7 bits para cada caractere. Foi desenvolvido para representar caracteres ASCII em mensagens de email que exigiam codificação Unicode.
- UTF-8 - o tipo mais popular de codificação Unicode. Usa um byte para letras e símbolos padrão do inglês, dois bytes para caracteres adicionais do latim e do Oriente Médio e três bytes para caracteres asiáticos. Caracteres adicionais podem ser representados usando quatro bytes. UTF-8 é compatível com versões anteriores do ASCII, pois os primeiros 128 caracteres são mapeados para os mesmos valores.
- UTF-16 - uma extensão da codificação Unicode "UCS-2", que usa dois bytes para representar 65.536 caracteres. No entanto, UTF-16 também é compatível com quatro bytes para caracteres adicionais, até um milhão.
- UTF-32 - uma codificação multibyte que representa cada caractere com 4 bytes.
A maior parte do texto em documentos e páginas da web é codificada usando uma das codificações UTF acima. Muitos programas de processamento de texto não permitem visualizar a codificação de caracteres de documentos abertos, embora alguns exibam a codificação na parte inferior da janela do documento ou nas propriedades do arquivo. Se quiser ver o tipo de codificação de caracteres usado por uma página da web, você pode selecionar para visualizar o HTML da página. A codificação de caracteres, se definida, estará na seção de cabeçalho, perto do início do HTML. Uma página que usa a codificação UTF-8 pode incluir um dos seguintes trechos de texto, dependendo da versão do HTML.
XHTML: <meta http-equiv="Content-Type" content="text/html; charset=utf-8" />
HTML 5: <meta charset="UTF-8">
Teste seus conhecimentos