UTF
Je zkratkou pro „Unicode Transformation Format“. UTF označuje několik typů kódování znaků Unicode, včetně UTF-7, UTF-8, UTF-16 a UTF-32.
- UTF-7 – používá 7 bitů pro každý znak. Byl navržen k reprezentaci znaků ASCII ve zprávách e-mailu, které vyžadovaly kódování Unicode.
- UTF-8 – nejrozšířenější typ kódování Unicode. Používá jeden bajt pro standardní anglická písmena a symboly, dva bajty pro další latinské a blízkovýchodní znaky a tři bajty pro asijské znaky. Další znaky lze reprezentovat pomocí čtyř bajtů. UTF-8 je zpětně kompatibilní s ASCII, protože prvních 128 znaků je přiřazeno stejným hodnotám.
- UTF-16 – rozšíření kódování Unicode „UCS-2“, které používá dva bajty k reprezentaci 65 536 znaků. UTF-16 však také podporuje čtyři bajty pro další znaky až do počtu jednoho milionu.
- UTF-32 – vícebajtové kódování, které reprezentuje každý znak pomocí 4 bajtů.
Většina textu v dokumentech a webových stránkách je kódována pomocí jednoho z výše uvedených kódování UTF. Mnoho programů pro zpracování textu neumožňuje zobrazit kódování znaků otevřených dokumentů, některé však toto kódování zobrazují ve spodní části okna dokumentu nebo ve vlastnostech souboru. Pokud chcete zjistit typ kódování znaků použitý webovou stránkou, můžete vybrat a zobrazit tak její HTML. Kódování znaků, pokud je definováno, bude v záhlaví v horní části HTML. Stránka používající kódování UTF-8 může v závislosti na verzi HTML obsahovat jeden z následujících úryvků textu.
XHTML: <meta http-equiv="Content-Type" content="text/html; charset=utf-8" />
HTML 5: <meta charset="UTF-8">
Otestujte své znalosti