Unicode
Unicode je univerzální standard kódování znaků. Určuje, jak jsou jednotlivé znaky reprezentovány v textových souborech, webových stránkách a dalších typech dokumentů.
Na rozdíl od ASCII, které bylo navrženo pouze pro reprezentaci základních anglických znaků, byl Unicode navržen tak, aby podporoval znaky všech jazyků na světě. Standardní znaková sada ASCII podporuje pouze 128 znaků, zatímco Unicode může podporovat přibližně 1 000 000 znaků. Zatímco ASCII používá k reprezentaci každého znaku pouze jeden bajt, Unicode podporuje až 4 bajty pro každý znak.
Existuje několik různých typů kódování Unicode, přičemž nejběžnější jsou UTF-8 a UTF-16. UTF-8 se stal standardním kódováním znaků používaným na webu a je také výchozím kódováním používaným mnoha softwarovými programy. Přestože UTF-8 podporuje až čtyři bajty na znak, bylo by neefektivní používat čtyři bajty k reprezentaci často používaných znaků. Proto UTF-8 používá k reprezentaci běžných anglických znaků pouze jeden bajt. Evropské (latinské), hebrejské a arabské znaky jsou reprezentovány dvěma bajty, zatímco k reprezentaci čínských, japonských, korejských a dalších asijských znaků se používají tři bajty. Další znaky Unicode lze reprezentovat čtyřmi bajty.
Otestujte své znalosti