Unicode
Unicode to uniwersalny standard kodowania znaków. Określa sposób reprezentowania poszczególnych znaków w plikach tekstowych, stronach internetowych i innych rodzajach dokumentów.
W przeciwieństwie do standardu ASCII, który zaprojektowano wyłącznie do reprezentowania podstawowych znaków języka angielskiego, Unicode obsługuje znaki ze wszystkich języków świata. Standardowy zestaw znaków ASCII obsługuje tylko 128 znaków, podczas gdy Unicode może obsługiwać około 1 000 000 znaków. ASCII używa tylko jednego bajtu do reprezentowania każdego znaku, natomiast Unicode obsługuje do 4 bajtów na znak.
Istnieje kilka różnych rodzajów kodowania Unicode, jednak najczęściej używane są UTF-8 i UTF-16. UTF-8 stało się standardowym kodowaniem znaków używanym w Internecie i jest także domyślnym kodowaniem używanym przez wiele programów oprogramowania. Chociaż UTF-8 obsługuje do czterech bajtów na znak, używanie czterech bajtów do reprezentowania często używanych znaków byłoby nieefektywne. Dlatego UTF-8 używa tylko jednego bajtu do reprezentowania typowych znaków języka angielskiego. Znaki europejskie (łacińskie), hebrajskie i arabskie są reprezentowane za pomocą dwóch bajtów, natomiast znaki chińskie, japońskie, koreańskie i inne znaki azjatyckie są reprezentowane za pomocą trzech bajtów. Dodatkowe znaki Unicode można reprezentować za pomocą czterech bajtów.
Sprawdź swoją wiedzę