Unicode
Unicode is een universele standaard voor tekencodering. De standaard bepaalt hoe afzonderlijke tekens worden weergegeven in tekstbestanden, webpagina's en andere soorten documenten.
In tegenstelling tot ASCII, dat is ontworpen om alleen eenvoudige Engelse tekens weer te geven, is Unicode ontworpen voor tekens uit alle talen ter wereld. De standaardtekenset van ASCII ondersteunt slechts 128 tekens, terwijl Unicode ongeveer 1.000.000 tekens kan ondersteunen. Terwijl ASCII slechts één byte gebruikt om elk teken weer te geven, ondersteunt Unicode maximaal 4 bytes per teken.
Er zijn verschillende soorten Unicode-coderingen, hoewel UTF-8 en UTF-16 het meest worden gebruikt. UTF-8 is de standaardtekencodering op het Web geworden en is ook de standaardcodering van veel softwareprogramma's. Hoewel UTF-8 maximaal vier bytes per teken ondersteunt, zou het inefficiënt zijn om vier bytes te gebruiken voor veelgebruikte tekens. Daarom gebruikt UTF-8 slechts één byte om veelvoorkomende Engelse tekens weer te geven. Europese (Latijnse), Hebreeuwse en Arabische tekens worden met twee bytes weergegeven, terwijl Chinese, Japanse, Koreaanse en andere Aziatische tekens drie bytes gebruiken. Aanvullende Unicode-tekens kunnen met vier bytes worden weergegeven.
Test je kennis