Unicode
Unicode ist ein universeller Standard für die Zeichenkodierung. Er legt fest, wie einzelne Zeichen in Textdateien, Webseiten und anderen Arten von Dokumenten dargestellt werden.
Im Gegensatz zu ASCII, das nur für die Darstellung grundlegender englischer Zeichen entwickelt wurde, unterstützt Unicode Zeichen aus allen Sprachen der Welt. Der standardmäßige ASCII-Zeichensatz unterstützt nur 128 Zeichen, während Unicode ungefähr 1.000.000 Zeichen unterstützen kann. Während ASCII nur ein Byte für die Darstellung jedes Zeichens verwendet, unterstützt Unicode bis zu 4 Bytes pro Zeichen.
Es gibt mehrere verschiedene Arten von Unicode-Kodierungen, wobei UTF-8 und UTF-16 am weitesten verbreitet sind. UTF-8 ist zur Standardzeichenkodierung im Web geworden und wird auch von vielen Softwareprogrammen standardmäßig verwendet. Obwohl UTF-8 bis zu vier Bytes pro Zeichen unterstützt, wäre es ineffizient, häufig verwendete Zeichen mit vier Bytes darzustellen. Daher verwendet UTF-8 nur ein Byte für die Darstellung gängiger englischer Zeichen. Europäische (lateinische), hebräische und arabische Zeichen werden mit zwei Bytes dargestellt, während drei Bytes für chinesische, japanische, koreanische und andere asiatische Zeichen verwendet werden. Zusätzliche Unicode-Zeichen können mit vier Bytes dargestellt werden.
Testen Sie Ihr Wissen