Zeichencodierung
Auch wenn wir Textdokumente als Textzeilen sehen, betrachten Computer sie tatsächlich als Binärdaten oder als eine Reihe von Einsen und Nullen. Daher müssen die Zeichen in einem Textdokument durch numerische Codes dargestellt werden. Dazu wird der Text mit einer von mehreren Arten der Zeichencodierung gespeichert.
Die beliebtesten Arten der Zeichencodierung sind ASCII und Unicode. Obwohl ASCII noch von fast allen Texteditoren unterstützt wird, wird Unicode häufiger verwendet, da es einen größeren Zeichensatz unterstützt. Unicode wird häufig als UTF-8, UTF-16 oder UTF-32 definiert, die sich auf unterschiedliche Unicode-Standards beziehen. UTF steht für "Unicode Transformation Format", und die Zahl gibt die Anzahl der Bits an, die zur Darstellung jedes Zeichens verwendet werden. Seit den Anfängen der Computertechnik werden Zeichen durch mindestens ein Byte (8 Bits) dargestellt. Deshalb speichern die verschiedenen Unicode-Standards Zeichen in Vielfachen von 8 Bits.
Obwohl ASCII und Unicode die häufigsten Arten der Zeichencodierung sind, können auch andere Codierungsstandards verwendet werden, um Textdateien zu codieren. Beispielsweise gibt es mehrere sprachspezifische Zeichencodierungsstandards, etwa für westliche Sprachen, Lateinisch-US, Japanisch, Koreanisch und Chinesisch. Während westliche Sprachen ähnliche Zeichen verwenden, benötigen östliche Sprachen einen völlig anderen Zeichensatz. Daher würde eine lateinische Codierung die Symbole nicht unterstützen, die zur Darstellung einer Textzeichenkette auf Chinesisch erforderlich sind. Glücklicherweise unterstützen moderne Standards wie UTF-16 einen ausreichend großen Zeichensatz, um sowohl westliche als auch östliche Buchstaben und Symbole darzustellen.
Testen Sie Ihr Wissen