Regulärer Ausdruck
Ein regulärer Ausdruck (oder „Regex“) ist ein Suchmuster, mit dem ein oder mehrere Zeichen innerhalb einer Zeichenfolge gefunden werden. Er kann bestimmte Zeichen, Platzhalter und Zeichenbereiche finden. Reguläre Ausdrücke wurden ursprünglich von Unix-Dienstprogrammen wie vi und grep verwendet. Heute werden sie jedoch von vielen Anwendungen zur Codebearbeitung und Anwendungen sowie Textverarbeitungsprogrammen auf mehreren Plattformen unterstützt. Reguläre Ausdrücke können auch in den meisten wichtigen Programmiersprachen verwendet werden.
Ein regulärer Ausdruck kann so einfach wie eine einfache Zeichenfolge sein, zum Beispiel „app“. Der Regex „app“ würde Zeichenfolgen finden, die die Wörter „apps“, „applications“ und „inapplicable“ enthalten. Ein regulärer Ausdruck kann auch Ankerzeichen („^“ und „$“) enthalten, mit denen jeweils der Anfang und das Ende einer Zeile angegeben werden. Daher würde der Regex „^apps“ die Zeichenfolge „apps are great“ finden, nicht aber die Zeichenfolge „I like apps.“
Reguläre Ausdrücke können Bindestriche enthalten, mit denen ein Zeichenbereich gefunden wird, zum Beispiel alle Kleinbuchstaben. Der Regex „[a-z]“ würde beispielsweise „apps“ finden, nicht aber die Zeichenfolgen „Apps“ oder „123“. Der Regex „[A-Za-z]“ würde „Apps“ finden, und „[0-9]“ würde „123“ finden. Ein Punkt, der in regulären Ausdrücken das standardmäßige Platzhalterzeichen ist, kann verwendet werden, um jedes Zeichen zu finden (außer einem Zeilenendzeichen). Ein Punkt gefolgt von einem Sternchen (.*) findet null oder mehr Vorkommen, während ein Punkt gefolgt von einem Pluszeichen (.+) ein oder mehr Vorkommen findet.
Was passiert also, wenn Sie eine Zeichenfolge finden müssen, die einen Bindestrich, ein Sternchen, ein Pluszeichen oder ein Ankerzeichen enthält? Diese Zeichen können in ein Muster für reguläre Ausdrücke aufgenommen werden, indem sie mit einem Backslash („\“) „escaped“ werden. Um beispielsweise nach „$0.99“ zu suchen, würde der Regex wie folgt aussehen: „\$0\.99“. Backslashes werden auch verwendet, um nach nicht druckbaren Zeichen zu suchen. So findet „\r“ einen Wagenrücklauf, „\n“ einen Zeilenumbruch und „\t“ ein Tabulatorzeichen.
Auch wenn das Erstellen eines einfachen regulären Ausdrucks nicht viel Aufwand erfordert, ist das Schreiben eines fortgeschrittenen Regex keine leichte Aufgabe. Selbst die besten Programmierer erstellen komplexe reguläre Ausdrücke nur selten beim ersten Versuch korrekt. Bei richtiger Verwendung sind reguläre Ausdrücke jedoch ein leistungsfähiges Werkzeug zum Suchen, Finden und Ersetzen bestimmter Texte.
Testen Sie Ihr Wissen