Generative KI
Generative KI ist eine Kategorie von Modellen künstlicher Intelligenz, die dafür entwickelt wurden, neue Daten zu erzeugen. Diese Modelle werden mit großen Datensätzen trainiert, die ihnen beibringen, Muster und Strukturen in Texten, Bildern, Videos und Audiodateien zu erkennen. Nach dem Training können ihre Algorithmen als Reaktion auf eine Benutzereingabe neue Daten mit ähnlichen Eigenschaften erzeugen. Verschiedene Modelle können Absätze mit natürlich klingendem Text erzeugen, Bilder in unterschiedlichen künstlerischen Stilen darstellen oder Audiobeispiele erstellen.
Große Sprachmodelle
Generative Textmodelle (auch große Sprachmodelle genannt) können Textblöcke auf Grundlage einer Eingabeaufforderung des Benutzers erzeugen. Obwohl die Ausgabe wie von einer Person geschrieben wirken kann, ist generativer Text tatsächlich eine Form von fortgeschrittener Texterkennung. Das Modell erzeugt jeweils ein Wort und sagt das nächste Wort in einer Folge auf Grundlage seines Trainingsmaterials voraus. Mit einer ausreichend großen Datenmenge können generative Sprachmodelle Aufsätze, Liedtexte oder sogar funktionsfähigen Quellcode in mehreren Programmiersprachen erzeugen.
Verschiedene große Sprachmodelle verwenden unterschiedliche Trainingsdatensätze. Die größten Modelle nutzen eine große Vielfalt an Texten, darunter Bücher, Nachrichtenartikel, Beiträge in sozialen Medien, Forschungsarbeiten und Aufsätze. Beispiele für generative Textmodelle sind ChatGPT, Google Bard und Bing Chat.
Diffusionsmodelle
Generative Bildmodelle erstellen Bilder mithilfe eines Verfahrens, das als Diffusionsmodellierung bezeichnet wird. Diese Modelle werden durch maschinelles Lernen trainiert, indem sie große Datensätze analysieren, die von menschlichen Trainern mit Beschreibungen des Inhalts und des künstlerischen Stils jedes Bildes versehen wurden. Das Modell verwendet diese Markierungen während des Trainings, um bestimmte Muster und Strukturen innerhalb eines Bildes mit dem jeweils passenden Text zu verknüpfen.
Während des Trainings zerlegt ein Diffusionsmodell ein Bild zunächst in einer langen Reihe von Schritten und fügt dabei langsam zufälliges Rauschen hinzu. Nachdem das ursprüngliche Bild auf ein Rauschen reduziert wurde, setzt das Modell das Bild anhand seiner Inhaltsmarkierungen langsam wieder zusammen, indem es Details erzeugt, die das zufällige Rauschen ersetzen. Es wiederholt diesen Vorgang unzählige Male, während sein neuronales Netzwerk Variablen anpasst, bis das reproduzierte Bild dem Original ähnelt. Nach dem Training kann ein Modell mithilfe der erlernten Schlüsselwörter und Markierungen aus einer Eingabeaufforderung des Benutzers völlig neue Bilder erstellen. Beispiele für generative Bildmodelle sind DALL-E, Midjourney und Stable Diffusion.
Ethische Bedenken
Der schnelle Aufstieg der Technologie für generative KI bringt einige ethische Bedenken mit sich. Diese Modelle benötigen riesige Trainingsdatensätze – Dutzende Terabyte an Text für ein Sprachmodell und Hunderte Millionen Bilder für ein Diffusionsmodell. Diese Trainingsdaten enthalten häufig urheberrechtlich geschütztes Material und können auf Grundlage dieser Werke abgeleitete Inhalte erstellen, ohne den ursprünglichen Urheber zu nennen oder zu vergüten. Trainingsdaten können auch Bilder von Personen ohne deren Einwilligung enthalten. Schließlich ist die Frage, ob die Ausgabe einer generativen KI urheberrechtlich geschützt werden kann (und wem dieses Urheberrecht gehört), rechtlich noch nicht geklärt.
Generative KI-Modelle sind nur so gut, wie es ihre Trainingsdaten zulassen, und Probleme innerhalb dieser Datensätze können in der Ausgabe eines Modells sichtbar werden. Enthält der Trainingsdatensatz eines Modells Material mit voreingenommener Sprache oder Bildsprache, kann das Modell diese Vorurteile übernehmen und in seine Ausgabe aufnehmen. Die Entwickler generativer KI-Modelle filtern zwar häufig Hassrede heraus, doch subtile Vorurteile sind viel schwieriger zu erkennen und zu entfernen. Außerdem wird ein Modell, das mit Daten trainiert wurde, die sachlich falsche Informationen enthalten, diese Informationen weitergeben und seine Benutzer möglicherweise in die Irre führen.
Testen Sie Ihr Wissen