Generatieve AI
Generatieve AI is een categorie kunstmatige-intelligentiemodel die is ontworpen om nieuwe gegevens te genereren. Deze modellen worden getraind met grote gegevensverzamelingen die ze leren patronen en structuren in tekst, afbeeldingen, video en audio te herkennen. Nadat ze zijn getraind, kunnen hun algoritmen nieuwe gegevens met vergelijkbare eigenschappen genereren als reactie op invoer van de gebruiker. Verschillende modellen kunnen alinea's met natuurlijk klinkende tekst genereren, afbeeldingen in verschillende artistieke stijlen maken of audiofragmenten creëren.
Grote taalmodellen
Generatieve tekstmodellen (ook wel grote taalmodellen genoemd) kunnen tekstblokken genereren op basis van een prompt van de gebruiker. Hoewel de uitvoer eruit kan zien alsof die door een persoon is geschreven, is generatieve tekst in werkelijkheid een vorm van geavanceerde voorspellende tekst. Het model genereert één woord per keer en voorspelt het volgende woord in een reeks op basis van het materiaal waarmee het is getraind. Met een voldoende grote hoeveelheid gegevens kunnen generatieve taalmodellen essays, songteksten en zelfs functionele broncode in meerdere programmeertalen genereren.
Verschillende grote taalmodellen gebruiken verschillende sets met trainingsgegevens. De grootste modellen gebruiken een grote verscheidenheid aan tekst, waaronder boeken, nieuwsartikelen, berichten op sociale media, onderzoeksartikelen en essays. Voorbeelden van generatieve tekstmodellen zijn ChatGPT, Google Bard en Bing Chat.
Diffusiemodellen
Generatieve beeldmodellen maken afbeeldingen met behulp van een methode die diffusiemodellering wordt genoemd. Deze modellen worden getraind met machine learning — grote gegevensverzamelingen analyseren die door menselijke trainers zijn voorzien van beschrijvingen van zowel de inhoud als de artistieke stijl van elke afbeelding. Het model gebruikt deze labels tijdens het trainen om specifieke patronen en structuren in een afbeelding te koppelen aan de bijbehorende tekst.
Tijdens het trainen breekt een diffusiemodel een afbeelding eerst op in een lange reeks stappen, waarbij het langzaam willekeurige ruis toevoegt. Nadat de oorspronkelijke afbeelding is gereduceerd tot ruis, stelt het model de afbeelding langzaam opnieuw samen op basis van de inhoudslabels door details te genereren die de willekeurige ruis vervangen. Het probeert dit proces talloze keren terwijl zijn neuraal netwerk variabelen aanpast totdat de gereproduceerde afbeelding op het origineel lijkt. Nadat het model is getraind, kan het volledig nieuwe afbeeldingen maken op basis van een prompt van de gebruiker, met behulp van de trefwoorden en labels die het heeft geleerd. Voorbeelden van generatieve beeldmodellen zijn DALL-E, Midjourney en Stable Diffusion.
Ethische aandachtspunten
De snelle opkomst van generatieve AI-technologie brengt enkele ethische aandachtspunten met zich mee. Deze modellen hebben enorme hoeveelheden trainingsgegevens nodig — tientallen terabytes aan tekst voor een taalmodel en honderden miljoenen afbeeldingen voor een diffusiemodel. Deze trainingsgegevens bevatten vaak materiaal waarop auteursrecht rust en kunnen afgeleid materiaal op basis van die werken creëren zonder de oorspronkelijke maker erkenning te geven of te vergoeden. Trainingsgegevens kunnen ook afbeeldingen van mensen bevatten zonder hun toestemming. Ten slotte is de vraag of op de uitvoer van generatieve AI auteursrecht kan rusten (en wie dat auteursrecht bezit) juridisch nog niet definitief beantwoord.
Generatieve AI-modellen zijn slechts zo goed als hun trainingsgegevens toestaan, en problemen in die gegevens kunnen in de uitvoer van een model verschijnen. Als de trainingsgegevens van een model materiaal met bevooroordeelde taal of afbeeldingen bevatten, kan het die vooroordelen overnemen en in zijn uitvoer opnemen. Hoewel de ontwikkelaars van generatieve AI-modellen haatdragende taal vaak eruit filteren, is subtiele vooringenomenheid veel moeilijker te detecteren en te verwijderen. Bovendien zal een model dat is getraind met gegevens die feitelijk onjuiste informatie bevatten, die informatie doorgeven, waardoor gebruikers mogelijk worden misleid.
Test je kennis