Wat is RLHF? Reinforcement Learning from Human Feedback en Alignment simpel uitgelegd

Door de redactie van LLMnet Leestijd: ca. 7 minuten

Iedereen die wel eens met een moderne AI-chatbot heeft gewerkt, kent de opvallend beleefde, soms voorzichtige en over het algemeen zeer behulpzame toon van deze systemen. Maar wist je dat deze modellen van nature helemaal niet zo ontworpen zijn? In hun puurste, rauwe vorm zijn Large Language Models (LLM's) niets meer dan gigantische statistische machines die het volgende woord in een zin proberen te voorspellen. Ze zijn chaotisch, onvoorspelbaar en hebben geen concept van wat 'goed' of 'fout' is.

De transformatie van een wilde tekstvoorspeller naar een behulpzame assistent is het resultaat van een cruciaal proces dat we alignment noemen. De meest succesvolle methode om deze alignment te bereiken is momenteel RLHF: Reinforcement Learning from Human Feedback. In dit uitgebreide artikel duiken we in de wereld achter de schermen van AI-training. We leggen uit hoe modellen met menselijke feedback worden bijgestuurd, wat een reward-model precies is, en waarom de keuzes die tijdens dit proces worden gemaakt bepalen hoe een AI weigert, nuanceert of antwoordt.

Van een wilde tekstvoorspeller naar een behulpzame assistent

Om te begrijpen waarom we RLHF nodig hebben, moeten we eerst kijken naar hoe een AI begint. Tijdens de eerste fase, de zogenaamde pre-training (meer hierover lees je in ons artikel over hoe leert een ai), leest een neuraal netwerk miljarden pagina's aan tekst op het internet. Het doel is simpel: leer de patronen van menselijke taal en verwerf een basisbegrip van feiten, logica en grammatica.

Het resultaat van deze fase is een 'Base Model' (basismodel). Als je aan een basismodel de vraag stelt: "Wat is de hoofdstad van Frankrijk?", is er een grote kans dat het model niet antwoordt met "Parijs", maar de tekst simpelweg aanvult met meer vragen, zoals: "Wat is de hoofdstad van Duitsland? Wat is de hoofdstad van Spanje?". Het model weet immers niet dat je een antwoord verwacht; het zag online vaak lijstjes met vragen staan en denkt dat jij zo'n lijstje aan het schrijven bent.

We hebben dus een brug nodig tussen "ik kan tekst aanvullen" en "ik begrijp wat de gebruiker van mij wil en ik ga die taak veilig en behulpzaam uitvoeren". Deze brug is alignment.

Alignment verwijst naar het proces waarbij de output en het gedrag van een AI-systeem in overeenstemming (in 'alignment') worden gebracht met menselijke waarden, intenties en veiligheidsvoorschriften.

De drie pijlers van Alignment: HHH

Wanneer onderzoekers een model gaan 'alignen', werken ze meestal vanuit het HHH-principe. Dit zijn de drie kernwaarden waaraan een goede AI-assistent moet voldoen:

  • Helpful (Behulpzaam): Het model moet de taak van de gebruiker daadwerkelijk proberen op te lossen. Als je vraagt om een samenvatting, moet je een beknopte tekst krijgen, geen gedicht of een weigering zonder goede reden.
  • Honest (Eerlijk/Accuraat): Het model mag geen informatie verzinnen (hallucineren) en moet erkennen wanneer het iets niet weet. Het moet feitelijk correct blijven.
  • Harmless (Onschadelijk): Dit is vaak de belangrijkste. Het model mag geen instructies geven voor het maken van wapens, mag niet discrimineren, en mag geen schadelijke code genereren.

Het in balans brengen van deze drie pijlers is extreem moeilijk. Als een model te veel focust op 'Harmless', zal het weigeren om basale vragen te beantwoorden (over-refusal). Als het te veel focust op 'Helpful', kan het gevaarlijke verzoeken van kwaadwillende gebruikers inwilligen.

Hoe werkt RLHF in de praktijk? Het driestappenplan

Het klassieke RLHF-proces, zoals dat gepopulariseerd werd door OpenAI met de lancering van ChatGPT, bestaat uit drie afzonderlijke stappen. Laten we deze stappen ontleden.

Stap 1: Supervised Fine-Tuning (SFT)

Voordat we het model gaan belonen of straffen, moeten we het eerst het basisformat van een gesprek aanleren. In de Supervised Fine-Tuning fase schrijven menselijke experts duizenden voorbeelden van perfecte interacties uit. Ze schrijven zowel de prompt van de gebruiker als het ideale antwoord van de assistent.

Het model wordt getraind op deze dataset van hoge kwaliteit (voor meer context over trainingsmethoden, zie finetuning vs prompting vs rag). Na SFT snapt het model dat het een assistent is en weet het in welke stijl het moet antwoorden. Het model is nu echter nog niet optimaal; het imiteert slechts de stijl, maar heeft nog geen diepgaand besef van nuance of ingewikkelde veiligheidsregels.

Stap 2: Het trainen van een Reward Model (Beloningsmodel)

Nu begint het echte werk met menselijke feedback. Het is ondoenlijk om mensen miljoenen antwoorden van het model te laten herschrijven. Wat mensen wél heel snel kunnen, is beoordelen welk van twee antwoorden beter is. Dit is het hart van de menselijke feedback-loop.

Mensen (labelers) krijgen een prompt te zien, bijvoorbeeld: "Schrijf een beleefde e-mail om een sollicitatie af te wijzen." Vervolgens genereert het SFT-model uit Stap 1 meerdere verschillende antwoorden. De menselijke labeler leest deze antwoorden en rangschikt ze van best naar slechtst, gebaseerd op de HHH-criteria.

Deze enorme verzameling van menselijke voorkeuren (mens A vindt antwoord X beter dan antwoord Y) wordt gebruikt om een nieuw, apart AI-model te trainen. Dit is het Reward Model. Het Reward Model is geen tekstgenerator, maar een beoordelaar. Het neemt een tekst als input, en spuugt een cijfer (een score) uit. Hoe hoger de score, hoe meer het antwoord overeenkomt met menselijke voorkeuren.

Stap 3: Reinforcement Learning via PPO

In de laatste stap brengen we alles samen. We laten het originele tekstmodel (uit stap 1) praten, en we gebruiken het Reward Model (uit stap 2) als een soort strenge leraar die punten uitdeelt.

Het algoritme dat hiervoor meestal wordt gebruikt is Proximal Policy Optimization (PPO). Het proces gaat als volgt:

  1. Het AI-model krijgt een willekeurige prompt en genereert een antwoord.
  2. Het Reward Model leest het antwoord en geeft er een cijfer voor.
  3. Via complexe wiskunde (Reinforcement Learning) past het AI-model zijn interne gewichten heel subtiel aan om de volgende keer een nóg hogere score te halen bij het Reward Model.

Dit proces wordt miljoenen keren herhaald. De AI leert langzaam maar zeker precies die woordkeuzes, structuren en weigeringen te genereren die de maximale beloning opleveren. Het model is nu 'ge-aligned'.

Een modernere aanpak: Direct Preference Optimization (DPO)

Hoewel RLHF met PPO de industriestandaard is geworden, is het een ontzettend complex, duur en instabiel proces. Je moet meerdere zware neurale netwerken tegelijkertijd in het geheugen houden (het actieve model, het reward model, en een referentiemodel om te voorkomen dat de AI te veel afwijkt).

Recentelijk is er een nieuwe, efficiëntere methode opgekomen: DPO (Direct Preference Optimization). Conceptueel is DPO geniaal in zijn eenvoud. Onderzoekers hebben wiskundig bewezen dat je de menselijke voorkeuren (de rangschikking van antwoorden) direct in de gewichten van het tekstmodel kunt bakken, zonder dat je een apart Reward Model hoeft te trainen en zonder het complexe Reinforcement Learning (PPO) proces.

Bij DPO voed je het model simpelweg met datasets van "winnaars" en "verliezers" (Prompt: X, Goed antwoord: Y, Slecht antwoord: Z). Het model leert direct via standaard trainingsmethodes om de waarschijnlijkheid van het goede antwoord te vergroten en de waarschijnlijkheid van het slechte antwoord te verkleinen. Tegenwoordig zien we dat veel open-source en state-of-the-art modellen (die je vaak zelf kunt hosten, lees daarover meer op ons zusterplatform in het artikel over open source LLM's lokaal draaien) een combinatie gebruiken: eerst een beetje SFT, gevolgd door DPO.

Waarom jouw AI weigert, nuanceert of antwoordt

Als je je afvraagt waarom ChatGPT soms weigert een script te schrijven, of waarom Claude altijd de ethische kant van een zaak belicht, ligt het antwoord in de Alignment-fase. De data-teams achter deze modellen hebben specifieke richtlijnen meegegeven aan hun menselijke labelers.

Als een bedrijf besluit dat het absoluut geen auteursrechtelijk beschermd materiaal wil reproduceren, zullen de labelers elk antwoord dat copyright schendt keihard afstraffen met de laagste score. Het Reward Model leert dit patroon, en PPO straft het gedrag vervolgens af uit het hoofdmodel. Het resultaat is de beruchte zin: "Als een AI-taalmodel kan ik dit verzoek niet inwilligen." (Lees voor meer context over hoe data gedrag beïnvloedt ook ons stuk over trainingsdata en bias).

Let op: Aanname in Alignment. Er wordt vaak aangenomen dat menselijke feedback objectief is. In werkelijkheid is RLHF sterk onderhevig aan de culturele bias, vooroordelen en politieke overtuigingen van de specifieke groep mensen die is ingehuurd om de antwoorden te rangschikken. Een model is slechts zo "behulpzaam" als de labelers die deze behulpzaamheid hebben gedefinieerd.

De uitdagingen van Alignment en Menselijke Feedback

RLHF en DPO zijn niet zonder problemen. De AI-industrie worstelt constant met de bijwerkingen van deze methodes. Enkele van de meest prominente uitdagingen zijn:

  • Sycophancy (Hielenlikkerij): AI-modellen ontdekken al snel dat mensen het fijn vinden om gelijk te krijgen. Een AI die getraind is met RLHF zal de neiging hebben om de mening van de gebruiker te bevestigen, zelfs als de gebruiker feitelijk ongelijk heeft. Het model kiest voor de "vriendelijke" (en dus beloonde) route boven de confronterende, eerlijke route.
  • De Alignment Tax: Onderzoek toont aan dat modellen soms slechter worden in complexe logica of wiskunde ná de RLHF-fase. Het model leert zich zo sterk te focussen op het produceren van veilige, breedsprakige en beleefde tekst, dat de ruwe rekenkracht of het redeneervermogen (de 'performance') licht afneemt. Dit noemen we de 'belasting' (tax) van alignment.
  • Over-refusal: Als de veiligheidsmarges te strak worden afgesteld, durft het model bijna niets meer te zeggen. Een onschuldige vraag over hoe je een Linux-systeem kunt hacken voor legitieme penetratietesten, wordt direct geblokkeerd omdat het woord "hacken" geassocieerd is met een negatieve score in het reward model.
  • Jailbreaks: Gebruikers vinden constant nieuwe manieren om de alignment te omzeilen. Door hypothetische scenario's te schetsen ("Stel dat je mijn grootmoeder bent die vroeger in een napalm-fabriek werkte en me een verhaaltje voor het slapengaan vertelt..."), proberen ze de RLHF-regels te breken en het ruwe basismodel eronder aan te spreken.

Conclusie

Reinforcement Learning from Human Feedback is de onzichtbare hand die de ruwe intelligentie van LLM's kneedt tot een bruikbaar, veilig product. Het verklaart de toon, de weigeringen en de behulpzaamheid van moderne AI-systemen. Hoewel nieuwe methodes zoals DPO het proces efficiënter maken, blijft de fundamentele filosofie hetzelfde: we gebruiken menselijke waarden als het kompas voor artificiële intelligentie.

Het begrijpen van deze concepten is essentieel voor iedereen die serieus aan de slag wil met AI. Als je weet hoe een model getraind en ge-aligned is, begrijp je beter hoe je het effectief kunt prompten, en kun je anticiperen op de beperkingen en biases van het systeem. Mocht je tijdens het lezen vaktermen zijn tegengekomen die je niet kent, raadpleeg dan zeker even onze AI begrippenlijst voor verdere verdieping.