Temperature, top-p en andere sampling-parameters uitgelegd

Wanneer je communiceert met een Large Language Model via een API of interface, bepaal je met sampling-parameters hoe het model kiest uit mogelijke vervolgwoorden. In deze module leer je de belangrijkste instellingen en hun impact op creativiteit en betrouwbaarheid.

Hoe LLM's woorden kiezen

Een taalmodel voorspelt niet direct hele zinnen, maar berekent per stap de waarschijnlijkheid van elk mogelijk volgend woord (token) in de woordenschat. Zonder sturing kiest het model simpelweg altijd het meest waarschijnlijke woord. Sampling-parameters grijpen in op dit waarschijnlijkheidsdistributieproces.

De Belangrijkste Parameters

1. Temperature (Temperatuur)

Wat het doet: De temperatuur schaalt de waarschijnlijkheden van tokens voordat ze worden omgezet in kansen.

  • Lage temperatuur (bijv. 0.0 - 0.2): Maakt de kansenverdeling steiler. Het meest waarschijnlijke woord krijgt bijna alle voorkeur, wat leidt tot voorspelbare, deterministische en feitelijke antwoorden.
  • Hoge temperatuur (bijv. 0.8 - 1.2): Vlakt de verdeling af. Minder waarschijnlijke woorden maken opeens een grotere kans, wat resulteert in creatievere, verrassendere output.

2. Top-p (Nucleus Sampling)

Wat het doet: Top-p beperkt de woordkeuze tot een cumulatieve kansdrempel. Bij een instelling van 0.9 kijkt het model alleen naar de set woorden die samen 90% van de cumulatieve waarschijnlijkheid vormen. Woorden met een zeer lage kans vallen direct af, ongeacht de temperatuur.

3. Frequency & Presence Penalty

Wat het doet: Deze parameters gaan herhaling tegen.

  • Frequency Penalty: Verlaagt de kans op een woord op basis van hoe vaak dat woord al in de gegenereerde tekst is voorgekomen.
  • Presence Penalty: Moedigt het model aan om over nieuwe onderwerpen te praten door al gebruikte woorden direct te bestraffen, ongeacht de exacte frequentie.

Wanneer gebruik je welke waarde?

Gebruiksdoel Temperature Top-p
Code generatie / Data-extractie 0.0 - 0.1 1.0
Zakelijke e-mails / Klantenservice 0.3 - 0.5 0.9
Creatief schrijven / Brainstormen 0.8 - 1.0 0.95

Praktische Oefening

Je bouwt een applicatie die juridische contracten analyseert en puntsgewijze samenvattingen maakt. Welke instellingen kies je voor de API-aanroep om te voorkomen dat het model zelf feiten verzint (hallucineert)?

Antwoord: Kies voor een lage temperatuur (bijv. 0.1) om maximale voorspelbaarheid en feitelijke nauwkeurigheid te garanderen.