LLMnet Leren — Educatieplatform

Hoe leert een AI? Training uitgelegd voor beginners

Van ruwe data naar intelligente assistent: begrijp de fundamentele principes achter moderne AI-modellen zonder technische voorkennis.

Module: Cursus Artificial Intelligence Fundamenten Verken ook de LLMnet KennisHUB

Wanneer we horen over de indrukwekkende prestaties van moderne kunstmatige intelligentie (AI), is het makkelijk om te denken aan een denkend wezen met een eigen bewustzijn. Maar niets is minder waar. Een AI-model is in de kern een geavanceerde wiskundige rekenmachine die getraind is om patronen te ontdekken in enorme hoeveelheden tekst, getallen of beelden.

In deze module ontdek je intuïtief hoe dat leerproces werkt, wat het verschil is tussen basistraining en fine-tuning, en waarom de kwaliteit van de invoerale data allesbepalend is.

1. De Intuïtieve Analogie: De Ervaren Woordenschat-Meester

De Analogie: De Honderdduizend Boekenlezer

Stel je voor dat je een persoon hebt die nog nooit een woord Nederlands heeft gehoord, maar wel de opdracht krijgt om honderdduizend boeken uit een bibliotheek te lezen. Die persoon krijgt geen grammatica-regels uitgelegd, en leert geen woordenboek uit het hoofd. In plaats daarvan krijgt hij één simpele uitdaging op elke pagina:

"Ik dek de tafel met een bord en een..." — en dan wordt het laatste woord bedekt.

De lezer moet nu raden welk woord daar logischerwijs hoort (bijvoorbeeld "mes" of "vork"). In het begin gokt hij maar wat. Maar na het lezen van miljoenen vergelijkbare zinnen ontdekt hij patronen. Hij merkt dat na "brood en..." vaak "boter" volgt, en na "hoge..." vaker "druk" dan "tafel". Door dit miljarden keren te herhalen, bouwt hij een enorm fijnmazig web van waarschijnlijkheden op.

Dit is precies wat een Large Language Model (LLM) doet. Het voorspelt telkens het meest waarschijnlijke volgende woord of stukje tekst (token) op basis van de context die eraan voorafgaat. Er is geen sprake van begrip of intentie; er is sprake van statistische patroonherkenning op een astronomische schaal.

2. Hoe werkt het trainingsproces in stappen?

Het bouwen van een functionerend AI-systeem gebeurt niet in één keer. Dit verloopt via opeenvolgende fasen waarin het model steeds specifieker wordt gevormd:

  1. Voorbereiding en Verzamelen: Gigantische hoeveelheden openbare data (teksten van websites, boeken, wetenschappelijke artikelen) worden verzameld en opgeschoond.
  2. Ongecontroleerde Basistraining (Pre-training): Het model ondergaat de 'woordenschat-oefening' uit onze analogie. Het leert de structuur van de taal, feiten over de wereld en algemene verbanden. Dit kost de meeste rekenkracht en tijd.
  3. Fine-Tuning en Instructietraining: Een puur voorspellend model is nog geen behulpzame assistent; als je vraagt "Wat is de hoofdstad van Frankrijk?", zou een basistraining kunnen antwoorden met "Wat is de hoofdstad van Spanje?". Bij fine-tuning wordt het model geleerd om als dialoogpartner te reageren, vragen te beantwoorden en veiligheidsrichtlijnen te volgen.

3. Trainen vs. Finetunen vs. Gebruiken

In de praktijk worden termen als 'trainen' en 'gebruiken' door elkaar gehaald. Laten we ze helder van elkaar onderscheiden:

Fase Wat gebeurt er? Doel
Basistraining (Pre-training) Het model wordt vanaf nul getraind op ruwe teksten om taalpatronen te leren. Een universele taalfundering bouwen.
Fine-tuning Het reeds getrainde model wordt bijgeschaafd met gerichte voorbeeldvragen en antwoorden. Specialiseren in een specifieke stijl, rol of vakgebied.
Gebruiken (Inference) Je stelt een vraag aan het voltooide model en het genereert direct een antwoord. Directe productiviteit en probleemoplossing.

4. Waarom de kwaliteit van data telt (Garbage In, Garbage Out)

Er bestaat een hardnekkig misverstand dat "meer data altijd beter is". In werkelijkheid is de kwaliteit, diversiteit en zuiverheid van de trainingsdata vele malen belangrijker dan de pure hoeveelheid.

De Wet van Data: Als een model wordt gevoed met verouderde, vooringenomen of feitelijk onjuiste informatie, zal het model die fouten met evenveel overtuiging herhalen. Dit staat in de computerwereld bekend als Garbage In, Garbage Out.

Daarom besteden ontwikkelaars enorme hoeveelheden tijd aan het filteren van rommel, het verwijderen van dubbele teksten en het corrigeren van schadelijke biases voordat de training begint. Een model getraind op een kleinere, zorgvuldig geselecteerde bibliotheek presteert vaak stukken beter dan een model dat ongefilterd het hele internet heeft ingeslikt.

5. Oefening: Test je inzicht

Korte Praktijkopdracht

Stel je voor dat je een AI wilt inzetten als klantenservice-medewerker voor een specifieke Nederlandse webshop in duurzame kleding. Welke actie is het meest effectief om de AI betrouwbaar te maken?

Antwoord: Optie B. Door te kiezen voor fine-tuning op specifieke bedrijfsdata krijgt het model de juiste context zonder dat er onnodig vanaf nul getraind hoeft te worden.