Naar de inhoud
NLEN
Illustratie: Mechanistische interpreteerbaarheid uitgelegd

Mechanistische interpreteerbaarheid uitgelegd

Door Ivo Donker — samengesteld met AI-ondersteuning (Claude & Gemini) · Laatst bijgewerkt: 6 augustus 2026

Grote taalmodellen presteren indrukwekkend op uiteenlopende taken, van het schrijven van broncode tot het beantwoorden van ingewikkelde kennisvragen. Toch blijft de manier waarop deze netwerken tot hun antwoorden komen voor een groot deel verborgen in een web van miljarden getallen. Mechanistische interpreteerbaarheid is het onderzoeksgebied dat dit wil veranderen. De centrale vraag van dit vakgebied is niet of een model een taak goed uitvoert, maar hoe de interne berekening precies verloopt tussen het moment van invoer en de uiteindelijke uitvoer.

In plaats van een model te behandelen als een gesloten doos waarvan we alleen de resultaten meten, probeert mechanistische interpreteerbaarheid het netwerk te ontleden zoals een software-engineer een gecompileerd programma leest. Het doel is het blootleggen van de precieze algoritmes en interne structuren die tijdens de training in het netwerk zijn ontstaan.

Het verschil met traditionele uitlegmethoden

Klassieke methoden voor uitlegbaarheid binnen kunstmatige intelligentie richten zich voornamelijk op de invoer. Bekende benaderingen analyseren bijvoorbeeld welke woorden of afbeeldingselementen het zwaarst meewogen bij een specifieke beslissing. Deze technieken tonen weliswaar welke delen van de tekst invloed hadden, maar ze laten niet zien hoe het model die informatie heeft verwerkt.

Mechanistische interpreteerbaarheid pakt dit anders aan. Het zoekt niet naar een correlatie tussen invoersignalen en uitkomsten, maar naar het daadwerkelijke rekenmechanisme. Het beschrijft hoe individuele componenten informatie transformeren, doorgeven en combineren. Zoals eerder is besproken in het artikel over parameters en gewichten, bepalen de gewichten wat een model weet en kan. Mechanistisch onderzoek probeert de exacte logica te ontcijferen die in die gewichten besloten ligt.

Kernverschil: Waar traditionele uitlegbaarheid vraagt "Naar welk woord keek het model?", vraagt mechanistische interpreteerbaarheid "Welk intern algoritme transformeerde woord A in voorspelling B?"

Waarom een enkele activatie geen helder beeld geeft

Een voor de hand liggende gedachte is om simpelweg te kijken wanneer specifieke neuronen in het netwerk actief worden. Men zou hopen dat één neuron verantwoordelijk is voor het begrip "Frankrijk", en een ander voor "hoofdstad". In de praktijk blijkt dit zelden te werken. Neuronen reageren in de regel op een bonte verzameling van schijnbaar ongerelateerde onderwerpen, zoals zowel wiskundige formules als Franse poëzie.

Dit komt doordat het model niet rekent in netjes afgebakende vakjes, maar in richtingen binnen een hoogdimensionale vectorruimte. Begrippen worden vertegenwoordigd als specifieke vectoren of richtingen binnen die ruimte. Omdat een enkele richting door meerdere neuronen tegelijk wordt gevormd, is de activatie van één enkel neuron op zichzelf vrijwel onleesbaar voor een menselijke waarnemer.

Superpositie: meer begrippen dan richtingen

Het fenomeen dat dit veroorzaakt, staat bekend als superpositie. Tijdens het trainen leert een netwerk enorm veel verschillende concepten kennen. De dimensie van de interne weergave — het aantal beschikbare rekenassen — is echter beperkt door de architectuur van de transformer. Om deze beperking te omzeilen, pakt het model meer begrippen in dan er orthogonale (haakse) richtingen beschikbaar zijn.

Superpositie betekent in gewone taal dat het model richtingen deelt. Twee begrippen die zelden tegelijk voorkomen, worden onder een hele kleine hoek ten opzichte van elkaar opgeslagen. Omdat ze bijna haaks op elkaar staan, storen ze elkaar nauwelijks. Maar voor wie van buitenaf naar de afzonderlijke neuronen kijkt, lijkt een enkel neuron hierdoor op meerdere onsamenhangende dingen te reageren. Het neuron helpt namelijk mee aan de opbouw van meerdere gedeelde richtingen tegelijk.

Eigenschap Geheugen per begrip (Monosemantisch) Superpositie (Polysemantisch)
Representatie Eén neuron vertegenwoordigt precies één helder begrip. Eén neuron helpt mee aan meerdere concepten tegelijk.
Capaciteit Maximaal evenveel begrippen als er neuronen zijn. Veel meer begrippen dan het aantal beschikbare neuronen.
Interpreteerbaarheid Direct af te lezen en eenvoudig te begrijpen. Zeer complex; vereist wiskundige ontwarring van richtingen.

Het ontwarren van verstrengelde begrippen

Omdat superpositie het rechtstreeks aflezen van netwerken bemoeilijkt, zoeken onderzoekers naar manieren om deze verstrengeling ongedaan te maken. De meest gebruikte route is de inzet van een apart hulpmodel, een zogenaamde sparse autoencoder. Dit hulpmodel neemt de verstrengelde activaties uit het taalmodel en projecteert ze naar een veel grotere, ijlere (sparse) weergave.

In deze uitgebreide ruimte komen de begrippen wel los van elkaar te staan. Elk kenmerk in de ijlere weergave komt nu overeen met één enkel, helder concept — bijvoorbeeld "een verwijzing naar de Eiffel-toren" of "een haakje dat gesloten moet worden in C++ code". Door deze transformatie wordt de complexe intern aanwezige informatie eindelijk vertaald naar iets wat voor mensen begrijpelijk is.

De residuele stroom als gedeeld werkgeheugen

Om te begrijpen hoe informatie zich door een transformer verplaatst, is het concept van de residuele stroom essentieel. Je kunt de residuele stroom zien als de centrale snelweg of het gedeelde werkgeheugen van het netwerk. Zoals beschreven in het overzicht van wat een transformer is, bestaat een model uit een reeks opeenvolgende lagen.

Elke laag in de transformer leest informatie uit de residuele stroom, voert een berekening uit en schrijft de uitkomst vervolgens weer bij op de residuele stroom. De oorspronkelijke informatie blijft behouden, tenzij een latere laag deze expliciet aanpast of overschrijft. Dit verklaart waarom informatie over de zinsstructuur of de context duizenden tokens verderop nog steeds aanwezig en te raadplegen is.

Binnen dit proces vervullen verschillende onderdelen specifieke rollen:

Circuits: de bouwstenen van modelgedrag

Het centrale idee binnen de mechanistische benadering is dat een model taken uitvoert via circuits. Een circuit is een klein, samenwerkend netwerk van specifieke onderdelen (zoals bepaalde attention-koppen en feed-forward lagen) dat samen een herkenbare deeltaak uitvoert.

Een bekend voorbeeld van zo'n circuit is het "inductiecircuit". Dit is een combinatie van minstens twee attention-koppen die patronen herkent van het type "als A werd gevolgd door B, en we zien nu weer A, dan is de kans groot dat B volgt". Een ander voorbeeld is een circuit dat namen van personen bijhoudt om voornaamwoorden correct te koppelen. Een complex taalmodel bestaat uit duizenden van zulke kleine, overlappende circuits die parallel en volgtijdelijk werken.

Bewijs leveren door in te grijpen

Het simpelweg observeren dat een bepaald onderdeel actief is bij een specifieke taak toont alleen correlatie aan. Om echt te bewijzen dat een mechanisme verantwoordelijk is voor een uitkomst, moeten onderzoekers ingrijpen. Dit wordt gedaan via causale interventies.

Onderzoekers schakelen bijvoorbeeld een specifiek onderdeel uit (zogenaamde 'ablatie') of vervangen de activatie van een component door de activatie van een andere tekstinvoer (zogenaamde 'activation patching'). Als de voorspelling van het model vervolgens precies verandert zoals het hypothetische circuit voorspelt, levert dat een sterk bewijs dat het mechanisme correct is geïdentificeerd.

Causale interventies verlopen meestal volgens een vast patroon:

  1. Het model voert een taak uit met een normale invoer, waarbij de interne activaties worden opgeslagen.
  2. De invoer wordt licht gewijzigd, waardoor de uitkomst verandert.
  3. Onderzoekers vervangen stapsgewijs specifieke activaties uit de gewijzigde run door de originele activaties.
  4. Zodra de oorspronkelijke uitkomst herstelt, is het exacte onderdeel gelokaliseerd dat de cruciale informatie overdraagt.

Beperkingen van interventies en het schaalprobleem

Hoewel causale interventies sterker bewijs leveren dan loutere correlatie, is ook deze aanpak niet onfeilbaar. Neurale netwerken zijn namelijk erg robuust en bevatten vaak overtollige paden. Als een onderzoeker één circuit uitschakelt, kan het model soms via een alternatieve route (een back-upsysteem) alsnog het juiste antwoord bereiken. Dit kan de onderzoeker ten onrechte doen concluderen dat het uitgeschakelde onderdeel geen rol van betekenis speelde.

Daarnaast kampt het vakgebied met een enorm schaalprobleem. Tot nu toe zijn onderzoekers er voornamelijk in geslaagd om kleine, afgebakende deeltaken in kaart te brengen bij relatief kleine modellen. Het ontleden van een gigantisch model met honderden miljarden parameters vereist enorme rekenkracht en geavanceerde automatisering. Het handmatig analyseren van elk circuit is bij huidige grote modellen praktisch onmogelijk.

Praktische toepassingen: meer dan nieuwsgierigheid

Mechanistische interpreteerbaarheid is geen puur theoretische oefening; het heeft directe praktische relevantie voor de veiligheid en betrouwbaarheid van AI-systemen. Wie begrijpt hoe een model intern rekent, kan sturen op een manier die met externe training alleen niet haalbaar is.

Belangrijke praktische toepassingen zijn:

De grens tussen interne rekenstappen en gegenereerde uitleg

Een veelvoorkomende misvatting is dat een taalmodel zijn eigen werking kan uitleggen wanneer je het vraagt "Waarom gaf je dit antwoord?". Technieken zoals chain-of-thought laten het model stapsgewijs een redenering uitschrijven. Dit is echter een tekstuele weergave die achteraf of incidenteel gegenereerd wordt, en geen getrouw verslag van de werkelijke rekenstappen in het netwerk.

Een taalmodel dat zijn eigen redenering beschrijft, produceert een plausibel klinkend verhaal dat past bij de context. Dit verhaal kan nuttig zijn, maar het garandeert niet dat de gewichten en circuits die exacte route hebben gevolgd. Mechanistische interpreteerbaarheid kijkt daarom niet naar wat het model zegt over zijn gedrag, maar naar wat de getallen in het netwerk feitelijk doen.

Wat dit betekent voor gebruikers en ontwikkelaars

Voor gebruikers en organisaties die AI-toepassingen implementeren, maakt mechanistisch onderzoek duidelijk dat uitlegbaarheid nog lang geen opgelost probleem is. Uitspraken van leveranciers over 'volledig transparante' of 'begrijpelijke' AI-systemen moeten met terughoudendheid worden geïnterpreteerd.

De wetenschap maakt gestaag vorderingen in het begrijpen van kleine bouwstenen, maar het opvoeren van deze technieken naar volledige, complexe modellen is een proces van lange adem. Zolang we de interne rekenmechanismen niet volledig kunnen doorgronden, blijft het monitoren en testen van feitelijk gedrag een onmisbaar onderdeel van verantwoord AI-gebruik.

Lees ook