Inleiding: De mythe van de universele prompt
In de vroege dagen van grote taalmodellen werd vaak aangenomen dat een "goede prompt" een universeel toepasbaar recept was. Veel gebruikers ontwikkelden standaardformuleringen, zogenaamde megaprompts, en verwachtten dat deze identieke resultaten zouden opleveren in ChatGPT, Claude en Google Gemini. In de praktijk blijkt deze aanname echter een hardnekkige misvatting. Een instructie die bij Anthropic Claude fantastische, gestructureerde rapporten oplevert, kan bij OpenAI ChatGPT leiden tot een te beknopte samenvatting, en bij Google Gemini juist tot een onnodig verhalend betoog dat de feitelijke kern mist.
Het verschil in responsgedrag is geen toeval of willekeur. Het is het rechtstreekse gevolg van fundamentele verschillen in de onderliggende modelarchitecturen, de samenstelling van de pre-training datasets, en bovenal de specifieke RLHF (Reinforcement Learning from Human Feedback) en DPO (Direct Preference Optimization) strategieën van de ontwikkelaars. Elke leverancier stelt andere prioriteiten bij het uitlijnen van het model met menselijke voorkeuren. Anthropic legt zware nadruk op redeneerstappen, veiligheidsgrenzen en het navolgen van ingewikkelde XML-structuren. OpenAI optimaliseert ChatGPT voor beknoptheid, actiegerichte taken en strakke JSON-schema's. Google bouwt Gemini daarentegen vanuit een multimodale oorsprong met een enorme werkgeheugencontext, wat vraagt om een specifieke positionering van informatie.
Wie op professioneel niveau werkt met AI-toepassingen of software ontwikkelt op basis van LLM-API's, kan het zich niet veroorloven om alle modellen over één kam te scheren. Model-specifiek prompten is de kunst om de unieke sterktes van elk model te benutten en de bekende zwaktes bewust te omzeilen. In dit artikel ontleden we hoe Claude, Gemini en ChatGPT onder de motorkap verschillen in hoe zij opdrachten verwerken, en hoe je je promptstrategie per provider aanpast voor het beste resultaat.
Systeemkaarten en Alignment: De psychologie achter de modellen
Om te begrijpen waarom een model op een bepaalde manier reageert, moet je kijken naar de "systeemkaart" en de alignment-filosofie van de maker. Alignment bepaalt immers hoe het model keuzes maakt wanneer instructies ambigu zijn of wanneer er een conflict ontstaat tussen verschillende opdrachten.
Anthropic hanteert voor de Claude-familie het principe van Constitutional AI. Claude wordt tijdens de trainingsfase beoordeeld door een ander AI-model op basis van een expliciete grondwet met waarden als eerlijkheid, schadeloosheid en hulpvaardigheid. Dit zorgt ervoor dat Claude buitengewoon goed is in het interpreteren van nuance en het geven van transparante verantwoording. Claude heeft echter ook de neiging om zeer verbaal te zijn over wat het wel en niet kan, en zal bij twijfel eerder een uitgebreide toelichting geven dan een kort, definitief antwoord. Daarnaast is Claude sterk gecentreerd rondom de gedachte dat de gebruiker complexe context aanreikt die nauwgezet gelezen moet worden.
OpenAI heeft met de GPT-reeks (zoals GPT-4o) een zeer pragmatische alignment-koers gevaren. GPT-modellen zijn getraind om extreem direct te reageren op de meest recente instructie in de chatgeschiedenis. Ze zijn sterk geoptimaliseerd voor taakgerichtheid: als je GPT-4o vraagt om een lijst van drie punten, krijg je bijna gegarandeerd exact drie punten zonder inleidende beleefdheden. Deze "steerability" maakt ChatGPT fantastisch voor gestructureerde gegevensverwerking, maar het maakt het model ook gevoeliger voor het negeren van achtergrondcontext die eerder in een lange prompt is geplaatst.
Google Gemini is vanaf de grond opgebouwd als een native multimodaal model dat extreem grote contextvensters kan verwerken. Waar Claude en GPT van oudsher tekstmodellen zijn waaraan visuele modules zijn toegevoegd, verwerkt Gemini tekst, beelden en audio binnen dezelfde attention-lagen. Gemini's alignment is sterk gericht op het verwerken van massale hoeveelheden informatie en het genereren van natuurlijke, mensachtige conversaties. Gemini kan hierdoor echter sneller afgeleid raken door ruis in de prompt als de kernvraag niet helder is afgebakend.
Promptstructuur voor Anthropic Claude: XML-tags en expliciete kaders
Anthropic stelt zeer expliciete richtlijnen op voor het prompten van Claude. Het belangrijkste instrument in je gereedschapskist bij Claude is het gebruik van XML-tags (zoals <context>, <instructions>, en <examples>). De attention-lagen van Claude zijn tijdens de RLHF-fase specifiek getraind om XML-structuren te herkennen als harde grensmarkeringen tussen verschillende onderdelen van een prompt.
Wanneer je een ingewikkelde taak aan Claude geeft, voorkomt het gebruik van XML-tags dat het model instructies verwart met de data die het moet verwerken. Dit is bijzonder waardevol bij het voorkomen van ongewenste beïnvloeding door de invoertekst. Een optimale prompt voor Claude ziet er qua opbouw als volgt uit:
<system>
Je bent een ervaren senior data-analist gespecialiseerd in de Nederlandse zorgsector.
</system>
<context>
Hieronder staat het jaarverslag van een regionaal ziekenhuis over 2025.
[VOEG HIER DE TEKST IN]
</context>
<instructions>
Analyseer de financiële resultaten in de context.
1. Identificeer de drie grootste kostenposten.
2. Vergelijk de operationele marge met de landelijke norm van 2%.
3. Geef je analyse weer binnen de geopende tags.
</instructions>
<output_format>
Schrijf je antwoord in het volgende XML-formaat:
<analyse>
<kostenposten></kostenposten>
<marge_evaluatie></marge_evaluatie>
</analyse>
</output_format>
Het zwakke punt van Claude bij deze aanpak is dat het model de XML-structuur soms té letterlijk overneemt in zijn definitieve antwoord, ook als je dat niet expliciet vraagt. Als je een natuurlijke tekst als eindresultaat wilt, moet je expliciet vermelden: "Gebruik geen XML-tags in je uiteindelijke antwoord aan de lezer." Daarnaast heeft Claude de neiging om bij complexe analyses eerst een lange denkstap te formuleren. Als je snelle, minimale JSON-uitvoer nodig hebt, vergt dit bij Claude meer moeite qua sturing dan bij ChatGPT.
Promptstructuur voor OpenAI ChatGPT: Systeemrollen en strakke restricties
OpenAI-modellen reageren het beste op een duidelijke scheiding tussen de systeemrol (System Prompt) en de gebruikersopdracht (User Prompt), gecombineerd met overzichtelijke Markdown-kopjes. Waar Claude exceleert bij XML, begrijpt GPT-4o Markdown-interpunctie zoals #, ##, en - tot in de puntjes.
GPT-modellen hebben een sterke voorkeur voor actieve werkwoorden en expliciete restricties ("Do NOT include..."). Wanneer je GPT-4o een taak geeft, werkt een instructie in de vorm van een negatieve afbakening vaak beter dan bij andere modellen. Als je wilt voorkomen dat het model een inleidende beleefdheidszin typt, schrijf je simpelweg: "Start direct met de eerste alinea. Geen begroeting, geen inleiding." GPT-4o volgt deze directe restricties vrijwel feilloos op.
# ROL
Je bent een professionele copywriter voor Nederlandse B2B SaaS-bedrijven.
# TAAK
Herschrijf de onderstaande productomschrijving voor een landingspagina.
# REGELS
- Maximaal 150 woorden.
- Gebruik de 'Jij'-vorm.
- Banning: gebruik GEEN woorden zoals 'revolutionair', 'naadloos' of 'ontzorgen'.
- Format: Eén H2-kop, gevolgd door twee korte alinea's en een bulletlist van 3 punten.
# INVOER
[TEKST HIER]
Wil je weten hoe de nieuwste versies van GPT-4o, Claude en Gemini presteren op het gebied van specifiek Nederlandstalige schrijfopdrachten en stijlkwaliteit? Bekijk dan de uitgebreide vergelijking van GPT-4o, Claude en Gemini voor Nederlandse content op het hub-platform, waar de tekstkwaliteit van deze drie reuzen naast elkaar is gezet.
Het zwakke punt van ChatGPT is het zogenaamde "sycophancy"-gedrag: de neiging om het overdreven snel eens te zijn met de gebruiker. Als je in je prompt een aanname formuleert ("Waarom is strategie A beter dan strategie B?"), zal GPT-4o zelden tegenwerpen dat strategie B wellicht superieur is, tenzij je in de System Prompt expliciet vastlegt dat het model een kritische oppositierol moet aannemen.
Promptstructuur voor Google Gemini: Grote context en informatiepositie
Google Gemini onderscheidt zich door zijn immense contextvenster, dat in veel versies oploopt van honderden duizenden tot miljoenen tokens. Dit verandert de manier waarop je prompts opbouwt ingrijpend. Waar je bij ChatGPT of Claude vaak informatie moet samenvatten of opsplitsen vanwege contextbeperkingen, kun je bij Gemini complete documentatiearchieven, boeken of uren aan audiotranscripties in één keer meesturen.
Dit enorme voordeel brengt echter een specifiek attentie-probleem met zich mee, dat bekend staat als het "Lost in the Middle"-verscheinsel. Wanneer je een gigantische hoeveelheid informatie aan reikt, heeft het aandacht-mechanisme van de transformer de neiging om de meeste waarde te hechten aan het begin en het absolute einde van de prompt. Informatie die diep in het midden van een bestand van 500.000 tokens verborgen zit, kan over het hoofd worden gezien als de prompt verkeerd is opgebouwd.
De optimale strategie voor Gemini is de "Anchored Prompting"-methode:
- Start met de Hoofdopdracht: Zeg direct in de eerste alinea wat het uiteindelijke doel is.
- Bied de Massa-Context aan: Plaats alle brondocumenten, data en achtergrondinformatie in het middenblok.
- Herhaal de Exacte Vraag en Randvoorwaarden onderaan: Sluit de prompt af met de specifieke vraag en de gewenste uitvoerindeling. Dit verankert de aandacht van het model op het moment dat de tekstgeneratie begint.
Een veelvoorkomend zwak punt van Gemini is dat het bij kortere, alledaagse prompts soms te vrijblijvend reageert of cruciale instructies negeert als deze ergens halverwege een laap tekst zijn opgeborgen. Door de vraag onderaan de prompt te herhalen, dwing je Gemini om de gehele bovenliggende context te filteren op basis van de meest recente instructie.
Redeneermodellen en Chain-of-Thought per provider
Een van de belangrijkste doorbraken in prompting is het gebruik van Chain-of-Thought (CoT), oftewel het expliciet laten opschrijven van tussenstappen voordat het model tot een eindconclusie komt. De manier waarop je dit activeert verschilt echter sterk per model en per modelgeneratie.
Bij standaardinstructiemodellen (zoals Claude 3.5 Sonnet, GPT-4o of Gemini 1.5 Pro) moet je Chain-of-Thought vaak handmatig afdwingen in je prompt. Bij Claude werkt het uitstekend om een specifieke tag toe te voegen, zoals <thinking>, waarin het model eerst zijn logica moet uitwerken voordat het de tag <answer> opent. Bij GPT-4o werkt de klassieke zin "Denk stap voor stap na over dit probleem voordat je antwoordt" nog steeds wonderwel om logische redeneerfouten te verminderen.
Als je meer wilt leren over de onderliggende logica van deze techniek, lees dan de diepgaande uitleg over het laten redeneren van een model in stappen op het leerplatform.
Bij de nieuwere klasse van dedicated redeneermodellen (zoals de OpenAI o1- en o3-serie) is handmatige Chain-of-Thought in de prompt juist gecontra-indiceerd. Deze modellen voeren uit zichzelf al een interne redeneerslag uit vóórdat ze de eerste token aan de gebruiker tonen. Als je bij deze specifieke redeneermodellen expliciet vraagt om "stap voor stap na te denken" in de prompt, kan dit de interne redeneerketen verstoren of leiden tot onnodige overhead en hogere latency. Bij redeneermodellen geldt: geef een zo kaal en helder mogelijke probleemstelling met duidelijke randvoorwaarden, en laat het model zelf de denkruimte indelen.
Sampling-parameters en systeeminstellingen afstemmen
Prompten stopt niet bij de tekst van de opdracht zelf; de parameters waarmee je de API aanroept of de interface instelt zijn minstens zo bepalend voor het eindresultaat. De belangrijkste instellingen zijn Temperature en Top-P.
Wat veel ontwikkelaars over het hoofd zien, is dat een instelling van Temperature = 0.7 niet op elk platform hetzelfde effect sorteert. Dit komt doordat het verloop van de logit-waarschijnlijkheden per modelarchitectuur verschilt. Een overzicht van de aanbevolen instellingen per taak en provider:
| Model / Provider | Type Taak | Aanbevolen Temperature | Aanbevolen Top-P | Aandachtspunt |
|---|---|---|---|---|
| Anthropic Claude | Analyse & Code | 0.0 - 0.2 | 0.9 - 1.0 | Claude blijft bij lage temperature zeer precies; verhoog naar 0.7 voor creatief schrijven. |
| OpenAI GPT-4o | JSON & Data-extractie | 0.0 | 1.0 | Gebruik bij voorkeur `response_format: { type: "json_object" }` in plaats van alleen promptsturing. |
| Google Gemini | Grote documentanalyse | 0.2 - 0.4 | 0.95 | Hogere temperature bij Gemini kan bij grote documenten leiden tot creatieve invulling van ontbrekende feiten. |
Wil je precies begrijpen wat de wiskundige werking is van deze instellingen achter de schermen? Bekijk de praktische uitleg over temperature, top-p en andere sampling-parameters voor een diepere duik in de waarschijnlijkheidsverdelingen van LLM-outputs.
Veelgemaakte fouten bij model-overstijgend prompten
In de praktijk zien we dat veel AI-gebruikers en ontwikkelaars tegen dezelfde obstakels aanlopen wanneer ze schakelen tussen verschillende modelaanbieders. Een overzicht van de meest kritische fouten en hoe je ze herstelt:
1. 'Copy-pasting' van Claude XML-prompts naar ChatGPT
Wanneer je een uitgebreide prompt vol XML-tags rechtstreeks aan GPT-4o voert, zal het model de tags weliswaar begrijpen, maar het kan ze negeren of juist willekeurig overnemen in de uitvoer. Herschrijf XML-tags voor GPT-4o naar duidelijke Markdown-headers (#) en genummerde instructielijsten.
2. Onvoldoende instructieherhaling bij grote Gemini-prompts
Het uploaden van een PDF van 200 pagina's naar Gemini met als enige prompt bovenaan "Vat dit samen" leidt vaak tot oppervlakkige samenvattingen van enkel de eerste hoofdstukken. Plaats bij Gemini de specifieke samenvattingsinstructie én de gewenste focuspunten altijd helemaal onderaan de tekstmassa.
3. Verwachten dat hallucinaties op dezelfde manier ontstaan
Elk model heeft andere "blinde vlekken". GPT-4o tendeert bij gebrek aan feiten naar het overtuigend verzinnen van plausibele details. Claude neigt bij twijfel eerder naar overmatige terughoudendheid of weigering, terwijl Gemini feiten uit verschillende delen van een grote bron soms verkeerd aan elkaar koppelt. Om te begrijpen hoe je deze risico's per model beperkt, kun je de uitgebreide analyse lezen over waarom AI dingen verzint en hoe je hallucinaties beperkt.
Als je benieuwd bent naar een breder overzicht van de valkuilen die gebruikers tegenkomen in de praktijk, ongeacht het model dat ze gebruiken, raden we het artikel aan over veelgemaakte fouten bij prompten en hoe je ze voorkomt op het community-platform, waar praktijkervaringen van ontwikkelaars worden gedeeld.
Samenvatting en vergelijkingsmatrix
Om snel de juiste keuzes te maken bij het ontwerpen van prompts voor een specifiek model, kun je onderstaande vergelijkingsmatrix als leidraad gebruiken:
| Eigenschap | Anthropic Claude | OpenAI ChatGPT / GPT-4o | Google Gemini |
|---|---|---|---|
| Optimaal Formaat | XML-tags (<instructions>) |
Markdown (# headers) & JSON |
Anchored Prompting (Vraag onderaan) |
| Sterkste Punt | Complex redeneren, nuance, schrijfstijl | Strikte taakvolging, JSON-schema's | Enorme context, multimodale analyse |
| Grootste Valkuil | Te verbaal, overmatige voorzichtigheid | Sycophancy (ja-knikken), contextverlies | Informatieverlies in het midden (Lost in Middle) |
| Beste Instructiestijl | Uitleggend, kaders stellend | Direct, restrictief ("Do NOT") | Informatierijk, met duidelijke slotvraag |


