Hoe werkt ChatGPT en hoe komt het aan zijn antwoorden?
Trainingsdata en live webzoeken uitgelegd: hoe ChatGPT bronnen kiest en waarom een toppositie in Google niet vereist is.
Read this in English →$ trace --systeem=chatgpt --richting=bron
Hoe werkt ChatGPT en hoe komt het aan zijn antwoorden?
ChatGPT werkt langs twee routes: het bouwt antwoorden uit de kennis die tijdens de training in het model is gegaan, en uit live webzoekresultaten wanneer de zoekfunctie aanstaat. In beide gevallen kiest het bronnen op inhoud en structuur, niet op de volgorde van Google. Dit stuk legt de werking uit in gewone taal; er komt geen formule aan te pas en er wordt niets verkocht.
Wie wil weten hoe hij in ChatGPT-antwoorden terechtkomt, moet eerst weten waar die antwoorden vandaan komen. Dat is minder geheimzinnig dan het lijkt. Er zijn twee routes, en ze werken wezenlijk anders.
01 / route eenKennis uit de training
Het taalmodel achter ChatGPT is getraind op een grote hoeveelheid tekst van het open web, tot een afkapdatum. Alles wat het model in die periode over jouw vakgebied, jouw markt en eventueel jouw bedrijf heeft gelezen, zit verwerkt in het model zelf.
Vraag je ChatGPT zonder zoekfunctie naar jouw markt, dan antwoordt het volledig uit dit geheugen. Het antwoord kan daardoor jaren achterlopen op de werkelijkheid, en het model zegt er zelden bij hoe oud zijn kennis is.
Deze route is traag en onvolledig. Sta je er niet in, dan kun je dat niet snel repareren: nieuwe content bereikt het model pas bij een volgende trainingsronde, en niemand buiten OpenAI bepaalt wat daarin meegaat. Wat je er wel aan hebt: teksten die al jaren online staan, veel gelezen en veel aangehaald worden, wegen hier het zwaarst. Het is de lange termijn van AI-vindbaarheid.
02 / route tweeLive webzoeken
Staat de zoekfunctie aan, dan zoekt ChatGPT op het moment van de vraag live op het web, leest een aantal pagina's en bouwt daaruit een antwoord met bronvermeldingen. Dit is de route waar je op korte termijn iets aan kunt doen, want hier telt wat er nú op het web staat en of jouw pagina's op dat moment leesbaar en vindbaar zijn.
De selectie werkt in twee stappen. Eerst bepaalt een zoekopdracht welke pagina's worden opgehaald. Daarna beslist het model welke passages uit die pagina's het antwoord halen. Die tweede stap is waar structuur het verschil maakt: een pagina die de vraag letterlijk beantwoordt, in een passage die zelfstandig leesbaar is, wordt eerder aangehaald dan een pagina waar het antwoord verspreid staat over twaalf alinea's.
Let daarbij op een detail dat vaak wordt gemist: de vraag die de gebruiker stelt, is zelden de zoekopdracht die het systeem uitvoert. ChatGPT herformuleert de vraag, splitst hem soms in meerdere zoekopdrachten en combineert de uitkomsten. Je hoeft dus niet elke denkbare formulering te bedienen; je moet het onderwerp volledig en helder behandelen, zodat je pagina bij meerdere van die afgeleide zoekopdrachten bovendrijft.
De twee routes naast elkaar:
| Route een: training | Route twee: live webzoeken | |
|---|---|---|
| Bron van het antwoord | Kennis in het model zelf, tot de afkapdatum | Pagina's die op het moment van de vraag gelezen worden |
| Actualiteit | Kan jaren achterlopen | Wat nú op het web staat |
| Invloed op korte termijn | Vrijwel geen: wacht op een volgende trainingsronde | Direct: leesbaarheid en vindbaarheid van vandaag tellen |
| Bronvermelding | Zelden | Standaard, met verwijzing naar de gebruikte pagina's |
Voor de praktijk betekent dit dat elke verbetering die je vandaag doorvoert, via route twee al in het volgende antwoord kan zitten, terwijl dezelfde verbetering pas veel later in het model zelf doorsijpelt. Wie aan zijn zichtbaarheid werkt, werkt dus vrijwel altijd eerst aan route twee; route een volgt vanzelf naarmate teksten langer meegaan en vaker worden aangehaald.
03 / breder dan googleWaarom een toppositie niet vereist is
ChatGPT kijkt breder dan de bovenste resultaten van een zoekmachine. Waar de AI Overviews van Google sterk leunen op de eigen rankings, haalt ChatGPT zijn bronnen uit een ruimere selectie en leunt het daarbij minder op de positie dan een zoekmachine.
Voor een AI-antwoord concurreer je niet met tien blauwe links, maar met elke pagina die de vraag beter beantwoordt dan de jouwe.
Dat heeft twee kanten. De gunstige: een goed opgebouwde pagina van een klein bedrijf kan geciteerd worden zonder dat die pagina in Google bovenaan staat. De ongunstige: een toppositie in Google is geen garantie voor een plek in het antwoord. De selectiecriteria overlappen, maar ze zijn niet gelijk. Hoe die criteria per platform verschillen staat verder uitgewerkt in hoe Perplexity werkt en hoe je in de bronnen komt.
04 / de derdenWikipedia, Reddit en vakmedia tellen mee
ChatGPT citeert opvallend vaak bronnen die niet van de bedrijven zelf zijn. Volgens analyses van ChatGPT-citatiepatronen is Wikipedia goed voor ongeveer 7,8 procent van de citaties en Reddit voor ongeveer 1,8 procent, en daar komen reviewsites en vakmedia nog bij. Een antwoord over jouw markt kan dus samengesteld zijn uit wat anderen over die markt schrijven, terwijl geen enkele bedrijfssite wordt aangehaald.
Voor jouw zichtbaarheid betekent dit dat je eigen site maar de helft van het verhaal is. Wat er op de plekken van derden over jouw markt en jouw bedrijf staat, bepaalt mee of en hoe je in antwoorden verschijnt. Wat AI-vindbaarheid in de volle breedte inhoudt, staat in wat is AI-vindbaarheid; wat wij er praktisch in doen vind je op datadriftdigital.nl.
Wie hier niets mee hoeft: bedrijven zonder online zoekende klanten. Voor iedereen met instroom uit zoekverkeer geldt dat deze twee routes samen bepalen waar die instroom de komende jaren vandaan komt.
Waar haalt ChatGPT zijn informatie vandaan?+
Moet ik bovenaan in Google staan om in ChatGPT te verschijnen?+
Kan ik beïnvloeden wat ChatGPT over mijn bedrijf zegt uit trainingsdata?+
Waarom citeert ChatGPT zo vaak Wikipedia en Reddit?+
Wat is het verschil tussen ChatGPT en Google AI Overviews als bron van antwoorden?+
Benieuwd uit welke bronnen de antwoorden over jouw markt worden samengesteld?
De AI-Vindbaarheidsscan
Wij meten op een vaste set zoekvragen waar je wél en niet verschijnt in ChatGPT, Perplexity, Claude en Google AI Overviews, en wie er nu staat. Eén rapport, € 695, volledig verrekenbaar met een vervolgtraject. Ook zonder vervolg houd je het rapport en weet je waar je staat.
Deze tekst is met AI-ondersteuning tot stand gekomen en door een mens gecontroleerd en vastgesteld voor publicatie.