Werkt een AI-psycholoog echt? Wat het onderzoek zegt over AI-therapiechatbots
Sceptici hebben gelijk als ze zich afvragen of een AI-psycholoog iets meetbaars doet, of dat het alleen maar ondersteunend klinkt. Het eerlijke, op bewijs gebaseerde antwoord is ja, met echte grenzen: de eerste gerandomiseerde gecontroleerde studie van een generatieve AI-therapiechatbot, gepubliceerd in NEJM AI in maart 2025, en een reeks meta-analyses met tienduizenden deelnemers wijzen beide op meetbare, kleine tot matige voordelen bij depressie en angst. Hieronder staat wat het onderzoek werkelijk zegt — inclusief waar het bewijs sterk is, waar het dun is, en op wie het niet van toepassing is.

Dit is geen hype of afwijzing. Het is een blik op de baanbrekende gerandomiseerde Therabot-studie van Dartmouth, de meta-analyses met tienduizenden deelnemers in 18 landen, en de specifieke plekken waar de bewijsbasis nog dun is.
Dit artikel bespreekt gepubliceerd onderzoek en is geen medisch advies. Een AI-psycholoog vervangt geen bevoegde behandelaar. Als u in de VS in een crisis verkeert, bel of sms 988 (de Suicide and Crisis Lifeline) of sms HOME naar 741741. Bel 911 bij onmiddellijk gevaar.
Het korte antwoord: meetbare voordelen, met grenzen
“Werkt” heeft in de context van deze studies een nauwe, toetsbare betekenis — en die is het waard om te definiëren voordat we naar cijfers kijken. Zodra die betekenis duidelijk is, ziet de vorm van het bewijs er niet langer uit als marketing en begint het te lijken op een normale, imperfecte klinische onderzoeksbasis.
Wat “werkt” hier eigenlijk betekent
In dit onderzoek betekent “werkt” een statistisch significante vermindering van symptomen ten opzichte van een controlegroep, gemeten over een afgebakend studievenster — meestal 4 tot 8 weken. Het betekent geen genezing, en het betekent geen gelijkwaardigheid aan jaren psychotherapie. Het effect is echt maar bescheiden, en tot nu toe is het geconcentreerd in speciaal ontworpen cognitieve gedragstherapie (CGT)-tools in plaats van chatbots voor algemeen gebruik.
Dat onderscheid is belangrijker dan welk afzonderlijk percentage in dit artikel dan ook. Een gerandomiseerde gecontroleerde studie (RCT) is het ontwerp dat onderzoekers het meest vertrouwen, omdat het een AI-therapiechatbot vergelijkt met een echte controlegroep, waarmee het effect van de tool wordt geïsoleerd van placebo, tijd of aandacht alleen.
Waarom het antwoord “ja, maar” is
De beste afzonderlijke dataset — Dartmouths Therabot-studie — laat een betekenisvolle vermindering van depressie- en angstsymptomen zien. Bredere meta-analyses, die tientallen studies samenvoegen, bevestigen een klein tot matig effect in plaats van een uitzonderlijk resultaat. Maar drie kanttekeningen gelden voor bijna alles: de follow-updata die nodig zijn om te bewijzen dat het voordeel aanhoudt zijn dun, het risico op vertekening in de onderliggende studies is vaak hoog, en het sterkste bewijs behoort tot een nauwe categorie speciaal ontworpen tools, niet tot chatbots in het algemeen.
De baanbrekende studie: Dartmouths Therabot-trial
Het meeste van wat bekend is over de vraag of een generatieve AI-therapiechatbot klinische symptomen kan beïnvloeden, komt uit één studie, dus het is de moeite waard door te nemen wat die daadwerkelijk testte en vond.
Wat de studie vond
De eerste gerandomiseerde gecontroleerde studie van een generatieve AI-therapiechatbot verscheen in NEJM AI in maart 2025. Onderzoekers van Dartmouth includeerden 210 volwassenen met een ernstige depressieve stoornis, een gegeneraliseerde angststoornis of een klinisch hoog risico op voedings- en eetstoornissen, en wezen 106 toe aan Therabot en 104 aan een wachtlijstcontrole. Na vier en acht weken daalden de depressiesymptomen van de behandelgroep met 51%, de angstsymptomen met 31% en de aan eetstoornissen gerelateerde zorgen over het lichaamsbeeld met 19% — verminderingen die de auteurs van de studie beschreven als vergelijkbaar met wat doorgaans wordt gezien bij ambulante therapie.

Therabot zelf is geen chatbot voor algemeen gebruik; het is specifiek getraind op best practices van CGT en klinische gesprekspatronen, wat een groot deel is van waarom de resultaten niet automatisch overdraagbaar zijn naar andere AI-tools.
De verrassing van de therapeutische alliantie
Deelnemers gebruikten Therabot ongeveer zes uur gedurende de studieperiode, ruwweg het equivalent van acht therapiesessies, en ongeveer driekwart kreeg op dat moment geen andere geestelijke gezondheidszorg. Opmerkelijk is dat ze hun vertrouwen in de software beoordeelden op een niveau dat dicht ligt bij wat patiënten doorgaans rapporteren over een menselijke therapeut.
We hadden niet verwacht dat mensen de software bijna als een vriend zouden behandelen. Het zegt mij dat ze werkelijk relaties met Therabot aan het vormen waren.
Nicholas Jacobson, Dartmouth (hoofdonderzoeker Therabot)
Dat niveau van betrokkenheid is ongebruikelijk voor een zelfgestuurde digitale tool, waar uitval doorgaans het grootste obstakel is voor enig meetbaar effect.
Wat de meta-analyses zeggen over duizenden mensen
Eén studie, hoe goed opgezet ook, is niet genoeg om een veldbreed patroon vast te stellen. Daar zijn meta-analyses voor, en over AI-therapiechatbots dekken ze nu een steekproef die groot genoeg is om iets met vertrouwen te kunnen zeggen.
Klein tot matig, maar consistent. Een meta-analyse uit 2025 gericht op adolescenten en jongvolwassenen, die 31 gerandomiseerde gecontroleerde studies en 29.637 deelnemers in 18 landen samenvoegde, vond gestandaardiseerde gemiddelde verschillen van −0,43 voor depressie, −0,37 voor angst en −0,35 voor algehele psychische stress. Dat zijn bescheiden effectgroottes volgens gangbare klinische maatstaven, maar ze waren statistisch robuust over een steekproef die groot genoeg was om toeval als verklaring uit te sluiten. Omdat de onderzoekspopulatie jonger uitviel (leeftijd 15–39), spreken deze specifieke cijfers het meest direct tot die leeftijdsgroep en niet tot volwassenen in het algemeen.

Het effect is het sterkst op korte termijn. Een aparte meta-analyse van kortere interventies vond hetzelfde patroon: significante maar kleine verbeteringen geconcentreerd in de eerste vier tot acht weken van gebruik, wat nauw aansluit bij het venster van de Therabot-studie zelf. Voorbij dat punt worden de data over de vraag of het voordeel standhoudt merkbaar dunner.
| Uitkomstmaat | Gestandaardiseerde effectgrootte (SMD) | Interpretatie |
|---|---|---|
| Depressie | −0.43 | Klein tot matig |
| Angst | −0.37 | Klein tot matig |
| Algemene psychische stress | −0.35 | Klein |
| Ervaren stress | −0.41 | Klein tot matig |
Die cijfers komen uit een gepoolde analyse van 31 RCT’s, niet uit de marketingclaims van één product, en daarom behandelen onderzoekers ze als het dichtste dat er momenteel is bij een veldbreed antwoord.
Niet alle “AI-therapeuten” zijn gelijk: speciaal ontworpen versus generiek
Het woord “AI-therapeut” wordt toegepast op twee heel verschillende categorieën software, en het bewijs ondersteunt slechts één daarvan.
Waar het bewijs zich werkelijk bevindt
Elke studie die tot nu toe is besproken, testte een tool die speciaal is ontworpen voor geestelijke gezondheid en gebaseerd is op CGT — Therabot, en in eerder onderzoek Woebot en Wysa. Deze producten zijn vanaf de grond af ontworpen rond klinische protocollen, getest in gecontroleerde studies en verbeterd op basis van uitkomstgegevens. Die bewijsbasis strekt zich niet uit tot grote taalmodellen voor algemeen gebruik zoals ChatGPT, die niet in gerandomiseerde klinische studies zijn gevalideerd voor therapeutisch gebruik.
- Therabot — speciaal ontworpen CGT-chatbot, getest in een RCT met 210 deelnemers (NEJM AI, 2025)
- Woebot — eerdere op CGT gebaseerde chatbot met gepubliceerd pilot- en RCT-bewijs
- Wysa — op CGT geïnformeerde chatbot met gepubliceerde effectiviteitsstudies
- Generieke LLM-chatbots (bijv. ChatGPT) — geen klinische studies die therapeutisch gebruik valideren
Waarom het onderscheid ertoe doet
De American Psychological Association heeft gewaarschuwd dat generieke AI-chatbots die als vervanging voor therapie worden gebruikt echte risico’s kunnen opleveren, juist omdat ze de klinische waarborgen en validatie missen waar speciaal ontworpen tools omheen zijn gebouwd. De positieve studieresultaten die in dit artikel worden besproken behoren tot een nauwe categorie gestructureerde, klinisch ontworpen producten — niet tot elke willekeurige chatbot waarmee iemand toevallig praat.
| Kenmerk | Speciaal ontworpen CGT-chatbot (bijv. Therabot) | Generieke LLM-chatbot (bijv. ChatGPT) |
|---|---|---|
| Getraind op CGT-protocollen | Ja | Nee |
| Getest in een gerandomiseerde gecontroleerde studie | Ja (Therabot: NEJM AI, 2025) | Nee |
| Door APA gemarkeerd klinisch risico | Lager, maar nog steeds onder toezicht | Hoger — expliciet gemarkeerd |
| Beoogd gebruik | Ondersteuning geestelijke gezondheid | Conversatie voor algemeen gebruik |
De eerlijke beperkingen van het bewijs
Elk cijfer hierboven komt uit echte studies, maar de onderzoekers achter die studies zijn openhartig over hoe ver de data werkelijk reiken — en het is de moeite waard dat voor waar aan te nemen in plaats van eroverheen te lezen.

Dit is wat de bewijsbasis vandaag beperkt:
- De meeste opgenomen studies dragen een hoog risico op vertekening in hun ontwerp of rapportage.
- De algehele bewijskwaliteit wordt beoordeeld als zeer laag tot laag met behulp van het GRADE-kader, een standaard die onderzoekers gebruiken om zekerheid te beoordelen.
- Zeventien van de 31 studies in de grootste meta-analyse hadden uitvalpercentages boven de 20%, wat betekent dat een aanzienlijk deel van de deelnemers vóór voltooiing afhaakte.
- Slechts 15 van de 31 studies verzamelden überhaupt follow-updata, wat niet genoeg is om te bevestigen of de voordelen aanhouden nadat de studie eindigt.
- Slechts drie studies in de gehele meta-analyse testten specifiek generatieve AI, in tegenstelling tot oudere, op regels gebaseerde chatbots — dus voor de nieuwste generatie tools blijft de effectiviteit op schaal, in de eigen woorden van de onderzoekers, onbekend.
Zelfs de auteurs van Therabot, wiens studie de sterkste resultaten in het veld tot nu toe opleverde, concludeerden dat geen enkele generatieve AI-agent klaar is om volledig autonoom te opereren in de geestelijke gezondheidszorg, en dat nauw toezicht door behandelaars essentieel blijft voor een veilige inzet.
Dus kan een AI-psycholoog uw therapeut vervangen?
Gezien al het bovenstaande ondersteunt het bewijs een specifieke, begrensde rol voor een AI-psycholoog — geen algemeen ja of nee.
Een realistische rol voor het bewijs
De data die vandaag beschikbaar zijn ondersteunen een AI-psycholoog als een goedkope, toegankelijke eerste stap of een aanvulling op zorg — werkelijk nuttig bij milde tot matige depressie- en angstsymptomen, voor het oefenen van coping-vaardigheden tussen echte sessies, en voor mensen die te maken hebben met lange wachtlijsten of kostenbarrières voor menselijke therapie. Het ondersteunt niet het behandelen van een AI-psycholoog als vervanging voor een bevoegde behandelaar, en het ondersteunt expliciet niet het vertrouwen op een AI-psycholoog voor diagnose, medicatiebeheer, traumabehandeling of crisiszorg.

Wat het bewijs ondersteunt:
- Een goedkope, toegankelijke eerste stap bij milde tot matige depressie of angst
- Een aanvulling voor het oefenen van coping-vaardigheden tussen echte therapiesessies
- Een noodoplossing voor mensen die te maken hebben met lange wachtlijsten of kostenbarrières voor menselijke zorg
Wat het bewijs niet ondersteunt:
- Diagnose van een psychische aandoening
- Medicatiebeheer
- Traumabehandeling
- Crisis- of spoedzorg
Iedereen die overweegt er een te proberen kan dezelfde vragen doorlopen die het onderzoek zelf oproept:
- Zijn uw symptomen mild tot matig, in plaats van ernstig of complex?
- Is de tool die u overweegt speciaal ontworpen voor geestelijke gezondheid (zoals Therabot, Woebot of Wysa), of een generieke chatbot?
- Heeft u toegang tot een bevoegde behandelaar voor diagnose of medicatie indien nodig?
- Gebruikt u het als aanvulling op therapie, of als volledige vervanging ervan?
- Kent u uw lokale crisisbronnen (988, 741741, 911) voordat u ze nodig heeft?
- Houdt u bij of uw symptomen daadwerkelijk verbeteren over een paar weken, in plaats van aan te nemen dat dat zo is?
