Bir Yapay Zeka Psikoloğu Gerçekten İşe Yarıyor mu? Yapay Zeka Terapi Sohbet Botlarına İlişkin Kanıtlar

Şüphecilerin, bir yapay zeka psikoloğunun ölçülebilir bir şey yapıp yapmadığını, yoksa yalnızca destekleyici mi göründüğünü sorması yerindedir. Dürüst, kanıta dayalı yanıt şudur: evet, gerçek sınırlarla birlikte. Üretken bir yapay zeka terapi sohbet botunun Mart 2025’te NEJM AI‘da yayımlanan ilk randomize kontrollü çalışması ve on binlerce katılımcıyı kapsayan bir dizi meta-analiz, her ikisi de depresyon ve anksiyete için ölçülebilir, küçük-orta düzeyde faydalara işaret ediyor. Aşağıda araştırmaların gerçekte ne söylediği yer alıyor — kanıtların güçlü olduğu yerler, zayıf olduğu yerler ve kimler için geçerli olmadığı dahil.

A person in a calm session with a psychologist reviewing an outcome chart
Kanıtlar gerçek ama mütevazı faydalara işaret ediyor — bir yapay zeka psikoloğu, bir tedavi olarak değil, ölçülü bir ilk adım olarak en iyi şekilde işe yarar.

Bu ne bir abartı ne de bir küçümseme. Bu, dönüm noktası niteliğindeki Dartmouth Therabot randomize çalışmasına, 18 ülkedeki on binlerce katılımcıyı kapsayan meta-analizlere ve kanıt tabanının hâlâ zayıf olduğu belirli yerlere bir bakış.

Bu makale yayımlanmış araştırmaları inceler ve tıbbi tavsiye değildir. Bir yapay zeka psikoloğu lisanslı bir klinisyenin yerini almaz. ABD’de kriz halindeyseniz, 988’i (İntihar ve Kriz Yardım Hattı) arayın ya da mesaj gönderin veya HOME yazıp 741741’e mesaj gönderin. Ani tehlike için 911’i arayın.

Kısa yanıt: ölçülebilir faydalar, sınırlarla birlikte

Bu çalışmalar bağlamında “işe yaramak”, dar ve test edilebilir bir anlama sahiptir — ve herhangi bir sayıya bakmadan önce bunu tanımlamakta fayda var. Bu anlam netleştiğinde, kanıtların biçimi bir pazarlama gibi görünmeyi bırakır ve normal, kusurlu bir klinik araştırma tabanı gibi görünmeye başlar.

“İşe yaramak” burada gerçekte ne anlama geliyor

Bu araştırmada “işe yaramak”, belirli bir çalışma penceresi boyunca — çoğunlukla 4 ila 8 hafta — bir kontrol grubuna kıyasla belirtilerde istatistiksel olarak anlamlı bir azalma anlamına gelir. Bir tedavi anlamına gelmez ve yıllarca süren psikoterapiye denk olma anlamına gelmez. Etki gerçek ama mütevazıdır ve şimdiye kadar genel amaçlı sohbet botlarından ziyade özel olarak geliştirilmiş bilişsel davranışçı terapi (CBT) araçlarında yoğunlaşmıştır.

Bu ayrım, bu makaledeki tek bir yüzdeden daha önemlidir. Randomize kontrollü çalışma (RCT), araştırmacıların en çok güvendiği tasarımdır çünkü bir yapay zeka terapi sohbet botunu gerçek bir kontrol grubuyla karşılaştırır ve aracın etkisini plasebo, zaman ya da yalnızca ilgiden ayırır.

Yanıt neden “evet, ama”

En iyi tek veri kümesi — Dartmouth’un Therabot çalışması — depresyon ve anksiyete belirtilerinde anlamlı bir azalma gösteriyor. Onlarca çalışmayı bir araya getiren daha geniş meta-analizler, aykırı bir sonuç yerine küçük-orta düzeyde bir etkiyi doğruluyor. Ancak bunların neredeyse tamamı için üç kısıt geçerli: faydanın kalıcı olduğunu kanıtlamak için gereken takip verileri yetersiz, temeldeki çalışmalarda yanlılık riski genellikle yüksek ve en güçlü kanıtlar genel sohbet botlarına değil, özel olarak geliştirilmiş araçların dar bir kategorisine ait.

Dönüm noktası çalışma: Dartmouth’un Therabot denemesi

Üretken bir yapay zeka terapi sohbet botunun klinik belirtileri değiştirip değiştiremeyeceği hakkında bilinenlerin çoğu tek bir çalışmadan geliyor, bu yüzden neyi gerçekten test edip bulduğunu adım adım incelemekte fayda var.

Çalışma neyi buldu

Üretken bir yapay zeka terapi sohbet botunun ilk randomize kontrollü çalışması Mart 2025’te NEJM AI’da yayımlandı. Dartmouth‘taki araştırmacılar, majör depresif bozukluğu, yaygın anksiyete bozukluğu ya da beslenme ve yeme bozuklukları için klinik olarak yüksek riski olan 210 yetişkini kaydetti; 106’sını Therabot’a ve 104’ünü bekleme listesi kontrol grubuna randomize etti. Dört ve sekiz haftanın ardından tedavi grubunun depresyon belirtileri %51, anksiyete belirtileri %31 ve yeme bozukluğuyla ilişkili beden imajı endişeleri %19 azaldı — çalışma yazarlarının ayakta tedavi terapisinde tipik olarak görülenle karşılaştırılabilir olarak tanımladığı azalmalar.

Bar chart of Therabot trial symptom reductions over 8 weeks: depression 51%, anxiety 31%, eating-disorder concerns 19%
Dartmouth Therabot çalışmasında, depresyon belirtileri sekiz hafta içinde %51, anksiyete %31 ve yeme bozukluğu endişeleri %19 azaldı.

Therabot’un kendisi genel amaçlı bir sohbet botu değildir; özel olarak CBT en iyi uygulamaları ve klinik diyalog kalıpları üzerine eğitildi ve sonuçlarının diğer yapay zeka araçlarına otomatik olarak aktarılmamasının önemli bir nedeni de budur.

Terapötik ittifak sürprizi

Katılımcılar çalışma dönemi boyunca Therabot’u yaklaşık altı saat, yani kabaca sekiz terapi seansına denk gelecek şekilde kullandı ve yaklaşık dörtte üçü o sırada başka herhangi bir ruh sağlığı tedavisi almıyordu. Dikkat çekici biçimde, yazılıma duydukları güveni, hastaların tipik olarak bir insan terapiste bildirdiğine yakın olarak değerlendirdiler.

İnsanların yazılıma neredeyse bir arkadaş gibi davranmasını beklemiyorduk. Bu bana, Therabot ile gerçekten ilişki kurduklarını gösteriyor. — Nicholas Jacobson, Dartmouth (Therabot baş araştırmacısı)

Bu düzeyde bir etkileşim, terkin herhangi bir ölçülebilir etkinin önündeki en büyük engel olduğu, kendi kendine yönlendirilen bir dijital araç için alışılmadıktır.

Meta-analizler binlerce insan genelinde ne söylüyor

Tek bir çalışma, ne kadar iyi tasarlanmış olursa olsun, alan çapında bir örüntü belirlemek için yeterli değildir. Meta-analizler bunun içindir ve yapay zeka terapi sohbet botları konusunda artık güvenle bir şey söyleyecek kadar büyük bir örneklemi kapsıyorlar.

Küçük-orta düzeyde, ama tutarlı. 2025’te ergenlere ve genç yetişkinlere odaklanan, 18 ülkedeki 31 randomize kontrollü çalışmayı ve 29.637 katılımcıyı bir araya getiren bir meta-analiz, depresyon için −0,43, anksiyete için −0,37 ve genel psikolojik sıkıntı için −0,35 standartlaştırılmış ortalama farklar buldu. Bunlar geleneksel klinik ölçütlere göre mütevazı etki büyüklükleridir, ancak açıklamayı şansa bağlamayı dışlayacak kadar büyük bir örneklemde istatistiksel olarak sağlamdılar. Çalışma popülasyonu daha genç bir yaşa (15–39 yaş) kaydığından, bu belirli sayılar geniş anlamda yetişkinlerden ziyade doğrudan bu yaş grubuna hitap ediyor.

Infographic: 31 randomized trials, 29,637 participants, 18 countries, showing a small-to-moderate effect
18 ülkedeki 31 randomize çalışma ve 29.637 katılımcı bir araya getirildiğinde, etki gerçek ama küçük-orta düzeydedir — bir tedavi değil.

Etki kısa vadede en güçlüdür. Daha kısa müdahalelere ilişkin ayrı bir meta-analiz aynı örüntüyü buldu: kullanımın ilk dört ila sekiz haftasında yoğunlaşan anlamlı ama küçük iyileşmeler, Therabot çalışmasının kendi penceresiyle yakından örtüşüyor. Bu noktanın ötesinde, faydanın kalıcı olup olmadığına ilişkin veriler belirgin biçimde zayıflıyor.

Sonuç ölçütüStandartlaştırılmış etki büyüklüğü (SMD)Yorum
Depresyon−0,43Küçük-orta
Anksiyete−0,37Küçük-orta
Genel psikolojik sıkıntı−0,35Küçük
Algılanan stres−0,41Küçük-orta

Bu sayılar, tek bir ürünün pazarlama iddialarından değil, 31 RCT’nin bir araya getirildiği bir analizden geliyor; araştırmacıların bunları şu anda mevcut olan alan çapında bir yanıta en yakın şey olarak görmesinin nedeni de budur.

Tüm “yapay zeka terapistleri” eşit değil: özel geliştirilmiş vs genel amaçlı

“Yapay zeka terapisti” ifadesi, çok farklı iki yazılım kategorisine uygulanıyor ve kanıtlar bunlardan yalnızca birini destekliyor.

Kanıtların gerçekte olduğu yer

Şimdiye kadar tartışılan her çalışma, ruh sağlığı için özel olarak geliştirilmiş ve CBT temelli bir aracı test etti — Therabot ve daha önceki araştırmalarda Woebot ve Wysa. Bu ürünler, klinik protokoller etrafında sıfırdan tasarlandı, kontrollü çalışmalarda test edildi ve sonuç verilerine dayanarak yinelendi. Bu kanıt tabanı, terapötik kullanım için randomize klinik çalışmalarda doğrulanmamış olan ChatGPT gibi genel amaçlı büyük dil modellerini kapsamaz.

  • Therabot — özel geliştirilmiş CBT sohbet botu, 210 katılımcılı bir RCT’de test edildi (NEJM AI, 2025)
  • Woebot — yayımlanmış pilot ve RCT kanıtları olan, daha önceki CBT temelli sohbet botu
  • Wysa — yayımlanmış etkililik çalışmaları olan, CBT bilgisine dayalı sohbet botu
  • Genel amaçlı LLM sohbet botları (örn. ChatGPT) — terapötik kullanımı doğrulayan klinik çalışma yok

Ayrım neden önemli

Amerikan Psikoloji Derneği, terapi yerine kullanılan genel amaçlı yapay zeka sohbet botlarının gerçek riskler oluşturabileceği konusunda uyardı; tam da özel geliştirilmiş araçların etrafında tasarlandığı klinik güvenlik önlemlerinden ve doğrulamadan yoksun oldukları için. Bu makalede tartışılan olumlu çalışma sonuçları, dar bir yapılandırılmış, klinik olarak tasarlanmış ürünler kategorisine aittir — bir kişinin konuştuğu herhangi bir sohbet botuna değil.

ÖzellikÖzel geliştirilmiş CBT sohbet botu (örn. Therabot)Genel amaçlı LLM sohbet botu (örn. ChatGPT)
CBT protokolleri üzerine eğitildiEvetHayır
Randomize kontrollü çalışmada test edildiEvet (Therabot: NEJM AI, 2025)Hayır
APA tarafından işaretlenen klinik riskDaha düşük, ama yine de denetimliDaha yüksek — açıkça işaretlendi
Amaçlanan kullanımRuh sağlığı desteğiGenel amaçlı konuşma

Kanıtların dürüst sınırlamaları

Yukarıdaki her rakam gerçek çalışmalardan geliyor, ancak bu çalışmaların arkasındaki araştırmacılar, verilerin gerçekte ne kadar ileriye uzandığı konusunda açık sözlü — ve bunu göz ardı etmek yerine olduğu gibi kabul etmekte fayda var.

Comparison: purpose-built CBT chatbot tested in trials versus generic chatbot with no clinical validation
Kanıtlar, klinik doğrulaması olmayan genel amaçlı sohbet botlarını değil, özel geliştirilmiş, çalışmalarla test edilmiş CBT araçlarını destekliyor.

Kanıt tabanını bugün sınırlayan şeyler şunlar:

  1. Dahil edilen çalışmaların çoğu, tasarımlarında ya da raporlamalarında yüksek yanlılık riski taşıyor.
  2. Genel kanıt kalitesi, araştırmacıların kesinliği derecelendirmek için kullandığı standart bir çerçeve olan GRADE kullanılarak çok düşük ile düşük arasında derecelendiriliyor.
  3. En büyük meta-analizdeki 31 çalışmanın on yedisinde terk oranları %20’nin üzerindeydi; bu, katılımcıların önemli bir kısmının tamamlamadan önce ayrıldığı anlamına geliyor.
  4. 31 çalışmanın yalnızca 15’i herhangi bir takip verisi topladı; bu da faydaların çalışma sona erdikten sonra sürdürülüp sürdürülmediğini doğrulamak için yeterli değil.
  5. Tüm meta-analizde yalnızca üç çalışma, daha eski kural tabanlı sohbet botlarının aksine özellikle üretken yapay zekayı test etti — dolayısıyla en yeni nesil araçlar için ölçekte etkililik, araştırmacıların kendi ifadesiyle, bilinmiyor.

Alanda şimdiye kadarki en güçlü sonuçları üreten Therabot yazarları bile, hiçbir üretken yapay zeka aracısının ruh sağlığı bakımında tam özerk olarak çalışmaya hazır olmadığı ve güvenli bir dağıtım için yakın klinisyen gözetiminin elzem kaldığı sonucuna vardı.

Peki bir yapay zeka psikoloğu terapistinizin yerini alabilir mi?

Yukarıdaki her şey göz önüne alındığında, kanıtlar bir yapay zeka psikoloğu için belirli, sınırlı bir rolü destekliyor — kesin bir evet ya da hayır değil.

Kanıtlar için gerçekçi bir rol

Bugün mevcut olan veriler, bir yapay zeka psikoloğunu düşük maliyetli, erişilebilir bir ilk adım ya da bakıma bir tamamlayıcı olarak destekliyor — hafif-orta düzey depresyon ve anksiyete belirtileri için, gerçek seanslar arasında başa çıkma becerilerini uygulamak için ve insan terapisine uzun bekleme listeleri ya da maliyet engelleriyle karşı karşıya olan kişiler için gerçekten yararlı. Bir yapay zeka psikoloğunu lisanslı bir klinisyenin yerine koymayı desteklemiyor ve tanı, ilaç yönetimi, travma tedavisi ya da kriz bakımı için ona güvenmeyi açıkça desteklemiyor.

Good fit versus not a fit checklist for using an AI psychologist
Hafif-orta düzey belirtiler ve seanslar arası destek için uygun — tanı, ilaç, travma ya da kriz için değil.

Kanıtların desteklediği şeyler:

  • Hafif-orta düzey depresyon ya da anksiyete için düşük maliyetli, erişilebilir bir ilk adım
  • Gerçek terapi seansları arasında başa çıkma becerilerini uygulamak için bir tamamlayıcı
  • İnsan bakımına uzun bekleme listeleri ya da maliyet engelleriyle karşı karşıya olan kişiler için bir geçici çözüm

Kanıtların desteklemediği şeyler:

  • Bir ruh sağlığı durumunun tanısı
  • İlaç yönetimi
  • Travma tedavisi
  • Kriz ya da acil durum bakımı

Bir tane denemeyi düşünen herkes, araştırmanın kendisinin gündeme getirdiği aynı soruları gözden geçirebilir:

  1. Belirtileriniz şiddetli ya da karmaşık değil de hafif-orta düzeyde mi?
  2. Düşündüğünüz araç ruh sağlığı için özel olarak mı geliştirilmiş (Therabot, Woebot ya da Wysa gibi), yoksa genel amaçlı bir sohbet botu mu?
  3. Gerekirse tanı ya da ilaç için lisanslı bir klinisyene erişiminiz var mı?
  4. Onu terapiyi tamamlamak için mi, yoksa terapinin tam bir ikamesi olarak mı kullanıyorsunuz?
  5. İhtiyaç duymadan önce yerel kriz kaynaklarınızı (988, 741741, 911) biliyor musunuz?
  6. Belirtilerinizin gerçekten iyileşip iyileşmediğini birkaç hafta boyunca, iyileştiklerini varsaymak yerine, takip ediyor musunuz?

Sıkça Sorulan Sorular

keyboard_arrow_up