Adakah Ahli Psikologi AI Benar-benar Berkesan? Bukti tentang Chatbot Terapi AI

Golongan skeptik berhak bertanya sama ada seorang ahli psikologi AI melakukan sesuatu yang boleh diukur, atau ia hanya berbunyi menyokong. Jawapan yang jujur dan berasaskan bukti ialah ya, dengan had yang sebenar: percubaan terkawal rawak pertama bagi chatbot terapi AI generatif, yang diterbitkan dalam NEJM AI pada Mac 2025, serta beberapa siri meta-analisis yang meliputi puluhan ribu peserta, kedua-duanya menunjukkan manfaat kecil hingga sederhana yang boleh diukur bagi kemurungan dan keresahan. Di bawah ini ialah apa yang sebenarnya diperkatakan oleh penyelidikan — termasuk di mana buktinya kukuh, di mana ia tipis, dan kepada siapa ia tidak terpakai.

Seseorang dalam sesi yang tenang bersama ahli psikologi sambil menyemak carta hasil
Bukti menunjukkan manfaat yang nyata tetapi sederhana — seorang ahli psikologi AI paling berkesan sebagai langkah pertama yang berhati-hati, bukan penawar.

Ini bukan gembar-gembur mahupun penolakan. Ini ialah tinjauan tentang percubaan rawak Therabot Dartmouth yang penting itu, meta-analisis yang merangkumi puluhan ribu peserta di 18 buah negara, serta tempat-tempat khusus di mana asas bukti masih tipis.

Artikel ini mengulas penyelidikan yang telah diterbitkan dan bukan nasihat perubatan. Seorang ahli psikologi AI tidak menggantikan pakar klinikal berlesen. Jika anda berada dalam krisis di A.S., hubungi atau hantar teks ke 988 (Suicide and Crisis Lifeline) atau hantar teks HOME ke 741741. Hubungi 911 untuk bahaya serta-merta.

Jawapan ringkas: manfaat yang boleh diukur, dengan had

“Berkesan,” dalam konteks percubaan-percubaan ini, mempunyai makna yang sempit dan boleh diuji — dan ia patut ditakrifkan sebelum melihat sebarang angka. Sebaik sahaja maknanya jelas, bentuk bukti itu berhenti kelihatan seperti pemasaran dan mula kelihatan seperti asas penyelidikan klinikal yang biasa dan tidak sempurna.

Apa yang “berkesan” sebenarnya bermaksud di sini

Dalam penyelidikan ini, “berkesan” bermaksud pengurangan simptom yang signifikan secara statistik berbanding kumpulan kawalan, diukur dalam tempoh percubaan yang ditetapkan — kebanyakannya 4 hingga 8 minggu. Ia tidak bermaksud penawar, dan ia tidak bermaksud setara dengan bertahun-tahun psikoterapi. Kesannya nyata tetapi sederhana, dan setakat ini ia tertumpu pada alat terapi tingkah laku kognitif (CBT) yang dibina khusus, bukannya chatbot serba guna.

Perbezaan itu lebih penting daripada mana-mana peratusan tunggal dalam artikel ini. Percubaan terkawal rawak (RCT) ialah reka bentuk yang paling dipercayai oleh penyelidik kerana ia membandingkan chatbot terapi AI dengan kumpulan kawalan yang tulen, mengasingkan kesan alat itu daripada plasebo, masa, atau perhatian semata-mata.

Kenapa jawapannya “ya, tetapi”

Set data tunggal yang terbaik — percubaan Therabot Dartmouth — menunjukkan pengurangan bermakna dalam simptom kemurungan dan keresahan. Meta-analisis yang lebih luas, yang menggabungkan berpuluh-puluh percubaan, mengesahkan kesan kecil hingga sederhana dan bukannya hasil terpencil. Namun tiga syarat terpakai kepada hampir keseluruhannya: data susulan yang diperlukan untuk membuktikan manfaat itu berkekalan adalah tipis, risiko bias dalam kajian asas selalunya tinggi, dan bukti terkukuh adalah milik kategori sempit alat yang dibina khusus, bukan chatbot secara umum.

Kajian penting: percubaan Therabot Dartmouth

Kebanyakan daripada apa yang diketahui tentang sama ada chatbot terapi AI generatif boleh menggerakkan simptom klinikal datang daripada satu percubaan, jadi ia berbaloi untuk diteliti tentang apa yang sebenarnya diuji dan ditemuinya.

Apa yang ditemui oleh percubaan itu

Percubaan terkawal rawak pertama bagi chatbot terapi AI generatif muncul dalam NEJM AI pada Mac 2025. Penyelidik di Dartmouth mendaftarkan 210 orang dewasa dengan gangguan kemurungan major, gangguan keresahan menyeluruh, atau risiko tinggi secara klinikal bagi gangguan pemakanan, dengan merawakkan 106 kepada Therabot dan 104 kepada kumpulan kawalan senarai menunggu. Selepas empat dan lapan minggu, simptom kemurungan kumpulan rawatan menurun 51%, simptom keresahan menurun 31%, dan kebimbangan imej badan yang berkaitan dengan gangguan pemakanan menurun 19% — pengurangan yang digambarkan oleh penulis kajian sebagai setanding dengan apa yang biasanya dilihat dalam terapi pesakit luar.

Carta bar pengurangan simptom percubaan Therabot dalam tempoh 8 minggu: kemurungan 51%, keresahan 31%, kebimbangan gangguan pemakanan 19%
Dalam percubaan Therabot Dartmouth, simptom kemurungan menurun 51%, keresahan 31%, dan kebimbangan gangguan pemakanan 19% dalam tempoh lapan minggu.

Therabot itu sendiri bukanlah chatbot serba guna; ia dilatih secara khusus berdasarkan amalan terbaik CBT dan corak dialog klinikal, yang merupakan sebahagian besar sebab hasilnya tidak secara automatik dipindahkan kepada alat AI yang lain.

Kejutan pakatan terapeutik

Peserta menggunakan Therabot selama kira-kira enam jam sepanjang tempoh percubaan, kira-kira setara dengan lapan sesi terapi, dan lebih kurang tiga suku daripada mereka tidak menerima sebarang rawatan kesihatan mental lain pada masa itu. Yang ketaranya, mereka menilai kepercayaan mereka terhadap perisian itu hampir dengan apa yang biasanya dilaporkan pesakit terhadap ahli terapi manusia.

Kami tidak menjangka bahawa orang ramai hampir memperlakukan perisian itu seperti seorang kawan. Ia memberitahu saya bahawa mereka sebenarnya sedang membentuk hubungan dengan Therabot.

Nicholas Jacobson, Dartmouth (ketua penyelidik Therabot)

Tahap penglibatan itu luar biasa bagi alat digital yang dipandu sendiri, di mana keciciran biasanya menjadi halangan terbesar kepada sebarang kesan yang boleh diukur.

Apa yang diperkatakan oleh meta-analisis merentasi ribuan orang

Satu percubaan, walau bagaimana baik pun ia direka, tidak mencukupi untuk menetapkan corak seluruh bidang. Itulah tujuan meta-analisis, dan bagi chatbot terapi AI, ia kini merangkumi sampel yang cukup besar untuk mengatakan sesuatu dengan yakin.

Kecil hingga sederhana, tetapi konsisten. Satu meta-analisis 2025 yang tertumpu pada remaja dan dewasa muda, yang menggabungkan 31 percubaan terkawal rawak dan 29,637 peserta di 18 buah negara, mendapati perbezaan min terpiawai sebanyak −0.43 bagi kemurungan, −0.37 bagi keresahan, dan −0.35 bagi tekanan psikologi keseluruhan. Itu ialah saiz kesan yang sederhana mengikut penanda aras klinikal konvensional, tetapi ia mantap secara statistik merentasi sampel yang cukup besar untuk menolak faktor kebetulan sebagai penjelasannya. Oleh sebab populasi kajian condong lebih muda (berumur 15–39), angka-angka khusus ini bercakap paling langsung tentang kumpulan umur itu berbanding orang dewasa secara umum.

Infografik: 31 percubaan rawak, 29,637 peserta, 18 buah negara, menunjukkan kesan kecil hingga sederhana
Dengan menggabungkan 31 percubaan rawak dan 29,637 peserta di 18 buah negara, kesannya nyata tetapi kecil hingga sederhana — bukan penawar.

Kesannya paling kuat dalam jangka pendek. Satu meta-analisis berasingan bagi intervensi yang lebih pendek mendapati corak yang sama: penambahbaikan yang signifikan tetapi kecil, tertumpu dalam empat hingga lapan minggu pertama penggunaan, hampir sepadan dengan tempoh percubaan Therabot itu sendiri. Selepas titik itu, data tentang sama ada manfaat itu berkekalan menjadi jauh lebih tipis.

Ukuran hasilSaiz kesan terpiawai (SMD)Tafsiran
Kemurungan−0.43Kecil hingga sederhana
Keresahan−0.37Kecil hingga sederhana
Tekanan psikologi umum−0.35Kecil
Tekanan yang dirasai−0.41Kecil hingga sederhana

Angka-angka itu datang daripada analisis gabungan 31 RCT, bukan tuntutan pemasaran satu produk, itulah sebabnya penyelidik menganggapnya sebagai perkara paling hampir dengan jawapan seluruh bidang yang tersedia pada masa ini.

Bukan semua “ahli terapi AI” adalah setara: dibina khusus vs generik

Perkataan “ahli terapi AI” digunakan bagi dua kategori perisian yang sangat berbeza, dan bukti hanya menyokong salah satu daripadanya.

Di mana buktinya sebenarnya berada

Setiap percubaan yang dibincangkan setakat ini menguji alat yang dibina khusus untuk kesihatan mental dan berlandaskan CBT — Therabot, dan dalam penyelidikan terdahulu, Woebot dan Wysa. Produk-produk ini direka dari asas berpaksikan protokol klinikal, diuji dalam kajian terkawal, dan diperhalusi berdasarkan data hasil. Asas bukti itu tidak melangkau ke model bahasa besar serba guna seperti ChatGPT, yang belum disahkan dalam percubaan klinikal rawak untuk kegunaan terapeutik.

  • Therabot — chatbot CBT yang dibina khusus, diuji dalam RCT dengan 210 peserta (NEJM AI, 2025)
  • Woebot — chatbot berasaskan CBT terdahulu dengan bukti perintis dan RCT yang telah diterbitkan
  • Wysa — chatbot berlandaskan CBT dengan kajian keberkesanan yang telah diterbitkan
  • Chatbot LLM generik (cth., ChatGPT) — tiada percubaan klinikal yang mengesahkan kegunaan terapeutik

Kenapa perbezaan ini penting

American Psychological Association telah memberi amaran bahawa chatbot AI generik yang digunakan sebagai pengganti terapi boleh menimbulkan risiko yang sebenar, tepat kerana ia tidak mempunyai pagar pelindung klinikal dan pengesahan yang menjadi asas reka bentuk alat yang dibina khusus. Hasil percubaan positif yang dibincangkan dalam artikel ini adalah milik kategori sempit produk yang berstruktur dan direka secara klinikal — bukan mana-mana chatbot yang kebetulan sedang berbual dengan seseorang.

CiriChatbot CBT yang dibina khusus (cth., Therabot)Chatbot LLM generik (cth., ChatGPT)
Dilatih berdasarkan protokol CBTYaTidak
Diuji dalam percubaan terkawal rawakYa (Therabot: NEJM AI, 2025)Tidak
Risiko klinikal ditandakan APALebih rendah, tetapi tetap diseliaLebih tinggi — ditandakan secara jelas
Kegunaan yang dimaksudkanSokongan kesihatan mentalPerbualan serba guna

Had bukti yang jujur

Setiap angka di atas datang daripada percubaan yang sebenar, tetapi penyelidik di sebalik percubaan tersebut berterus terang tentang sejauh mana data itu benar-benar boleh diregangkan — dan ia patut diterima seadanya dan bukannya dibaca melampauinya.

Perbandingan: chatbot CBT yang dibina khusus diuji dalam percubaan berbanding chatbot generik tanpa pengesahan klinikal
Bukti menyokong alat CBT yang dibina khusus dan diuji dalam percubaan — bukan chatbot generik, yang tiada pengesahan klinikal.

Berikut ialah apa yang mengehadkan asas bukti hari ini:

  1. Kebanyakan kajian yang disertakan membawa risiko bias yang tinggi dalam reka bentuk atau pelaporannya.
  2. Kualiti bukti keseluruhan digredkan sangat rendah hingga rendah menggunakan rangka kerja GRADE, satu piawaian yang digunakan penyelidik untuk menilai kepastian.
  3. Tujuh belas daripada 31 kajian dalam meta-analisis terbesar mempunyai kadar keciciran melebihi 20%, bermakna sebahagian besar peserta tercicir sebelum tamat.
  4. Hanya 15 daripada 31 kajian mengumpulkan sebarang data susulan langsung, yang tidak mencukupi untuk mengesahkan sama ada manfaat itu berkekalan selepas percubaan berakhir.
  5. Hanya tiga kajian dalam keseluruhan meta-analisis menguji AI generatif secara khusus, berbanding chatbot berasaskan peraturan yang lebih lama — jadi bagi generasi alat terbaharu, keberkesanan pada skala besar masih, dalam kata-kata penyelidik sendiri, tidak diketahui.

Malah penulis Therabot, yang percubaannya menghasilkan keputusan terkukuh dalam bidang ini setakat ini, menyimpulkan bahawa tiada ejen AI generatif yang bersedia untuk beroperasi sepenuhnya secara autonomi dalam penjagaan kesihatan mental, dan bahawa pengawasan rapat oleh pakar klinikal kekal penting untuk penggunaan yang selamat.

Jadi bolehkah seorang ahli psikologi AI menggantikan ahli terapi anda?

Berdasarkan semua yang di atas, bukti menyokong peranan yang khusus dan terbatas bagi seorang ahli psikologi AI — bukan ya atau tidak secara pukal.

Peranan realistik bagi bukti tersebut

Data yang tersedia hari ini menyokong seorang ahli psikologi AI sebagai langkah pertama yang murah dan mudah diakses atau sebagai pelengkap kepada penjagaan — benar-benar berguna bagi simptom kemurungan dan keresahan yang ringan hingga sederhana, untuk melatih kemahiran mengatasi masalah antara sesi sebenar, dan bagi orang yang menghadapi senarai menunggu yang panjang atau halangan kos untuk terapi manusia. Ia tidak menyokong memperlakukan seorang ahli psikologi AI sebagai pengganti pakar klinikal berlesen, dan ia secara jelas tidak menyokong bergantung padanya untuk diagnosis, pengurusan ubat, rawatan trauma, atau penjagaan krisis.

Senarai semak sesuai berbanding tidak sesuai untuk menggunakan seorang ahli psikologi AI
Sesuai untuk simptom ringan hingga sederhana dan sokongan antara sesi — bukan untuk diagnosis, ubat, trauma, atau krisis.

Apa yang disokong oleh bukti:

  • Langkah pertama yang murah dan mudah diakses bagi kemurungan atau keresahan ringan hingga sederhana
  • Pelengkap untuk melatih kemahiran mengatasi masalah antara sesi terapi sebenar
  • Penampung sementara bagi orang yang menghadapi senarai menunggu yang panjang atau halangan kos untuk penjagaan manusia

Apa yang tidak disokong oleh bukti:

  • Diagnosis sesuatu keadaan kesihatan mental
  • Pengurusan ubat
  • Rawatan trauma
  • Penjagaan krisis atau kecemasan

Sesiapa yang menimbang sama ada untuk mencuba salah satu daripadanya boleh menyelesaikan soalan-soalan sama yang dibangkitkan oleh penyelidikan itu sendiri:

  1. Adakah simptom anda ringan hingga sederhana, dan bukannya teruk atau kompleks?
  2. Adakah alat yang anda pertimbangkan dibina khusus untuk kesihatan mental (seperti Therabot, Woebot, atau Wysa), atau chatbot generik?
  3. Adakah anda mempunyai akses kepada pakar klinikal berlesen untuk diagnosis atau ubat jika perlu?
  4. Adakah anda menggunakannya untuk melengkapkan terapi, atau sebagai pengganti penuh kepadanya?
  5. Adakah anda tahu sumber krisis tempatan anda (988, 741741, 911) sebelum anda memerlukannya?
  6. Adakah anda menjejaki sama ada simptom anda benar-benar bertambah baik dalam tempoh beberapa minggu, bukan menganggap ia begitu?

Soalan Lazim

keyboard_arrow_up