Nhà tâm lý học AI có thực sự hiệu quả không? Bằng chứng về các chatbot trị liệu bằng AI

A person in a calm session with a psychologist reviewing an outcome chart
Bằng chứng cho thấy những lợi ích thực sự nhưng khiêm tốn — một nhà tâm lý học AI phát huy hiệu quả nhất khi là bước đầu tiên có kiểm soát, chứ không phải một phương thuốc chữa lành.

Những người hoài nghi có lý khi tự hỏi liệu một nhà tâm lý học AI có mang lại điều gì đo lường được hay không, hay nó chỉ nghe có vẻ thấu cảm. Câu trả lời trung thực, dựa trên bằng chứng là có, với những giới hạn thực sự: thử nghiệm ngẫu nhiên có đối chứng đầu tiên về một chatbot trị liệu bằng AI tạo sinh, được công bố trên NEJM AI vào tháng 3 năm 2025, cùng với một loạt phân tích tổng hợp bao trùm hàng chục nghìn người tham gia, cả hai đều chỉ ra những lợi ích đo lường được, từ nhỏ đến vừa phải, đối với trầm cảm và lo âu. Dưới đây là những gì nghiên cứu thực sự nói — bao gồm cả nơi bằng chứng vững chắc, nơi nó còn mỏng, và những ai mà nó không áp dụng.

Đây không phải là sự thổi phồng hay xem thường. Đây là cái nhìn về thử nghiệm ngẫu nhiên mang tính cột mốc Therabot của Dartmouth, các phân tích tổng hợp bao trùm hàng chục nghìn người tham gia tại 18 quốc gia, và những nơi cụ thể mà nền tảng bằng chứng vẫn còn mỏng.

Bài viết này xem xét nghiên cứu đã được công bố và không phải là lời khuyên y tế. Một nhà tâm lý học AI không thay thế cho một bác sĩ lâm sàng có giấy phép hành nghề. Nếu bạn đang trong khủng hoảng ở Hoa Kỳ, hãy gọi hoặc nhắn tin đến 988 (Đường dây Phòng chống Tự tử và Khủng hoảng) hoặc nhắn HOME đến 741741. Gọi 911 nếu có nguy hiểm tức thời.

Câu trả lời ngắn gọn: lợi ích đo lường được, kèm theo giới hạn

«Hiệu quả», trong bối cảnh của những thử nghiệm này, có một ý nghĩa hẹp và có thể kiểm chứng — và điều đáng làm là định nghĩa nó trước khi nhìn vào bất kỳ con số nào. Một khi ý nghĩa đó đã rõ ràng, hình hài của bằng chứng thôi trông giống như tiếp thị và bắt đầu trông giống như một nền tảng nghiên cứu lâm sàng bình thường, chưa hoàn hảo.

«Hiệu quả» thực sự có nghĩa gì ở đây

Trong nghiên cứu này, «hiệu quả» có nghĩa là sự giảm triệu chứng có ý nghĩa thống kê so với một nhóm đối chứng, được đo lường trong một khoảng thời gian thử nghiệm xác định — chủ yếu là từ 4 đến 8 tuần. Nó không có nghĩa là chữa khỏi, và không có nghĩa là tương đương với nhiều năm trị liệu tâm lý. Hiệu ứng là thực nhưng khiêm tốn, và cho đến nay nó tập trung ở các công cụ liệu pháp nhận thức hành vi (CBT) được thiết kế chuyên biệt cho mục đích đó, chứ không phải các chatbot đa dụng.

Sự phân biệt đó quan trọng hơn bất kỳ tỷ lệ phần trăm cụ thể nào trong bài viết này. Một thử nghiệm ngẫu nhiên có đối chứng (RCT) là thiết kế mà các nhà nghiên cứu tin tưởng nhất, bởi nó so sánh một chatbot trị liệu bằng AI với một nhóm đối chứng thực sự, tách biệt tác động của công cụ khỏi hiệu ứng giả dược, thời gian, hay chỉ đơn thuần là sự quan tâm.

Vì sao câu trả lời là «có, nhưng»

Bộ dữ liệu đơn lẻ tốt nhất — thử nghiệm Therabot của Dartmouth — cho thấy sự giảm đáng kể các triệu chứng trầm cảm và lo âu. Các phân tích tổng hợp rộng hơn, gộp lại hàng chục thử nghiệm, xác nhận một hiệu ứng từ nhỏ đến vừa phải chứ không phải một kết quả bất thường. Nhưng ba điểm dè dặt áp dụng cho gần như toàn bộ điều đó: dữ liệu theo dõi cần thiết để chứng minh lợi ích bền vững còn mỏng, nguy cơ sai lệch trong các nghiên cứu nền tảng thường cao, và bằng chứng mạnh nhất thuộc về một nhóm hẹp các công cụ được thiết kế chuyên biệt, chứ không phải chatbot nói chung.

Nghiên cứu cột mốc: thử nghiệm Therabot của Dartmouth

Phần lớn những gì được biết về việc liệu một chatbot trị liệu bằng AI tạo sinh có thể làm thay đổi các triệu chứng lâm sàng hay không đều đến từ một thử nghiệm duy nhất, vì vậy điều đáng làm là xem xét kỹ nó thực sự đã kiểm tra và tìm ra điều gì.

Thử nghiệm đã tìm ra điều gì

Thử nghiệm ngẫu nhiên có đối chứng đầu tiên về một chatbot trị liệu bằng AI tạo sinh xuất hiện trên NEJM AI vào tháng 3 năm 2025. Các nhà nghiên cứu tại Dartmouth đã tuyển 210 người trưởng thành mắc rối loạn trầm cảm chủ yếu, rối loạn lo âu lan tỏa, hoặc có nguy cơ lâm sàng cao về rối loạn ăn uống, phân bổ ngẫu nhiên 106 người vào Therabot và 104 người vào nhóm đối chứng trong danh sách chờ. Sau bốn và tám tuần, các triệu chứng trầm cảm của nhóm điều trị giảm 51%, triệu chứng lo âu giảm 31%, và những lo ngại về hình ảnh cơ thể liên quan đến rối loạn ăn uống giảm 19% — những mức giảm mà các tác giả nghiên cứu mô tả là tương đương với những gì thường thấy ở liệu pháp ngoại trú.

Bar chart of Therabot trial symptom reductions over 8 weeks: depression 51%, anxiety 31%, eating-disorder concerns 19%
Trong thử nghiệm Therabot của Dartmouth, các triệu chứng trầm cảm giảm 51%, lo âu 31%, và những lo ngại về rối loạn ăn uống giảm 19% trong tám tuần.

Bản thân Therabot không phải là một chatbot đa dụng; nó được huấn luyện chuyên biệt trên các thực hành tốt nhất của CBT và các mẫu đối thoại lâm sàng, đây phần lớn là lý do tại sao kết quả của nó không tự động chuyển sang được các công cụ AI khác.

Điều bất ngờ về liên minh trị liệu

Người tham gia đã sử dụng Therabot trong khoảng sáu giờ trong suốt thời gian thử nghiệm, tương đương gần tám buổi trị liệu, và khoảng ba phần tư trong số họ không nhận được bất kỳ phương pháp điều trị sức khỏe tâm thần nào khác vào thời điểm đó. Đáng chú ý, họ đánh giá mức độ tin tưởng của mình vào phần mềm gần bằng mức mà bệnh nhân thường báo cáo đối với một nhà trị liệu là con người.

Chúng tôi đã không ngờ rằng mọi người gần như đối xử với phần mềm như một người bạn. Điều đó nói với tôi rằng họ thực sự đang hình thành các mối quan hệ với Therabot.

Nicholas Jacobson, Dartmouth (nghiên cứu viên chính của Therabot)

Mức độ gắn kết đó là điều bất thường đối với một công cụ số tự hướng dẫn, nơi mà việc bỏ cuộc thường là trở ngại lớn nhất đối với bất kỳ hiệu ứng đo lường được nào.

Các phân tích tổng hợp nói gì trên hàng nghìn người

Một thử nghiệm đơn lẻ, dù được thiết kế tốt đến đâu, cũng không đủ để thiết lập một mô thức trên phạm vi toàn lĩnh vực. Đó là mục đích của các phân tích tổng hợp, và về các chatbot trị liệu bằng AI, giờ đây chúng bao trùm một cỡ mẫu đủ lớn để khẳng định điều gì đó một cách tự tin.

Từ nhỏ đến vừa phải, nhưng nhất quán. Một phân tích tổng hợp năm 2025 tập trung vào thanh thiếu niên và người trẻ tuổi, gộp lại 31 thử nghiệm ngẫu nhiên có đối chứng và 29.637 người tham gia tại 18 quốc gia, đã tìm thấy các chênh lệch trung bình chuẩn hóa là −0,43 đối với trầm cảm, −0,37 đối với lo âu, và −0,35 đối với sự đau khổ tâm lý nói chung. Đó là những kích thước hiệu ứng khiêm tốn theo các thước đo lâm sàng thông thường, nhưng chúng vững chắc về mặt thống kê trên một cỡ mẫu đủ lớn để loại trừ khả năng ngẫu nhiên là lời giải thích. Vì dân số nghiên cứu nghiêng về độ tuổi trẻ hơn (từ 15 đến 39 tuổi), những con số cụ thể này nói lên nhiều nhất một cách trực tiếp về nhóm tuổi đó thay vì người trưởng thành nói chung.

Infographic: 31 randomized trials, 29,637 participants, 18 countries, showing a small-to-moderate effect
Gộp lại 31 thử nghiệm ngẫu nhiên và 29.637 người tham gia tại 18 quốc gia, hiệu ứng là thực nhưng từ nhỏ đến vừa phải — không phải một phương thuốc chữa lành.

Hiệu ứng mạnh nhất trong ngắn hạn. Một phân tích tổng hợp riêng biệt về các can thiệp ngắn hơn đã tìm thấy cùng một mô thức: những cải thiện có ý nghĩa nhưng nhỏ, tập trung trong bốn đến tám tuần đầu tiên sử dụng, khớp chặt chẽ với chính khoảng thời gian của thử nghiệm Therabot. Vượt qua điểm đó, dữ liệu về việc liệu lợi ích có duy trì hay không trở nên mỏng đi rõ rệt.

Chỉ số kết quảKích thước hiệu ứng chuẩn hóa (SMD)Diễn giải
Trầm cảm−0,43Từ nhỏ đến vừa phải
Lo âu−0,37Từ nhỏ đến vừa phải
Sự đau khổ tâm lý nói chung−0,35Nhỏ
Căng thẳng cảm nhận−0,41Từ nhỏ đến vừa phải

Những con số đó đến từ một phân tích gộp của 31 RCT, chứ không phải từ những tuyên bố tiếp thị của một sản phẩm đơn lẻ, đó là lý do tại sao các nhà nghiên cứu coi chúng là thứ gần nhất với một câu trả lời trên phạm vi toàn lĩnh vực hiện có.

Không phải mọi «nhà trị liệu AI» đều như nhau: được thiết kế chuyên biệt so với đa dụng

Cụm từ «nhà trị liệu AI» được áp dụng cho hai loại phần mềm rất khác nhau, và bằng chứng chỉ ủng hộ một trong số đó.

Bằng chứng thực sự nằm ở đâu

Mọi thử nghiệm được thảo luận cho đến nay đều kiểm tra một công cụ được thiết kế chuyên biệt cho sức khỏe tâm thần và dựa trên nền tảng CBT — Therabot, và trong các nghiên cứu trước đó, Woebot và Wysa. Những sản phẩm này được thiết kế từ đầu xoay quanh các quy trình lâm sàng, được kiểm tra trong các nghiên cứu có đối chứng, và được lặp lại dựa trên dữ liệu kết quả. Nền tảng bằng chứng đó không mở rộng sang các mô hình ngôn ngữ lớn đa dụng như ChatGPT, vốn chưa được thẩm định trong các thử nghiệm lâm sàng ngẫu nhiên cho mục đích sử dụng trị liệu.

  • Therabot — chatbot CBT được thiết kế chuyên biệt, được kiểm tra trong một RCT với 210 người tham gia (NEJM AI, 2025)
  • Woebot — chatbot dựa trên CBT ra đời sớm hơn với bằng chứng thử nghiệm thí điểm và RCT đã công bố
  • Wysa — chatbot dựa trên nền tảng CBT với các nghiên cứu hiệu quả đã công bố
  • Các chatbot LLM đa dụng (ví dụ, ChatGPT) — không có thử nghiệm lâm sàng nào thẩm định việc sử dụng trị liệu

Vì sao sự phân biệt này quan trọng

Hiệp hội Tâm lý học Hoa Kỳ đã cảnh báo rằng các chatbot AI đa dụng được dùng thay thế cho trị liệu có thể gây ra những rủi ro thực sự, chính bởi chúng thiếu các rào chắn lâm sàng và sự thẩm định mà các công cụ được thiết kế chuyên biệt được xây dựng xoay quanh. Những kết quả thử nghiệm tích cực được thảo luận trong bài viết này thuộc về một nhóm hẹp các sản phẩm có cấu trúc, được thiết kế về mặt lâm sàng — chứ không phải bất kỳ chatbot nào mà một người tình cờ trò chuyện cùng.

Đặc điểmChatbot CBT được thiết kế chuyên biệt (ví dụ, Therabot)Chatbot LLM đa dụng (ví dụ, ChatGPT)
Được huấn luyện trên các quy trình CBTKhông
Được kiểm tra trong một thử nghiệm ngẫu nhiên có đối chứngCó (Therabot: NEJM AI, 2025)Không
Rủi ro lâm sàng được APA đánh dấuThấp hơn, nhưng vẫn được giám sátCao hơn — được đánh dấu rõ ràng
Mục đích sử dụng dự kiếnHỗ trợ sức khỏe tâm thầnTrò chuyện đa dụng

Những giới hạn trung thực của bằng chứng

Mọi con số ở trên đều đến từ các thử nghiệm thực sự, nhưng các nhà nghiên cứu đứng sau những thử nghiệm đó thẳng thắn về việc dữ liệu thực sự vươn được đến đâu — và điều đáng làm là tiếp nhận điều đó đúng như nó là, thay vì đọc lướt qua.

Comparison: purpose-built CBT chatbot tested in trials versus generic chatbot with no clinical validation
Bằng chứng ủng hộ các công cụ CBT được thiết kế chuyên biệt, đã được kiểm tra trong thử nghiệm — chứ không phải các chatbot đa dụng, vốn không có sự thẩm định lâm sàng nào.

Đây là những gì giới hạn nền tảng bằng chứng ngày nay:

  1. Hầu hết các nghiên cứu được đưa vào đều mang nguy cơ sai lệch cao trong thiết kế hoặc báo cáo của chúng.
  2. Chất lượng bằng chứng tổng thể được xếp hạng từ rất thấp đến thấp theo khung GRADE, một tiêu chuẩn mà các nhà nghiên cứu dùng để đánh giá mức độ chắc chắn.
  3. Mười bảy trong số 31 nghiên cứu ở phân tích tổng hợp lớn nhất có tỷ lệ bỏ cuộc trên 20%, nghĩa là một phần đáng kể người tham gia đã bỏ cuộc trước khi hoàn thành.
  4. Chỉ 15 trong số 31 nghiên cứu thu thập bất kỳ dữ liệu theo dõi nào, điều đó không đủ để xác nhận liệu lợi ích có được duy trì sau khi thử nghiệm kết thúc hay không.
  5. Chỉ ba nghiên cứu trong toàn bộ phân tích tổng hợp kiểm tra AI tạo sinh một cách cụ thể, khác với các chatbot dựa trên luật lệ cũ hơn — vì vậy đối với thế hệ công cụ mới nhất, hiệu quả ở quy mô lớn vẫn còn, theo chính lời của các nhà nghiên cứu, chưa được biết đến.

Ngay cả các tác giả của Therabot, những người có thử nghiệm tạo ra kết quả mạnh nhất trong lĩnh vực cho đến nay, cũng kết luận rằng không có tác nhân AI tạo sinh nào sẵn sàng hoạt động hoàn toàn tự chủ trong chăm sóc sức khỏe tâm thần, và rằng sự giám sát chặt chẽ của bác sĩ lâm sàng vẫn thiết yếu để triển khai an toàn.

Vậy một nhà tâm lý học AI có thể thay thế nhà trị liệu của bạn không?

Với tất cả những điều trên, bằng chứng ủng hộ một vai trò cụ thể, có giới hạn cho một nhà tâm lý học AI — chứ không phải một lời khẳng định có hay không chung chung.

Một vai trò thực tế cho bằng chứng

Dữ liệu có sẵn ngày nay ủng hộ một nhà tâm lý học AI như một bước đầu tiên chi phí thấp, dễ tiếp cận hoặc một phần bổ trợ cho việc chăm sóc — thực sự hữu ích cho các triệu chứng trầm cảm và lo âu từ nhẹ đến vừa, để thực hành các kỹ năng ứng phó giữa những buổi trị liệu thực sự, và cho những người phải đối mặt với danh sách chờ dài hoặc rào cản chi phí để tiếp cận trị liệu bởi con người. Nó không ủng hộ việc coi một nhà tâm lý học AI như sự thay thế cho một bác sĩ lâm sàng có giấy phép, và nó rõ ràng không ủng hộ việc dựa vào một nhà tâm lý học AI để chẩn đoán, quản lý thuốc, điều trị sang chấn, hay chăm sóc khủng hoảng.

Good fit versus not a fit checklist for using an AI psychologist
Phù hợp cho các triệu chứng từ nhẹ đến vừa và hỗ trợ giữa các buổi trị liệu — không phù hợp cho chẩn đoán, thuốc men, sang chấn, hay khủng hoảng.

Những gì bằng chứng ủng hộ:

  • Một bước đầu tiên chi phí thấp, dễ tiếp cận cho trầm cảm hoặc lo âu từ nhẹ đến vừa
  • Một phần bổ trợ để thực hành các kỹ năng ứng phó giữa những buổi trị liệu thực sự
  • Một giải pháp tạm thời cho những người phải đối mặt với danh sách chờ dài hoặc rào cản chi phí để được chăm sóc bởi con người

Những gì bằng chứng không ủng hộ:

  • Chẩn đoán một tình trạng sức khỏe tâm thần
  • Quản lý thuốc men
  • Điều trị sang chấn
  • Chăm sóc khủng hoảng hoặc cấp cứu

Bất kỳ ai đang cân nhắc có nên thử một công cụ như vậy hay không đều có thể suy xét qua chính những câu hỏi mà nghiên cứu đặt ra:

  1. Các triệu chứng của bạn ở mức nhẹ đến vừa, chứ không phải nghiêm trọng hay phức tạp?
  2. Công cụ mà bạn đang cân nhắc có được thiết kế chuyên biệt cho sức khỏe tâm thần (như Therabot, Woebot, hoặc Wysa) không, hay là một chatbot đa dụng?
  3. Bạn có quyền tiếp cận một bác sĩ lâm sàng có giấy phép để chẩn đoán hoặc kê thuốc nếu cần không?
  4. Bạn đang dùng nó để bổ trợ cho trị liệu, hay như một sự thay thế hoàn toàn cho trị liệu?
  5. Bạn có biết các nguồn lực khủng hoảng tại địa phương (988, 741741, 911) trước khi bạn cần đến chúng không?
  6. Bạn có đang theo dõi xem các triệu chứng của mình có thực sự cải thiện qua vài tuần hay không, chứ không phải mặc định rằng chúng đang cải thiện?

Câu hỏi thường gặp

keyboard_arrow_up