Does an AI Psychologist Actually Work? Evidence on AI Therapy Chatbots
怀疑者有理由追问,AI 心理学家是否真能带来可衡量的作用,还是只是听上去很有支持力。诚实的、基于证据的答案是:能,但有真实的局限。2025 年 3 月发表于 NEJM AI 的首个生成式 AI 治疗聊天机器人随机对照试验,以及一系列涵盖数万名参与者的荟萃分析,都指向对抑郁和焦虑存在可衡量的、小到中等的益处。以下是研究实际所说的内容——包括证据充分之处、薄弱之处,以及它不适用于谁。

这既不是炒作,也不是全盘否定。这是对标志性的 Dartmouth Therabot 随机试验、跨越 18 个国家、涵盖数万名参与者的荟萃分析,以及证据基础仍然薄弱的具体环节的一次审视。
本文综述已发表的研究,不构成医疗建议。AI 心理学家不能取代持照临床医生。如果你在美国正处于危机中,请拨打或发短信至 988(自杀与危机生命线),或发送 HOME 至 741741。若有即时危险,请拨打 911。
简短的答案:可衡量的益处,但有局限
在这些试验的语境中,”有效”有一个狭义、可检验的含义——在看任何数字之前,值得先把它界定清楚。一旦这个含义明确了,证据的样貌就不再像营销,而开始像一份正常、并不完美的临床研究基础。
这里的”有效”究竟意味着什么
在这项研究中,”有效”指的是与对照组相比、在设定的试验窗口内(多为 4 到 8 周)测得的具有统计学意义的症状减轻。它并不意味着治愈,也不意味着等同于多年的心理治疗。效果是真实但适度的,而且到目前为止,它集中体现在专门构建的认知行为疗法(CBT)工具上,而非通用型聊天机器人。
这一区分比本文中任何单一的百分比都更重要。随机对照试验(RCT)是研究者最信任的设计,因为它将一款 AI 治疗聊天机器人与真正的对照组进行比较,从而把工具本身的效果与安慰剂、时间或仅仅是被关注的作用区分开来。
为什么答案是”是,但是”
最好的单一数据集——Dartmouth 的 Therabot 试验——显示抑郁和焦虑症状有显著的减轻。更广泛的荟萃分析汇总了数十项试验,证实这是小到中等的效果,而非孤立的异常结果。但几乎全部证据都适用三条限定条件:证明益处能够持续所需的随访数据很薄弱;底层研究的偏倚风险往往很高;而最有力的证据属于一类狭窄的专门构建工具,而非泛泛而言的聊天机器人。
标志性研究:Dartmouth 的 Therabot 试验
关于生成式 AI 治疗聊天机器人能否改变临床症状,目前已知的大部分内容都来自一项试验,因此值得梳理一下它究竟检验了什么、发现了什么。
试验发现了什么
首个生成式 AI 治疗聊天机器人的随机对照试验于 2025 年 3 月发表在 NEJM AI 上。Dartmouth 的研究者招募了 210 名患有重度抑郁障碍、广泛性焦虑障碍,或临床上进食与饮食障碍高风险的成年人,将其中 106 人随机分配到 Therabot,104 人分配到候补名单对照组。在第四周和第八周后,治疗组的抑郁症状下降了 51%,焦虑症状下降了 31%,与进食障碍相关的身体形象顾虑下降了 19%——研究作者形容这些减幅可与门诊治疗通常所见的效果相媲美。

Therabot 本身并非通用型聊天机器人;它是专门基于 CBT 最佳实践和临床对话模式训练的,这在很大程度上说明了为什么它的结果不会自动迁移到其他 AI 工具上。
治疗联盟的意外发现
参与者在试验期间使用 Therabot 约六小时,大致相当于八次治疗会谈,而其中约四分之三的人当时并未接受任何其他心理健康治疗。值得注意的是,他们对这款软件的信任程度,接近患者通常对人类治疗师所报告的水平。
我们没有预料到人们几乎会把这款软件当作朋友。这在我看来说明,他们确实在与 Therabot 建立关系。
Nicholas Jacobson, Dartmouth (Therabot lead researcher)
对于一款自助式数字工具而言,这种投入程度是不寻常的——在这类工具中,中途退出通常是任何可衡量效果的最大障碍。
荟萃分析在数千人身上说了什么
单独一项试验,无论设计得多好,都不足以确立一个覆盖整个领域的规律。这正是荟萃分析的用途,而在 AI 治疗聊天机器人方面,它们如今已覆盖足够大的样本,可以有把握地说出一些结论。
小到中等,但一致。一项聚焦青少年和青年的 2025 年荟萃分析,汇总了 18 个国家的 31 项随机对照试验和 29,637 名参与者,发现抑郁的标准化均数差为 −0.43,焦虑为 −0.37,总体心理困扰为 −0.35。按常规临床基准,这些是适度的效应量,但在一个大到足以排除偶然性解释的样本中,它们在统计上是稳健的。由于研究人群偏年轻(15–39 岁),这些具体数字最直接地针对该年龄组,而非广义上的成年人。

效果在短期内最强。另一项针对较短干预的荟萃分析发现了相同的规律:显著但微小的改善集中在使用的前四到八周,与 Therabot 试验本身的窗口高度吻合。过了那个时间点,关于益处是否持续的数据就明显变得更薄弱。
| 结局指标 | 标准化效应量(SMD) | 解读 |
|---|---|---|
| 抑郁 | −0.43 | 小到中等 |
| 焦虑 | −0.37 | 小到中等 |
| 总体心理困扰 | −0.35 | 小 |
| 感知压力 | −0.41 | 小到中等 |
这些数字来自对 31 项 RCT 的汇总分析,而非某个单一产品的营销宣称,这正是研究者将其视为目前可得的、最接近领域整体答案的原因。
并非所有”AI 治疗师”都一样:专门构建 vs 通用型
“AI 治疗师”这个词被套用到两类截然不同的软件上,而证据只支持其中一类。
证据实际所在之处
到目前为止讨论的每一项试验,检验的都是一款专为心理健康构建、以 CBT 为基础的工具——Therabot,以及在更早的研究中,Woebot 和 Wysa。这些产品从一开始就围绕临床方案设计,在受控研究中接受检验,并根据结局数据不断迭代。这一证据基础并不延伸到诸如 ChatGPT 之类的通用型大语言模型,后者尚未在随机临床试验中就治疗用途得到验证。
- Therabot——专门构建的 CBT 聊天机器人,在一项 210 名参与者的 RCT 中接受检验(NEJM AI, 2025)
- Woebot——较早的基于 CBT 的聊天机器人,有已发表的试点和 RCT 证据
- Wysa——以 CBT 为依据的聊天机器人,有已发表的有效性研究
- 通用型 LLM 聊天机器人(例如 ChatGPT)——没有验证治疗用途的临床试验
为什么这一区分很重要
美国心理学会(American Psychological Association)已警告,被当作治疗替代品使用的通用型 AI 聊天机器人可能带来真实的风险,正是因为它们缺乏专门构建工具所设计的临床防护栏和验证。本文讨论的正面试验结果属于一类狭窄的、结构化的、经临床设计的产品——而不属于某人恰好正在对话的任意聊天机器人。
| 特征 | 专门构建的 CBT 聊天机器人(例如 Therabot) | 通用型 LLM 聊天机器人(例如 ChatGPT) |
|---|---|---|
| 基于 CBT 方案训练 | 是 | 否 |
| 在随机对照试验中接受检验 | 是(Therabot:NEJM AI, 2025) | 否 |
| 被 APA 标示的临床风险 | 较低,但仍需监督 | 较高——被明确标示 |
| 预期用途 | 心理健康支持 | 通用型对话 |
证据的诚实局限
上文的每一个数字都来自真实的试验,但这些试验背后的研究者对数据实际能延伸到多远都很坦率——值得照实看待,而不是略过不读。

以下是当今限制证据基础的因素:
- 大多数纳入的研究在设计或报告上存在较高的偏倚风险。
- 用研究者评定确定性的标准框架 GRADE 衡量,总体证据质量被评为极低到低。
- 最大的那项荟萃分析中,31 项研究里有 17 项的失访率高于 20%,意味着相当一部分参与者在完成前退出。
- 31 项研究中只有 15 项收集了任何随访数据,这不足以确认益处在试验结束后是否得以维持。
- 整项荟萃分析中,只有三项研究专门检验了生成式 AI,而非较旧的基于规则的聊天机器人——因此对于最新一代工具而言,用研究者自己的话说,其大规模有效性仍属未知。
即便是 Therabot 的作者们——他们的试验产生了迄今该领域最有力的结果——也得出结论:没有任何生成式 AI 智能体已准备好在心理健康护理中完全自主运行,而密切的临床医生监督对于安全部署仍然必不可少。
那么,AI 心理学家能取代你的治疗师吗?
综合以上所有内容,证据支持 AI 心理学家扮演一个具体、有界的角色——而不是笼统的是或否。
证据所支持的现实角色
当今可得的数据支持将 AI 心理学家作为一个低成本、可及的第一步或护理的补充——对于轻到中度的抑郁和焦虑症状、在真实会谈之间练习应对技巧,以及面临漫长候补名单或人类治疗成本障碍的人,它确实有用。它并不支持把 AI 心理学家当作持照临床医生的替代品,也明确不支持依赖它进行诊断、药物管理、创伤治疗或危机护理。

证据所支持的:
- 针对轻到中度抑郁或焦虑的低成本、可及的第一步
- 在真实治疗会谈之间练习应对技巧的补充
- 面临漫长候补名单或人类护理成本障碍者的权宜之计
证据所不支持的:
- 心理健康状况的诊断
- 药物管理
- 创伤治疗
- 危机或紧急护理
任何在权衡是否要尝试的人,都可以逐一思考研究本身提出的这些问题:
- 你的症状是轻到中度,而非严重或复杂吗?
- 你在考虑的工具是专为心理健康构建的(如 Therabot、Woebot 或 Wysa),还是通用型聊天机器人?
- 如有需要,你是否能获得持照临床医生进行诊断或用药?
- 你是用它来补充治疗,还是作为治疗的完全替代?
- 在你需要之前,你是否已了解本地的危机资源(988、741741、911)?
- 你是否在几周内跟踪症状是否真的在改善,而不是想当然地认为它们在改善?
