¿Funciona realmente un psicólogo con IA? La evidencia sobre los chatbots de terapia con IA

Los escépticos tienen razón al preguntarse si un psicólogo con IA logra algo medible, o si simplemente suena comprensivo. La respuesta honesta y basada en la evidencia es que sí, con límites reales: el primer ensayo controlado aleatorizado de un chatbot de terapia con IA generativa, publicado en NEJM AI en marzo de 2025, y una serie de metaanálisis que abarcan decenas de miles de participantes apuntan ambos a beneficios medibles, de pequeños a moderados, para la depresión y la ansiedad. A continuación se expone lo que la investigación dice en realidad, incluyendo dónde la evidencia es sólida, dónde es débil y a quién no se aplica.
Esto no es exageración ni desprecio. Es un vistazo al emblemático ensayo aleatorizado Therabot de Dartmouth, a los metaanálisis que abarcan decenas de miles de participantes en 18 países y a los lugares concretos donde la base de evidencia sigue siendo débil.
Este artículo revisa investigación publicada y no constituye consejo médico. Un psicólogo con IA no reemplaza a un clínico con licencia. Si estás en crisis en EE. UU., llama o envía un mensaje de texto al 988 (la Línea de Prevención del Suicidio y Crisis) o escribe HOME al 741741. Llama al 911 en caso de peligro inmediato.
La respuesta corta: beneficios medibles, con límites
«Funciona», en el contexto de estos ensayos, tiene un significado estrecho y comprobable, y vale la pena definirlo antes de mirar cualquier cifra. Una vez que ese significado queda claro, la forma de la evidencia deja de parecer marketing y empieza a parecer una base de investigación clínica normal e imperfecta.
Qué significa realmente «funciona» aquí
En esta investigación, «funciona» significa una reducción estadísticamente significativa de los síntomas en comparación con un grupo de control, medida durante una ventana de ensayo definida, en su mayoría de 4 a 8 semanas. No significa una cura, y no significa equivalencia a años de psicoterapia. El efecto es real pero modesto, y hasta ahora se concentra en herramientas de terapia cognitivo-conductual (TCC) diseñadas específicamente para ese fin, en lugar de chatbots de propósito general.
Esa distinción importa más que cualquier porcentaje concreto de este artículo. Un ensayo controlado aleatorizado (ECA) es el diseño en el que más confían los investigadores porque compara un chatbot de terapia con IA frente a un grupo de control genuino, aislando el efecto de la herramienta del placebo, del tiempo o de la atención por sí sola.
Por qué la respuesta es «sí, pero»
El mejor conjunto de datos individual —el ensayo Therabot de Dartmouth— muestra una reducción significativa de los síntomas de depresión y ansiedad. Los metaanálisis más amplios, que agrupan decenas de ensayos, confirman un efecto de pequeño a moderado en lugar de un resultado atípico. Pero tres salvedades se aplican a casi todo ello: los datos de seguimiento necesarios para demostrar que el beneficio perdura son escasos, el riesgo de sesgo en los estudios subyacentes suele ser alto y la evidencia más sólida pertenece a una categoría estrecha de herramientas diseñadas específicamente para ese fin, no a los chatbots en general.
El estudio emblemático: el ensayo Therabot de Dartmouth
La mayor parte de lo que se sabe sobre si un chatbot de terapia con IA generativa puede modificar los síntomas clínicos proviene de un solo ensayo, así que vale la pena repasar qué probó y qué encontró en realidad.
Qué encontró el ensayo
El primer ensayo controlado aleatorizado de un chatbot de terapia con IA generativa apareció en NEJM AI en marzo de 2025. Investigadores de Dartmouth reclutaron a 210 adultos con trastorno depresivo mayor, trastorno de ansiedad generalizada o riesgo clínicamente alto de trastornos de la conducta alimentaria, asignando al azar a 106 a Therabot y a 104 a un grupo de control en lista de espera. Después de cuatro y ocho semanas, los síntomas de depresión del grupo de tratamiento cayeron un 51 %, los síntomas de ansiedad cayeron un 31 % y las preocupaciones sobre la imagen corporal relacionadas con los trastornos alimentarios cayeron un 19 %, reducciones que los autores del estudio describieron como comparables a lo que se observa habitualmente con la terapia ambulatoria.

Therabot en sí no es un chatbot de propósito general; fue entrenado específicamente con las mejores prácticas de TCC y patrones de diálogo clínico, lo cual es en gran parte la razón por la que sus resultados no se transfieren automáticamente a otras herramientas de IA.
La sorpresa de la alianza terapéutica
Los participantes usaron Therabot durante aproximadamente seis horas a lo largo del periodo del ensayo, el equivalente aproximado a ocho sesiones de terapia, y alrededor de tres cuartas partes no recibían ningún otro tratamiento de salud mental en ese momento. Cabe destacar que valoraron su confianza en el software cerca de lo que los pacientes suelen reportar hacia un terapeuta humano.
No esperábamos que la gente casi tratara al software como a un amigo. Eso me dice que en realidad estaban formando relaciones con Therabot.
Nicholas Jacobson, Dartmouth (investigador principal de Therabot)
Ese nivel de compromiso es inusual para una herramienta digital autoguiada, donde el abandono suele ser el mayor obstáculo para cualquier efecto medible.
Qué dicen los metaanálisis entre miles de personas
Un solo ensayo, por bien diseñado que esté, no basta para establecer un patrón a nivel de todo el campo. Para eso sirven los metaanálisis, y sobre los chatbots de terapia con IA ahora abarcan una muestra lo bastante grande como para afirmar algo con confianza.
De pequeño a moderado, pero consistente. Un metaanálisis de 2025 centrado en adolescentes y adultos jóvenes, que agrupó 31 ensayos controlados aleatorizados y 29 637 participantes en 18 países, encontró diferencias medias estandarizadas de −0,43 para la depresión, −0,37 para la ansiedad y −0,35 para el malestar psicológico general. Se trata de tamaños de efecto modestos según los criterios clínicos convencionales, pero fueron estadísticamente robustos en una muestra lo bastante grande como para descartar el azar como explicación. Como la población del estudio se inclinaba hacia edades más jóvenes (de 15 a 39 años), estas cifras concretas hablan de forma más directa sobre ese grupo de edad que sobre los adultos en general.

El efecto es más fuerte a corto plazo. Un metaanálisis distinto de intervenciones más breves encontró el mismo patrón: mejoras significativas pero pequeñas concentradas en las primeras cuatro a ocho semanas de uso, coincidiendo estrechamente con la propia ventana del ensayo Therabot. Más allá de ese punto, los datos sobre si el beneficio se mantiene se vuelven notablemente más escasos.
| Medida de resultado | Tamaño del efecto estandarizado (DME) | Interpretación |
|---|---|---|
| Depresión | −0,43 | De pequeño a moderado |
| Ansiedad | −0,37 | De pequeño a moderado |
| Malestar psicológico general | −0,35 | Pequeño |
| Estrés percibido | −0,41 | De pequeño a moderado |
Esas cifras provienen de un análisis conjunto de 31 ECA, no de las afirmaciones de marketing de un solo producto, motivo por el cual los investigadores las tratan como lo más cercano a una respuesta a nivel de todo el campo disponible actualmente.
No todos los «terapeutas con IA» son iguales: diseñados para ese fin frente a genéricos
La expresión «terapeuta con IA» se aplica a dos categorías de software muy diferentes, y la evidencia respalda solo a una de ellas.
Dónde está realmente la evidencia
Todos los ensayos comentados hasta ahora probaron una herramienta diseñada específicamente para la salud mental y fundamentada en la TCC: Therabot y, en investigaciones anteriores, Woebot y Wysa. Estos productos se diseñaron desde cero en torno a protocolos clínicos, se probaron en estudios controlados y se iteraron con base en datos de resultados. Esa base de evidencia no se extiende a los grandes modelos de lenguaje de propósito general como ChatGPT, que no han sido validados en ensayos clínicos aleatorizados para uso terapéutico.
- Therabot: chatbot de TCC diseñado para ese fin, probado en un ECA con 210 participantes (NEJM AI, 2025)
- Woebot: chatbot anterior basado en la TCC con evidencia publicada de estudio piloto y ECA
- Wysa: chatbot fundamentado en la TCC con estudios de eficacia publicados
- Chatbots LLM genéricos (p. ej., ChatGPT): sin ensayos clínicos que validen su uso terapéutico
Por qué importa la distinción
La Asociación Estadounidense de Psicología ha advertido de que los chatbots de IA genéricos usados como sustituto de la terapia pueden plantear riesgos reales, precisamente porque carecen de las salvaguardas clínicas y de la validación en torno a las cuales se diseñaron las herramientas creadas para ese fin. Los resultados positivos de los ensayos comentados en este artículo pertenecen a una categoría estrecha de productos estructurados y diseñados clínicamente, no a cualquier chatbot con el que una persona resulte estar hablando.
| Característica | Chatbot de TCC diseñado para ese fin (p. ej., Therabot) | Chatbot LLM genérico (p. ej., ChatGPT) |
|---|---|---|
| Entrenado en protocolos de TCC | Sí | No |
| Probado en un ensayo controlado aleatorizado | Sí (Therabot: NEJM AI, 2025) | No |
| Riesgo clínico señalado por la APA | Menor, pero aún supervisado | Mayor: señalado explícitamente |
| Uso previsto | Apoyo a la salud mental | Conversación de propósito general |
Las limitaciones honestas de la evidencia
Todas las cifras anteriores provienen de ensayos reales, pero los investigadores que están detrás de esos ensayos son francos sobre hasta dónde llegan en realidad los datos, y vale la pena tomarlo al pie de la letra en lugar de pasarlo por alto.

Esto es lo que limita la base de evidencia hoy en día:
- La mayoría de los estudios incluidos presentan un alto riesgo de sesgo en su diseño o en la presentación de resultados.
- La calidad general de la evidencia se califica de muy baja a baja según el marco GRADE, un estándar que los investigadores usan para valorar la certeza.
- Diecisiete de los 31 estudios del mayor metaanálisis tuvieron tasas de abandono superiores al 20 %, lo que significa que una proporción considerable de participantes lo dejó antes de terminar.
- Solo 15 de los 31 estudios recopilaron algún dato de seguimiento, lo cual no basta para confirmar si los beneficios se mantienen tras finalizar el ensayo.
- Solo tres estudios de todo el metaanálisis probaron IA generativa específicamente, en contraste con chatbots más antiguos basados en reglas, de modo que para la generación más reciente de herramientas la eficacia a gran escala sigue siendo, en palabras de los propios investigadores, desconocida.
Incluso los autores de Therabot, cuyo ensayo produjo los resultados más sólidos del campo hasta ahora, concluyeron que ningún agente de IA generativa está listo para operar de forma totalmente autónoma en la atención de salud mental, y que la supervisión estrecha de un clínico sigue siendo esencial para un despliegue seguro.
Entonces, ¿puede un psicólogo con IA reemplazar a tu terapeuta?
Dado todo lo anterior, la evidencia respalda un papel específico y acotado para un psicólogo con IA, no un sí o un no rotundos.
Un papel realista para la evidencia
Los datos disponibles hoy respaldan al psicólogo con IA como un primer paso accesible y de bajo costo o como un complemento de la atención: genuinamente útil para los síntomas de depresión y ansiedad de leves a moderados, para practicar habilidades de afrontamiento entre sesiones reales y para las personas que enfrentan largas listas de espera o barreras de costo para acceder a la terapia humana. No respalda tratar a un psicólogo con IA como un reemplazo de un clínico con licencia, y explícitamente no respalda depender de uno para el diagnóstico, el manejo de la medicación, el tratamiento del trauma o la atención de crisis.

Lo que la evidencia respalda:
- Un primer paso accesible y de bajo costo para la depresión o la ansiedad de leves a moderadas
- Un complemento para practicar habilidades de afrontamiento entre sesiones reales de terapia
- Una solución provisional para las personas que enfrentan largas listas de espera o barreras de costo para la atención humana
Lo que la evidencia no respalda:
- El diagnóstico de un trastorno de salud mental
- El manejo de la medicación
- El tratamiento del trauma
- La atención de crisis o de emergencia
Cualquiera que esté sopesando si probar uno puede repasar las mismas preguntas que plantea la propia investigación:
- ¿Tus síntomas son de leves a moderados, en lugar de graves o complejos?
- ¿La herramienta que estás considerando está diseñada específicamente para la salud mental (como Therabot, Woebot o Wysa), o es un chatbot genérico?
- ¿Tienes acceso a un clínico con licencia para el diagnóstico o la medicación si fuera necesario?
- ¿La estás usando para complementar la terapia, o como sustituto total de ella?
- ¿Conoces tus recursos locales de crisis (988, 741741, 911) antes de necesitarlos?
- ¿Estás haciendo un seguimiento de si tus síntomas están mejorando realmente a lo largo de unas semanas, en lugar de dar por sentado que lo hacen?
