Рабочий альянс с чат-ботом: что измерил Therabot и что осталось за рамками
- В первом рандомизированном исследовании генеративного чат-бота-психотерапевта (Therabot, Дартмутский колледж; NEJM AI, 2025) 210 взрослых распределили на четыре недели работы с Therabot (n=106) либо в лист ожидания (n=104); самооценка рабочего альянса по шкале WAI-SR достигла значений, типичных для очной амбулаторной психотерапии.
- Снижение симптоматики относительно листа ожидания было выраженным: 51% при депрессии (d≈0,85), 31% при тревоге (d≈0,79), 19% при риске расстройств пищевого поведения (d≈0,63); средняя продолжительность использования – около 6 часов, примерно восемь сессий.
- За те же четыре недели исследовательская группа вмешивалась 28 раз: 15 – по соображениям безопасности, включая суицидальные мысли, и 13 – чтобы исправить неуместные ответы чат-бота.
- Оценка альянса – это самоотчёт о субъективном переживании пациента, а не клинический исход и не мера безопасности; сравнение велось с листом ожидания, а не с группой живых специалистов, а комментарий в NEJM AI напомнил, что WAI создавался для человеческих отношений.
В марте 2025 года команда из Дартмута опубликовала первое рандомизированное исследование генеративного чат-бота-психотерапевта, и одна строка разошлась шире остальных: пациенты оценили рабочий альянс с программой почти так же высоко, как оценивают живых специалистов. Спустя год дискуссии эта фраза по-прежнему берёт на себя больше, чем позволяют данные. Стоит развести то, что зафиксировал WAI-SR, и то, чего он не касался.
Что показало исследование
Дизайн был аккуратным. 210 взрослых с клинически значимой депрессией, тревогой или высоким риском расстройства пищевого поведения распределили на четыре недели неограниченного доступа к Therabot (n=106) либо в лист ожидания (n=104) с оценкой на 4-й и 8-й неделях. Снижение относительно листа ожидания оказалось существенным: депрессия – 51% (d≈0,85), тревога – 31% (d≈0,79), озабоченность телом и питанием – 19% (d≈0,63).
Самым заметным была вовлечённость. Участники общались с программой около шести часов за месяц – эквивалент примерно восьми сессий, – причём значительная часть контактов инициировалась самими пользователями, нередко ночью. По шкале WAI-SR средняя оценка альянса попала в диапазон, характерный для амбулаторной психотерапии. В сумме это не пустой результат: люди разговаривали с агентом, возвращались к нему и субъективно чувствовали себя лучше.
Альянс – не исход и не безопасность
Прочтение, которому стоит сопротивляться, – это соскальзывание от «альянс не ниже человеческого» к «не хуже живого специалиста». Здесь три шва. Во-первых, сравнение шло с листом ожидания, а не с психотерапевтом и не с активным контролем, поэтому изменение симптоматики нельзя приписать альянсу – или чему-либо специфическому – по сравнению с простым ожиданием. Во-вторых, оценка альянса – это самоотчёт о переживании контакта, целей и задач; комментарий в NEJM AI отдельно указал, что WAI разрабатывался для человеческих отношений, и его правомерность применительно к небиологическому собеседнику не установлена, так что высокий балл может отражать вовлечённость и безоценочность в той же мере, что и терапевтическую связь. В-третьих, самое осязаемое: за те же четыре недели команде пришлось вмешаться 28 раз – 15 по соображениям безопасности, включая суицидальные мысли, и 13, чтобы исправить неуместные реплики. Альянс ощущался человеческим; контур безопасности сам себя не удержал. Руководитель работы прямо заявил, что ни один генеративный агент не готов действовать в психиатрии автономно.
Вывод отсюда двусторонний. Результат реален, и его не нужно ни раздувать, ни отмахиваться. Пациент способен сформировать субъективно ощутимый рабочий альянс с диалоговым агентом, и это заслуживает изучения как самостоятельный механизм вовлечения. Но это не доказательство того, что агент проводит психотерапию, безопасен без надзора или может заменить те отношения, которые имитирует.
Альянс, который пациент оценивает не ниже человеческого, говорит о переживании пациента, а не о том, что программа занимается психотерапией.
Лист ожидания без активного контроля не позволяет связать динамику симптоматики именно с альянсом; это единственное четырёхнедельное исследование со смещением выборки в сторону молодых и открытых к технологиям участников, без слепой независимой оценки и без обоснования применимости WAI к небиологическому агенту.