Приложение сравнения никогда не было пустым: что измерили 32 испытания при тревоге, измеряя цифровое плацебо
- Систематический обзор с метаанализом, Университет Осаки: рассмотрены 54 рандомизированных испытания с цифровым плацебо в качестве условия сравнения (7092 участника), объединены 32 испытания со шкалами GAD-7, DASS-A или HADS-A (5311 участников). Сводное изменение в группе сравнения составило g Хеджеса = 0,28 (95 % ДИ от 0,18 до 0,38) при I² = 76 %.
- Оценка представляет собой внутригрупповое изменение от исходного уровня к концу вмешательства, вычисленное по средним значениям и стандартным отклонениям одной лишь группы сравнения. Это не сопоставление с группой без лечения, поэтому естественное течение, регрессия к среднему и повторное самооценивание помещены в то же число, что и ожидания пациента.
- Оценка устояла при проверках: тест Эггера дал p = 0,47; процедура восполнения недостающих работ добавила 2 исследования и снизила величину до g = 0,24 (95 % ДИ от 0,13 до 0,35); только испытания с низким риском систематической ошибки дали g = 0,26 (95 % ДИ от 0,15 до 0,36); исключение испытаний с восстановленными средними или стандартными отклонениями дало g = 0,30 (95 % ДИ от 0,20 до 0,40).
- Содержание приложения сравнения оказалось статистически значимым модификатором (анализ подгрупп, p = 0,02) наряду с диагнозом (p = 0,03) и исходной тяжестью (p = 0,02); вместе с выбором шкалы они объяснили R² = 58,5 % неоднородности. Одна оговорка: в строке метарегрессии для условия "Removed" коэффициент -0,048 несовместим ни с собственным интервалом (от -0,954 до -0,013), ни со стандартной ошибкой 0,240, ни с p = 0,04, которые все указывают примерно на -0,48.
Группа из Университета Осаки задала вопрос, который испытания цифровых средств помощи при психических расстройствах обычно обходят: насколько само приложение сравнения сдвигает балл тревоги? По 32 рандомизированным испытаниям и 5311 участникам сводный ответ составил g Хеджеса = 0,28 (95 % ДИ от 0,18 до 0,38). Величина скромнее, чем предполагает воодушевление вокруг цифрового плацебо, и измеряет она не совсем то, что обозначает её название.
Что именно измерено
Величину эффекта вычисляли по средним значениям и стандартным отклонениям на исходном уровне и после вмешательства в одной лишь группе сравнения. Это внутригрупповое изменение за период лечения, а не разность между группами. В него свёрнуто всё, что способно сдвинуть балл шкалы самоотчёта за несколько недель: естественное течение тревожного эпизода, регрессия к среднему в выборке, отобранной по повышенным баллам при скрининге, реактивность четвёртого по счёту заполнения GAD-7 и те ожидания, которые породило приложение сравнения. Называя всю эту величину эффектом плацебо, мы приписываем ожиданиям то, что произвели несколько процессов сообща.
Авторы были аккуратны там, где это позволяли данные. Поиск вёлся в PubMed, Web of Science и Scopus в июле 2024 года; если испытание сообщало несколько показателей тревоги, брался тот, где ответ на плацебо был наименьшим, что смещает сводную величину вниз, а не вверх. Тест Эггера смещения публикаций не выявил (p = 0,47), процедура восполнения добавила 2 недостающих исследования и привела оценку к g = 0,24 (95 % ДИ от 0,13 до 0,35). Ограничение выборки испытаниями с низким риском систематической ошибки дало g = 0,26 (95 % ДИ от 0,15 до 0,36); исключение испытаний, где средние или стандартные отклонения приходилось восстанавливать, дало g = 0,30 (95 % ДИ от 0,20 до 0,40). Оценка устойчива ко всем проверкам, которые применили авторы. Осторожности требует её истолкование.
Условие сравнения не одинаково
Обзор разделяет контрольные приложения на четыре разновидности, заимствуя эту классификацию из более ранних работ, а не создавая её, и именно эту часть стоит забрать себе. «Replaced» заменяет действующий компонент нейтральным. "Removed" попросту удаляет действующий компонент. "Unrelated" подставляет другой, не связанный с исходным действующий компонент. "Less" оставляет ослабленный вариант того же самого. Испытание, где лечебное приложение сравнивают с урезанной копией себя, и испытание, где его сравнивают с оболочкой дневника настроения, ставят разные опыты, а общий ярлык "плацебо-контролируемое" эту разницу скрывает, а не описывает.
Разновидность условия сравнения оказалась статистически значимым модификатором (анализ подгрупп, p = 0,02), как и диагноз (p = 0,03) и исходная тяжесть (p = 0,02). В метарегрессии первичным психическим расстройствам соответствовал коэффициент 0,308 (95 % ДИ от 0,087 до 0,530, p = 0,01), а низким исходным баллам – коэффициент -0,222 (95 % ДИ от -0,406 до -0,038, p = 0,02); вместе с выбором шкалы они объяснили R² = 58,5 % неоднородности. Обратите внимание на направление по тяжести: чем выше исходные баллы, тем крупнее видимый ответ на плацебо. Именно это предсказывает регрессия к среднему. Это же предсказывают и ожидания пациента. Данная схема исследования развести их не позволяет.
Одно предостережение о самой таблице, поскольку читатель может в неё заглянуть. В строке для условия "Removed" стоит коэффициент -0,048, рядом с 95 % интервалом от -0,954 до -0,013, стандартной ошибкой 0,240 и p = 0,04. Все четыре значения истинными быть не могут: интервал центрирован около -0,48, что в точности следует из этой стандартной ошибки и этого значения p, и именно большая величина, а не -0,048, согласуется с утверждением самой работы о том, что условие "Removed" давало наименьший ответ. Ещё в двух строках видны сходные обмолвки – в нижней границе для возраста и в стандартной ошибке для числа групп; все прочие строки внутренне согласованы. Я следовал интервалам, которые согласуются с текстом, и не стал бы цитировать напечатанный в этой ячейке коэффициент.
Как читать испытание приложения на приёме
Когда пациент приходит с приложением, за которым стоит рандомизированное испытание, полезен не вопрос, превзошло ли оно плацебо, а вопрос, чем это плацебо было. Стандартизованная разность 0,3 по сравнению с выхолощенной копией того же продукта означает не то же самое, что такая же разность по сравнению с посторонним приложением. Стоит выяснить, что именно открывала группа сравнения, как долго пользовалась и как часто её просили оценивать своё состояние. Первые два ответа обычно есть в реестрах испытаний; третий чаще всего и остаётся самой крупной неучтённой составляющей.
Величина 0,28 принадлежит испытанию, а не пациенту на приёме. В обычной помощи никого не рандомизируют, никого не ослепляют и никто не измеряет состояние человека еженедельно силами сотрудника исследования. Что этот метаанализ действительно устанавливает – это нижнюю планку: в испытаниях вмешательств, которые нельзя как следует ослепить, группа сравнения сдвигается примерно на четверть или треть стандартного отклонения ещё до того, как станет виден собственный эффект вмешательства. Любому цифровому средству эту планку нужно перекрыть, прежде чем его заявка что-то значит.
Находку о тяжести стоит проговаривать вслух. Пациенты, набранные с высокими исходными баллами, улучшались в группе сравнения сильнее, и та же несимметричность работает на приёме, куда человек обычно приходит на плохой неделе. Если кто-то начал пользоваться приложением в понедельник и через две недели чувствует себя ровнее, улучшение настоящее и его стоит признать. Но причина улучшения самим улучшением не устанавливается. Оба утверждения умещаются в одну фразу, и произнесённые вместе они удерживают пациента и от того, чтобы бросить работающее лечение из-за одной хорошей недели, и от того, чтобы приписать заслугу приложению, случайно оказавшемуся рядом.
Описанный здесь эффект цифрового плацебо – это внутригрупповое изменение в группе сравнения, а значит, ожидания пациента – один из нескольких процессов, упакованных в одно число.
Авторы перечисляют свои: включены только взрослые 18 лет и старше, объединены только три шкалы самоотчёта тревоги, поиск шёл по трём базам, отдалённых данных нет, а определение цифрового плацебо было одним из нескольких допустимых. Неоднородность высока, I² = 76 %. Одна оговорка принадлежит редактору, а не авторам: схема оценивает, насколько меняются группы сравнения, а не какую долю этого изменения вызвали ожидания, и сама статья такого различения не проводит, называя измеренную величину эффектом цифрового плацебо. Первый автор работает в компании NS Pharma, которая, как указано в статье, цифровых лечебных решений не предлагает, а исследование, по утверждению авторов, велось независимо от компании.