Чи можуть штучні інтелекти стати вашими терапевтами?
Чи може штучний інтелект стати вашим терапевтом? (Ілюстрація: Midjourney)
Зростаючий інтерес до ШІ у сфері ментального здоров’я
У США дедалі більше людей звертаються до штучного інтелекту, щоб отримати підтримку у складних психологічних ситуаціях. За даними CNN, майже кожен п’ятий молодий дорослий вже користувався чат-ботами на кшталт ChatGPT для консультацій щодо психічного здоров’я.
Головними причинами такого вибору є дефіцит кваліфікованих фахівців, висока вартість традиційної терапії та тривалість очікування на прийом. ШІ-моделі на основі великих мовних моделей (LLM) стають доступною і порівняно недорогою альтернативою для тих, хто шукає допомоги.
Як оцінюють ефективність і безпеку ШІ у ролі консультантів?
Наукова команда університету USC провела масштабне дослідження, щоб розібратися в цьому. Вони протестували такі популярні LLM, як ChatGPT-4, Llama 3.3 та Gemini 1.5 Pro, відповідаючи на реальні запитання пацієнтів, пов’язані з ментальним здоров’ям.
Далі відповіді штучного інтелекту оцінили 100 ліцензованих фахівців у галузі психічного здоров’я. Критеріями оцінювання були безпека, клінічна відповідність, ефективність, точність фактів і загальна якість відповідей.
Результати зібралися у дослідницькому звіті «COUNSELBENCH», прийнятому до престижної конференції ICLR 2026 з прийнятністю всього 1% доповідей.
Методика дослідження: як проходила оцінка відповідей AI
Відбір та аналіз запитів від реальних пацієнтів
Першим етапом команди було обрали 100 питань з платформи CounselChat — це майданчик, де ліцензовані терапевти відповідали анонімним користувачам. Теми охоплювали широкий спектр: від депресії та травм до професійного вигорання.
Кожне питання отримало відповіді трьох моделей AI та найкращу відповідь від людини-експерта для порівняння.
Оцінка фахівцями та критерії оцінювання
100 професіоналів з психотерапії надали дві тисячі оцінок 400 відповідей.
- Загальна якість – наскільки відповідь була комплексною і доречною;
- Емпатія – наскільки AI розумів та відображав емоції;
- Специфічність – чи була відповідь адаптована до індивідуальної ситуації;
- Медична доречність – чи уникалися небажані діагнози й поради;
- Токсичність – чи містилися у відповідях шкідливі або стигматизуючі вислови;
- Фактична послідовність – відповідність клінічним знанням.
Ці критерії допомогли отримати реалістичне й деталізоване уявлення про поведінку ШІ під час взаємодії з користувачами.
Перевірка на стрес: боротьба з провалами і помилками ШІ
На другому етапі дослідники сформували 120 складних і провокаційних запитань, щоби виявити слабкі місця моделей. Окрема група експертів оцінила отримані відповіді, щоб з’ясувати, чи проявляються помилки стабільно у різних системах.
Паралельно дев’ять моделей ШІ оцінювали самі себе, застосовуючи ту ж методику, що й люди. Виявилося, що їхнє самокритичне судження часто було недостовірним, адже вони не помічали власних недоліків.
Які результати показали AI-моделі у психотерапії?
Потенціал і сильні сторони
В цілому, тестовані ШІ показали добрі результати у спілкуванні:
- Відповіді були плавними, підтримуючими та часто не поступалися людським у базовій взаємодії.
- Llama 3.3 отримала найвищу оцінку в більшості критеріїв, випереджаючи конкурентів.
- ChatGPT-4 виявився найбезпечнішим, оскільки часто наполягав на зверненні за допомогою до професіоналів і уникав ризикованих порад.
Gemini 1.5 Pro хоч і посів останнє місце за загальною якістю, продемонстрував найвищий рівень емпатії серед AI, навіть кращий за онлайн-терапевтів у деяких випадках.
Де моделькам змінюватись і що викликає занепокоєння?
Безпека залишається найбільшою проблемою. Всі ШІ час від часу давали небажані поради, що можуть бути шкідливими без нагляду лікарів, зокрема:
- Загальні та надто спрощені відповіді;
- Нещодавні припущення без достатньої інформації;
- Неправомірна рекомендація медикаментів або терапевтичних методів (наприклад, антидепресантів чи когнітивно-поведінкової терапії).
Gemini відзначили за недостатню чуйність і розуміння емоцій (44,1% випадків). Llama була найчастіше винною у надмірних узагальненнях і підозріливому медичному консультуванні. ChatGPT-4 критикували за відсутність персоналізації та іноді некорисні поради.
Також під час стрес-тестів помічали упереджені оцінки, коли моделі могли називати поведінку «ненормальною» або відгукуватись байдуже.
Що це означає для майбутнього підтримки психічного здоров’я?
Дослідження вперше комплексно вивчає впровадження великих мовних моделей у сфері ментального здоров’я з погляду 100 експертів.
Незважаючи на серйозні ризики і недоліки, штучний інтелект має значний потенціал як допоміжний інструмент у наданні психологічної підтримки. Однак це потребує подальших удосконалень та суворого контролю зі сторони фахівців.
Також важливо пам’ятати, що поки що жодна система не замінить живе спілкування з кваліфікованим терапевтом.
Опубліковано: 7 липня 2026 року
Оновлено: 7 липня 2026 року
У статті використано деякий контент, створений за допомогою штучного інтелекту для підвищення ясності, послідовності та ґрунтовнішого розкриття складних наукових тем.