Чи може ChatGPT виконувати роль терапевта? Дослідження USC оцінює відповіді штучного інтелекту на питання про психічне здоров’я – USC Viterbi

Written By: author avatar Олена Ткач
author avatar Олена Ткач
Фахівчиня з цифрового маркетингу. Пише просто про складне: штучний інтелект, мобільні додатки, технології в Україні.Гасло: «Технології — це просто. Особливо, коли пояснюю я».

7 Липня, 2026

Чи можуть штучні інтелекти стати вашими терапевтами?

Чи може штучний інтелект стати вашим терапевтом? (Ілюстрація: Midjourney)

Зростаючий інтерес до ШІ у сфері ментального здоров’я

У США дедалі більше людей звертаються до штучного інтелекту, щоб отримати підтримку у складних психологічних ситуаціях. За даними CNN, майже кожен п’ятий молодий дорослий вже користувався чат-ботами на кшталт ChatGPT для консультацій щодо психічного здоров’я.

Головними причинами такого вибору є дефіцит кваліфікованих фахівців, висока вартість традиційної терапії та тривалість очікування на прийом. ШІ-моделі на основі великих мовних моделей (LLM) стають доступною і порівняно недорогою альтернативою для тих, хто шукає допомоги.

Як оцінюють ефективність і безпеку ШІ у ролі консультантів?

Наукова команда університету USC провела масштабне дослідження, щоб розібратися в цьому. Вони протестували такі популярні LLM, як ChatGPT-4, Llama 3.3 та Gemini 1.5 Pro, відповідаючи на реальні запитання пацієнтів, пов’язані з ментальним здоров’ям.

Далі відповіді штучного інтелекту оцінили 100 ліцензованих фахівців у галузі психічного здоров’я. Критеріями оцінювання були безпека, клінічна відповідність, ефективність, точність фактів і загальна якість відповідей.

Результати зібралися у дослідницькому звіті «COUNSELBENCH», прийнятому до престижної конференції ICLR 2026 з прийнятністю всього 1% доповідей.

Методика дослідження: як проходила оцінка відповідей AI

Відбір та аналіз запитів від реальних пацієнтів

Першим етапом команди було обрали 100 питань з платформи CounselChat — це майданчик, де ліцензовані терапевти відповідали анонімним користувачам. Теми охоплювали широкий спектр: від депресії та травм до професійного вигорання.

Кожне питання отримало відповіді трьох моделей AI та найкращу відповідь від людини-експерта для порівняння.

Оцінка фахівцями та критерії оцінювання

100 професіоналів з психотерапії надали дві тисячі оцінок 400 відповідей.

  • Загальна якість – наскільки відповідь була комплексною і доречною;
  • Емпатія – наскільки AI розумів та відображав емоції;
  • Специфічність – чи була відповідь адаптована до індивідуальної ситуації;
  • Медична доречність – чи уникалися небажані діагнози й поради;
  • Токсичність – чи містилися у відповідях шкідливі або стигматизуючі вислови;
  • Фактична послідовність – відповідність клінічним знанням.

Ці критерії допомогли отримати реалістичне й деталізоване уявлення про поведінку ШІ під час взаємодії з користувачами.

Перевірка на стрес: боротьба з провалами і помилками ШІ

На другому етапі дослідники сформували 120 складних і провокаційних запитань, щоби виявити слабкі місця моделей. Окрема група експертів оцінила отримані відповіді, щоб з’ясувати, чи проявляються помилки стабільно у різних системах.

Паралельно дев’ять моделей ШІ оцінювали самі себе, застосовуючи ту ж методику, що й люди. Виявилося, що їхнє самокритичне судження часто було недостовірним, адже вони не помічали власних недоліків.

Які результати показали AI-моделі у психотерапії?

Потенціал і сильні сторони

В цілому, тестовані ШІ показали добрі результати у спілкуванні:

  1. Відповіді були плавними, підтримуючими та часто не поступалися людським у базовій взаємодії.
  2. Llama 3.3 отримала найвищу оцінку в більшості критеріїв, випереджаючи конкурентів.
  3. ChatGPT-4 виявився найбезпечнішим, оскільки часто наполягав на зверненні за допомогою до професіоналів і уникав ризикованих порад.

Gemini 1.5 Pro хоч і посів останнє місце за загальною якістю, продемонстрував найвищий рівень емпатії серед AI, навіть кращий за онлайн-терапевтів у деяких випадках.

Де моделькам змінюватись і що викликає занепокоєння?

Безпека залишається найбільшою проблемою. Всі ШІ час від часу давали небажані поради, що можуть бути шкідливими без нагляду лікарів, зокрема:

  • Загальні та надто спрощені відповіді;
  • Нещодавні припущення без достатньої інформації;
  • Неправомірна рекомендація медикаментів або терапевтичних методів (наприклад, антидепресантів чи когнітивно-поведінкової терапії).

Gemini відзначили за недостатню чуйність і розуміння емоцій (44,1% випадків). Llama була найчастіше винною у надмірних узагальненнях і підозріливому медичному консультуванні. ChatGPT-4 критикували за відсутність персоналізації та іноді некорисні поради.

Також під час стрес-тестів помічали упереджені оцінки, коли моделі могли називати поведінку «ненормальною» або відгукуватись байдуже.

Що це означає для майбутнього підтримки психічного здоров’я?

Дослідження вперше комплексно вивчає впровадження великих мовних моделей у сфері ментального здоров’я з погляду 100 експертів.

Незважаючи на серйозні ризики і недоліки, штучний інтелект має значний потенціал як допоміжний інструмент у наданні психологічної підтримки. Однак це потребує подальших удосконалень та суворого контролю зі сторони фахівців.

Також важливо пам’ятати, що поки що жодна система не замінить живе спілкування з кваліфікованим терапевтом.

Опубліковано: 7 липня 2026 року
Оновлено: 7 липня 2026 року

У статті використано деякий контент, створений за допомогою штучного інтелекту для підвищення ясності, послідовності та ґрунтовнішого розкриття складних наукових тем.

author avatar
Олена Ткач
Фахівчиня з цифрового маркетингу. Пише просто про складне: штучний інтелект, мобільні додатки, технології в Україні.Гасло: «Технології — це просто. Особливо, коли пояснюю я».

різне