OpenAI запускає GPT-Live: революція у голосовому спілкуванні з штучним інтелектом
Компанія OpenAI представила нове покоління голосових моделей GPT-Live, які змінюють уявлення про спілкування з штучним інтелектом. Тепер AI одночасно слухає і говорить, а складні завдання передає більш просунутій моделі GPT-5.5, працюючи у фоновому режимі.
Що нового приніс GPT-Live?
GPT-Live створений, щоб розмови з ChatGPT стали легкими та природними, наче ви спілкуєтеся з реальною людиною. Вже доступні дві версії:
- GPT-Live-1 – для платних користувачів на планах Go, Plus та Pro;
- GPT-Live-1 mini – безкоштовний варіант для всіх користувачів.
Обидві працюють на iOS, Android та на сайті ChatGPT.com. В найближчому часі OpenAI планує надати API для розробників.
Повноцінне двонапрямне спілкування
Замість старого формату, де користувач говорив, а AI відповідав, GPT-Live володіє повно duplex архітектурою: він може слухати і говорити одночасно, як людина під час живої розмови. Важливо, що модель приймає рішення багато разів на секунду, чи варто говорити, слухати далі, зробити паузу або втрутитись.
- Використання звукових сигналів на кшталт «мгм» чи «зрозуміло» допомагає моделі показувати, що вона уважно слухає.
- Користувачі можуть перебивати, задуматись або попросити говорити повільніше.
Покращення взаємодії та візуальні новинки
OpenAI повідомляє, що GPT-Live виявився улюбленим у 75,7% випадків порівняно з попередньою “Advanced Voice Mode”. Навіть полегшена версія mini отримала 69,2% симпатій аудиторії.
Оновлення також включає:
- Візуальні картки з актуальною інформацією: погода, біржові показники, спортивні результати тощо;
- Ребрендинг та поліпшення 9 голосів GPT-Live;
- Працюють поки що без опції відео або демонстрації екрану, але ці функції обіцяють додати незабаром.
Розділення функцій: розум і розмова
Найгігантська інновація GPT-Live – це поділ між управлінням живої розмови та складним мисленням. Якщо виникає запит, що потребує веб-пошуку чи глибшого аналізу, GPT-Live автоматично передає завдання у фоновий режим моделі GPT-5.5. Таким чином, діалог не зачіпається і йде без зупинок.
Різні рівні мислення для різних потреб
Користувачі можуть обирати один із трьох варіантів швидкості та глибини роздумів:
- Instant – швидкі відповіді для простих питань;
- Medium – збалансований варіант для більш складних завдань;
- High – максимальна увага до деталів для вимогливих задач.
Таке делегування задач виправляє головний недолік попередників, які відповідали лише власними ресурсами, значно відстаючи від найкращих моделей.
Успішність та точність нової моделі
Завдяки співпраці з GPT-5.5, GPT-Live досягає вражаючих результатів у тестах. Наприклад, у науковому тесті GPQA точність GPT-Live-1 при високому рівні мислення становить 84,2%, тоді як у Advanced Voice Mode – лише 45,3%.
Особливо помітною є різниця у веб-пошуку за допомогою моделі для агентського пошуку BrowseComp:
- GPT-Live-1 показує точність 75,2%;
- Advanced Voice Mode – жалюгідні 0,7%;
- Навіть версія Mini демонструє 31,6% точності.
Телефонна підтримка на новому рівні
Внутрішній тест OpenAI tau3 Voice Telecom оцінює здатність повнодуплексних голосових агентів допомагати клієнтам у реальних телефонних ситуаціях. Результати GPT-Live вражають:
- Високий рівень мислення дозволяє виконувати до 65% завдань майже вдвічі швидше, ніж старі моделі;
- Advanced Voice Mode залишається найповільнішим і найменш ефективним;
- Варіант Instant швидше, але менш точний – вирішує близько 37% кейсів.
Безпека і людяність: баланс нової епохи ШІ
Люди схильні прирівнювати AI до живої людини, що може призводити до небезпечних ситуацій через емоційну залежність. Особливо це актуально для користувачів, які багато говорять з голосовими моделями.
OpenAI передбачив низку заходів безпеки, які спрацьовують ще під час промовляння користувачем, спрямовуючи розмову в безпечніше русло. У високоризикових випадках бесіда може завершитися, а у випадках тем, пов’язаних із самопошкодженням, одразу ж з’являються контакти кризових служб.
Дитяча безпека та контроль батьків
Для молодших користувачів модель GPT-Live налаштована діяти відповідно до віку. Батьки можуть вмикати фільтри доступу до голосового асистента та отримуватимуть повідомлення у критичних ситуаціях. Голоси в системі строго обмежені — жодних копій реальних голосів, лише узгоджені заздалегідь варіанти.
Більш детальна інформація про безпекові механізми доступна у спеціальній системній карті OpenAI.