OpenAI запускає GPT-Live: голосовий асистент нового покоління для живої та природної розмови
OpenAI представляє GPT-Live — інноваційну серію голосових моделей з архітектурою full-duplex, що дозволяє одночасно слухати і говорити, а складні завдання передавати GPT-5.5 в фоновому режимі.
Новий рівень взаємодії: як працює GPT-Live
GPT-Live — це революція у світі голосових помічників, яка робить спілкування з ChatGPT набагато живішим і природнішим. Наразі доступні дві версії: повна GPT-Live-1 для передплатників планів Go, Plus і Pro, а також полегшений варіант GPT-Live-1 mini для безкоштовних акаунтів. Обидва працюють на платформах iOS, Android і ChatGPT.com. Планується і швидке відкриття доступу через API для розробників, які можуть зареєструватись через спеціальну форму.
Замість звичайного жорсткого режиму “говориш — чекай відповіді”, GPT-Live обирає архітектуру full-duplex. Це означає, що модель може одночасно приймати ваші слова і відповідати, імітуючи звичну людську бесіду. Подібні системи раніше демонструвала Nvidia з відкритою моделлю PersonaPlex, але OpenAI пропонує більш глибоке занурення.
Система приймає рішення багаторазово за секунду: говорити, слухати, робити паузу чи перебивати, а при необхідності — використовувати спеціальні інструменти. Для підсилення ефекту живої розмови вона може вставляти зв’язані слова, як-от «ммм» або «зрозумів», щоб показати, що слідкує за ходом діалогу. Користувачі ж можуть у будь-який момент перервати, подумати або попросити сповільнити темп відповіді.
Порівняння з попередніми голосовими режимами
Згідно з повідомленнями OpenAI, GPT-Live-1 обрали 75,7% користувачів замість «Розширеного голосового режиму», а варіант mini — 69,2%. Окрім оновленої системи діалогу, модель отримала нові візуальні картки, які можуть відображатись під час спілкування для показу погоди, котирувань акцій або результатів спортивних подій. Також було оновлено дев’ять голосів, що використовуються GPT-Live.
На момент запуску GPT-Live не підтримує голосове спілкування з відео чи демонстрацією екрану, проте OpenAI обіцяє додати ці функції найближчим часом. Нині «Стандартний» та «Розширений голосовий режим» зі згаданими можливостями залишаються у користуванні.
Нова делегація завдань GPT-5.5 змінює правила гри
Ключовою інновацією є розподіл обов’язків: управління живою бесідою залишилося GPT-Live, а складні операції, такі як веб-пошук, роздуми чи агентська робота, віддаються в фоновому режимі GPT-5.5. При цьому сама розмова продовжується без перерв.
Архітектура влаштована так, що GPT-Live завжди з’єднаний з найсучаснішими моделями OpenAI. До того ж користувачі можуть обирати рівень глибини аналізу, від «Миттєвого» (швидкі відповіді) до «Середнього» і «Високого», коли ChatGPT витрачає більше часу на опрацювання питання.
Це суттєво піднімає планку у порівнянні із старими «живими» моделями, які працювали виключно на власних здібностях і значно поступалися сучасним рішенням у складних завданнях.
Вражаючі показники якості
На тесті GPQA з наукового мислення GPT-Live-1 демонструє 84,2% точності при високому рівні аналітики, у той час як «Розширений голосовий режим» — лише 45,3%. Ще яскравішою є різниця в BrowseComp — бенчмарку для пошуку в інтернеті агентським способом. GPT-Live-1 набирає 75,2%, а «Розширена» версія — жалюгідні 0,7%. Mini-варіант теж показує значні результати — 31,6%.
Також GPT-Live показує кращі результати на внутрішньому тесті OpenAI tau3 Voice Telecom, який оцінює повнодуплексних голосових агентів у реалістичних завданнях технічної підтримки. Залежно від рівня аналітики, GPT-Live-1 успішно виконує значно більше завдань і робить це швидше. На противагу йому, «Розширений режим» має найнижчий рівень виконання і витрачає більше часу.

Більш людський голос підвищує виклики безпеки
Сприйняття ШІ як живої людини — це подвійний меч. Статистика свідчить, що користувачі голосових моделей частіше розвивають емоційну залежність і можуть піддаватися маніпуляціям, що часом має серйозні наслідки. Коли система звучить і відповідає, немов реальна людина, ці ризики зростають.
Тому OpenAI вбудувала низку систем безпеки, які починають діяти ще під час мовлення користувача. Вони можуть спрямовувати відповідь у безпечніше русло, показувати додаткові попередження або ж зовсім припинити розмову у критичних випадках. При згадках тем пов’язаних із самогубством автоматично з’являються телефони довіри.
Для молодших користувачів модель налаштована на поведінку відповідно до віку. Батьки можуть встановлювати батьківський контроль, обмежуючи доступ до голосових функцій у ChatGPT і отримуючи сповіщення про потенційно ризикові ситуації. Варто зазначити, що GPT-Live не імітує реальні голоси, а користується лише заздалегідь заданими варіантами.
Повний опис заходів безпеки детально описаний у офіційному System Card OpenAI.