OpenAI презентує революційні голосові моделі для ChatGPT: справжнє спілкування з ІІ
OpenAI оновлює свою технологію голосового штучного інтелекту, зближуючи її з можливостями текстової версії ChatGPT. На сьогодні всі користувачі отримали доступ до двох нових моделей — GPT-Live-1 і його компактного аналогу, які вже доступні на мобільних застосунках і на веб-платформі.
Що нового в голосових моделях GPT-Live-1?
Нові голосові движки базуються на найсучасніших моделях OpenAI і пропонують три рівні глибини інтелектуальних відповідей. Найголовніше – за словами керівника продукту ChatGPT voice Атті Елеті, голос став більш живим, природним і здатним підтримувати справжній діалог.
Покращена взаємодія в реальному часі
Визначальна новація — технологія «безперервної взаємодії», яка дозволяє одночасно чути і говорити. Завдяки цьому штучний інтелект не чекає, доки ви закінчите фразу, а відповідає й «слухає» паралельно, що робить розмову плавнішою та комфортнішою.
- Ідеально підходить для синхронного перекладу — говорите англійською, а ChatGPT майже без затримки транслює вашу промову іспанською, хінді чи іншими мовами.
- Під час складних завдань модель делегує обробку даних потужнішій версії GPT-5.5, працюючи над кількома питаннями одночасно.
«Розумний» мультизадачний підхід
За словами дослідника Кунда Кумара, GPT-Live може, не полишаючи діалогу, звертатися до потужнішої моделі для розв’язання важких питань, і вбудовувати відповіді у власну бесіду з користувачем. Такий спосіб роботи нагадує людську манеру спілкування, коли ми думаємо і говоримо одночасно.
Візуалізація відповідей: інноваційний підхід до інформування
OpenAI пішла далі, інтегрувавши можливості створення наочних відповідей за допомогою нових технологій дизайну штучного інтелекту. Іноді найкраща відповідь — це не голос, а інфографіка чи діаграма, наприклад:
- Прогнози погоди, які можна побачити, а не лише почути;
- Статистика спортивних подій у вигляді графічних блоків;
- Іншого виду візуальна інформація, що доповнює розмову.
Нижче наведено приклад такої графічної відповіді, створеної ChatGPT в голосовому режимі.
Доступність та налаштування користувача
Нові голосові моделі доступні всім користувачам ChatGPT — як безкоштовним, так і платним. Якщо оновлення поки не з’явилося у вашому додатку чи на сайті, варто зачекати кілька днів. OpenAI поступово розгортає доступ для усіх.
Особливості голосового режиму:
- Введено наповнювачі мови типу «умм», «ерр» — роблячи інтелект більш людяним і природним;
- Можливість перервати відповідь без затримок, що значно покращує взаємодію;
- Режим очікування, коли модель терпляче слухає і відповідає лише на ім’я, подібно до голосових помічників.
Повага до приватності та безпеки
OpenAI автоматично виключає записи ваших голосових команд із навчання моделей, а аудіофайли зберігаються максимум 30 днів для контексту розмови і можуть бути видалені користувачем. Безпека — важливий аспект, адже нові моделі містять розширені засоби захисту від шкідливого контенту, таких як насильство, самопошкодження чи неприйнятні теми.
Незважаючи на унікальність і природність нових голосових моделей, варто пам’ятати про обережність у сприйнятті ІІ, адже крихкість людської психології вимагає відповідального ставлення до технологічних новинок.