OpenAI выпустила новые голосовые модели под названием GPT-Live-1 и GPT-Live-1 mini, заявив, что они звучат более естественно и лучше справляются с очередностью реплик в диалоге. Это полнодуплексные модели, то есть они могут говорить и слушать одновременно, позволяя пользователям естественно перебивать их и обеспечивая такие функции, как синхронный перевод.
Компания также по умолчанию заменяет текущий режим Advanced Voice Mode в ChatGPT на GPT-Live-1 mini. Пользователи платных тарифов смогут получить доступ к более крупной модели GPT-Live-1. Предыдущая модель сочетала модель распознавания речи для транскрибации, большую языковую модель для генерации ответов и модель преобразования текста в речь для озвучивания итогового ответа.
На пресс-брифинге компания заявила, что новые модели решают такие проблемы, как перебивание пользователей во время их речи и недостаточный уровень интеллектуальности для ответов на вопросы. Новые модели OpenAI будут отправлять запрос в новейшие текстовые модели компании, такие как GPT-5.5, для поиска, рассуждений или агентных возможностей, продолжая при этом разговор.
OpenAI также показала, что модель может долго сохранять молчание и воспринимать контекст разговора, пока к ней не обратятся. Кроме того, поскольку новый голосовой режим имеет доступ к более новым моделям GPT, он также может представлять некоторую информацию в визуальном формате. Другие стартапы, такие как Monogram, привлекший $40 млн посевного финансирования от DST и Lux Capital, также делают ставку на визуальные ответы, чтобы сделать ассистентов более интерактивными.
Компания заявила, что новый голосовой режим в ChatGPT рассчитан на более длительные разговоры. Во время брифинга руководитель продукта ChatGPT Voice Атти Элети сказал, что во время прогулок у него бывали 30–40-минутные разговоры с голосовой функцией.
OpenAI считает, что голос может стать основным интерфейсом для взаимодействия с вычислительными системами при выполнении сложной работы. В сообщениях предполагалось, что компания может выпустить пару наушников с ИИ-возможностями уже в этом году. Однако она не предоставила никакой информации об аппаратных продуктах.
«Со временем, как мы полагаем, это также откроет возможность использовать голос как своего рода основной интерфейс для взаимодействия с вычислительными системами и для управления всё более сложной долгосрочной агентной работой. Те поразительные сценарии использования, которые мы видим у людей, применяющих Codex и ChatGPT, — мы считаем, что голос может стать будущим интерфейсом для самых разных видов работы», — сказал Элети.
В последние несколько лет OpenAI работала над усилением голосовых функций, чтобы голосовой режим ChatGPT звучал более естественно. Компания заявила, что более 150 млн человек общаются с ChatGPT с помощью таких функций, как Voice и Dictation.
Конкуренты также пытаются сделать ассистентов более выразительными.
И Apple, и Amazon обновили своих ассистентов, сделав их более разговорными и улучшив работу с контекстом. Стартапы вроде Sesame, основанного сооснователем Oculus Бренданом Айрибе и Анкитом Кумаром, также запустили ИИ-ассистентов с более естественным общением, которые при этом выполняют задачи в фоновом режиме.
OpenAI движется в том же направлении, стремясь позволить пользователям дольше общаться с её ассистентом без помощи рук. Несмотря на заявление о том, что новый голосовой режим звучит более естественно, компания подчеркнула, что не стремится сделать его ИИ-компаньоном. Она отметила, что в новые модели встроены защитные механизмы, позволяющие давать подросткам ответы, соответствующие их возрасту.
Новый голосовой режим всё ещё нуждается в доработке. Во время демонстрации, когда компания показывала функцию синхронного перевода на хинди, у ассистента был сильный американский акцент, а его речь на хинди звучала неестественно и имела слегка книжный тон. Компания заявила, что новый режим оптимизирован для «самых распространённых языков», но не уточнила, каких именно.
Источник: TechCrunch