OpenAI представила голосовые модели GPT-Live-1 и Mini с дуплексной архитектурой для одновременной обработки речи и генерации ответа
Новые модели позволяют прерывать ИИ в любой момент, распознают устные подтверждения вроде «ага» и «понял» и лучше фильтруют фоновые шумы
GPT-Live автоматически делегирует сложные задачи другим моделям OpenAI, включая GPT-5.5, не прерывая разговор
Внедрены дополнительные меры безопасности: система способна завершить голосовой диалог при высоких рисках, а родителей уведомляют о попытках разговора на тему самоповреждения
OpenAI выпускает две новые голосовые модели — GPT-Live-1 и GPT-Live-1 mini, — которые, по заявлению компании, заметно меняют работу голосового режима ChatGPT. Формально это обновление одной функции, но по сути речь о смене самого принципа, по которому чат-бот слушает человека и отвечает ему.
Предыдущий подход, Advanced Voice Mode, компания запустила летом 2024 года. На старте он произвёл сильное впечатление и выглядел серьёзным шагом вперёд по сравнению с давно закостеневшими голосовыми ассистентами вроде Siri и Alexa, но со временем ограничения стали слишком заметны. В его основе лежала так называемая пошаговая модель, которая работает ровно так, как звучит: система обязана дождаться, пока человек замолчит, и только потом начинает говорить сама.
На практике это давало вымученный обмен репликами. Хуже того, признаком конца фразы для модели служила тишина, поэтому обычная пауза на раздумье регулярно принималась за окончание вопроса — и ассистент влезал в середину мысли собеседника. Любой, кто пробовал надиктовать голосом длинный запрос, знает это ощущение неловкости.
Что такое дуплексная архитектура
Семейство GPT-Live-1 построено на дуплексной архитектуре: модель способна одновременно обрабатывать входящий звук и генерировать собственный ответ. «Это позволяет модели вести более естественный диалог, лучше чувствовать время и даже выполнять синхронный перевод», — объясняют в компании.
Аналогия здесь простая: пошаговая модель ведёт себя как рация, где говорить может только один участник, а дуплексная — как обычный телефонный звонок, в котором оба слышат друг друга непрерывно. Именно из этого свойства вырастают все остальные улучшения: перебивание в любой момент, реакция на междометия, способность подстроить темп речи. Отдельно стоит отметить синхронный перевод — сценарий, который до сих пор требовал специализированных приложений и почти всегда работал с задержкой в несколько секунд.
Вторая идея релиза — делегирование. Если голосовая модель понимает, что запрос требует рассуждений, веб-поиска или иных агентных возможностей, она может обратиться за помощью к другим моделям OpenAI, включая GPT-5.5. Тяжёлая работа при этом идёт в фоне, а разговор с GPT-Live не прерывается. Это разумный инженерный компромисс: держать одну гигантскую модель, которая одновременно быстро говорит и глубоко думает, слишком дорого, поэтому роль ведущего диалог и роль эксперта разделены.
В сумме изменения дают голосовой опыт, который в компании считают более полезным. Новые модели можно прервать в любой момент и попросить говорить медленнее, если темп кажется слишком быстрым. Пока говорит человек, ассистент подтверждает, что слушает, словесными сигналами вроде «мхм» и «понял», — мелочь, но именно из таких мелочей складывается ощущение живого разговора. Отдельно в OpenAI утверждают, что модели стали устойчивее к фоновому шуму: это важно для использования в транспорте, на улице и в открытом офисе.
ChatGPT Voice также научился показывать визуальные элементы — карточки-виджеты для погоды, спорта, котировок и других тем. Как и раньше, поддерживаются загрузка изображений и файлов, а также поиск в интернете. Голос перестаёт быть отдельным изолированным режимом и превращается в ещё один способ работать с тем же ассистентом.
Безопасность и родительский контроль
Одновременно OpenAI заявляет о новых мерах безопасности в ChatGPT Voice. «Когда система обнаруживает потенциально небезопасный вывод, она может направить модель к более безопасному ответу, отобразить дополнительные предупреждения или завершить голосовой разговор в случаях высокого риска», — говорится в описании компании.
Родители и опекуны могут через недавно появившиеся родительские элементы управления вовсе отключить ChatGPT Voice для подростка. Если доступ оставлен и система замечает, что разговор уводят в сторону самоповреждения, родителю приходит уведомление. Это прямое следствие давления, под которым разработчики чат-ботов оказались за последние годы: к ним предъявляют иски, их проверяют регуляторы, а тема защиты несовершеннолетних стала для отрасли основным репутационным риском. Голосовой интерфейс усиливает проблему — он воспринимается интимнее текстового и лучше маскирует, что собеседник является программой.
Кто ещё делает голосовых ассистентов
Конкуренция в этой нише за последние два года стала плотной. У Google есть Gemini Live с распознаванием того, что происходит в камере смартфона, Amazon перестроила Alexa вокруг больших языковых моделей, а Apple уже не первый год обещает по-настоящему переработанную Siri. При этом голос — самый естественный интерфейс для машины, автомобиля, кухни и наушников, то есть для тех сценариев, где экран либо неудобен, либо недоступен вовсе.
Реальный барьер здесь не качество распознавания, а задержка и естественность реплик. Пауза в полторы секунды перед ответом мгновенно убивает ощущение разговора, и именно эту секунду все участники гонки и пытаются отыграть. Дуплексная схема — попытка решить проблему архитектурно, а не подкручиванием оптимизаций.
Доступность, тарифы и что это значит для СНГ
Развёртывание GPT-Live в ChatGPT начинается на Android, iOS и в веб-версии. GPT-Live 1 станет основной моделью для подписчиков тарифов Go, Plus и Pro, а бесплатные аккаунты по умолчанию получат более компактную Live-1 mini. Тариф Go — самый доступный в линейке, он изначально появился на развивающихся рынках как ответ на то, что подписка за двадцать долларов в месяц там оказывается слишком дорогой.
Для пользователей из СНГ ситуация привычная и не самая простая: ChatGPT официально не работает в России и Белоруссии, оплата подписки картами местных банков невозможна, а голосовой режим вдобавок требует стабильного соединения с низкой задержкой. Отдельно стоит помнить, что доступность чат-бота на сторонних платформах непостоянна: работа ChatGPT в мессенджере WhatsApp* была прекращена после того, как владелец сервиса изменил правила для сторонних ИИ-ассистентов. Ассистенты, работающие в чужих экосистемах, всегда живут по чужим правилам.
Практический вывод из релиза выходит за рамки одной компании. Если дуплексные модели действительно снимают проблему пауз и перебиваний, голосовое общение с ИИ перестаёт быть демонстрацией и становится рабочим инструментом — для перевода, диктовки, обучения языку и работы с руками, занятыми чем-то другим. Проверять это придётся на реальных разговорах, а не на подготовленных сценах презентаций, и первые недели после развёртывания обычно показывают куда больше, чем сам анонс.
* Принадлежит компании Meta, деятельность которой признана экстремистской и запрещена на территории Российской Федерации. Социальные сети Facebook и Instagram запрещены в РФ.












