ChatGPT внедрил новую голосовую модель GPT-Live с архитектурой полного дуплекса, позволяющей одновременно слушать и говорить без перебиваний
GPT-Live доступен всем пользователям ChatGPT, но бесплатный тариф ограничен моделью mini, а настройка трёх уровней интеллекта требует платной подписки
Пользователи могут переключаться между уровнями интеллекта от Instant до High, при этом более сложные задачи автоматически передаются фоновым моделям вроде GPT-5.5
Новая голосовая модель поддерживает живые переводы и интерактивные виджеты, но пока не умеет работать с экраном и видео
ИИ-ассистенты вроде ChatGPT с каждым обновлением становятся точнее и быстрее, предлагая пользователям всё больше возможностей. Генеративный ИИ по-прежнему не идеален, и полагаться на него как на безусловный источник информации не стоит, но для тех, кто уже привык к этой технологии, голосовое общение может оказаться удобнее набора текста. Первая голосовая версия ChatGPT, появившаяся в 2023 году, работала через три отдельные системы: сначала речь распознавалась и превращалась в текст, затем языковая модель формировала ответ, а модель синтеза речи озвучивала его.
Источник изображения — engadget.com
Позже на смену пришёл Advanced Voice Mode с единой мультимодальной моделью, что заметно улучшило качество общения. 8 июля 2026 года OpenAI объявила о запуске новой модели GPT-Live, которая полностью заменила предыдущую систему в качестве голосового режима по умолчанию. Компания называет архитектуру «полнодуплексной»: модель может слушать и говорить одновременно, десятки раз в секунду принимая решение — продолжать ли молчать, вставить короткую реплику или полноценно ответить. Раньше короткая пауза в речи пользователя нередко ошибочно принималась моделью за конец фразы, из-за чего ChatGPT начинал отвечать до того, как собеседник договаривал предложение.
Во время разговора GPT-Live может подавать короткие сигналы вроде «мхм» или «да», как это делает человек в живой беседе. Если вопрос требует поиска информации или более глубокого рассуждения, модель незаметно передаёт задачу на обработку более мощной системе — на старте это GPT-5.5 — и продолжает поддерживать разговор, пока ответ формируется в фоновом режиме.
GPT-Live доступен в приложении ChatGPT на Android и iOS, а также в веб-версии в любом браузере, и раскатывается пользователям по всему миру. Подписчики тарифов ChatGPT Pro, Plus и Go получают модель GPT-Live-1, а пользователям бесплатного плана достаётся облегчённая GPT-Live-1 mini. Чтобы начать голосовой разговор, достаточно нажать на значок волны в правой части текстового поля; при первом обращении приложение запросит доступ к микрофону устройства.
После входа в голосовой режим на экране появляется отзывчивая плавающая сфера, реагирующая на речь. Через значок настроек в правом верхнем углу можно выбрать один из трёх уровней интеллекта — Instant, Medium и High. Эта настройка недоступна в облегчённой модели GPT-Live-1 mini и требует платной подписки. Голосовой режим при этом продолжает работать, даже если свернуть приложение или заблокировать устройство.
Главное ограничение новой модели на старте — отсутствие поддержки демонстрации экрана и видео. Вернуться к прежней голосовой модели можно через настройки ChatGPT в разделе Voice, где также доступен выбор голоса, языка общения и включение голosового режима по умолчанию при запуске приложения.
Пользователи, привыкшие скорее печатать, чем разговаривать с ассистентом, в первые дни после запуска отмечали, что обновлённый голосовой режим ощущается заметно естественнее предыдущих версий: ChatGPT почти не перебивает на полуслове и не заставляет неловко ждать паузы, чтобы вступить в разговор. При развёрнутых репликах у части пользователей возникало впечатление, что модель предугадывает продолжение фразы ещё до того, как она произнесена. Похожие полнодуплексные архитектуры параллельно развивают и другие компании — в частности, Google представляет собственный Gemini Live, а над аналогичными системами работают ByteDance и Nvidia.
Благодаря быстрой реакции GPT-Live хорошо подходит и для синхронного перевода: в любой момент разговора можно прокрутить экран вниз и увидеть текстовую расшифровку всего сказанного. Если ChatGPT решает, что на вопрос лучше ответить визуально, помимо голосового ответа он формирует рядом интерактивный виджет.
По умолчанию уровень интеллекта GPT-Live установлен на Instant — он быстро справляется с большинством повседневных вопросов, а поисковые запросы и более сложные рассуждения незаметно передаёт мощным моделям в фоне. Переключение на уровни Medium и High добавляет доле секунды на обдумывание ответа, но не нарушает естественности беседы и подойдёт тем, кто планирует регулярно обсуждать с ассистентом сложные темы. Доступ к GPT-Live через API пока не открыт — OpenAI собирает заявки на лист ожидания, и разработчикам голосовых приложений пока предлагается использовать модели линейки GPT-Realtime.















