Компания OpenAI представила Ultrafast — новый уровень обслуживания в своём программном интерфейсе (API), при котором флагманская модель GPT-5.6 Sol отвечает значительно быстрее обычного. Анонс состоялся в четверг, 13 августа.

Режим Ultrafast для модели GPT-5.6 Sol от OpenAI

По заявлению разработчиков, в новом режиме модель выдаёт до 750 выходных токенов в секунду — это до 14 раз быстрее стандартной обработки, у которой базовая скорость составляет примерно 53 токена в секунду. Токены — это отдельные фрагменты текста, из которых языковая модель собирает ответ пользователю.

Принципиальный момент в том, что ускорение достигнуто без перехода на упрощённую модель. Раньше высокая скорость ответа почти всегда означала выбор более компактной или узкоспециализированной нейросети. В OpenAI описывают Ultrafast как движение в другом направлении — больше полезной работы в секунду при том же уровне возможностей, что и у обычной GPT-5.6 Sol.

реклама кормит Уточку 🦆

Что показали замеры

Основной аргумент разработчиков — прохождение теста Humanity's Last Exam (HLE). Это набор из 2500 вопросов уровня научной степени по химии, экономике и литературе. В ускоренном режиме GPT-5.6 Sol ответила на весь набор за 11 часов 11 минут, тогда как Claude Fable 5 в тех же условиях потребовалось более трёх суток непрерывных вычислений — 78 часов 27 минут. При этом точность ответов, по утверждению испытателей, оказалась сопоставимой.

Модель и режим
Время на 2500 вопросов HLE
Скорость вывода
GPT-5.6 Sol, Ultrafast
11 ч 11 мин
до 750 токенов/с
GPT-5.6 Sol, стандартный режим
нет данных
около 53 токенов/с
Claude Fable 5
78 ч 27 мин
в 11 раз ниже, чем у Ultrafast

На тесте GDP-Val, который оценивает выполнение экономически значимых задач умственного труда — юридических заключений, финансовых моделей, инженерных отчётов, — Ultrafast дал ускорение в 5,6 раза от начала до конца задачи без ухудшения качества результата.

Важная оговорка: все приведённые замеры выполнила сама Cerebras — партнёр OpenAI, а не независимая сторона. Тестирование проводилось в июле 2026 года.

реклама кормит Уточку 🦆

Откуда берётся скорость

Ultrafast работает на оборудовании компании Cerebras (биржевой код NASDAQ: CBRS) — производителя специализированных вычислителей для искусственного интеллекта. В основе лежит архитектура Wafer-Scale Engine: вместо привычной сборки из множества графических ускорителей используется один кристалл размером с целую кремниевую пластину, несущий 44 ГБ сверхбыстрой памяти SRAM прямо на борту.

Благодаря этому веса модели хранятся непосредственно на кристалле, и их не нужно постоянно перегонять между встроенной и внешней памятью, как это происходит на графических ускорителях. Именно перегон данных, а не сами вычисления, обычно и ограничивает скорость работы больших моделей — Cerebras это узкое место устраняет.

Соглашение о поставке вычислительных мощностей OpenAI и Cerebras заключили ещё в январе 2026 года, и Ultrafast стал первым публичным результатом этого партнёрства.

реклама кормит Уточку 🦆

Кому это нужно

В OpenAI видят применение ускоренному режиму прежде всего в корпоративных задачах, где задержка ответа критична не меньше, чем его качество:

  • реагирование на сбои и нештатные ситуации в инфраструктуре;
  • обслуживание клиентов и служба поддержки;
  • анализ финансовых рынков в режиме реального времени;
  • электронная торговля и подбор товаров;
  • программы-помощники, выполняющие цепочки действий без участия человека.

Отдельно отмечается работа с длинными документами — юридическими заключениями, финансовыми расчётами и технической отчётностью, где модель генерирует большие объёмы текста и выигрыш в скорости накапливается.

реклама кормит Уточку 🦆

Как получить доступ

Пока Ultrafast доступен только в предварительной версии и только через программный интерфейс OpenAI — в ChatGPT режима нет. Круг участников ограничен небольшой группой корпоративных клиентов: компания оценивает спрос и запас мощностей. Доступ обещают расширять по мере наращивания вычислительных ресурсов.

Напомним, что GPT-5.6 Sol была представлена в июне 2026 года вместе со сбалансированной моделью Terra и ориентированной на скорость Luna. В июле всё семейство стало широко доступным — в том числе в ChatGPT, среде Codex и через программный интерфейс.

Ускоренные режимы есть и у конкурентов: Anthropic предлагает режим Fast для моделей Claude. Однако, по замерам Cerebras, GPT-5.6 Sol в режиме Ultrafast работает примерно в 5 раз быстрее Claude Opus 4.8 в ускоренном режиме. Независимых проверок этих цифр пока не публиковалось.