AMD и Cerebras объединяют серверные стойки Helios и чипы Wafer-Scale Engine для совместной обработки ИИ-инференса
По заявлению компаний, платформа обеспечит до 5 раз больше токенов в секунду на ватт по сравнению с решениями на одной архитектуре
Инференс разделён на этапы: стойка AMD Helios с ускорителями Instinct MI400 обрабатывает промпты и контекст, а чипы Cerebras WSE отвечают за генерацию токенов
Архитектура похожа на подход Nvidia CPX, но роли ускорителей распределены в обратном порядке
Первой платформа появится в облаке Cerebras Cloud во второй половине 2026 года
Компании AMD и Cerebras Systems представили технологическое партнёрство по созданию совместной платформы для инференса ИИ. Анонс состоялся в четверг, 23 июля 2026 года, в рамках мероприятия Advancing AI 2026 в Сан-Франциско. Платформа объединит процессоры AMD EPYC и ускорители Instinct в составе стоечной инфраструктуры AMD Helios с чипами Wafer-Scale Engine (WSE) от Cerebras. По замыслу разработчиков, новая система сможет одновременно обеспечить низкую задержку процессоров и ускорителей AMD и высокую пропускную способность памяти чипов WSE.
Источник изображения — tomshardware.com
Идея партнёрства строится на разделении инференс-нагрузки между двумя архитектурами. Стойка AMD Helios с процессорами EPYC шестого поколения и ускорителями Instinct MI400-серии берёт на себя приём и обработку запросов, включая большие контекстные окна, — эта стадия называется prefill. Чипы Cerebras WSE, в свою очередь, отвечают за decode — непосредственную генерацию токенов, где критична скорость доступа к памяти.
Технические характеристики платформы
Одна стойка AMD Helios способна вместить до 72 ускорителей Instinct MI400-серии (в частности, MI455X) в связке с процессорами EPYC шестого поколения, сетевым оборудованием Pensando и программным стеком ROCm. Заявленная пиковая производительность стойки достигает 2,9 экафлопс в формате FP4 и 1,4 экафлопс в формате FP8, а объём памяти HBM4 составляет 31 ТБ при пропускной способности 1,7 ПБ/с. Актуальное поколение чипов Cerebras — WSE-3 — использует 44 ГБ встроенной SRAM-памяти, расположенной непосредственно рядом с вычислительными блоками, обеспечивает пропускную способность порядка 21 ПБ/с и содержит около 900 тысяч ядер и 4 триллиона транзисторов на кристалле. Именно близость памяти к вычислительным блокам, по данным разработчиков, позволяет заметно ускорить генерацию токенов.
По оценке AMD и Cerebras, совместное решение способно обеспечить до 5 раз больше токенов в секунду на ватт (T/s/W) по сравнению с использованием только одной из архитектур — расчёты основаны на внутреннем моделировании при сопоставимом уровне интерактивности на модели Kimi 2.6 с 1 триллионом параметров. Компании пока не раскрыли дополнительные данные о производительности и не уточнили, как именно две вычислительные платформы будут технически объединены в единый инференс-пайплайн.
По сути, базовая идея платформы AMD и Cerebras повторяет концепцию Nvidia CPX, однако распределение специализированного оборудования между этапами инференса здесь инвертировано.
Архитектура Nvidia делит инференс на этапы контекста/префилла и генерации/декодирования. Ускоритель Rubin CPX с памятью GDDR7, от которого впоследствии отказались, был оптимизирован именно под вычислительно ёмкий этап префилла, тогда как обычные ускорители Rubin с памятью HBM обрабатывали этап генерации, ограниченный пропускной способностью памяти.
В платформе AMD и Cerebras сохраняется тот же принцип разделения нагрузки, но роли поменялись местами: стойка AMD Helios с ускорителями Instinct обрабатывает этап префилла — запросы и большие контекстные окна, — а Cerebras WSE берёт на себя этап декодирования, отвечающий за чувствительную к задержкам генерацию токенов.
Реакция рынка и дальнейшие планы
Новость о партнёрстве положительно отразилась на котировках Cerebras Systems, вышедшей на биржу в мае 2026 года: акции компании прибавили около 4,86%. О планах масштабного развёртывания стоек AMD Helios также заявила компания OpenAI, что подчёркивает растущую конкуренцию за вычислительные мощности для ИИ. Cerebras намерена в первую очередь установить системы AMD Helios в собственных дата-центрах и интегрировать их со своими стойками WSE, а в дальнейшем предложить решение и другим ИИ-компаниям.
Согласно заявлениям AMD и Cerebras, совместное решение станет доступно в первую очередь через облако Cerebras Cloud во второй половине 2026 года.







