Вице-президент Nvidia подтвердил отгрузку сотен тысяч серверов на базе Grace
В процессоре Vera компания впервые отказалась от готовых ядер Arm в пользу собственного дизайна Olympus
Vera — монолитный кристалл с 88 ядрами, 176 потоками и 3,4 ТБ/с внутренней пропускной способности
Nvidia оценивает рынок серверных процессоров в 200 миллиардов долларов — заметно выше отраслевых прогнозов
22 июля AMD представила 256-ядерный EPYC Venice на Zen 6 — прямого соперника Vera
Ян Бак, вице-президент Nvidia по гиперскейлингу и высокопроизводительным вычислениям, а также создатель CUDA, оценил объёмы поставок серверных платформ компании осторожной формулировкой: «отгрузили… скажем так, сотни тысяч серверов на базе Grace». В мае Nvidia раскрывала другую цифру — более 2,5 миллиона процессоров Grace суммарно, а в феврале объявила о партнёрстве с Meta* по развёртыванию отдельных серверов Grace. Слова Бака намекают, что реальные масштабы установок ещё больше: компания всерьёз пытается закрепиться на рынке, который десятилетиями делили между собой два игрока.
Источник изображения — tomshardware.com
Заявление показательное, хотя и не сенсационное. Nvidia превратилась в доминирующую силу Кремниевой долины на волне спроса на GPU во время беспрецедентной стройки дата-центров под инференс ИИ. Но с начала года, когда инвесторы вновь обратили внимание на производителей центральных процессоров вроде Intel и AMD, капитализация компании просела примерно на 1 триллион долларов. Причина — смена баланса оборудования: если раньше на один CPU приходилось до восьми ускорителей, то агентные нагрузки в отдельных конфигурациях подтянули это соотношение к одному к одному.
Почему агентный ИИ вернул интерес к центральным процессорам
Логика проста: агент не просто «думает» на ускорителе, он постоянно дёргает центральный процессор. Запуск кода в песочнице, вызовы инструментов, обращения к базам данных, интерпретаторы Python и JavaScript, сборка контекста — всё это ложится на CPU и упирается в скорость одного потока, а не в общую пропускную способность. Именно под такой профиль нагрузки Nvidia и проектировала Vera.
Впрочем, спрос на собственные процессоры компания фиксировала ещё до бума агентов — правда, в узкой нише. «Там не поднимали веб-сервер [на Grace]… их не используют для того, для чего используют облако, то есть для дешёвых вычислений с низкой стоимостью на ядро», — пояснил Бак. «Их разворачивали под насыщенные данными бэкенд-операции — например, обработку данных».
Grace для Nvidia был скорее пробным заходом в сегмент серверных процессоров. Он построен на 72 стандартных ядрах Arm Neoverse V2, но уже отличался фирменной масштабируемой когерентной структурой (SCF). Vera получила её второе поколение — и, что важнее, первое собственное ядро Nvidia под названием Olympus, разработанное с нуля под набор инструкций Armv9.2, а не взятое из каталога Arm. Grace приоткрыл дверь, Vera входит в неё уже в полный рост.
Монолит против чиплетов: чем Vera отличается от Intel и AMD
Каким бы ни оказался итог битвы серверных процессоров нового поколения — а она разгорелась всерьёз, поскольку AMD представила EPYC Venice на Zen 6 22 июля, — архитектурно Vera радикально расходится с тем, что делают Intel и AMD. Главное отличие: чип монолитный, все 88 ядер размещены на одном кристалле. Конкуренты несколько лет назад ушли в чиплеты, что даёт очень высокую плотность ядер ценой разброса задержек и усложнённой когерентности. Nvidia пошла в обратную сторону и вдобавок отдала под коммуникационную структуру заметную долю площади кристалла.
Ключевые характеристики Vera выглядят так:
- 88 ядер Olympus и 176 потоков на сокет; в двухсокетной конфигурации — 176 ядер и 352 потока
- 164 МБ общего кэша третьего уровня на монолитном вычислительном кристалле
- 3,4 ТБ/с бисекционной пропускной способности структуры SCF второго поколения
- Память LPDDR5X в модулях SOCAMM2: до 1,2 ТБ/с суммарно, до 14 ГБ/с на ядро и до 1,5 ТБ объёма на процессор
- Каждое ядро: 64 КБ кэша инструкций L1, 96 КБ кэша данных L1 и 2 МБ L2
- Декодер шириной 10 инструкций за такт, выборка до 16 инструкций за такт, нейросетевой предсказатель переходов
- Настраиваемый теплопакет в диапазоне 250–450 Вт
Отдельного внимания заслуживает пространственная многопоточность (Spatial Multithreading) — фирменная альтернатива классическому SMT. Вместо того чтобы делить ресурсы ядра между потоками по времени, Nvidia физически разделяет их: один поток может работать в режиме максимальной производительности, пока второй обслуживает служебные задачи. Либо ядро превращается в два независимых окружения, если нужна плотность. Заявленный прирост числа инструкций за такт относительно Grace — примерно в 1,5 раза.
Позицию по числу ядер Бак объяснил прямо: «Одна из причин, почему у нас не 128 ядер, — мы отвели очень много площади кристалла под коммуникационную структуру». По его словам, эти 3,4 ТБ/с внутри процессора позволяют каждому ядру обращаться к любому кэшу и любому контроллеру памяти на полной скорости без коллизий.
Уточнение для тех, кто сравнивает цифры: 3,4 ТБ/с — это пропускная способность внутренней структуры «ядро–ядро», а не памяти. Суммарная пропускная способность подсистемы LPDDR5X составляет до 1,2 ТБ/с. Восемь контроллеров памяти работают со сменными модулями SOCAMM2, а каждый сокет виден операционной системе как один домен NUMA — даже в двухпроцессорной машине узлов будет всего два.
Цена архитектурного выбора
Как и чиплетный подход, монолит с широкой структурой предполагает свои компромиссы. Основная масса нагрузок в дата-центрах по-прежнему «унаследованная» — под неё и строились гиперскейлеры, и при всём ненасытном спросе на ИИ-инфраструктуру в ближайшие годы это вряд ли изменится.
Бак размен признаёт, но переворачивает вопрос в сторону конкурентов: «Смогут ли Intel и другие построить богатые коммуникационные структуры? Есть ли у них интеллектуальная собственность и экосистема, чтобы сделать это и связать всё с LP-памятью? Пусть расскажут, когда сделают… но этот размен будет стоить унаследованных нагрузок». Ещё откровеннее он высказался на мартовской конференции GTC: «Миру не будет служить один-единственный процессор, и это не наше намерение».
Ответ AMD: 256 ядер и спор о тестах
Столкновение произошло почти синхронно. На мероприятии Advancing AI 2026 в Сан-Франциско AMD официально представила семейство EPYC 9006 Venice — первые серверные процессоры на Zen 6 и первые высокопроизводительные чипы, выпускаемые по 2-нанометровому техпроцессу TSMC. Флагман несёт до 256 плотных ядер Zen 6c и 512 потоков, новый сокет SP7, 16 каналов памяти с суммарной пропускной способностью около 1,6 ТБ/с и поддержку PCIe 6.0. Поставки версии SP7 ожидаются в четвёртом квартале, остальные варианты линейки — в 2027 году.
Дальше началась перепалка вокруг тестов. Nvidia опубликовала собственные оценки SPEC для Vera, AMD в ответ пересчитала сравнение на том же компиляторе и заявила о более чем двукратном превосходстве двухсокетной системы на Venice по совокупной производительности и примерно 20 % преимущества в расчёте на ядро. Независимых проверок пока нет, так что все цифры с обеих сторон стоит воспринимать как маркетинговые оценки производителей, а не как результат сторонних измерений.
Показательно другое: обе компании публично объясняют свои архитектурные решения именно агентными нагрузками. У AMD под это выделен отдельный вариант с низким энергопотреблением и памятью LPDDR5X в тех же модулях SOCAMM2, что и у Nvidia — то есть спор идёт уже не о том, нужен ли рынку специализированный хост-процессор, а о том, чей подход к нему окажется точнее.
Ставка на рынок в 200 миллиардов
Амбиции Nvidia в сегменте серверных процессоров явно шире, чем следует из биржевых заголовков. Компания оценивает общий адресуемый рынок (TAM) центральных процессоров для дата-центров в 200 миллиардов долларов — прогноз заметно оптимистичнее отраслевого консенсуса, который к 2030 году даёт около 120 миллиардов (в свежих оценках планка поднялась примерно до 170 миллиардов). Агентный ИИ этот рынок дополнительно растягивает: в апреле Morgan Stanley оценил вклад агентов в 60 миллиардов долларов.
Vera уже находится в полномасштабном производстве вместе с остальной ИИ-инфраструктурой Nvidia следующего поколения: ускорителями Rubin, сетевыми картами ConnectX-9, коммутаторами SpectrumX и прочими компонентами стойки Vera Rubin NVL72. По данным компании, одна такая стойка состоит примерно из 1,3 миллиона компонентов, а в списке сборочных партнёров по всему миру значится более 300 организаций. Работающие стойки Vera Rubin NVL72 уже демонстрировались в штаб-квартире Nvidia — на них выполнялись нагрузки OpenAI.
Для рынка СНГ прямых поставок такого оборудования по понятным причинам не предвидится, но косвенное влияние будет ощутимым: именно на этих платформах обучаются и работают модели, к которым локальные компании обращаются через облачные интерфейсы, и именно от их стоимости зависит цена вычислений для конечного пользователя.
* Meta признана экстремистской организацией, её деятельность запрещена на территории Российской Федерации. Социальные сети Facebook и Instagram запрещены в РФ.












