Google разрабатывает серверный процессор, неофициально названный Frozen v2, который будет напрямую встраивать часть архитектуры модели Gemini в кремний. Об этом сообщает издание The Information со ссылкой на два осведомлённых источника. Инженеры проекта прогнозируют, что чип сможет обрабатывать в шесть–десять раз больше токенов на единицу энергии, чем новейшее поколение TPU от Google. Развёртывание планируется уже к 2028 году. По словам источников, проект частично является ответом на критическую нехватку вычислительных мощностей для ИИ: внутренняя конкуренция за ресурсы дошла до того, что Google Cloud вынужден был отказываться от сделок с внешними заказчиками.

Серверный ИИ-процессор Google Frozen v2 с архитектурой Gemini, зафиксированной в кремнииИсточник изображения — tomshardware.com

реклама кормит Уточку 🦆

Что означает «заморозка» архитектуры

TPU, как и GPU, выполняет любую загруженную на него модель. Из-за этого оборудование вынуждено принимать решения на ходу при работе с каждой из них: разбирать структуру вычислений, планировать порядок операций и постоянно перекладывать данные между памятью и вычислительными блоками. В Frozen v2 часть этих решений для Gemini будет жёстко зафиксирована в транзисторах — это сократит количество шагов, выполняемых процессором, и объём перемещаемых данных на один запрос.

Само название отсылает к привычной для разработчиков нейросетей практике: «заморозкой» называют фиксацию параметров, после которой они перестают меняться. Здесь тот же принцип доводят до предела и переносят с уровня программного обеспечения на уровень физической схемы. Главная выгода — обход так называемой «стены памяти»: именно перекачка данных между чипом и дорогой скоростной памятью HBM съедает основную часть энергии и времени при обслуживании крупных моделей. Один из источников отметил, что задержка ответа может снизиться настолько, что станут возможны новые сценарии применения, недоступные при нынешних скоростях.

реклама кормит Уточку 🦆

Почему первую версию Frozen отложили

Оригинальный замысел Frozen, продвигавшийся главным научным сотрудником Google DeepMind Джеффом Дином, шёл ещё дальше и предполагал внедрение самих весов Gemini непосредственно в чип. Однако Google отложил эту идею: кремний, привязанный к одной-единственной версии модели, имел бы слишком короткий срок жизни и устарел бы раньше, чем окупился.

Frozen v2 фиксирует только архитектуру, а веса оставляет обновляемыми — то есть в железо закладывается чертёж модели, а не её настроенные параметры. Благодаря этому чип остаётся полезным для разных выпусков Gemini, но лишь до тех пор, пока Google строит их на одной и той же базовой архитектуре. Насколько глубоко «замораживать» модель, по данным отчёта, всё ещё не решено. Именно здесь и заключается ключевой риск проекта: отрасль меняется быстро, и удачный на бумаге компромисс между жёсткостью и гибкостью к 2028 году может оказаться устаревшим.

реклама кормит Уточку 🦆

Место в линейке процессоров Google

Google не планирует выпускать Frozen v2 в таких же объёмах, как TPU, и рассматривает это поколение частично как пробный запуск для более узкоспециализированных чипов — по мере того как архитектуры моделей будут стабилизироваться. Процессор будет дополнять, а не заменять линейку TPU, которая на восьмом поколении, представленном на конференции Cloud Next в апреле, разделилась на отдельные варианты для обучения и для обработки запросов. Судя по описанию, Frozen v2 предназначен исключительно для второй задачи. Целевой 2028 год совпадает с планом Google заказать у Intel упаковку более 3 миллионов TPU. Маловероятно, что такой чип станет продуктом для внешних заказчиков: он имеет смысл только там, где одна и та же модель обслуживает миллиарды запросов.

Процессоры с жёстко зашитой моделью уже существуют не только на бумаге. Стартап Taalas из Торонто, привлёкший в сумме более $219 млн от инвесторов, включая Quiet Capital и Fidelity, представил в феврале чип HC1 с постоянно встроенной в кремний моделью Llama 3.1 8B компании Meta*. Кристалл площадью 815 мм² содержит около 53 млрд транзисторов и произведён по техпроцессу N6 TSMC. Компания заявляет о 17 000 токенов в секунду на пользователя без использования HBM на упаковке — при этом речь пока идёт о демонстрационном образце и о собственных замерах разработчика. Nvidia, в свою очередь, заключила в декабре сделку на $20 млрд по лицензированию технологий разработчика чипов для обработки запросов Groq.

реклама кормит Уточку 🦆

Реакция рынка и позиция Google

Сообщение заметно отразилось на котировках: акции Alphabet в ходе торгов прибавляли до 3,7% и закрылись примерно на 1,5% выше предыдущего уровня. Новость подхватили Reuters и Bloomberg Law — инвесторы восприняли её как сигнал о том, что Google рассчитывает резко снизить себестоимость обслуживания собственных моделей, а не просто нарастить закупки оборудования.

Google пока не подтвердил проект. Представитель компании заявил, что подразделения регулярно экспериментируют с идеями высокой энергоэффективности, но не каждый такой проект доходит до производства, и подчеркнул: «этот тщательный поиск является основой нашего полного стека решений». Так что относиться к Frozen v2 стоит как к направлению развития, а не как к готовому продукту — до заявленного срока развёртывания остаётся ещё около двух лет.

* Принадлежит компании Meta, деятельность которой признана экстремистской и запрещена на территории Российской Федерации. Социальные сети Facebook и Instagram запрещены в РФ.