Google разрабатывает чип Frozen v2, который встраивает архитектуру Gemini в кремний для повышения эффективности
Новый процессор сможет выдавать в 6–10 раз больше токенов на единицу энергии, чем актуальные TPU Google
Frozen v2 фиксирует архитектуру модели аппаратно, но оставляет веса обновляемыми для совместимости с новыми версиями Gemini
Запуск запланирован на 2028 год, при этом проект частично вызван дефицитом вычислительных мощностей ИИ
Google разрабатывает серверный процессор, неофициально названный Frozen v2, который будет напрямую встраивать часть архитектуры модели Gemini в кремний. Об этом сообщает издание The Information со ссылкой на два осведомлённых источника. Инженеры проекта прогнозируют, что чип сможет обрабатывать в шесть–десять раз больше токенов на единицу энергии, чем новейшее поколение TPU от Google. Развёртывание планируется уже к 2028 году. По словам источников, проект частично является ответом на критическую нехватку вычислительных мощностей для ИИ: внутренняя конкуренция за ресурсы дошла до того, что Google Cloud вынужден был отказываться от сделок с внешними заказчиками.
Что означает «заморозка» архитектуры
TPU, как и GPU, выполняет любую загруженную на него модель. Из-за этого оборудование вынуждено принимать решения на ходу при работе с каждой из них: разбирать структуру вычислений, планировать порядок операций и постоянно перекладывать данные между памятью и вычислительными блоками. В Frozen v2 часть этих решений для Gemini будет жёстко зафиксирована в транзисторах — это сократит количество шагов, выполняемых процессором, и объём перемещаемых данных на один запрос.
Само название отсылает к привычной для разработчиков нейросетей практике: «заморозкой» называют фиксацию параметров, после которой они перестают меняться. Здесь тот же принцип доводят до предела и переносят с уровня программного обеспечения на уровень физической схемы. Главная выгода — обход так называемой «стены памяти»: именно перекачка данных между чипом и дорогой скоростной памятью HBM съедает основную часть энергии и времени при обслуживании крупных моделей. Один из источников отметил, что задержка ответа может снизиться настолько, что станут возможны новые сценарии применения, недоступные при нынешних скоростях.
Почему первую версию Frozen отложили
Оригинальный замысел Frozen, продвигавшийся главным научным сотрудником Google DeepMind Джеффом Дином, шёл ещё дальше и предполагал внедрение самих весов Gemini непосредственно в чип. Однако Google отложил эту идею: кремний, привязанный к одной-единственной версии модели, имел бы слишком короткий срок жизни и устарел бы раньше, чем окупился.
Frozen v2 фиксирует только архитектуру, а веса оставляет обновляемыми — то есть в железо закладывается чертёж модели, а не её настроенные параметры. Благодаря этому чип остаётся полезным для разных выпусков Gemini, но лишь до тех пор, пока Google строит их на одной и той же базовой архитектуре. Насколько глубоко «замораживать» модель, по данным отчёта, всё ещё не решено. Именно здесь и заключается ключевой риск проекта: отрасль меняется быстро, и удачный на бумаге компромисс между жёсткостью и гибкостью к 2028 году может оказаться устаревшим.
Место в линейке процессоров Google
Google не планирует выпускать Frozen v2 в таких же объёмах, как TPU, и рассматривает это поколение частично как пробный запуск для более узкоспециализированных чипов — по мере того как архитектуры моделей будут стабилизироваться. Процессор будет дополнять, а не заменять линейку TPU, которая на восьмом поколении, представленном на конференции Cloud Next в апреле, разделилась на отдельные варианты для обучения и для обработки запросов. Судя по описанию, Frozen v2 предназначен исключительно для второй задачи. Целевой 2028 год совпадает с планом Google заказать у Intel упаковку более 3 миллионов TPU. Маловероятно, что такой чип станет продуктом для внешних заказчиков: он имеет смысл только там, где одна и та же модель обслуживает миллиарды запросов.
Процессоры с жёстко зашитой моделью уже существуют не только на бумаге. Стартап Taalas из Торонто, привлёкший в сумме более $219 млн от инвесторов, включая Quiet Capital и Fidelity, представил в феврале чип HC1 с постоянно встроенной в кремний моделью Llama 3.1 8B компании Meta*. Кристалл площадью 815 мм² содержит около 53 млрд транзисторов и произведён по техпроцессу N6 TSMC. Компания заявляет о 17 000 токенов в секунду на пользователя без использования HBM на упаковке — при этом речь пока идёт о демонстрационном образце и о собственных замерах разработчика. Nvidia, в свою очередь, заключила в декабре сделку на $20 млрд по лицензированию технологий разработчика чипов для обработки запросов Groq.
Реакция рынка и позиция Google
Сообщение заметно отразилось на котировках: акции Alphabet в ходе торгов прибавляли до 3,7% и закрылись примерно на 1,5% выше предыдущего уровня. Новость подхватили Reuters и Bloomberg Law — инвесторы восприняли её как сигнал о том, что Google рассчитывает резко снизить себестоимость обслуживания собственных моделей, а не просто нарастить закупки оборудования.
Google пока не подтвердил проект. Представитель компании заявил, что подразделения регулярно экспериментируют с идеями высокой энергоэффективности, но не каждый такой проект доходит до производства, и подчеркнул: «этот тщательный поиск является основой нашего полного стека решений». Так что относиться к Frozen v2 стоит как к направлению развития, а не как к готовому продукту — до заявленного срока развёртывания остаётся ещё около двух лет.
* Принадлежит компании Meta, деятельность которой признана экстремистской и запрещена на территории Российской Федерации. Социальные сети Facebook и Instagram запрещены в РФ.










