Главное
- AWS впервые столкнулась с нехваткой CPU-мощностей из-за ИИ-агентов
- Соотношение GPU к CPU в дата-центрах сместилось с 8:1 ближе к 1:1 из-за роста агентных нагрузок
- Инженеры Amazon ждут доступа к EC2-инстансам по несколько дней вместо прежних часов
- Один ИИ-кодинг-агент превысил бюджет разработки Amazon на 860%, потратив $1,8 млн за месяц
Amazon Web Services ужесточает контроль над внутренним использованием инстансов EC2 среди своих инженеров. В мае, по сообщениям The Information, компания провела встречи с инженерами и потребовала сократить расход CPU, чтобы обеспечить достаточную вычислительную мощность для удовлетворения клиентского спроса. Это сообщение появилось на фоне ажиотажного спроса на CPU в дата-центрах: традиционное соотношение GPU к CPU, составлявшее восемь к одному или четыре к одному, теперь движется к паритету.
Источник изображения — tomshardware.com
Как изменился доступ к EC2-инстансам
Инстансы EC2 составляют значительную часть современного интернета и используются также в частных развертываниях. Ранее инженеры AWS могли свободно создавать собственные инстансы для разработки, используя относительно низкую загрузку CPU, характерную для веб-инфраструктуры, чтобы задействовать больше виртуальных машин. Теперь же инженеры сообщают, что ждут доступа днями, тогда как раньше могли получить его за часы. Один из инженеров рассказал The Information, что за несколько лет работы в Amazon ему никогда не приходилось ждать инстанс так долго.
Какие CPU использует Amazon
Amazon использует несколько типов CPU в инстансах EC2, включая варианты от AMD и Intel, а также свой относительно новый чип Graviton5. Graviton5 — самый мощный CPU Amazon на сегодняшний день, основанный на Arm-архитектуре, аналогичной CPU Vera от Nvidia и собственным решениям Arm.
AI-агенты и взрывной рост затрат
Рост спроса на CPU подстегнут AI-агентами — новой парадигмой производительности, с которой даже такие гиганты, как Amazon, испытывают трудности. Например, в прошлом месяце кодирующий агент потратил $1,8 миллиона на токены в Amazon, превысив бюджет разработки на 860%.
Большая часть текущей AI-инфраструктуры спроектирована вокруг инференса — рабочей нагрузки, ускоряемой GPU. При соотношении четыре к одному CPU служил лишь для подачи данных GPU. Однако агентные рабочие нагрузки гораздо сложнее: они включают вызовы инструментов, выполняемые на CPU, а также более сложную оркестрацию инференса на GPU. Именно это вывело CPU на передний план в эпоху агентов. Intel, AMD и другие компании повторяют то, что мы слышали от производителей памяти и хранилищ в последние месяцы: спрос на CPU настолько высок, что большинство компаний готовы брать всё, что доступно.
Конкуренция на рынке CPU для дата-центров
Крупные игроки извлекают выгоду из этого спроса. AMD недавно представила линейку CPU Zen 6 «Venice» для дата-центров, что стало первым случаем за десятилетия, когда AMD запустила новую архитектуру в дата-центрах раньше, чем на потребительском рынке. Nvidia также сместила акцент с ускорителей на новый CPU Vera, стремясь закрепиться на растущем рынке агентной AI-инфраструктуры.
Хотя Amazon сталкивается с нехваткой CPU как у внутренних инженеров, так и у внешних клиентов, The Information отмечает, что дефицит в основном касается спотовых инстансов. Консультант сообщил изданию, что контрактные мощности не испытывают никаких перебоев.
Комментарий AWS
После выхода материала представитель Amazon Web Services предоставил следующий комментарий:
«Спрос на сервисы AWS, включая EC2, невероятно высок и продолжает расти. Несмотря на этот высокий спрос, мы продолжаем удовлетворять подавляющее большинство вычислительных потребностей как внутренних, так и внешних клиентов. Мы тесно работаем с внутренними командами, чтобы удовлетворить их вычислительные потребности, обеспечивая при этом максимально эффективное использование ресурсов EC2, например, возвращая простаивающие инстансы, оптимизируя размеры и масштабируясь по мере изменения потребностей — так же, как мы делали всегда. Эти меры помогают управлять мощностями как для внутренних, так и для внешних клиентов, и любые предположения о том, что эти давние усилия отражают новые ограничения мощности, просто неверны.
Эта предпосылка сенсационна. Бережливость — в нашей ДНК с первого дня. Мы всегда поощряли наши команды работать эффективно. Мы также делимся лучшими практиками оптимизации ресурсов с внешними клиентами. Это не новая директива, и поощрение эффективного использования ресурсов не уникально для Amazon».
На вопрос о том, устанавливались ли для инженеров конкретные сроки по сокращению вычислительных ресурсов, как сообщалось в The Information, представитель AWS ответил: «Этот нарратив о EC2 неточен. В рамках нашей обычной деловой практики, подкрепленной нашим лидерским принципом бережливости, мы всегда стремимся к эффективности использования ресурсов, чтобы команды оптимизировали мощности».















