Компания Arm представила платформу CSS for Mobile 2 — вычислительную основу, спроектированную вокруг задач машинного обучения. В её состав входят процессорные ядра C2-Ultra и C2-Pro с блоками SME2 (второе поколение масштабируемого матричного расширения), а также графический процессор Mali G2-Ultra NX с выделенными нейроускорителями, благодаря которым нейросетевая графика выполняется прямо на видеоядре.
Блок-схема Arm C2-Ultra. Источник изображения — cnx-software.com
Ядра Arm C2-Ultra и C2-Pro
Характеристики Arm C2-Ultra:
- Архитектура — Armv9.3-A
- Расширения
- Armv9.4-A (ряд ключевых возможностей)
- Расширения SME2
- Расширения SVE2
- Криптографические расширения
- Расширения RAS
- Поддержка набора команд — AArch64
- Микроархитектура
- Конвейер — с внеочередным исполнением
- Суперскалярное исполнение
- Neon и SVE2
- Опциональный криптографический блок
- До 14 ядер в кластере
- 40-разрядная физическая адресация
- Подсистема памяти и внешние интерфейсы
- Кэш инструкций 64 КБ, кэш данных 128 КБ
- Кэш второго уровня 2 или 3 МБ
- Опциональный кэш третьего уровня от 256 КБ до 32 МБ
- Поддержка коррекции ошибок ECC
- Шинные интерфейсы — AMBA AXI5 или CHI.E
- Опциональный порт ACP
- Опциональный периферийный порт
- Безопасность — TrustZone, Secure-EL2
- Прерывания — интерфейс GIC, GICv4.1
- Блок мониторинга производительности — PMUv3
- Отладка — CoreSight v3
- Расширение встроенной трассировки — ETEv1.0
- Расширение буфера трассировки
- Опциональная конфигурация с оптимизацией по площади кристалла
Насколько выросла производительность
По данным разработчика, кластер на ядрах C2 даёт следующий прирост относительно равноценного кластера предыдущего поколения C1:
- До 1,7 раза выше производительность в задачах машинного обучения
- До 15% выше однопоточная производительность
- На 15% быстрее работа в браузере
- На 12% быстрее запуск приложений
- На 12% выше многопоточная производительность на уровне кластера
Практический пример — снижение задержки при работе языковых моделей и ИИ-агентов на двухъядерном кластере C2-Ultra по сравнению с двухъядерным кластером предыдущего поколения, особенно при задействованных блоках SME2. Именно матричные расширения здесь и делают основную работу: они ускоряют перемножение матриц — операцию, на которой держится вся инференция нейросетей.
Документации по C2-Pro на данный момент найти не удалось: ссылки ведут на материалы предыдущего поколения. Технические подробности по новому ядру C2-Ultra уже опубликованы на сайте документации.
Графический процессор Mali G2-Ultra NX
Ключевые особенности и характеристики Mali G2-Ultra NX:
Аппаратное ускорение нейросетей прямо в графическом процессоре — ключевая особенность Mali G2-Ultra NX. Источник изображения — cnx-software.com
- Поддержка программных интерфейсов — OpenGL ES 3.2, Vulkan 1.4, OpenCL 3.0 в полном профиле
- Шинный интерфейс — AMBA 4 ACE, ACE-LITE, AXI
- Настраиваемый двойной кэш второго уровня, до 8 сегментов по 2 МБ каждый
- Масштабируемость — от 10 до 24 ядер
- Адаптивное масштабируемое сжатие текстур (ASTC) с поддержкой стандартного и расширенного динамического диапазона
- Сжатие кадрового буфера (AFBC) версии 1.3.2, блоки 4 × 4
- Сжатие с фиксированным коэффициентом (AFRC)
- Нейросетевые технологии Arm
- Нейросетевое масштабирование (NSS): повышение разрешения с 540p до 1080p
- Нейросетевое увеличение частоты кадров (NFRU): удвоение с 30 до 60 кадров в секунду
- Совмещённое масштабирование и шумоподавление (NSSD): сочетание NSS и реконструкции лучей
- Трассировка лучей — блок RTUv3: выше эффективность по пропускной способности и производительность, меньше площадь кристалла, аппаратная поддержка карт непрозрачности
- Затенение с переменной частотой — поддержка вплоть до режима 4 × 4
Что это даёт в играх
По сравнению с предыдущим поколением графики архитектурные улучшения дают до 24% прироста в тестовых пакетах, до 14% в играх без применения нейросетей и снижение нагрузки при трассировке лучей на 70%.
С нейросетевым увеличением частоты кадров система способна поддерживать длительные игровые сессии на смартфоне при частоте до 120 кадров в секунду, а трафик к оперативной памяти сокращается до 70%. Последнее особенно важно для мобильных устройств: обращения к памяти зачастую расходуют больше энергии, чем сами вычисления, а значит, напрямую влияют и на нагрев, и на время работы от батареи.
Дополнительные сведения о новом графическом процессоре и о платформе CSS for Mobile 2 в целом опубликованы на сайте разработчика. Ожидать устройства на этих ядрах стоит в флагманских мобильных чипах следующего поколения — именно они определят, насколько заявленные цифры подтвердятся на практике.



















