Компания AMD анонсировала ускоритель AMD Instinct MI455X — это первое устройство, построенное на архитектуре AMD CDNA пятого поколения. Оно разработано специально для стоечного решения AMD Helios и обеспечивает высокую производительность при выполнении задач искусственного интеллекта, включая инференс, обучение и тонкую настройку моделей. Ускоритель использует комбинацию 2-нм и 3-нм чиплетов, оснащён 432 Гбайт памяти HBM4 и достигает пиковой пропускной способности 23,3 Тбайт/с.
Вычислительные чиплеты (XCD) изготавливаются по техпроцессу TSMC N2 (2 нм с круговым затвором), а чиплеты FCD и MID — по техпроцессу N3P (3 нм FinFET). В упаковке объединены 8 чиплетов XCD, 2 IOD и 2 FCD, а также 12 стеков HBM4, что в сумме даёт 320 миллиардов транзисторов. AMD Instinct MI455X поддерживает до восьми NUMA-доменов. В режиме NPS1 адреса распределяются по 12 стекам HBM на двух чиплетах, а в профиле NPS2 — на два раздела по 6 стекам HBM без обмена данными между чиплетами.
Источник изображений: AMD
Четыре чиплета XCD располагаются поверх каждого чиплета кеш-памяти (FCD) с применением гибридного соединения. В свою очередь, два чиплета FCD соединяются с шестью стеками HBM4, двумя чиплетами IO и друг с другом через технологию CoWoS-L от TSMC. Каждый XCD содержит 32 активных процессора WGP (Work Group Processor), что в сумме даёт 256.
Чиплеты HBM4 подключаются через 192-канальный интерфейс. Имеется 16 блоков кеша L2 по 16 Мбайт каждый, что в сумме составляет 192 Мбайт разделяемого кеша LLC. 16 линий AMD Infinity Fabric обеспечивают пропускную способность 256 Гбайт/с в двунаправленном режиме. Масштабирование в стойке поддерживается за счёт 72 линий UALoE (3,6 Тбайт/с в двунаправленном режиме).
По заявлениям производителя, AMD Instinct MI455X достигает пиковой производительности 20 Пфлопс в операциях MXFP6 и MXFP8, а также 40,3 Пфлопс в операциях MXFP4. Также заявлена поддержка типов данных FP4, FP6 и FP8. Для задач с FP64-нагрузками будет выпущена модификация MI430X.
В сравнении с моделью предыдущего поколения Instinct MI355X демонстрирует до четырёхкратного роста пиковой производительности вычислений, почти трёхкратное (в 2,9 раза) увеличение пропускной способности памяти и повышение объёма памяти в 1,5 раза. Как сообщает TechPowerUp, это обеспечивает 18-кратный прирост пропускной способности токенов и снижение стоимости токенов до 34 раз при работе с DeepSeek V4 Flash FP4.
Источник: