Компания AMD анонсировала ИИ-платформу Helios AI, которая в одной стойке ORW высотой 44OU объединяет процессоры EPYC Venice 9006 SP7, ускорители Instinct MI455X и сетевые контроллеры Pensando, а также программное обеспечение AMD ROCm. Генеральный директор Лиза Су (Lisa Su) сообщила о запуске полномасштабного производства Helios. В 18 узлах размещено 72 ускорителя MI455X — по четыре штуки в каждом. Согласно заявлению AMD, пиковая производительность на одну стойку достигает 2,9 экзафлопс в режиме FP4 и 1,4 экзафлопс в режиме FP8.
Источник изображений: AMD
Основой масштабируемой архитектуры Helios выступает технология UALoE (UALink over Ethernet), которая объединяет 72 ускорителя AMD Instinct MI455X в одной стойке в единый домен. Платформа AMD Helios, спроектированная с учётом общей пропускной способности до 260 Тбайт/с и доступа к 31 Тбайт памяти HBM4 с совокупной пропускной способностью 1,7 Пбайт/с в пределах одной стойки, позволяет обрабатывать модели и рабочие нагрузки, требующие плотного взаимодействия между ускорителями.
Как отмечается, система Helios разработана с учётом пути, который проходит ИИ-нагрузка через стойку. Данные поступают через хост-уровень, перемещаются в домен GPU, получают доступ к параметрам модели и активным данным в HBM4, а также взаимодействуют на уровне всей стойки через масштабируемую коммутационную сеть.
Архитектура сети базируется на одношаговой топологии с применением стандартных микросхем Ethernet-коммутаторов (ESUN), что позволяет GPU обмениваться данными с другим GPU через единственный коммутатор — это сокращает задержки, улучшает контроль перегрузок и повышает эффективность сетевого взаимодействия. Стойка обеспечивает совокупную пропускную способность при вертикальном расширении (через UALoE) до 260 Тбайт/с, а при горизонтальном — до 43 Тбайт/с (за счёт трёх подключений по 800GbE на каждый GPU).
Особое внимание разработчики уделили аппаратной устойчивости к сбоям в системе AMD Helios. Каждый графический процессор соединяется через 18 отдельных линий UALoE, распределённых по различным коммутационным блокам. Если аппаратный отказ затрагивает один из каналов, система автоматически сохраняет единое пространство GPU, задействуя резервные соединения.
Программное решение AMD Fabric Manager (AFM) предоставляет операционный уровень для масштабируемой сети AMD Helios, беря на себя автоматизацию развёртывания, выделение ресурсов, телеметрию, мониторинг и управление всей инфраструктурой в рамках единой платформы. Оно даёт операторам полную видимость масштабируемой сети, упрощая процессы развёртывания, мониторинга и обслуживания ИИ-инфраструктуры на уровне стоек по мере расширения сред.
В свою очередь, специализированная операционная система AMD Fabric OS (AFOS) работает непосредственно на уровне коммутации масштабируемой сети, обеспечивая управление в реальном времени и прозрачность, необходимые для выявления и реагирования на аппаратные события внутри самой сети. Вместе AFM и AFOS превращают масштабируемую сеть AMD Helios из простого аппаратного соединения в управляемую, наблюдаемую операционную платформу.
Не все вычислительные задачи требуют одновременного задействования 72 ускорителей, поэтому компания представила vPods — виртуальные кластеры (Virtual Pods), дающие клиентам возможность разбивать масштабируемую зону AMD Helios на более мелкие программно-определяемые среды, оптимизированные под конкретные рабочие нагрузки. Отдельные сеансы обучения, тестовые среды и инференс могут работать в одной стойке, при этом сохраняется изоляция и локализация отказов.
AMD Helios напрямую конкурирует с стоечными системами GB300 NVL72 и Vera Rubin NVL72. Как заявила Су, производительность вычислений AMD Helios на 15 % выше, чем у Vera Rubin, а объем высокоскоростной памяти — на 50 % больше. Она также подчеркнула, что AMD Helios обеспечивает на 30 % больше токенов на доллар по сравнению с серверами NVIDIA.
Источник: