Корпорации AMD и Cerebras Systems анонсировали партнёрство, в рамках которого планируется выпуск новой аппаратной инфраструктуры для ИИ-инференса с исключительно низкой задержкой и высокой пропускной способностью. Речь идёт о совмещении стоечных решений AMD Helios с ускорителями Cerebras Wafer-Scale Engine (WSE). Это своего рода ответ на интеграцию Groq в экосистему NVIDIA Vera Rubin.
Напомним, система Helios двойной ширины объединяет процессоры EPYC Venice с ядрами Zen 6, ускорители Instinct MI400 и DPU Vulcano. Эта платформа изначально разрабатывалась с фокусом на ресурсоёмкие задачи в сфере ИИ. В свою очередь, устройства WSE, содержащие сотни тысяч ядер, оптимизированы для молниеносного обучения и выполнения ИИ-моделей.
Совместный продукт AMD и Cerebras интегрирует сильные стороны Helios и WSE в единый рабочий процесс для максимальной производительности и эффективности инференса. В частности, создаётся дезагрегированная среда, где два ключевых этапа обработки задач оптимизируются независимо друг от друга. Стойки Helios обеспечивают исключительно высокую пропускную способность, обрабатывая запросы и большие контекстные окна. Ускорители WSE при этом берут на себя генерацию токенов с минимальной задержкой.
Источник изображения: Cerebras
В целом, новая платформа AMD и Cerebras, как утверждается, позволяет увеличить показатель токенов в секунду на ватт (Т/с/Вт) в пять раз по сравнению с конфигурациями, использующими только изделия WSE (при работе с мультимодальной моделью Kimi 2.6 1T, насчитывающей 1 трлн параметров). В рамках сотрудничества с AMD компания Cerebras планирует развернуть системы Helios в своих дата-центрах. Новое аппаратное решение станет доступно клиентам через облачный сервис Cerebras Cloud во второй половине текущего года.
Источник: