Cerebras представила CS-4 — новую rack-scale систему, которая, по заявлениям компании, обеспечивает инференс до 30 раз быстрее, чем GPU-системы, при улучшенной экономике и упрощённом развёртывании гипермасштабных мощностей. Компания позиционирует новинку как архитектуру для frontier AI.
До 30 раз быстрее GPU
На базе кристалла WSE-Turbo CS-4 обеспечивает инференс до 30 раз быстрее по сравнению с GPU-системами, устанавливая новый рекорд скорости инференса среди доступных в продакшене решений.
Три WSE-3 Turbo на систему
Каждый вафельный кристалл обеспечивает до 2 раз более высокую скорость по сравнению с предыдущим поколением.
Больше производительности на кристалл
Новая система питания, охлаждения и ввода-вывода раскрывает ещё больший потенциал производительности каждого кристалла.
Rack-scale платформа Nexus
Платформа обеспечивает быстрое развёртывание в гипермасштабных дата-центрах.
Более высокая пропускная способность
Решение CS-4 сдвигает границу Парето для инференса: система обеспечивает до 10 раз больше пропускной способности на ватт по сравнению с CS-3, при этом генерируя токены до 30 раз быстрее, чем производственные GPU-системы. В итоге система сочетает высокую пропускную способность с интерактивностью.
Архитектура для frontier-моделей
За счёт снижения задержки межкристального соединения до 2 микросекунд CS-4 выдаёт более 1000 токенов в секунду на моделях с более чем 10 триллионами параметров, сохраняя интерактивную производительность декодирования на беспрецедентном масштабе.
Создано для гипермасштаба
CS-4 — первая реализация новой архитектуры платформы Cerebras Nexus. Она построена вокруг модульной концепции с тремя базовыми элементами — вычислениями, питанием и вводом-выводом, каждый из которых содержит значительные инновации для упрощения производства, развёртывания, обслуживания и апгрейдов.
Модульный дизайн вычислительного «рюкзака»
В Cerebras переосмыслили концепцию сервера. Каждый Wafer-Scale Backpack — это самодостаточный узел, объединяющий кристалл, преобразование питания, прямое жидкостное охлаждение, высокоскоростной ввод-вывод и управляющую электронику в компактный 3D-модуль с на 50% меньшим числом компонентов. Такой дизайн упрощает производство и сокращает время развёртывания с нескольких дней до нескольких часов.
Плотная подача питания
Питание подводится к процессору на расстоянии всего 0,5 мм — примерно в 100 раз ближе, чем около 50 мм в традиционных GPU-платах. Это почти полностью устраняет потери мощности на уровне платы и позволяет подавать на WSE-3T вдвое больше энергии, обеспечивая более высокие рабочие частоты и ускоренную генерацию токенов.
Ввод-вывод нового поколения
CS-4 получила новую программируемую подсистему ввода-вывода, которая удваивает пропускную способность и снижает задержки — как для агрегированных, так и для дезагрегированных решений. Модуль Wafer I/O также позволяет соединять кристаллы внутри и между стойками без использования коммутатора, снижая задержку между кристаллами до двух микросекунд — ключевой параметр для интерактивности моделей с десятками триллионов параметров.
Сначала инфраструктура, затем вычисления
CS-4 отделяет стабильный слой питания, охлаждения и сети от модульных вычислительных блоков. Стойку Cerebras PowerRack можно установить и подготовить на объекте ещё до прибытия вычислительных модулей. После этого «рюкзаки» с вычислительными блоками просто устанавливаются на место и подключаются к питанию, охлаждению и данным — это сокращает развёртывание с дней до часов и упрощает обслуживание и будущие апгрейды на гипермасштабе.
Первые поставки CS-4 начнутся в этом квартале
Cerebras заявляет, что первые поставки CS-4 начнутся уже в этом квартале, предлагая заказчикам развернуть в собственных дата-центрах систему с самым быстрым доступным инференсом ИИ.