Cerebras CS-4: ИИ-кластер без сетевых коммутаторов

Cerebras Systems представила CS-4 — стоечную ИИ-систему нового поколения, которая соединяет wafer-scale процессоры между стойками без сетевых коммутаторов. Производитель утверждает, что такой подход снижает задержки при передаче данных по мере усложнения ИИ-инфраструктуры.

CS-4 работает до двух раз быстрее предыдущего поколения CS-3. В тесте с моделью GPT-OSS-120B компания заявила о скорости инференса на пользователя до 30 раз выше, чем у GPU-систем. Фактическая пропускная способность зависит от модели и конфигурации обслуживания.

Архитектура Nexus и Direct Wafer Links

CS-4 — первая система на базе новой архитектуры Cerebras Nexus rack-scale. Она включает Direct Wafer Links — прямые соединения между wafer-процессорами, которые снижают задержку между платами до двух микросекунд. Система также поддерживает RoCE v2 поверх Ethernet, что позволяет подключаться к существующим сетям дата-центров. Каждый CS-4 обеспечивает до 7,2 Тбит/с пропускной способности системного ввода-вывода.

Для инфраструктурных команд ключевой вопрос — что происходит с остальной сетью, когда часть коммутации между ускорителями исчезает.

Отказ от коммутаторов: плюсы и минусы

Устранение коммутаторов между системами Cerebras может снизить затраты на инфраструктуру и потребление электроэнергии, считает Нил Шах, вице-президент по исследованиям Counterpoint Research. По его словам, прямое соединение wafer-чипов от стойки к стойке убирает огромный сложный слой сетевого оборудования, который обычно съедает большую часть бюджета ИИ-кластера и до трети его электроэнергии.

Обратная сторона — ограниченная гибкость: соединения точка-точка хуже подходят для перенаправления трафика или обработки отказов, чем традиционные коммутируемые фабрики.

Архитектура снижает зависимость от традиционных коммутационных слоёв между системами Cerebras, но не устраняет потребность в обычном сетевом оборудовании, отметил Маниш Рават, аналитик по полупроводникам TechInsights. Внешняя связность, хранилища, оркестрация и взаимодействие с гетерогенными вычислениями по-прежнему требуют традиционных сетей.

Даниш Фаруки, генеральный директор Fab Economics, добавил, что приём данных и управление кластером останутся на традиционной Ethernet-инфраструктуре, а внешние системы в разнесённом инференсе будут общаться с CS-4 по RoCE v2.

Проприетарный стек и интеграция с GPU

Внутри фабрики Cerebras картина иная. Direct Wafer Links — проприетарная технология, поэтому добавить сторонние ускорители в фабрику нельзя. Масштабирование требует дополнительных систем Cerebras, отметил Шах.

Фаруки считает, что операционный разрыв может оказаться значительнее физических сетевых проблем. Существующие среды оркестрации обычно рассчитаны на обычные многоускорительные узлы, тогда как CS-4 полагается на собственный программный стек Cerebras для управления нагрузками внутри wafer-фабрики. Это может вынудить предприятия вести отдельный домен управления рядом с существующей GPU-инфраструктурой.

«Ключевым отраслевым тестом станет то, воспримут ли заказчики архитектуру как открытый компонент более широкой ИИ-инфраструктуры или как узкоспециализированный, но относительно проприетарный стек», — сказал Рават.

Проприетарная модель распространяется и на ПО. Cerebras поддерживает фреймворки, включая PyTorch, но нагрузки выполняются через платформу CSoft. По словам Шаха, экосистема уступает в зрелости и охвате среде CUDA от Nvidia, и предприятиям придётся взвешивать это против преимуществ wafer-подхода.

Ускоренный инференс нагружает хранилища

Более быстрый инференс усиливает нагрузку на системы хранения и приёма данных, которые должны успевать снабжать ускорители работой.

«Задача смещается со скорости генерации токенов на скорость подачи входных токенов и контекстных данных», — отметил Шах.

Фаруки указал, что узкое место может возникнуть на фазе prefill — когда модель обрабатывает входящий промпт перед генерацией токенов. В разнесённых развёртываниях эта работа может выполняться вне CS-4 и передаваться в систему Cerebras по Ethernet. В такой архитектуре производительность внешней сети становится критичной: состояние модели и контекстные данные должны попадать в CS-4 достаточно быстро, чтобы движок декодирования не простаивал.

Энергоэффективность и охлаждение

Cerebras позиционирует CS-4 как энергоэффективное решение: до 10 раз больше производительности на ватт по сравнению с CS-3. Рават отметил, что выигрыш в эффективности поможет по мере роста плотности ИИ-вычислений, но не устранит ограничения по питанию и охлаждению в масштабе.

На уровне стойки wafer-системы концентрируют вычисления на относительно небольшой площади, что повышает требования к локальному энергоснабжению и жидкостному охлаждению, добавил Фаруки. Похожие ограничения — плотность мощности и охлаждение — уже становятся ключевым фактором при проектировании ИИ-коридоров, которые строят операторы ЦОД для таких нагрузок. Отдельный вопрос — совместимость с GPU-инфраструктурой: здесь CS-4 конкурирует с подходами вроде стандартизации GPU-хранилищ, которую продвигает Nvidia.

Частые вопросы

Кому нужен CS-4?

Компаниям, которые строят ИИ-кластеры и хотят снизить задержки между ускорителями и сократить расходы на сетевое оборудование. Cerebras позиционирует систему как альтернативу GPU-кластерам Nvidia.

Чем CS-4 отличается от CS-3?

CS-4 до двух раз быстрее предшественника, даёт до 10 раз больше производительности на ватт и впервые использует архитектуру Nexus с прямыми соединениями wafer-процессоров без коммутаторов.

Что такое Direct Wafer Links?

Проприетарные прямые соединения Cerebras между wafer-процессорами, снижающие задержку между платами до двух микросекунд. Они исключают сетевые коммутаторы внутри фабрики Cerebras.

Поддерживает ли CS-4 стандартные сети?

Да, система поддерживает RoCE v2 поверх Ethernet и обеспечивает до 7,2 Тбит/с системного ввода-вывода. Это позволяет подключаться к существующей инфраструктуре дата-центра.

Можно ли добавить GPU других вендоров к CS-4?

Нет. Direct Wafer Links — проприетарная технология, поэтому фабрика Cerebras работает только с собственными системами. Сторонние ускорители могут взаимодействовать с CS-4 только через внешнюю сеть.

Какие фреймворки поддерживает CS-4?

Cerebras поддерживает PyTorch и другие популярные фреймворки, но все нагрузки выполняются через собственный программный стек CSoft.

В чём главный риск для предприятия?

Придётся вести отдельный домен управления для CS-4 рядом с существующей GPU-инфраструктурой, а также учитывать, что экосистема Cerebras менее зрелая, чем CUDA. Кроме того, wafer-системы требуют серьёзных мощностей по питанию и жидкостному охлаждению.

Источник: networkworld.com