AMD покупает Taalas: ИИ-чипы, «зашивающие» модель в кремний, вместо программируемых ускорителей

AMD объявила о приобретении Taalas — компании, развивающей принципиально иной подход к ИИ-инференсу. Вместо высокопрограммируемого чипа, способного запускать множество моделей, Taalas создаёт чипы, специализированные под одну конкретную модель: чтобы сменить модель в стойке, придётся сменить и чипы.

Идея в том, чтобы не подгружать веса модели из памяти типа HBM и не тратить программируемые ресурсы на её специфические матричные операции, а «выжечь» модель прямо в CMOS. По заявлению компании, выигрыш в производительности по сравнению с более программируемыми решениями может быть огромным.

Что уже показала Taalas

Текущее поколение железа — технологический демонстратор HC1. Компания показывала его с запущенной Llama 3.1 8B и заявляет до 17 000 токенов в секунду на пользователя. По паспорту HC1 — это чип на техпроцессе TSMC 6 нм с площадью кристалла 815 квадратных миллиметров и 53 миллиардами транзисторов. Сравнения с NVIDIA H200 и B200, а также с Groq, SambaNova и Cerebras — собственные измерения Taalas, подчёркивает издание.

Реалистичная картина сложнее: крупным современным моделям может понадобиться несколько чипов ретикулярного размера, чтобы уместить модель целиком. То есть потенциально нужно произвести десятки разных типов чипов, упаковать их, поставить на карты, протестировать и свести воедино программно — со всеми рисками серийного производства. Но, по словам Taalas, смена весов, размерностей матриц и прочих ключевых параметров требует замены всего двух слоёв масок, так что дорогих производственных масок нужно заметно меньше, чем при выпуске, например, двух разных GPU.

Специализированный чип меняет гибкость на эффективность: рабочая нагрузка ужимается в более прямой поток данных, снижая накладные расходы на вычисления и память, свойственные универсальным конструкциям. Плата за это — стойка, построенная под одну модель, не перенацеливается на другую. Такой подход выгоден для стабильных, высокообъёмных инференс-нагрузок — сегмента, который AMD называет самым быстрорастущим в ИИ-рынке. В компании добавили: специализация окупается, когда модель быстро принимается, вокруг неё строятся рабочие процессы и базовая нагрузка сохраняется долго — как gpt-oss-20b/120b, которые остаются востребованными, хотя давно не лидируют в своих размерных классах.

Что это значит для AMD

AMD планирует встроить технологию Taalas в свою дорожную карту ускорителей и строить вокруг неё системные продукты на базе Instinct. Это усиливает full-stack ИИ-платформу, которая уже включает стойковые системы Helios, процессоры EPYC и стек ПО ROCm. Наличие собственного движка специализированного инференса даёт AMD ещё один вариант для клиентов, которым нужна максимальная эффективность на одной стабильной модели, — рядом с универсальными ускорителями Instinct, которые компания продаёт и сейчас.

Главные открытые вопросы — как быстро демонстратор Taalas превратится в серийные изделия и сможет ли кремний под одну модель захватить достаточную долю рабочей нагрузки, чтобы конкурировать с гибкими ускорителями остального рынка. В любом случае, это крупный шаг AMD: появление в портфеле компании технологии, которая радикально снижает стоимость инференса на стабильных моделях, меняет расклад в гонке ускорителей — сегменте, где раньше доминировала ставка исключительно на универсальные чипы.

Источник: servethehome.com