AMD в очередной попытке потеснить Nvidia на рынке AI-железа приобрела компанию Taalas — стартап, который «выпекает» веса моделей прямо в кремний. Такой подход обещает поднять производительность инференса на порядок и более.
Сделка, объявленная в четверг после закрытия торгов, по контексту напоминает декабрьское лицензионное соглашение Nvidia на $20 млрд с Groq: цель та же — сделать премиальные инференс-сервисы для AI-агентов (например, ассистентов для кода) быстрее и дешевле. AMD не раскрыла условия сделки, но, судя по всему, речь идёт о полноценном поглощении, а не о найме команды под видом покупки.
Taalas основана в 2023 году, базируется в Торонто. Подход компании к инференсу радикально отличается от обычных GPU и от dataflow-архитектур, на которых строятся LPU Groq или waferscale-ускорители Cerebras.
Микросхема под конкретную модель
Чипы стартапа не хранят веса модели в HBM — вместо этого веса вытравливаются прямо в кремнии. По сути, чипы Taalas — это специализированные под конкретную модель интегральные схемы (model-specific integrated circuits, MSIC).
Технология Taalas не осталась на уровне концепции. В феврале стартап показал первый тестовый чип, произведённый по 6-нм техпроцессу TSMC, под названием HC1. На первых бенчмарках чип обслуживал Llama 3.1 8B от Meta со скоростью 16 960 токенов в секунду — на момент анонса это было в 48 раз быстрее GPU Nvidia и в 8,5 раза быстрее ускорителей Cerebras.
Llama 3.1 по нынешним меркам уже устарела — модель дебютировала в середине 2024 года, — но чип размером с область экспонирования литографа создавался прежде всего для доказательства концепции.
Taalas крайне скрытно относится к деталям устройства своих чипов, но известно, что процессоры состоят из двух основных областей: mask-ROM recall fabric, где вытравлены веса модели, и SRAM recall fabric, где хранятся KV-кэши и адаптеры для fine-tuning.
Для чипа второго поколения HC2, который должен выйти этим летом, Taalas планирует довести количество параметров до 20 миллиардов. Звучит не слишком внушительно, но, как и с GPU для больших моделей, веса просто распределяются между несколькими ускорителями с помощью pipeline parallelism.
При 20 миллиардах параметров на чип для модели с триллионом параметров понадобится всего 50 ускорителей — а у AMD как раз есть rack-scale платформа и собственная команда системного проектирования, способная без проблем разместить такое количество чипов.
Это заметно экономнее по площади и энергопотреблению, чем недавно представленные системы Nvidia LPX, которым для обслуживания той же модели понадобилось бы несколько десятков GPU и как минимум 2000 LPU Groq.
По имеющимся данным, AMD намерена сочетать стойки Helios на базе Instinct с чипами на технологии Taalas, что подразумевает дезагрегированную архитектуру: ресурсоёмкая обработка промптов выполняется на GPU, а генерация токенов переносится на ускорители на базе Taalas.
Также возможен вариант с чередованием поколений (tick-tock): клиенты сначала разворачивают и проверяют модели на ускорителях Instinct, а затем, убедившись в их работоспособности, переходят на ускорители Taalas. Здесь можно только строить предположения, но вот что сказал по этому поводу старший вице-президент AMD по AI Вамси Боппана в официальном заявлении:
«AMD создаёт full-stack AI-платформу, которая даёт клиентам возможность выбирать подходящее вычислительное решение для каждой AI-нагрузки».
Модель нужно действительно любить
Технология работает молниеносно, но, как можно было догадаться, имеет существенный недостаток. После развёртывания чипов клиент оказывается «привязан» к конкретной модели. Любое изменение крупнее чего-то вроде LoRA-адаптера требует пересъёмки чипа — а это дорого и долго.
AI-бум длится уже почти четыре года, и новые модели выходят практически ежемесячно. Чтобы получить выгоду от технологии Taalas, клиентам AMD придётся быть по-настоящему уверенными в выборе модели — кому-то это будет сделать проще, кому-то сложнее.
Впрочем, если верить стартапу, ситуация не так плоха, как кажется. Новая модель действительно требует пересъёмки чипа, но не с нуля — достаточно изменить всего два слоя металла, что заметно дешевле и быстрее.
Скорее всего, эта технология найдёт применение прежде всего у разработчиков AI-моделей, их инфраструктурных провайдеров и небольшого числа inference-провайдеров. В февральском интервью изданию The Next Platform в Taalas отмечали, что вытравливание весов модели в кремнии стоит в 100 раз дешевле, чем обучение модели уровня frontier.
У AMD есть все возможности договориться о таких сделках. OpenAI, Anthropic и Meta — крупные клиенты Instinct. Учитывая тесные рабочие отношения между разработчиками моделей и производителем чипов, не удивительно будет увидеть GPT или Claude, работающие на комбинации ускорителей Taalas и Instinct.
У технологии есть последствия и для разработки моделей. Один из способов снизить количество галлюцинаций — обменять время на точность. Этот приём, test-time scaling, довольно прост на практике: модели дают «думать» дольше перед ответом.
Недостаток test-time scaling в том, что он расходует существенно больше токенов, что делает его дорогим и заставляет пользователей дольше ждать ответа от чат-бота, ассистента для кода или агента. Если покупка Taalas позволит AMD снизить стоимость токена и ускорить генерацию в 10–20 раз, разработчики моделей могут решить увеличить время рассуждения ещё сильнее.
Как бы то ни было, ждать долго не придётся, чтобы увидеть, как Taalas впишется в более широкую стратегию AMD. При условии одобрения регуляторов сделка должна закрыться в четвёртом квартале.