Как AI inference отличается от AI training

Необученная большая языковая модель (LLM) — это как перемешанные плитки Scrabble на столе. Вместо отдельных букв каждая плитка показывает фрагменты слов, называемые токенами. Всё, что нужно для написания почти чего-угодно, есть, но ничего не имеет смысла.

Обучение модели организует эту кучу через игру в угадывание в массовом масштабе. Модели показывают реальный текст с скрытым следующим токеном и просят предсказать, что будет дальше. После каждого предположения правильный токен раскрывается и сравнивается с предсказанием — разница используется для расчёта точности модели. Игра разыгрывается не с одним предложением, а по миллиардам отрывков.

Пока настоящая партия в Scrabble может быть сыграна под запеканку и несколько напитков, обучение AI требует огромных вычислительных мощностей. Модель обновляет свои параметры через backpropagation — процесс, который многократно рассчитывает, как каждый из миллиардов или триллионов параметров модели должен измениться, чтобы улучшить следующее предсказание. Вот почему технологические гиганты строят центры обработки данных больших, чем когда-либо.

В итоге создатель модели решает, что дальнейшее обучение не стоит затрат, и игра в угадывание прекращается. Backpropagation заканчивается, параметры замораживаются, а LLM становится предобученной моделью. Fine-tuning — это короткий цикл обучения на более узкоспециализированных данных — добавляет финальные штрихи, и модель разворачивается.

Дальше идёт инференс. Это процесс использования развёрнутой модели, которая, после обучения, научилась выдавать плитки Scrabble — токены — в разумном порядке.

Можно подумать, что AI inference менее требователен с точки зрения вычисления, потому что расчёты backpropagation, используемые для обновления параметров, исключены. Но Суджип Бходжа, основатель и CTO компании по разработке аппаратного обеспечения для инференса d-Matrix, объясняет, что инференс создаёт новые вызовы.

Модели имеют "авторегрессивный" характер. То есть следующий результат зависит от предыдущего. «Так что для генерации следующего токена нужно прочитать все веса и весь контекст от предыдущего токена», — объясняет Бходжа. Контекст включает все промпты, все ответы LLM и все загруженные файлы. Это множество данных и множество обработки.

LLM генерирует свой ответ в два этапа: prefill и decode. Prefill — это когда модель читает промпт. Она обрабатывает каждый токен сразу, вычисляя, как каждый токен относится ко всем остальным. Эта операция называется attention, и это определяющая характеристика архитектуры transformer, стоящей за современными LLM. Это позволяет им отвечать на слово в его предложении, абзаце и более широком контексте, а не само по себе. Представьте себе, что вы расставляете плитки Scrabble перед тем, как поместить их в игру. Много игроков двигают плитки вокруг, чтобы представить, как они соединяются. Self-attention играет похожую роль, хотя вместо перемещения физических плиток каждый токен отправляет запрос остальным и получает оценку, указывающую на релевантность токена.

Эти запросы приводят к двум типам векторов: ключей и значений. Они обычно помещаются в хранилище под названием KV cache. Это не строго обязательно — модель могла бы вместо этого пересчитать эти векторы с каждым новым сгенерированным токеном. Но почти все LLM используют KV cache, чтобы снизить количество вычислений. KV cache хранится в памяти и становится блокнотом, к которому LLM может вернуться, чтобы понять беседу, и хотя он начинается маленьким, может раздуться до десятков гигабайт.

Prefill — это задача, которую легко разделить и работать над ней параллельно. Вот почему GPU стали доминирующим AI ускорителем по мере того, как LLM взлетали в популярности. Графическая растеризация (расчёт цвета каждого пикселя на экране) также массово параллельна, поэтому архитектуры GPU были естественной подгонкой.

Дальше идёт decode. Здесь модель генерирует свой ответ по одному токену за раз. На каждом шаге она берёт самый свежий токен, взвешивает его со всем в KV cache, использует эту информацию для предсказания следующего токена и добавляет ключ и значение нового токена в cache. Затем повторяет последовательно, токен за токеном.

Вот где авторегрессивная природа модели работает против скорости инференса. Предсказание каждого токена требует чтения всей модели из памяти, а эта модель состоит из возможно десятков или сотен гигабайт параметров (чисел, представляющих то, что модель выучила во время обучения). Главное — это в дополнение к памяти, требуемой для хранения KV cache.

В результате перемещение всех этих данных через память часто требует большей пропускной способности, чем есть у аппаратного обеспечения инференса. Поэтому, по крайней мере, некоторые вычислительные части GPU простаивают, пока ждут данные. Исследователи обнаружили, что GPU Nvidia H100, запускающие с открытым исходным кодом LLM, простаивают 50–80 процентов времени.

Роль памяти в инферинсе

Шахриар "Ша" Рабии, бывший глава кремниевой инженерии в Meta и соучредитель AI стартапа Majestic Labs, говорит, что простаивающие процессоры — это почему многие компании, пытающиеся улучшить производительность AI инференса, сосредоточены на памяти. «При подходе на основе GPU вы в итоге сильно переподготавливаете вычисления и испытываете нехватку памяти. Это движет большим масштабированием памяти», — говорит он.

d-Matrix Бходжи и Majestic Labs Рабии оба сосредоточены на этом узком месте памяти. Однако их компании представляют разные решения.

Второе поколение AI ускорителя d-Matrix, Raptor, целится улучшить производительность инференса путём минимизации расстояния между вычислениями и памятью. GPU в большинстве текущих развёртываний AI инференса делают это, размещая высокопропускную память (HBM) вокруг периметра GPU. Каждый HBM — это стопка микросхем DRAM, соединённых вместе и подключённых к сверхбыстрому интерфейсу GPU. Это отлично подходит для обучения, но для инференса объём памяти, которую вы можете таким образом сложить, и пропускная способность, которую она может обеспечить, оставляют желать лучшего.

Архитектура с многоуровневыми кристаллами d-Matrix

d-Matrix's Raptor устраняет это узкое место, складывая AI ускоритель на кристалл DRAM. Вместо складывания памяти d-Matrix складывает память и вычисления. Бходжа говорит, что это снижает расстояние, на которое должны путешествовать данные, до «микронов вместо миллиметров». Как строительство небоскрёба, направление в вертикаль позволяет сделать больше внутри того же физического пространства.

Majestic принимает противоположный подход. Вместо попытки минимизировать длину, которую должны пройти данные между вычислениями и памятью, компания сосредоточена на улучшении интерфейса памяти для размещения более длинных трассировок проводов при сохранении высокой пропускной способности. Более длинные провода позволяют Majestic подключать стопки памяти, которые находятся не непосредственно рядом с GPU, устраняя ограничение пространства HBM.

«Интерфейс памяти может работать на очень короткое физическое расстояние. В случае HBM — до 2–3 миллиметров. У вас есть эта береговая линия вокруг периметра, что единственное место, где вы можете разместить HBM», — говорит Рабии.

Majestic утверждает, что её интерфейс памяти может передавать биты на расстояние около метра. Это достигается с помощью запатентованного медного звена и микросхемы агрегатора памяти, которая координирует данные. «Агрегатор — это конечная точка для высокоскоростного интерфейса и способ распределить к множеству, множеству товарных микросхем DRAM», — говорит Рабии. Благодаря этому Majestic может поддерживать до 128 терабайт памяти DRAM в одной стойке сервера — значительное увеличение по сравнению с Nvidia GB300 NVL72 стойкой, которая имеет около 20 TB HBM3E.

Архитектура агрегации памяти Majestic Labs

d-Matrix и Majestic имеют одно общее: вместо HBM оба используют стандартную DRAM. Это самый распространённый тип компьютерной памяти в мире; она есть во всём, от смартфонов до автомобилей. Аналитик памяти Джим Хэнди говорит, что HBM стоит в два-три раза дороже DRAM. d-Matrix и Majestic выбрали DRAM отчасти из-за этого ценового преимущества. Однако сторонники HBM, включая гигантов памяти вроде Samsung и SK Hynix, не сидят без дела.

HBM4, последняя версия памяти HBM, сейчас в производстве и будет использоваться GPU Nvidia Vera Rubin, который, как ожидается, появится во второй половине 2026 года. Хошик Ким, глава исследований систем памяти в SK Hynix, говорит, что HBM4 «решительно преодолеет узкие места памяти, ограничивающие AI инференс сегодня» путём удвоения максимальной пропускной способности памяти HBM и увеличения объёма памяти HBM на стопку.

Комбинирование чипов для более быстрого инференса

Крупные игроки — Nvidia и Amazon — выбрали подход со всеми чипами на палубе. GPU Nvidia и обучающие ускорители Trainium Amazon по-прежнему хороши для части рабочей нагрузки инференса: этап prefill, где вычисляются все контекстные ключи и значения. Но для ускорения decode, части, где генерируются новые токены, они ищут новые архитектуры, ориентированные на память, от меньших игроков.

В случае Nvidia, меньший игрок был Groq (не путать с Grok — семейством LLM, обученных SpaceXAI). Nvidia закупила интеллектуальную собственность и наняла таланты из Groq в конце 2025 года, и всего через три месяца на конференции Nvidia GTC 2026 Дженсен Хуан представил языковой процессор Nvidia Groq 3 (LPU). Архитектура Groq опирается на память — в её случае SRAM — встроенную прямо в архитектуру чипа.

Если вы не архитектор чипов или фанатик ПК, вы, вероятно, никогда не думаете о SRAM. SRAM имеет преимущество быть плотно интегрированной в архитектуру вычислительного чипа — она находится на том же куске кремния, что и процессор — и имеет недостаток быть менее плотной и более дорогой, чем DRAM. Большинство чипов включают всего несколько десятков мегабайт SRAM. Однако AI инференс разжёг новый интерес к SRAM как способу приблизить веса модели, хранящиеся в памяти, к вычислениям.

Ян Бак, вице-президент и генеральный директор гипермасштабируемых и высокопроизводительных вычислений в Nvidia, говорит, что LPU имеет совсем другой набор приоритетов, чем GPU компании. LPU имеет намного меньше сырой вычислительной мощности, чем стандартный GPU, но получает 500 мегабайт встроенной SRAM, подключённой прямо к его блокам с плавающей запятой. «Преимущество — пропускная способность памяти. LPU имеет семь раз большей пропускной способности памяти, чем GPU», — говорит он.

Между GPU Rubin и LPU Groq, prefill и decode могут быть оба ускорены, чтобы получить лучшее из обоих миров, идёт теория. «Мы делаем всю математику внимания и обработку контекста на стойке Vera Rubin GPU», — объясняет Бак. «Для всех экспертных расчётов... умножений матриц мы делаем эту часть на LPU». Компания упаковывает 256 LPU в Groq 3 LPX — систему размером с стойку центра обработки данных.

Двухчипный подход Nvidia к инферинсу

Amazon Web Services (AWS), со своей стороны, заключил сделку с Cerebras по спариванию ускорителя Trainium с Wafer-Scale Engine 3 (WSE-3) Cerebras. Cerebras применяет похожий подход к Groq, хотя в намного большем масштабе. WSE-3 превращает весь кремниевый вафель в один чип, содержащий более 4 триллионов транзисторов. Дизайн не подключается к внешней памяти, но вместо этого вытравляет 44 гигабайта SRAM в каждый вафель. «Мы храним веса модели на SRAM», — говорит Джеймс Ванг, ранее директор маркетинга продуктов в Cerebras, теперь переехавший в SpaceXAI. «Поэтому это легко 40–80 миллиардов параметров, которые мы можем поддерживать на одном чипе».

Amazon планирует использовать чипы AWS Trainium для prefill и Cerebras для decode. Но чипы Cerebras также могут идти в одиночку в инферинсе. WSE-3 был развёрнут OpenAI для питания GPT-5.3-Codex-Spark, варианта режима кодирования компании, выдавая более 1000 токенов в секунду. Для сравнения, стандартное развёртывание GPT-5.4 OpenAI выдаёт 50–125 токенов в секунду.

Стратегия двухчипного инференса Amazon Web Services

Cerebras также может работать с prefill без перемещения рабочей нагрузки на разные специализированные чипы. Для этого он соединяет в сеть несколько чипов WSE-3, чтобы образовать единый пул памяти. Cerebras продемонстрировал, что может обслуживать модели с параметрами вплоть до 1T, такие как Moonshot AI Kimi 2.6, хотя Ванг говорит, что «архитектура не имеет внутреннего ограничения с точки зрения того, сколько параметров она выполнит».

Несмотря на эти различия в стратегии, Nvidia и AWS кажутся согласными с тем, что будущее AI инференса будет решено системным подходом, который объединяет различные виды чипов для решения самых больших LLM. Или, как говорит Бак: «Чтобы делать современный AI инференс, вам нужны все чипы».

Научиться делать больше с меньшим (битами)

Nvidia стала самой ценной технологической компанией мира, потому что спроектировала самые желаемые в мире GPU. Но не все внимание сосредоточено на улучшении аппаратного обеспечения AI инференса. AI исследователи также учатся оптимизировать программное обеспечение LLM и аппаратное обеспечение в тандеме, чтобы лучше использовать компоненты памяти и вычисления.

Большинство компьютеров хранят числа в 32-битном или 64-битном формате. Они определяют, сколько битов доступно для представления одного числа. Если доступно слишком мало битов, число не может быть сохранено без потери информации. Качество LLM выигрывает от более точных форматов чисел, но это создаёт проблему для производительности инференса. Более точные числа не бесплатны. Биты, которые их описывают, требуют больше места в памяти и требуют больше кремния и энергии для вычисления.

Жиль Бакхус, соучредитель компании по разработке AI ускорителей Tensordyne, говорит, что это создаёт напряжение между размером модели и точностью числа. «Предпочли бы вы модель размером x, которая работает в 8-битном, или вы предпочли бы модель в два раза большего размера, которая работает в 4-битном?» Размер каждой модели будет примерно одинаков с точки зрения памяти и вычисления, «но 4-битный подход даёт вам в два раза больше синапсов, если хотите. И люди выясняют, что это стоит того».

Процесс преобразования LLM из более точного формата чисел в менее точный называется quantization, и он используется в течение нескольких лет. Однако исследователи находят новые способы количественно определить модели вниз, сохраняя при этом большинство качества модели.

Nvidia недавно создала новый 4-битный числовой формат, NVFP4, для этой цели. AMD, Intel и Qualcomm вместо этого объединились вокруг конкурирующего 4-битного числового формата, называемого MXFP4, к разработке которого также присоединилась Nvidia. «Это чёрное искусство AI», — говорит Бак из Nvidia. Когда Nvidia количественно определила DeepSeek-R1 из FP8 в NVFP4, оценки по семи основным тестам деградировали менее чем на один процент, пока производительность улучшилась в три раза, говорит компания.

Quantization, вероятно, просто вершина айсберга, так как исследователи AI и стартапы исследуют разнообразие возможностей для оптимизации, некоторые из которых могли бы кардинально изменить кремний, найденный в аппаратном обеспечении AI инференса.

Tensordyne ожидается ускорить AI инференс логарифмической системой чисел, которая опирается на свойство логарифмов: логарифм A, умноженный на B, равен логарифму A, плюс логарифм B. Итак, хранение чисел как их экспонентов позволяет чипу складывать там, где он иначе умножал бы. Это имеет значение в кремнии, потому что цепи умножителя потребляют больше энергии и используют больше площади кристалла, чем сумматоры. Tensordyne говорит, что его стойка оборудования, называемая Napier, может производить до 1300 токенов в секунду на пользователя и может это делать, используя менее одной десятой столько же энергии, как сравнимое оборудование Nvidia.

Etched, стартап на основе Сан-Хосе, штат Калифорния, даже проектирует AI ускорители, которые переводят архитектуру transformer, используемую LLM, прямо в кремний. Вместо построения универсальных GPU компания подключает соединения, необходимые для эффективных вычислений transformer, в свой чип, делая чип намного менее гибким, но более эффективным для задач, которые чаще всего выполняются текущими LLM. Компания говорит, что её первый AI ускоритель, Sohu, может запускать модель Llama 70B Meta с потрясающими 500000 токенов в секунду, хотя этот подход также означает, что он не сможет запускать LLM, которые отойдут от типичной архитектуры transformer.

Останутся ли эти идеи плодотворными, еще предстоит увидеть. Etched только что отправила свою первую стойку в августе. Tensordyne полагает, что её первое аппаратное обеспечение будет доступно в 2027 году. Даже так, эти стартапы показывают, как спрос на производительность инференса питает нестандартные идеи.

Инференс — игра всех

Чистое разнообразие подходов к ускорению AI инференса — складывание вычисления на память, расширение интерфейсов с миллиметров на метры, использование всего кремниевого вафеля для SRAM, сжатие моделей в 4-битные представления — поднимает вопрос: Какой собирается выиграть, а какой собирается проиграть?

Но это, похоже, неправильный вопрос, говорят эксперты. Спрос на AI в настоящее время ненасытен, и хотя опасения по поводу пузыря AI преследуют индустрию, пока это не препятствовало росту.

Напротив, Кимбалл из Moor Insights & Strategy думает, что инференс может стимулировать интенсивный спрос на AI аппаратное обеспечение в долгосрочной перспективе, потому что неясно, где этот спрос закончится. «Вы можете добавить миллион агентов в вашу организацию», — говорит он. «Эти вещи работают 24 часа в сутки; они не идут домой в пять вечера, как мы».

Если AI инференс остаётся столь желаемым, как ожидает Кимбалл, эволюция, вероятно, будет следовать той же траектории, что и CPU. CPU улучшался не по одной оси, а по множеству фронтов одновременно. Однажды масштабирование транзистора замедлилось, инновации чип-архитектуры и системы всех видов размножились. Список отдельных инноваций, которые привели к сегодняшним вездесущим, мощным персональным вычислениям, мог бы заполнить десятки книг.

Несколько десятилетий спустя история инноваций AI инференса покажет аналогичную глубину.