OpenAI последние пару лет тихо разрабатывала «Jalapeño» — инференс-чип, о котором объявили на конференции Hot Chips. Слухи об успешном тейпауте циркулировали уже давно, но теперь появились подробности. OpenAI пригласила журналистов SemiAnalysis посмотреть на чип, посетить лаборатории компании, чтобы убедиться в его реальности, и протестировать его с помощью набора бенчмарков InferenceX.

В июне OpenAI анонсировала программу разработки чипа в партнёрстве с Broadcom — проект стартовал с чистого листа исключительно для инференса LLM. Работа над дизайном началась в середине 2024 года, и путь от найма первой команды до тейпаута занял около 16 месяцев — исключительно быстрый цикл разработки ASIC.

Обычно чипы первого поколения не конкурентоспособны, но OpenAI нарушила этот тренд: по результатам тестов на нескольких топовых open source моделях новый чип обходит все протестированные решения Nvidia, AMD и Google. Достигнуто это за счёт экстремального совместного проектирования аппаратной и программной частей. Что удивительно, OpenAI не сделала чип узкоспециализированным под какую-то конкретную часть инференса моделей — вместо этого ставка была сделана на универсальность и высокую производительность во всех сценариях.

Далее в материале — архитектурные детали, особенности программного стека и результаты тестов Jalapeño в бенчмарке InferenceX.

Источник: OpenAI

Универсальный инференс-чип

Многие пишут, что чип OpenAI специализирован под модели самой компании, но это не так — OpenAI создала универсальный чип для AI-инференса.

Сроки разработки поражают. Это подтверждает: заявления о том, что AI ускоряет проектирование чипов, — правда. Впрочем, скорость не отменяет того, что OpenAI потратила немало денег, приняла прагматичные архитектурные решения, а команда собралась сильная — так что удивляться не приходится.

Уже по одним спецификациям чип выглядит серьёзным конкурентом:

Источник: SemiAnalysis

А использование HBM4 ставит его в один ряд с флагманскими GPU от Nvidia и AMD:

Источник: OpenAI

Большая часть публикаций об этом чипе строится вокруг нескольких неосторожных комментариев OpenAI о том, что чип якобы оптимизирован под собственные модели компании иначе, чем другие чипы. Это неверно. Jalapeño — универсальный инференс-чип, способный работать с самыми разными моделями и нагрузками, включая бенчмарк InferenceX, который прогоняли прямо в лаборатории вместе с инженерами OpenAI. В шутку там даже показали, как на чипе запускается Doom — порт был сделан буквально с помощью промптов в Codex.

Jalapeño буквально сжигает конкурентов, если смотреть на главный показатель — токенов в секунду на общую утилитарную мощность (All-in utility MW). Причём всё это достигнуто без Multi Token Prediction (MTP), в то время как остальные чипы на графике показывают лучшие конфигурации своих SKU, все с включённым MTP.

Источник: SemiAnalysis

Jalapeño превосходит Blackwell по производительности на ватт почти во всех сценариях, причём без настройки под какую-то конкретную точку кривой. Он хорош и в сценариях с низкой задержкой, и при высокой пропускной способности. Если сравнивать честно — с результатами Single Token Prediction, — Jalapeño обходит всех конкурентов с большим отрывом. При низкой конкурентности демонстрируется впечатляющая интерактивность: свыше 700 токенов в секунду на пользователя при конкурентности 1 на модели DeepSeek R1.

Поразительно, но всё это достигнуто с single-token prediction (STP), без спекулятивного декодирования и без разделения prefill и decode. Помимо DeepSeek R1 показали и другие модели, включая Kimi-K2.5 и GPT-OSS, которые работали со скоростью около 1400 токенов в секунду на пользователя. Для всех моделей подтвердили, что результаты Jalapeño на GSM8k сопоставимы с показателями чипов Nvidia.

Есть несколько оговорок. Во-первых, все цифры предоставлены OpenAI. Прогоны InferenceX проверили лично в лаборатории, но полный набор бенчмарков InferenceX не прогонялся, и результатов AgentX пока нет. AgentX — предпочтительный набор для сравнения производительности чипов, поскольку датасеты с длинным контекстом и множеством ходов лучше отражают поведение кэша в реальных производственных нагрузках. Фреймворки, показывающие хорошие результаты на 8k1k, могут проседать на AgentX, поскольку реальные production-нагрузки нагружают роутеры, механизмы префикс-кэша, управление кэшем, offload-инфраструктуру и так далее — а всё это однопроходный тест 8k1k не проверяет. Подробнее об этом — в статье про AgentX.

Во-вторых, сравнение с Blackwell не совсем полное и не совсем честное. По сути Jalapeño конкурирует с чипами вроде Rubin, которые тоже используют HBM4. Системы Vera Rubin уже начинают поступать заказчикам, тогда как у OpenAI пока есть только инженерные образцы Jalapeño.

Поэтому производительность правильнее сравнивать с Rubin, а не с Blackwell, и в каком-то смысле ожидаемо, что кастомный чип, такой как Jalapeño, превосходит Blackwell. Vera Rubin NVL72 обеспечивает производительность на мегаватт в 5,4 раза выше, чем GB200 NVL72, как было показано в разборе заявлений Nvidia на презентации с CoreWeave в прошлом месяце. Сравнение Jalapeño с июльскими показателями Vera Rubin — ниже.

В-третьих, тестируемые модели — не самые передовые на открытом рынке. Nvidia и AMD публиковали результаты на более крупных моделях, таких как DeepSeek V4 Pro и Kimi K3, с использованием AgentX. Чем крупнее модель и чем она новее, тем сложнее её адаптировать под новый чип. При этом модели, которые OpenAI запускает на Jalapeño, тоже далеко не маленькие.

Анализ производительности

OpenAI проектирует чип под показатель производительности на ватт. Причина проста: компания сейчас ограничена мощностью дата-центров, а не бюджетом или площадью, поэтому токены на мегаватт — главный показатель. На Computex 2026 Дженсен Хуанг сказал, что производительность на ватт, надёжность и долгий срок службы — ключевые характеристики будущих GPU. Цитата: «Если у вас есть гигаватт мощности, то пропускная способность на ватт — это и есть выручка». Он также отметил, что выбирать неправильную архитектуру только потому, что чипы дешевле, — не имеет смысла.

Источник:キーноут Computex 2026

Этот же тезис подчеркнула Nvidia на презентации Vera на Hot Chips 2026, показывая тот же график выручки: «Дата-центр сегодня ограничен по мощности». Мощность имеет значение и напрямую определяет выручку.

Операторы не могут просто получить больше мегаватт, потому что установка GPU и наращивание мощности сети происходят в совершенно разных временных масштабах. Энергетические лимиты дата-центров ограничены подключением к сети, инфраструктурой, охлаждением и резервным питанием (UPS/генераторы). Задержки в подключении к электросети регулярно опережают темпы строительства и ввода оборудования, что подстёгивает спрос на BtM-мощность (behind-the-meter) — газовые турбины и генераторы, построенные непосредственно на территории дата-центра, за счётчиком поставщика энергии. Это позволяет запитать объект без ожидания подключения к сети и модернизации инфраструктуры энергокомпании — именно поэтому Colossus 2 от xAI так сильно опирается на BtM-мощности, пока фактическое подключение к сети сильно отстаёт. Подробнее — в энергетической модели SemiAnalysis.

Как было отмечено в одном из постов на X, tok/s/MW сводится к токенам на джоуль, поскольку ватт — это джоуль в секунду. Это делает показатель tok/s/MW характеристикой эффективности системы и её способности превращать энергию в токены.

Источник: SemiAnalysis

По этому показателю Jalapeño выигрывает даже у Rubin. Пропускная способность STP на мегаватт у Jalapeño превышает результаты MTP Vera Rubin, опубликованные Nvidia и CoreWeave в июле. Также он значительно превосходит показатели MTP GB200 2025 года. Как упоминалось в статье о Vera Rubin, тогда сравнение шло с результатами GB200 2025 года, поскольку это была схожая стадия раннего запуска, а сравнение с GB200 того же года держит зрелость софта константой. Следуя той же логике, здесь сравниваются последние июльские результаты 2026 года Vera Rubin, результаты GB200 2025 года и текущие результаты Jalapeño. Это вполне корректное сравнение, поскольку это лучшие публичные показатели Rubin, а OpenAI сделала тейпаут своего чипа позже Rubin. Оба чипа — и OpenAI, и Rubin — ещё незрелые, поэтому производительность будет расти и дальше.

Источник: OpenAI, SemiAnalysis

По показателю производительность/TCO Vera Rubin и Jalapeño идут почти вровень, выдавая примерно одинаковое число выходных токенов на доллар. Однако, как уже упоминалось, результаты Jalapeño получены без спекулятивного декодирования, а результаты Vera Rubin — с ним. Спекулятивное декодирование снижает стоимость токена в 3-5 раз. Когда спекулятивное декодирование появится на Jalapeño, это позволит обслуживать токены ещё дешевле. Конечно, часть преимущества по TCO объясняется тем, что высокая маржа Nvidia заменяется более низкой (хотя всё равно высокой) маржой Broadcom. Но это не всё. Например, тот факт, что программы разработки собственных AI ASIC у Meta и Microsoft так и не сдвинулись с места, несмотря на то что там занимаются этим намного дольше, показывает, что стоимость — лишь часть уравнения. Полную разбивку TCO Jalapeño можно найти в TCO-модели SemiAnalysis для AI Cloud.

Источник: OpenAI, SemiAnalysis

Архитектурно OpenAI решила не разделять prefill и decode (PD) по отдельным пулам чипов. Черновая модель и основная модель делят одни и те же чипы и фабрику — философия дизайна, жертвующая частью теоретической эффективности в пользу практичности эксплуатации. Мотивация в том, что структура нагрузки меняется со временем: например, соотношение входных токенов, записи в кэш, чтения из кэша и выходных токенов заметно изменилось по мере прохождения трёх эпох моделей (знаниевой, рассуждающей и агентной, о чём говорилось в недавней статье). Поэтому фиксированное заранее разделение кремния на гетерогенные пулы под prefill и decode со временем может привести к неэффективности. OpenAI выбрала однородный пул и стремится сделать чип хорошо работающим на всём подряд.

И это работает. На Kimi K2.5 (на которой основан Cursor Composer 2.5) Jalapeño достигает почти 700 токенов в секунду на пользователя и более чем в 9 раз превосходит следующий лучший чип на отметке 100 токенов в секунду на пользователя.

Источник: OpenAI, SemiAnalysis

На GPT-OSS — очередной разгром. Пропускная способность Jalapeño на мегаватт при равной интерактивности почти вдвое выше максимальной пропускной способности GB200 и более чем в 50 раз выше показателя GB200 при конкурентности 1. Более высокие точки конкурентности у Jalapeño используют EP8.

Источник: OpenAI, SemiAnalysis

Результаты впечатляют! Однако есть придирка: это лишь тест 8k1k — намного более простая нагрузка для настройки, и прогонов AgentX пока нет. Как отмечалось в статье про AgentX, многоходовые нагрузки с длинным контекстом нагружают куда больше аспектов стека обслуживания, таких как роутеры и префикс-кэш. Для успеха в агентных сценариях нужно намного больше оптимизаций. Подробнее — в статье про AgentX.

Углубляемся в спецификации и архитектуру

Все эти результаты получены на степпинге A0 Jalapeño, всего через 9 месяцев после старта программы. Но в производстве уже находится степпинг B0! B0 включает оптимизации, дающие примерно 25% прироста производительности на ватт по сравнению с более ранним A0. В частности, степпинг B0 обеспечивает 13,4 PFLOPs в MXFP4 на одном компьют-чипе размером с ретикл, произведённом на техпроцессе TSMC N3P. Для сравнения, у Rubin один compute-чип похожего размера на том же техпроцессе даёт 17,5 PFLOPs в плотном NVFP4.

Это выглядит достойно, если учесть, что TDP Jalapeño составляет всего 700 Вт против 900-1150 Вт на compute-чип у Rubin. Поскольку Jalapeño ориентирован на инференс, а не на обучение, понятно, что OpenAI не нужно поднимать TDP для максимизации FLOPs, но, тем не менее, приведённые цифры показывают достойные пиковые теоретические показатели.

При прямом сравнении с другими ускорителями у Jalapeño самая высокая пропускная способность HBM на ватт и самые высокие FLOPs на ватт — сопоставимо с конфигурацией Rubin Max-Q на 1800 Вт:

Источник: SemiAnalysis

Внешний I/O обеспечивается чиплетом N3E I/O с 32 линиями 800G SerDes для вычислительной фабрики: 24 линии (600 Гбит/с) используются для локального масштабирования внутри стойки, а 8 линий (200 Гбит/с) — для глобального масштабирования, охватывающего домен из 2048 XPU в нескольких стойках. Для системного I/O и подключения к x86-хосту используется PCIe Gen 5.

Jalapeño будет поставляться с HBM4 — компания стала одним из относительно ранних пользователей этой памяти после Nvidia и AMD, обойдя даже давно существующие программы TPU и Trainium. Поскольку один из ключевых архитектурных принципов Jalapeño — максимальное использование полосы HBM, выбор чего-то кроме лучшей HBM противоречил бы этой цели. В результате получается 15,4 ТБ/с полосы памяти на пакет — лучший показатель среди всех поставляемых ускорителей, использующих HBM3E. Такая полоса говорит о том, что HBM4 в чипе способна работать на скорости 10 Гбит/с на пин — немного выше, чем 9,6 Гбит/с, которых Nvidia добивается от HBM4 в Rubin. Поставщиком HBM, вероятно, выступает Samsung.

Источник: OpenAI

OpenAI сделала тейпаут Jalapeño в ноябре 2025 года, точнее — это был тейпаут дизайна CoWoS, а не только верхнего кремния. За 9 месяцев с этого тейпаута, и всего за 3 месяца работы с реальным кремнием, компания уже добилась очень хороших результатов. Это тем более впечатляет, если учесть, что программный стек создавался с нуля.

Для сравнения, тейпаут CoWoS для Rubin завершился в октябре 2025 года — месяцем раньше, — и тем не менее единственные ранние результаты, которые до сих пор были доступны, — это инженерные образцы от CoreWeave. Nvidia не позволила протестировать и опубликовать бенчмарки в том же формате, что и OpenAI, — это говорит о том, что программный стек компании ещё не созрел. CUDA-ров, возможно, уже не спасает ситуацию — учитывая, с какой скоростью OpenAI поднимает новые модели на своём кремнии.

Софт Rubin ещё далёк от оптимизированного, и в целом видно, что Jalapeño выдаёт лучшие цифры. Дело не в том, что аппаратное обеспечение Nvidia хуже, а скорее в том, что программный запуск Jalapeño продвигается быстрее. Это подчёркивает силу совместного проектирования аппаратной и программной частей — именно та область, где сильная команда разработки ASIC внутри передовой AI-лаборатории может обойти устоявшихся игроков рынка кремния. Как ни странно, старт с нуля мог сыграть в пользу OpenAI: компания могла принимать архитектурные решения без оглядки на обратную совместимость или старые версии софта.

Хотя у OpenAI пока есть только инженерные образцы Jalapeño, производство запланировано на постепенный рост в течение 2027 года, с основным объёмом выпуска, приходящимся на конец следующего года. Подробнее об объёмах и ценах — в модели ускорителей SemiAnalysis.

Достаточно сказать: OpenAI Jalapeño — это реальный высокообъёмный ASIC.

По сравнению с временной шкалой Rubin темпы Jalapeño просто шокируют. Как показано выше, результаты Jalapeño превосходят Rubin, несмотря на то что у Rubin был запас времени вперёд.

Источник: SemiAnalysis

Архитектура Jalapeño

Если углубиться в архитектуру, матричный движок чипа использует числовые форматы MXFP и систолический массив weight-stationary — похоже на TPU. Но в отличие от TPU он поддерживает более мелкие формы/размерности, то есть не имеет странных провалов производительности, которые проявляются при неудобных формах матричных умножений на больших систолических массивах.

Есть также 64-битные скалярные ядра и векторные ядра FP32/INT32. OpenAI инвестировала в резервирование на уровне лотка и встроила механизмы харвестинга выхода годных на уровне ядер и каналов. Компания заявляет, что использование AI в проектировании чипа дало 8% сокращение площади SIMD и 10% сокращение площади матричного движка. Точные условия PVT (процесс/напряжение/температура) не уточняются, но отмечается, что блоки, спроектированные с помощью AI, показали улучшенный тайминг и энергопотребление по сравнению с изначальными версиями.

Архитектура Jalapeño нацелена на устранение перемещения данных KVCache и весов, а также на устранение фиксированных задержек и накладных расходов — всё это, чтобы приблизиться к пиковым теоретическим FLOPs/полосе даже на малых батчах или формах по сравнению с другими ускорителями.

Ядра и HBM разделены на слайсы, где каждый слайс ядра имеет низколатентный локальный доступ к своему участку HBM. Синхронизация между слайсами происходит по выделенной высокоскоростной коллективной сети. Такая минималистичная иерархия памяти уже даёт Jalapeño потенциальное большое преимущество перед GPU, где обращения к памяти должны проходить через сложную систему памяти, что приводит к большим задержкам, которые нужно амортизировать или скрывать на больших формах.

Такой подход возможен благодаря тщательному размещению весов и KV: синхронизация между ядрами может быть ограничена узким набором известных высокоскоростных коммуникаций, например тензорно-параллельными обменами, которые перекрываются с вычислениями.

Источник: OpenAI

Есть также дополнительная общая сеть на кристалле (NoC), используемая для общих коммуникаций и доступа к сети масштабирования. В целом, за счёт упрощённой NoC и подсистемы памяти OpenAI экономит значительную мощность и получает большой прирост производительности по сравнению с Nvidia и Google.

Источник: OpenAI

На уровне ядра OpenAI описывает внеочередное (OoO) ядро с кэшем L1. Это заметное отличие от подхода, который используется в других ускорителях — все они вместо этого применяют программно управляемый scratchpad, обычно в паре с асинхронной поддержкой DMA. Аргумент здесь тот же: это позволяет Jalapeño избежать фиксированных издержек, таких как задержки барьеров, которые на других ускорителях (например, GPU) нужно скрывать или амортизировать за счёт большей работы на ядро, что усложняет приближение к пиковой полосе/производительности.

Плата за это — то, что Jalapeño сильно зависит от качественного префетчинга для своевременного поступления данных из памяти, что менее предсказуемо и сложнее анализировать. Тем не менее, с Codex в хорошей обвязке и доступом к детальной трассировке, поиск оптимального кернела с наилучшим префетчингом под конкретную форму, вероятно, требует минимального человеческого участия. Судя по всему, именно так OpenAI так быстро подняла DeepSeek R1, Kimi K2.5 и GPT-OSS.

Ядра также поддерживают «маленькие» размерности матриц, что (в зависимости от того, насколько маленькие) должно сделать чип более универсальным для разных моделей и размеров батчей, менее чувствительным к выравниванию размерностей матриц, накладным расходам на паддинг и неэффективности тайлинга. Например, у TPU, Trainium и чипов Etched очень большие систолические массивы, которые требуют крупных батчей или точно делимых размерностей моделей, чтобы избежать неэффективности тайлинга.

С Jalapeño OpenAI сосредоточилась на устранении фиксированных задержек в системе, чтобы максимально приблизиться к теоретическому пределу производительности во всех точках кривой Парето. В теории это может дать преимущество над GPU в нескольких режимах работы:

  • Значительно лучшая верхняя граница производительности при низкой задержке/малых батчах инференса, что на GPU ограничено множеством фиксированных издержек — задержками запуска, задержками барьеров, задержками системы памяти

  • Некоторый потенциал приблизиться к теоретическому пределу оборудования даже при большом батче или длинном контексте

Оговорка в том, что даже если верхняя граница производительности теоретически доступна, реализовать её в реальных кернелах может быть сложнее. Похоже, подход такой:

  1. Проектировать под максимальную верхнюю границу производительности для всех форм нагрузки

  2. Дать Codex проделать рутинную работу по поиску кернелов, достигающих этой верхней границы

Судя по крайне быстрому темпу, с которым команда OpenAI подняла нагрузки InferenceX на Jalapeño, такой подход выглядит оправданным.

Если Jalapeño окажется успешным, это будет сильным сигналом того, что одержимость индустрии программными моделями и идеальными универсальными компиляторами теряет смысл на фоне возможностей передовых AI-моделей.

Программное обеспечение

Кернелы для Jalapeño в OpenAI пишут почти как ассемблерный код. Каждый кернел получает вручную оптимизированный код, некоторые доходят до ~3000 строк, с проверками корректности и собственным санитайзером. Ранняя работа над кернелами шла с участием человека, а не полностью автоматически, но ситуация изменилась с появлением более масштабной внутренней версии Codex, которую OpenAI планирует предложить корпоративным клиентам. Внутренний движок обслуживания называется «Teacup». Любопытно, что у OpenAI не было собственной реализации кернелов MLA, пока не начали тестировать DeepSeek с помощью InferenceX. То, насколько быстро Codex смог написать работающие и эффективные кернелы (без участия команды инженеров-разработчиков кернелов OpenAI), демонстрирует зрелость программного конвейера.

Jalapeño программируется на Gluon — собственном языке OpenAI для написания кернелов. Построенный на базе Triton, Gluon сохраняет модель программирования SPMD (Single Program Multiple Data), но открывает низкоуровневые абстракции программирования. Например, для GPU Nvidia он предоставляет API, отображающиеся на инструкции PTX, включая инструкции MMA, TMA, механизмы mbarrier и многое другое. Самая уникальная абстракция, которую предлагает Gluon, — layout (раскладка). Говоря в общем, layout определяет соответствие между аппаратным ресурсом (например, 5-м регистром варпа 9) и элементом тензора (например, элементом на строке 6, столбце 7). Абстракция layout в Gluon основана на Linear Layouts — разновидности алгебры раскладок, изобретённой OpenAI. Linear Layouts математически формализует понятие layout и предоставляет инструменты для работы с ними. Это открывает целый ряд возможностей, включая доказуемо корректные преобразования layout и оптимальный memory swizzling.

В модели программирования Jalapeño каждая программа на Gluon отображается на постоянный (persistent) поток. Похоже, это намекает, что Jalapeño ориентирован на паттерн persistent kernel, при котором одна программа выполняется на нескольких тайлах, а распределение работы задаёт программист, а не аппаратный планировщик. OpenAI упомянула TensorInfo — абстракцию, явно кодирующую layout. Вероятно, это набор layout, спроектированных для Jalapeño на основе Linear Layouts. Наконец, каждое ядро поддерживает предварительную выборку данных и раздельные внеочередные блоки. Например, программист может задать ожидание предзагруженных данных, заблокированное семафором.

По иронии судьбы модели OpenAI, такие как GPT 5.6 Sol, которые сейчас работают на GPU Nvidia, использовались для проектирования чипа, представляющего реальную угрозу CUDA-рву — собственные GPU Nvidia в реальном времени помогают приблизить появление своего потенциального преемника.

Если сравнить показатели во времени, видно, насколько быстро развивается программный стек Jalapeño: улучшение пропускной способности более чем вдвое при определённых уровнях интерактивности достигалось менее чем за две недели. Каждый новый архив, полученный от команды Jalapeño, содержит целый набор улучшений.

Источник: OpenAI, SemiAnalysis

Причём улучшилась не только производительность кернелов: за 8 дней команда Jalapeño добавила поддержку TP32, развивая предыдущие конфигурации TP8 и выходя за пределы одной системы, чтобы получить рабочую конфигурацию масштаба целой стойки на крупной модели. Это действительно впечатляющий темп разработки.

Источник: OpenAI, SemiAnalysis

Для проверки производительности перед реальными прогонами на оборудовании OpenAI использует симулятор «chilisim», точность которого — в пределах 5% от измеренных показателей на реальном железе, с использованием шины трассировки фиксированной ширины. Трассировка на A0 была ограниченной, но существенно улучшилась на B0 — вероятно, с учётом данных, полученных из реальных прогонов на кремнии A0. Инженеры продемонстрировали работу Codex CLI на внутренней модели с прозвищем «Raiku» или «5.3 Codex Spark» при TPOT в 1,2 мс.

Команда также показала демо, написанные Codex и работающие непосредственно на чипе: Doom при 36 FPS, симуляцию гидродинамики в FP32 и визуализацию перетаскивания мышью под названием «Liquid Light».

Источник: SemiAnalysis

Что касается моделей, внутренний подход OpenAI на основе мегакернела, получивший прозвище «гигакернел», построен вокруг единого мегакернела, выполняющего цикл прямо на устройстве, чтобы сократить накладные расходы CPU и время запуска. Команда также всё активнее развивает стратегии test-time compute, с особым внутренним интересом к тому, как согласованно использовать миллион rollout'ов.

Диспаггрегировать или не диспаггрегировать

Ранее упоминалось, что OpenAI не использует разделение prefill и decode на этих чипах. Это стало неожиданностью, поскольку GPU Nvidia и AMD заметно выигрывают от PDD даже на однородном оборудовании. Разберёмся, почему команда Jalapeño выбрала именно такой путь.

Разделение prefill и decode (PDD) выглядит привлекательно, когда нагрузка зафиксирована. Prefill и decode по-разному нагружают оборудование, поэтому выделение под каждую фазу отдельно настроенного пула может повысить эффективность при одном выбранном соотношении входа/выхода. Однако production-трафик не держится на одном соотношении. Длина входных и выходных последовательностей, конкурентность, частота попаданий в кэш, доля принятых спекулятивных токенов и целевая задержка — всё это меняется в течение дня.

Как только устройства разделены на пулы prefill и decode, избыточный спрос на prefill оставляет decode-чипы простаивать, пока запросы стоят в очереди. Но избыточный спрос на decode приводит к обратному эффекту. Оператору приходится постоянно прогнозировать правильное соотношение, резервировать запасную мощность по обеим сторонам и перебалансировать систему, идеальное соотношение в которой постоянно меняется.

В унифицированной системе часть ресурсов может быть недоиспользована в конкретной фазе, но каждое устройство остаётся доступным для обслуживания следующего запроса. В разделённой системе целый чип может простаивать просто потому, что он принадлежит «неправильному» пулу. Локальная утилизация выглядит лучше, но глобальная может быть плохой.