Термин «эффективная граница» (efficient frontier) пришёл в AI-индустрию из экономики. Его используют, чтобы говорить об управлении компромиссами — чаще всего между стоимостью и возможностями моделей. Модель считается «передовой» (frontier model), если она предлагает наивысшую степень интеллекта при заданной стоимости или размере.

Эффективная граница показывает диапазон оптимальных комбинаций при выборе между двумя ценными результатами в условиях ограниченных ресурсов.
Эффективные границы существуют и в инференс-инжиниринге. Чаще всего это выражается как компромисс между задержкой (latency) и пропускной способностью (throughput), которая определяет стоимость. Также можно обменивать качество на пропускную способность (через квантизацию, дистилляцию и прунинг) или интеллект на скорость (через уровень «рассуждений» модели).
Инженерам инференса доступны два типа техник:
Техники, которые устанавливают компромисс между двумя факторами, перемещая развёртывание вдоль эффективной границы.
Техники, которые сдвигают всю границу для данного развёртывания, создавая дополнительную общую эффективность, которую можно распределить туда, где это наиболее выгодно.
Оба типа техник ценны.
Полезно уметь попадать в любую точку эффективной границы за счёт компромиссов. Отказ от скорости на пользователя позволяет строить высокопроизводительные, дешёвые пайплайны для batch-нагрузок. Жертва пропускной способностью в пользу скорости имеет смысл, когда чувствительные к задержке пользователи готовы платить больше.
И конечно, крайне полезно сдвигать саму границу целиком. Дополнительная эффективность создаёт прирост, который можно распределить на снижение задержки, повышение пропускной способности или их комбинацию.
Далее рассмотрены техники инференс-инжиниринга, которые позволяют выбрать точку на границе, и техники, которые сдвигают границу целиком. В качестве примера рассматривается запуск LLM вроде GLM-5.3 или Kimi K3 для агентного программирования с включённым переиспользованием KV-кэша и оптимальной KV-aware маршрутизацией.
Техники управления компромиссами
Попадание в конкретную цель в продакшене чаще связано не с открытием какого-то нового подхода, а с поиском правильного набора конфигураций с учётом характера трафика.

Техники управления компромиссами позволяют выбрать результат вдоль эффективной границы.
На практике эффективная граница очень неровная. Вместо гладкой непрерывной линии между результатами небольшие изменения могут давать большой эффект. Эти точки перегиба часто неочевидны и находятся эмпирически, через перебор параметров.
Размер батча
Самый очевидный компромисс между задержкой и пропускной способностью связан с размером батча — количеством запросов, обрабатываемых одновременно. Токен-уровневый непрерывный батчинг избавляет от задержки ожидания старта батча, но настроенный размер батча определяет и задержку на пользователя, и общую пропускную способность.
При малых размерах батча задержка на пользователя отличная, но общее количество генерируемых токенов на GPU невелико — стоимость токена оказывается высокой. Увеличение размера батча даёт обратный эффект: задержка на пользователя хуже, но пропускная способность выше при более низкой стоимости.
Стратегия параллелизма
Современные LLM насчитывают сотни миллиардов или триллионы параметров и должны распределяться по нескольким GPU. Способ, которым модель распределяется (параллелизуется) между GPU, может повышать либо задержку, либо пропускную способность.

Параллелизм разбивает большие модели между несколькими GPU.
Для развёртываний, чувствительных к задержке, стоит увеличивать степень тензорного параллелизма (TP). Несмотря на дорогую all-to-all коммуникацию, TP эффективно снижает задержки, поскольку эти операции быстро выполняются по высокоскоростным NVLink-соединениям.
Параллелизм экспертов (EP) может помочь и с задержкой, и с пропускной способностью. Более низкая степень EP обычно связана с лучшей задержкой, а широкий EP, включая распределение по всей стойке GPU, как правило, обеспечивает более высокую пропускную способность.
Ещё одна техника параллелизма для повышения пропускной способности — Attention Data Parallelism (ADP). Она реплицирует слои внимания для параллельных вычислений, повышая пропускную способность системы за счёт скорости обработки отдельного запроса.
Квантизация
Квантизация — запуск модели с пониженной точностью весов, активаций и/или значений KV-кэша — улучшает и задержку, и пропускную способность. Квантизованная модель сдвигает эффективную границу компромиссов обслуживания.
Однако квантизация вносит новый набор компромиссов между качеством и эффективностью обслуживания. Эта граница особенно неровная: значительного повышения эффективности обслуживания часто можно достичь с минимальным или нулевым падением качества модели, особенно при использовании форматов чисел с плавающей запятой микромасштабирования, таких как MXFP4 и NVFP4.
Техники, сдвигающие границу
Именно эти техники обычно попадают в заголовки новостей. Повышение общей производительности — самая интересная часть инференс-инжиниринга.

Техники сдвига границы создают универсальный прирост.
Самое приятное — эти техники часто складываются друг с другом. Например, удвоение производительности за счёт лучшего железа плюс удвоение за счёт лучшего софта дают четырёхкратный прирост общей производительности обслуживания, который можно распределить между задержкой и пропускной способностью.
Оптимизация ядер и улучшения runtime
CUDA-ядро (kernel) — низкоуровневая функция, выполняющая одну конкретную часть процесса инференса, например умножение матриц. Улучшение производительности отдельных ядер, а также сквозной производительности forward pass в инференс-движке означает, что на генерацию каждого токена требуется меньше ресурсов. Эти выигрыши в эффективности накапливаются по всему стеку и сдвигают границу производительности.
Подробнее о производительности на уровне ядер можно почитать в отдельном материале Baseten, написанном стажёром компании Брайаном Ли.
Спекулятивное декодирование
Спекулятивное декодирование — процесс угадывания токенов, которые модель, вероятно, сгенерирует, с последующей проверкой этих предположений. Когда эта техника была новой, она создавала компромисс между задержкой и пропускной способностью: спекуляция была дорогой, длины последовательностей — короткими, а частота принятия предположений — низкой, поэтому спекулятивное декодирование имело смысл только при малых размерах батча.
Сегодня такие техники, как EAGLE-3, DSpark и DFlash, всё ещё конкурируют с основным циклом модели за ресурсы, что несколько ограничивает максимальный размер батча. Тем не менее благодаря сильной производительности этих техник — особенно в генерации кода, где последовательности выходных токенов относительно предсказуемы — они дают прирост эффективности за счёт пропущенных forward pass в дополнение к прямому снижению задержки в виде большего числа токенов в секунду на пользователя.
Дизагрегация
P/D-дизагрегация — разделение этапов prefill и decode на выделенные воркеры — стратегия оптимизации высоконагруженных развёртываний LLM. Раздельный запуск prefill и decode позволяет оптимизировать воркеры под уникальные особенности каждой фазы инференса, а также подстраивать соотношение между воркерами prefill и decode под длины входных и выходных последовательностей и частоту попаданий в кэш из входящего трафика.

На практике дизагрегация чаще всего полезна для повышения пропускной способности при сохранении или небольшом улучшении задержки.
Материал даёт базовый обзор техник управления компромиссами в сравнении с техниками улучшения производительности системы в целом. Более подробно каждая из упомянутых техник разобрана в бесплатной книге Baseten Inference Engineering.