Сегодня в генеративном ИИ доминируют два семейства алгоритмов. Для непрерывных данных — изображений, видео — стандартом стали диффузионные модели. Для дискретных данных, таких как текст или код, обычно используются авторегрессионные модели. Разбор посвящён альтернативному подходу к работе с дискретными данными, построенному на диффузионной парадигме. Большинство современных языковых моделей авторегрессионны: они генерируют токены слева направо, по одному, обусловливая каждый следующий предыдущими. Подход мощный, но имеет встроенные ограничения:
- Нет исправления ошибок: однажды сгенерированный токен нельзя изменить, поэтому ранние ошибки накапливаются.
- Медленная генерация: последовательность требует столько же шагов, сколько в ней токенов, и плохо поддаётся быстрой параллельной генерации.
- Каузальное внимание: генерация смотрит только назад, никогда — на будущий контекст.
Диффузионные модели устроены иначе. Вместо того чтобы producировать текст по одному токену, они сразу генерируют всю последовательность, начиная с грубого черновика и постепенно уточняя его за несколько шагов. Это даёт ряд преимуществ: можно менять баланс скорости и качества числом шагов, ошибки можно исправлять по ходу генерации, а на каждом шаге модель видит двунаправленный контекст.
Применение диффузии к языку долго оставалось открытой проблемой. В 2024 году произошёл перелом: диффузионные модели стали конкурентоспособны по качеству с авторегрессионными. К 2026 году диффузионные LLM — уже реальность: релизы выпустили ведущие индустриальные лаборатории — Mercury 2 (Inception Labs), Gemma Diffusion (Google) и Nemotron Diffusion (NVIDIA). Далее прослеживаются идеи и работы, лежащие в основе этих современных моделей.
Фон: гауссова диффузия
Прежде чем переходить к диффузии для языка, стоит кратко вспомнить гауссову диффузию для генерации изображений — по аналогии с ней будет строиться дискретная диффузия.
Генерация через итеративное шумоподавление
В основе диффузионных моделей лежит понятие шумоподавления (denoising). Вместо того чтобы нарисовать изображение за один шаг, диффузионная модель создаёт его пошагово: начиная с чистого случайного шума и убирая его понемногу на каждом шаге, пока не проявится связное изображение. Оказывается, что генерировать изображение множеством мелких шагов гораздо проще, чем создавать его целиком сразу, — именно это делает диффузионные модели такими эффективными.
Как модель учится удалять шум? Хитрость в том, чтобы обучать её на примерах постепенного превращения шума в изображение. Диффузия достигает этого за счёт двух взаимодополняющих процессов. Во-первых, прямой процесс превращает чистое исходное изображение в чистый шум, шаг за шагом. Во-вторых, обратный процесс учится инвертировать это преобразование, превращая чистый шум обратно в изображение; он обучается на траекториях «изображение → шум», порождённых прямым процессом.
Прямой процесс
Прямой процесс берёт чистое обучающее изображение и создаёт последовательность всё более зашумлённых картинок, прослеживающих путь от чистых данных к чистому шуму. Делается это подмешиванием растущего количества случайного гауссова шума на каждом шаге, пока изображение не растворится в чистом статическом шуме. Этот шаг вообще не требует обучения — просто добавляется шум, — но он чрезвычайно полезен, поскольку производит неограниченный запас обучающих данных: примеры превращения изображений в шум и обратно.
Обратный процесс
Именно в обратном процессе происходит собственно обучение. Модель обучается превращать шум в изображения, проходя шаги прямого процесса в обратном порядке.
Конкретно: имея зашумлённое изображение, модель машинного обучения обучается отделять шум от исходного изображения или, что эквивалентно, предсказывать либо добавленный шум, либо само чистое изображение, поскольку зная зашумлённый вход и одну из этих величин, легко получить вторую. Как только модель умеет это делать, генерация становится простой: начать с чистого шума, попросить модель оценить и убрать немного шума, и повторить. Каждый проход приближает образец к чему-то похожему на реальные данные, пока не останется чистое изображение.
Этот рецепт «прямой/обратный процесс» — испортить данные шумом, затем научиться обращать порчу шаг за шагом — лежит в основе любой диффузионной модели.
Простые маскирующие диффузионные модели
Главное препятствие на пути переноса диффузии на язык — решить, что должно означать «шум» для дискретных токенов. Например, в классической диффузии шум гауссов, а добавление непрерывного гауссова шума к категориальным переменным попросту не определено. Ниже описан простой, но эффективный подход, определяющий шум через маскирование. Этот подход популяризировала группа авторов материала, и сегодня он лежит в основе большинства открытых диффузионных языковых моделей.
Маскирующая диффузия в двух словах
Проще всего понять маскирующую диффузию как трансформер, снимающий маски. Модель обучается так: берутся чистые последовательности, случайная доля их токенов маскируется, и двунаправленному трансформеру предлагается заполнить пропуски. Тем, кто знаком с BERT, это покажется знакомым — по сути, это BERT со случайной долей маскирования — но, в отличие от BERT, получившаяся модель генеративна. Маскирующую диффузию можно представить как генеративный BERT.
После обучения трансформера, снимающего маски, генерация текста строится так: начиная с полностью замаскированной последовательности, многократно повторяются два шага:
- Заполнение: модель заполняет каждый пропуск в текущей последовательности, давая грубую оценку чистых токенов.
- Ремаскирование: заполненная последовательность случайным образом снова частично зашумляется — часть токенов заменяется масками, но чуть больше токенов остаётся незамаскированными, чем в предыдущем раунде.
С каждым раундом остаётся всё меньше замаскированных позиций, пока последовательность не сойдётся к чистому образцу из модели. Таким образом, генерация сводится к тому, что последовательность, полная пропусков, постепенно заполняется словами в произвольном порядке.
Понимание маскирующей диффузии: вероятностная перспектива
Понять, почему этот процесс работает, помогает рассмотрение его как аналога гауссовой диффузии, описанной выше. Как и гауссова диффузия, маскирующая диффузия описывается моделью, состоящей из прямого и обратного процессов.
Прямой процесс
Цель прямого процесса — сгенерировать обучающие данные для обратного процесса. Его результат — траектория, которая начинается в точке данных и заканчивается последовательностью чистого шума; обратный процесс затем обучается воспроизводить эту траекторию в обратном порядке.
Ключевая задача — решить, что значит «зашумлённая» последовательность. В гауссовой диффузии добавлялось разное количество белого шума к изображению. В маскирующей диффузии вместо этого случайным образом маскируется доля токенов в дискретной последовательности. Степень маскирования задаётся расписанием $\alpha_t$ — вероятностью того, что данный токен останется незамаскированным, — которое играет роль отношения сигнал/шум в гауссовой диффузии. Оно начинается с $1$ при $t = 0$ (чистая последовательность) и убывает до $0$ при $t = 1$ (полностью замаскированная последовательность). Временная переменная $t$ индексирует путь от чистых данных к зашумлённым, и в момент $t$ частично замаскированная последовательность $z_t$ в среднем имеет долю $\alpha_t$ незамаскированных токенов.
Этот процесс реализуется как марковская цепь по последовательности переменных $z_t$, индексированных $t$, где $z_0$ — чистая, незамаскированная последовательность. Для $s < t$ цепь определяет $q(z_t \mid z_s)$, маскируя каждый ещё незамаскированный токен $z_s$ с вероятностью $(\alpha_s - \alpha_t)/\alpha_s$. Прогон этой марковской цепи на несколько шагов даёт траекторию от чистых данных до полностью замаскированного шума.
Обратный процесс
Далее, как и в гауссовой диффузии, обратный процесс обучается проходить последовательность всё более замаскированных латентов в обратном порядке — начиная с полностью замаскированной последовательности и в итоге генерируя результаты, похожие на чистые данные.
С помощью правила Байеса можно вывести математически оптимальный обратный процесс $q(z_s \mid z_t, x)$ при известной чистой последовательности $x$. Этот оптимальный процесс состоит из двух шагов: (1) имея частично замаскированный $z_t$, «подглядываем» в $x$, чтобы узнать истинные чистые токены; (2) формируем $z_s$, заменяя каждую замаскированную позицию $z_t$ её значением в $x$ с вероятностью $(\alpha_s - \alpha_t) / (1 - \alpha_t)$, иначе оставляя её замаскированной.
На практике итоговый результат $x$ на момент генерации, разумеется, неизвестен. Поэтому обучается модель $x_\theta(z_t)$, предсказывающая итоговую чистую последовательность по текущему состоянию $z_t$, и применяется идеальный обратный процесс $q(z_s \mid z_t, x)$, где вместо реального $x$ подставляется оценка $x_\theta(z_t)$. Формально обратный процесс определяется как вероятность $p(z_s \mid z_t) = q\big(z_s \mid z_t, x_\theta(z_t)\big)$. Это определение воспроизводит алгоритм сэмплирования, описанный выше: на каждом шаге модель $x_\theta(z_t)$ заполняет пропуски в $z_t$, и часть заполненных токенов сохраняется в $z_s$.
Вероятностная модель маскирующей диффузии
Собирая эти элементы вместе, получаем математическое определение маскирующей диффузионной языковой модели (MDLM). Прямой процесс $q(z_t \mid z_s)$ порождает траекторию от чистых данных к полностью замаскированным, а обратный процесс $p(z_s \mid z_t)$ учится её обращать. Более того, обратный процесс задаёт модель со скрытыми переменными $p(x, z_1, \dots, z_T)$, в которой $T$ промежуточных частично замаскированных образцов $z_1,...,z_T$ выступают скрытыми переменными. Генерация из обратного процесса $p(z_s \mid z_t)$ — это то же самое, что выполнение анцестрального сэмплирования из этой модели.
Качество модели $p$ также можно оценить через её правдоподобие $\log p(x)$. В моделях со скрытыми переменными оно неподдаётся точному вычислению, поэтому применяются приближения методом вариационного вывода. Для маскирующей диффузионной языковой модели вариационная нижняя граница правдоподобия (ELBO) имеет удивительно простой вид (при упрощающем допущении $\alpha_t = 1-t$):
\[\mathcal{L}_\text{ELBO} = \mathbb{E}_{t \sim \mathcal{U}[0,1]}\; \mathbb{E}_{q(z_t \mid x)} \left[ \frac{1}{t}\, \log p_\theta\!\left(x \mid z_t\right) \right].\]Разберём эту формулу. Внутреннее слагаемое $\log p_\theta(x \mid z_t)$ — это правдоподобие чистой последовательности $x$ при частично замаскированной последовательности $z_t$, полученной из прямого процесса. Иными словами, это функция потерь перекрёстной энтропии между предсказаниями трансформера, снимающего маски, и истинными токенами — это в точности потеря BERT!
В отличие от BERT, эта потеря усредняется по всем $t$, а значит, по всем возможным долям маскирования, а не по одной фиксированной. Она также нормируется на $t$ — ожидаемую долю замаскированных токенов (поскольку $\alpha_t = 1-t$); этот множитель обеспечивает, что каждая потеря BERT нормализуется по числу токенов, по которым она вычисляется.
Итоги и оценка маскирующей диффузии
Итак, MDLM очень похожа на BERT, с двумя ключевыми отличиями:
- Модель допускает обоснованные алгоритмы сэмплирования, соответствующие анцестральному сэмплированию в модели со скрытыми переменными.
- Обучение использует случайную долю маскирования, что соответствует обоснованной вариационной нижней границе логарифмического правдоподобия.
Наиболее интересно то, что вариационная нижняя граница позволяет строго сравнивать авторегрессионные и диффузионные языковые модели по логарифмическому правдоподобию (или, эквивалентно, перплексии) — стандартной метрике оценки языковых моделей. Долгое время между диффузионными и авторегрессионными языковыми моделями сохранялся существенный разрыв в перплексии, но упрощённые маскирующие диффузионные модели одними из первых закрыли значительную часть этого разрыва.
Построение диффузионной языковой модели промышленного уровня
Описанные выше маскирующие диффузионные модели полезны для формирования интуиции, но не готовы к промышленному использованию: они генерируют лишь последовательности фиксированной длины, не поддерживают итеративное уточнение (исправление ошибок) «из коробки» и не особенно быстры без дополнительного пост-обучения. Далее рассматриваются расширения, устраняющие эти ограничения, — в контексте современных диффузионных моделей с открытыми весами.
Блочная диффузия для генерации переменной длины
Первая проблема стандартных MDLM — ограничение фиксированной длиной последовательности. Блочная диффузия решает эту проблему, выполняя диффузию над блоками, обусловленными уже сгенерированными токенами. Такие блоки могут быть произвольного размера — от десятка до тысяч токенов — и в идеале зависят от прикладной области.
Например, в биологических приложениях может быть заранее известна длина взаимодействий, которые нужно захватить, и размер блока задаётся минимальной длиной, необходимой для этого. В языковом моделировании же интерес может представлять максимизация загрузки GPU; тогда размер блока выбирается так, чтобы арифметическая интенсивность прямого прохода (зависящая также от размера батча) соответствовала характеристикам используемого оборудования.
Кроме того, блочная диффузия естественно поддерживает KV-кэширование — технику, ускоряющую генерацию последовательностей в авторегрессионных моделях. После генерации блока с помощью трансформерной архитектуры его ключи и значения можно закэшировать и переиспользовать при генерации следующих блоков.
Другие подходы к генерации переменной длины опираются на связь между маскирующими диффузионными моделями и авторегрессионными моделями произвольного порядка. Например, Set Diffusion расширяет блочную диффузию, позволяя работать с произвольными наборами позиций, а не только с блоками слева направо. Другие подходы, такие как Edit Flows или FlexMDM, вместо этого моделируют генерацию как последовательность операций вставки, удаления и замены, что позволяет модели увеличивать или уменьшать длину последовательности по мере уточнения.
Архитектуры: энкодер, декодер и энкодер-декодер
Стандартные маскирующие диффузионные модели фактически представляют собой энкодер (как BERT), в отличие от авторегрессионных моделей типа декодера (как GPT). Архитектура «только энкодер» требует алгоритмов сэмплирования, вызывающих всю сеть целиком на каждом шаге шумоподавления, что может быть довольно затратно по вычислениям.
Ключевое наблюдение состоит в том, что диффузия выполняет два вида вычислений: (1) построение представления уже сгенерированных токенов и (2) шумоподавление зашумлённых токенов. Это наблюдение подсказывает использовать для каждой задачи отдельные модули. Результат — архитектура энкодер-декодер, где энкодер представляет чистые токены, а лёгкий декодер итеративно уточняет зашумлённую последовательность. Архитектуры энкодер-декодер лежат в основе современных открытых диффузионных LLM, таких как Gemma Diffusion и недавние модели Nemotron Diffusion.
Помимо ускорения инференса дискретной диффузии, такая архитектура ускоряет и обучение моделей блочной диффузии: после разбиения последовательности на блоки они пропускаются через меньший декодер во время обучения, что снижает число требуемых FLOPs.
Итеративное уточнение и встроенное исправление ошибок
Часть привлекательности диффузии — возможность итеративного уточнения. Стандартным MDLM этого не хватает: однажды размаскированный токен уже нельзя обновить, поскольку прямой процесс маскирования никогда не маскирует обратно размаскированный токен, и модель никогда не учится исправлять саму себя. Современные диффузионные языковые модели изменяют прямой и обратный процессы, чтобы вернуть эту возможность.
Ремаскирующая диффузия
Самое простое решение — ремаскирование: на каждом шаге часть новых размаскированных токенов сохраняется, но небольшое подмножество ранее размаскированных токенов снова маскируется, позволяя перегенерировать их. Рассмотрим пример: маскирующая диффузионная модель допускает грамматическую ошибку. При ремаскировании этот токен снова становится маской и затем исправляется, когда модель получает дополнительный контекст.
Ремаскирование можно применять к стандартным предобученным MDLM обоснованным способом как подключаемый сэмплер (формально это можно рассматривать как реализацию марковской цепи «предиктор-корректор»). Особенно интересно, что оно наделяет дискретную диффузию формой масштабирования вычислений на этапе инференса: увеличение числа шагов сэмплирования позволяет ремаскированию приближаться к качеству авторегрессионных моделей, а при ограниченном бюджете вычислений оно лучше сохраняет качество, чем обычное сэмплирование MDLM.
Диффузия с равномерным состоянием
Альтернативный вариант — использовать совершенно иной тип прямого и обратного процесса, отличный от маскирования. Диффузия с равномерным состоянием, пожалуй, самая распространённая альтернативная форма дискретного шума. Вместо маскирования её прямой процесс заменяет токены случайными из словаря. Обратный процесс начинается со случайной последовательности и меняет токены, пока результат не станет похож на данные.
В момент генерации модель видит последовательность без масок и решает, заменить ли каждый токен, что естественным образом поддерживает исправление ошибок, поскольку пересмотреть можно любой токен, а не только замаскированные, на любом шаге. Хотя маскирующие диффузионные модели, как правило, обучаются быстрее (достигая лучшей перплексии), диффузионные языковые модели с равномерным состоянием (UDLM) обеспечивают более быстрое сэмплирование и лучшую управляемость, о чём пойдёт речь ниже. Например, открытая модель Gemma diffusion представляет собой именно UDLM.
Как и MDLM, UDLM поддерживает упрощённую цель на основе вариационной нижней границы, улучшающую обучение. Более ранние, более общие фреймворки, такие как D3PM, также изучали равномерный и другие структурированные процессы шума, а методы вроде обобщённой интерполирующей дискретной диффузии (GIDD) объединяют маскирование и равномерный шум в единый процесс, способный воспроизвести любой из них как частный случай.
Ускорение сэмплирования диффузии с помощью дистилляции
Поскольку диффузия может генерировать или уточнять несколько токенов за шаг, она может быть в 5–10 раз быстрее авторегрессионной генерации. Однако сэмплирование множества токенов одновременно порождает несогласованности (например, два токена расходятся в грамматическом числе, как в примере с ремаскированием выше); если базовый процесс шума не может исправить такие ошибки, они накапливаются. Именно поэтому большинство быстрых диффузионных моделей сегодня опираются на процессы шума с исправлением ошибок, такие как ремаскирование или UDLM.
Ускорение сэмплирования для таких моделей часто вдохновлено прогрессивной дистилляцией: модель обучается на собственных генерациях, чтобы пропускать один шаг, и это повторяется рекурсивно, вдвое сокращая число шагов сэмплирования на каждом раунде. В диффузионных языковых моделях эта идея обобщается в такие техники, как самодистилляция во времени и дискретная консистентная дистилляция.
Эти методы можно рассматривать как форму on-policy обучения: стандартное обучение off-policy, поскольку обратный процесс обучается на образцах из прямого процесса, а не на тех образцах, которые он реально увидит от самого себя во время генерации. Обучение на собственных образцах модели на этапе постобработки — слишком дорогое для основного обучения — как раз и позволяет этим методам повышать скорость сэмплирования.
Диффузия делает возможной управляемую генерацию
Диффузионные модели особенно хороши в управляемой генерации: получении образца $x$, который также удовлетворяет целевому свойству $y$ — например, соответствию промпту, если $x$ — изображение, или аффинности связывания с целевым сайтом, если $x$ — молекула. Поскольку они уточняют результат глобально, а не совершают необратимые локальные правки, диффузионные модели эффективнее навигируют в пространстве образцов и производят более качественные образцы с нужным свойством.
На практике управляемость проявляется как Парето-компромисс между естественностью (похож ли образец на реальные данные?) и удовлетворением свойства (обладает ли он нужным свойством?). Например, можно попросить модель создать молекулы, которые выглядят естественно, но у них может не быть нужной аффинности связывания. И наоборот, можно оптимизировать под аффинность связывания, но тогда результаты могут не выглядеть как естественные молекулы и быть несинтезируемыми. Эти два соображения задают Парето-фронт, на котором диффузия превосходит авторегрессию.
Алгоритмы управляемой генерации
Диффузионные модели особенно эффективны в управляемой генерации благодаря техникам вроде guidance на основе классификатора (CBG) и guidance без классификатора (CFG). Например, в CBG, имея предиктор $p(y \mid x)$ целевого свойства $y$ по образцу $x$, эту модель можно использовать на каждом шаге, чтобы направлять процесс генерации, доказуемо получая образец из условного распределения $p(x \mid y) \propto p(y \mid x)\, p(x)$.
Обе техники естественным образом распространяются на MDLM и UDLM и особенно эффективны в сочетании с UDLM или с MDLM плюс ремаскирование, поскольку оба варианта поддерживают многократный пересмотр токенов при применении guidance.
Пост-обучение диффузионных языковых моделей
Диффузионные языковые модели также можно дообучать с помощью обучения с подкреплением для улучшения рассуждений, следуя тому же общему рецепту, что обеспечил недавние успехи авторегрессионных LLM. Основная сложность в том, что алгоритмам обучения с подкреплением вроде policy gradient нужна вероятность сэмплированной траектории, которую легко получить для авторегрессионных моделей (простое произведение вероятностей следующего токена), но дорого — для маскирующих диффузионных моделей, чья целевая функция усредняется по всем порядкам маскирования. d1 вводит diffu-GRPO — алгоритм policy gradient без критика, оценивающий эти логарифмические вероятности траектории приближением среднего поля в сочетании с маскированным supervised fine-tuning для дистилляции навыков рассуждения из существующих датасетов. d2 улучшает этот подход, выводя более точные оценщики правдоподобия — точный однопроходный оценщик для моделей, поддерживающих декодирование в произвольном порядке, и приближённый оценщик с настраиваемым компромиссом между вычислениями и точностью в остальных случаях, — достигая нового состояния искусства на бенчмарках логического и математического рассуждения вообще без опоры на supervised fine-tuning.
Пост-обучение с RL также играет ключевую роль в биологических приложениях диффузионных языковых моделей, где желаемая награда — часто экспериментально измеренное свойство (например, аффинность связывания или экспрессия гена), а не проверяемый ответ. Методы вроде DRAKES распространяют такую награду обратным проходом через траекторию сэмплирования дискретной диффузионной модели, дообучая её непосредственно для дизайна ДНК и белков, а более широкий обзор рассматривает пространство алгоритмов RL-дообучения для диффузионных моделей в целом.
Диффузионные большие языковые модели сегодня
За последние несколько лет диффузионные языковые модели были масштабированы до миллиардов параметров, показав улучшения над авторегрессионными моделями на масштабе. Ниже описаны работы в науке и языке, а также способы построения таких моделей из базовых компонентов, рассмотренных выше.
Биологические и научные области
Одной из первых областей успеха диффузионных языковых моделей стали научные приложения, в частности биологические последовательности. Тому есть две причины:
- Биологические последовательности реже проявляют смещение «слева направо», встроенное в авторегрессионные модели.
- Научные приложения часто выигрывают от управляемой генерации, что является естественной сильной стороной диффузии.
Моделирование последовательностей белков
Пожалуй, первым крупномасштабным применением дискретной диффузии стало моделирование белков. Недавняя модель ESM3 реализует MDLM с числом параметров до 100 млрд и обучена на огромных базах аминокислотных последовательностей. И обучение, и сэмплирование ESM3 соответствуют описанному выше подходу маскирующей диффузии. По заявлению создателей модели, этот подход превзошёл авторегрессионные базовые модели и установил новое состояние искусства в генерации белков.
По степени влияния модели ESM были одними из первых, применивших крупномасштабное моделирование последовательностей к биологическим данным. Эти модели широко используются в протеомике для задач вроде предсказания эффекта вариантов, фолдинга белков и генерации белков.
Моделирование нуклеотидных последовательностей
Белки — строительные блоки жизни, но их активность в значительной степени регулируется некодирующими геномными последовательностями, выходящими за рамки белковых моделей вроде ESM3. Языковые модели ДНК обобщают подход ESM3 как на кодирующие, так и на некодирующие геномные последовательности. В сотрудничестве с InstaDeep и BioNTech была обучена семья моделей Nucleotide Transformer v3 (NT-v3), масштабирующая MDLM до миллиардов параметров и более триллиона токенов ДНК. Эти модели принимают на вход многодорожечные данные, включающие уровни экспрессии генов наряду с исходной последовательностью. На этапе инференса эти дорожки поддерживают дискретное guidance без классификатора с ремаскированием, что позволяет генерировать последовательности ДНК с целевыми свойствами.
В качестве демонстрации условных генеративных возможностей этих моделей NT-v3 использовали для получения регуляторных последовательностей ДНК, усиливающих или подавляющих экспрессию конкретных генов. Варьируя силу guidance в дискретном CFG, был получен диапазон последовательностей, чьи возможности проверялись в лабораторных условиях. Полученные последовательности модулируют экспрессию генов лучше, чем прежние базовые подходы, и демонстрируют эффективность guidance.
Диффузионные большие языковые модели
Хотя дискретные диффузионные модели рано добились успеха в моделировании биологических последовательностей, последние 18 месяцев отмечены стремительным появлением диффузионных больших языковых моделей.
LLaDA
LLaDA масштабировала MDLM до 8 млрд параметров, повторяя рецепт LLaMA: основа MDLM, блочная диффузия при сэмплировании и совместимость с ремаскированием и пост-обучением. Модель выпущена с открытыми весами и демонстрирует благоприятное масштабирование по сравнению с авторегрессионными моделями.
Модели LLaDA открыты и служат основой для большого количества академических исследований.
Mercury
Mercury — первая коммерческая диффузионная LLM, представленная в 2025 году. Её отличительная черта — скорость: благодаря параллельной генерации она превышает 1000 токенов в секунду на пользователя на стандартных GPU, сохраняя качество своего класса. Mercury 2 соперничает по скорости с оптимизированными для скорости флагманскими моделями (Claude Haiku, Gemini Flash-Lite/Flash), работая в 5–10 раз быстрее.
Ранее такой уровень скорости достигался только на специализированных чипах (например, Groq), созданных специально для ускорения авторегрессионного инференса. Диффузионная модель, напротив, достигает сопоставимой скорости на стандартных GPU, изменяя алгоритм под особенности оборудования, а не наоборот.
Gemma Diffusion
Gemma Diffusion — современная открытая диффузионная модель от Google, широко поддерживаемая популярными фреймворками, включая Unsloth и Hugging Face. Она сочетает основу UDLM, блочную диффузию для генерации последовательностей переменной длины, архитектуру энкодер-декодер и ускоренное сэмплирование — смещая узкое место генерации с пропускной способности памяти на вычисления за счёт параллельного шумоподавления целого блока («холста») токенов на каждом прямом проходе, вместо выдачи одного токена за раз.
Nemotron Diffusion
Nemotron Diffusion — семейство открытых диффузионных моделей от NVIDIA, обученных с совместной авторегрессионно-диффузионной целью, реализующих MDLM и блочную диффузию. Последние модели добавляют архитектуру энкодер-декодер и масштабируются до 35 млрд параметров. Заявлена пропускная способность примерно в 2–8 раз выше сопоставимых авторегрессионных моделей при сохранении до 99% их качества, причём один и тот же чекпоинт может при необходимости переключаться на обычное авторегрессионное декодирование.
Заключение и итоговые размышления
Область диффузионных языковых моделей стремительно развилась за последние два года — с релизами промышленного уровня от нескольких ведущих лабораторий. Диффузия предлагает потенциальные преимущества над авторегрессионными моделями по скорости (до 10× за счёт параллельной генерации), управляемости (итеративное уточнение для генерации с целевыми свойствами), мультимодальности (единый алгоритмический подход для изображений и текста) и масштабированию вычислений на этапе инференса. Диффузия пока не масштабирована до тех же объёмов параметров, вычислений и данных, что и авторегрессионные модели, но эксперименты вплоть до 100 млрд параметров выглядят многообещающе.
Путь ли диффузия к более интеллектуальным моделям? Взгляд через законы масштабирования
В завершение стоит обратиться к вопросу, который часто задают на презентациях этой работы. Его можно перефразировать так: способны ли диффузионные модели в конечном счёте дать фундаментальные улучшения над авторегрессионными моделями в плане чистого интеллекта?
Чтобы ответить на этот вопрос, стоит взглянуть через призму законов масштабирования. Важнейшим источником прогресса в интеллекте моделей с 2019 по 2024 год, несомненно, было масштабирование предобучения больших языковых моделей. Что сделало это масштабирование возможным? Развитие архитектуры трансформера вместе с более широкой доступностью вычислений. Но что сделало трансформер особенным? До трансформера повсеместной архитектурой для языковых моделей были RNN. Однако RNN так и не привели к масштабированию предобучения, поскольку не масштабировались — а именно, потому что были принципиально последовательными алгоритмами, не способными в полной мере использовать GPU, которые представляют собой высокопараллельные вычислители. Именно трансформер принёс полностью параллельный алгоритм обучения, который масштабировался на крупные GPU и запустил революцию LLM.
С 2024 года прирост от предобучения выходит на плато, и большая часть улучшений интеллекта моделей теперь связана с масштабированием пост-обучения и вычислений на этапе инференса. Однако и пост-обучение, и инференс упираются в способность быстро генерировать, а сегодня это делается последовательным алгоритмом. Если бы инференс удалось сделать параллельным — так же, как когда-то обучение, — результат мог бы дать столь же драматический прирост интеллекта, какой наблюдался при масштабировании предобучения.
Диффузия рассматривается как подход, способный сделать инференс полностью параллельным и раскрыть эти возможности. Проще говоря, диффузия может стать для законов масштабирования на этапе инференса и пост-обучения тем же, чем трансформер стал для RNN в законах масштабирования предобучения. Возможность тратить больше FLOPs в секунду позволяет диффузии лучше использовать оборудование, что, в свою очередь, открывает пространство для масштабирования.
Пока рано говорить, насколько быстро будет развиваться диффузия, но, по мнению авторов, ставка того стоит.