После нескольких лет относительного затишья в области непрерывных диффузионных моделей для языка наблюдается всплеск новой активности — похоже, этот подход переживает своеобразное возвращение. Полностью дискретные методы диффузии в своё время во многом вытеснили ранние попытки заставить непрерывную диффузию работать с языком, но тенденция начинает меняться.

Исследователь и научный сотрудник DeepMind Сандер Дилеман ранее писал о диффузионных языковых моделях, и новый материал служит скорее обновлением — рассказом о том, что произошло в этой области с тех пор. Изложение субъективно, и альтернативные точки зрения приветствуются. Прежде чем переходить к техническим деталям непрерывной диффузии для языка, стоит взглянуть на историю вопроса.

Вызов автогрегрессионной гегемонии

chain

Современные языковые модели по большей части автогрегрессивны: они генерируют последовательности токен за токеном. Это естественное разбиение сложной задачи генерации на более простые последовательные шаги. Все шаги представляют собой экземпляры одной и той же базовой задачи (предсказать токен на основе предыдущих токенов), что позволяет использовать общие параметры вдоль последовательности. Несмотря на изначально последовательный характер генеративного процесса, архитектура Transformer допускает эффективное параллельное обучение по всем позициям последовательности с помощью teacher forcing. Этот рецепт оказался чрезвычайно масштабируемым и привёл к появлению больших языковых моделей (LLM).

Однако автогрегрессия — не единственный способ построить итеративный генеративный процесс для последовательностей. Вдохновившись ранними успехами в аудиовизуальной сфере, исследователи попробовали применить диффузию к генерации языка. Вместо генерации по одному элементу за раз генеративный процесс диффузионных моделей определяется через обращение процесса порчи (corruption), который постепенно разрушает информацию. Канонический способ сделать это — добавлять гауссов шум небольшими порциями, пока он полностью не заглушит сигнал.

2021: первые дискретные диффузионные модели

После ранних успехов в генерации изображений в 2019 и 2020 годах первые попытки применить эту идею к языку появились в 2021 году и заключались в замене непрерывного процесса порчи дискретным, что позволяло моделировать категориальные данные: multinomial diffusion, D3PM и SUNDAE.

Тогда доминирование автогрегрессии было не так прочно установлено, как сегодня: GPT-3 привлекла внимание, но «момент ChatGPT» наступит лишь в конце 2022 года. В то время дискретная диффузия, казалось, устраняла реальные теоретические изъяны автогрегрессивной парадигмы — например, exposure bias из-за teacher forcing и относительную сложность применения к задачам заполнения пропусков (infilling) и генерации с ограничениями. Стоит отметить, что в предыдущие годы уже исследовались неавторегрессивные подходы и подходы с произвольным порядком (особенно для машинного перевода), но пока не с точки зрения диффузии.

2022: непрерывная диффузия для дискретных данных

В 2022 году появилось несколько попыток применить непрерывную диффузию к языковому моделированию, начиная с Diffusion-LM. Этот подход решает несовместимость категориальных данных и порчи гауссовым шумом иначе: дискретные категории просто представляются непрерывными векторами эмбеддингов, которые прекрасно подходят для гауссовой порчи. Так механизм гауссовой диффузии, который так хорошо работает для изображений, можно применить без изменений.

Diffusion-LM подчёркивала преимущества этой альтернативной генеративной парадигмы, в частности для управляемой генерации текста. В последние месяцы 2022 года вышло немало других статей с вариациями этого подхода, включая DiffuSeq, SSD-LM, Difformer, SeqDiffuSeq, GENIE, LD4LG, а также две работы, над которыми работал сам Дилеман: self-conditioned embedding diffusion (SED) и continuous diffusion for categorical data (CDCD).

Привлекательность непрерывных методов в то время заключалась в том, что они могли использовать все инсайты, инструменты и механизмы, которые открывались и разрабатывались для непрерывной диффузии по мере того, как она полностью захватывала аудиовизуальную генерацию. Например, применение техник сэмплирования и дистилляции, разработанных для непрерывных диффузионных моделей, к дискретной диффузии часто было гораздо менее очевидным, а порой и вовсе невозможным.

Конец 2023: непрерывное исчезновение

Затем произошло нечто интересное: после 2023 года практически все новые исследования в этой области использовали дискретную диффузию, а непрерывная диффузия для языка исчезла. Диаграмма из обзорной статьи 2025 года о диффузионных языковых моделях наглядно это показывает:

Новый обзор по диффузионным языковым моделям: охватывает пре- и посттрейнинг, инференс и мультимодальность, с очень хорошими иллюстрациями. Не могу не испытывать грусть по поводу очевидного исчезновения непрерывного подхода после 2023 года 🥲

Непрерывные методы отмечены жёлтым, дискретные — зелёным. Переход от 2023 к 2024 году выглядит весьма резким. Точную причину назвать сложно, но можно предположить несколько факторов: один — «момент ChatGPT», который постепенно сместил фокус исследований языковой диффузии от теоретической элегантности к чистой производительности. Целью стало сравняться с мощными автогрегрессивными моделями в масштабе или даже превзойти их в отдельных задачах. Похоже, сообщество решило, что закрыть разрыв в производительности будет проще с полностью дискретными методами — возможно, потому что они концептуально ближе к автогрегрессии.

Другой фактор — начало исследований науки масштабирования диффузионных языковых моделей, и первые наблюдения для непрерывных методов не выглядели многообещающе. В мае 2023 года Гулраджани и Хашимото оценили разрыв в эффективности обучения для непрерывной диффузионной языковой модели на основе likelihood (Plaid-1B): она оказалась в 64 раза менее эффективна. (Диаграмма выше помечает Plaid как дискретную, хотя это непрерывный метод.)

В то время, когда сообщество LLM было сосредоточено на границе Парето между вычислениями на обучение и перплексией (Chinchilla-оптимальность), любой подход к моделированию, чья эффективность обучения хуже почти на два порядка по сравнению с автогрегрессивным бейзлайном, было трудно воспринимать серьёзно. Первая модель LLaMA, которая поставила под вопрос этот фокус на эффективности обучения и предлагала учитывать бюджет инференса, вышла лишь несколькими месяцами ранее (февраль 2023), так что вероятно, сообщество ещё не успело полностью осознать этот сдвиг.

Разумеется, всё это весьма спекулятивно. Возможно, дискретные методы просто случайно набрали больший импульс в тот момент. Если у кого-то есть мысли о причинах «непрерывного исчезновения» конца 2023 года — их можно высказать в комментариях.

Сам Дилеман к тому моменту уже перестал работать над диффузионными языковыми моделями (переключившись на построение моделей генерации изображений и видео: Imagen и Veo, а позже Nano Banana и Omni), поэтому наблюдал за этой эволюцией со стороны. Такой поворот показался ему несколько удивительным, поскольку непрерывная диффузия, по его мнению, обладает рядом важных преимуществ — способностью представлять неопределённость на уровне отдельного токена и богатым набором алгоритмов сэмплирования и трюков. Отказ от этих преимуществ выглядел потенциальной ошибкой, но исследовательское сообщество в целом явно решило иначе.

Адаптация непрерывной диффузии к дискретным данным

discrete

Прежде чем говорить о том, что происходит в этой области сегодня, полезно детальнее разобраться, как непрерывная диффузия применяется к дискретным данным — этот контекст поможет понять, что стоит за недавними событиями.

Первое, что нужно учитывать — природа дискретных данных, которые пытаются моделировать. Обычно под «дискретностью» на самом деле имеют в виду категориальность: выходное пространство (на уровне токена) представляет собой неструктурированное множество, и между разными значениями, которые может принимать переменная, нет никакой связи (порядковой или иной). Цифровые изображения, представленные в виде сетки пикселей, технически тоже дискретны, но поскольку дискретные значения цветовых каналов отражают лежащий в основе непрерывный физический сигнал (интенсивность света), их обычно всё равно рассматривают как непрерывные.

Если работать с категориальными данными, для успешной непрерывной диффузии необходимы несколько ингредиентов: стратегия эмбеддинга, функция потерь и разумный график шума. Кроме того, практически в каждой статье на эту тему встречается трюк, оказывающий огромное влияние на производительность — self-conditioning (самообусловливание). Далее эти компоненты рассматриваются по отдельности. Для краткости непрерывные диффузионные языковые модели обозначаются как CDLM, а их дискретные аналоги — как DDLM.

Стратегии эмбеддинга 📍

Современные нейросети обычно имеют вещественнозначные параметры и активации. Поэтому первым шагом в любой нейросети, обрабатывающей дискретные данные, обычно становится эмбеддинг дискретных входов в непрерывное пространство представлений. С этого момента сеть работает исключительно с вещественными представлениями. Эмбеддинги обычно рассматриваются как дополнительные параметры, которые оптимизируются совместно с остальной моделью. Это верно и для DDLM, и для автогрегрессивных моделей — внутренности этих нейросетей всё равно непрерывны.

Чтобы применить непрерывную диффузию к дискретным данным, можно просто «поднять» процесс порчи из дискретного входного пространства в непрерывное пространство эмбеддингов. Иными словами, по сравнению с дискретной диффузией это лишь вопрос смены порядка операций: вместо дискретной порчи с последующим непрерывным эмбеддингом сначала эмбеддим входы, а затем применяем непрерывную порчу.

cdlm embeddings
Схема (a) автогрегрессивной модели, (b) дискретной диффузионной модели (masked diffusion) и (c) непрерывной диффузионной модели. Зелёные блоки — непрерывные эмбеддинги дискретных токенов, синие — слои модели. Для a и b стадия эмбеддинга обычно считается частью модели. Порча для b происходит на уровне токенов, до эмбеддинга. Для c порча применяется добавлением шума к непрерывным эмбеддингам.

Форма и структура пространства эмбеддингов существенно влияют на характер непрерывного процесса порчи внутри него. Исследованы разные стратегии эмбеддинга:

  • Явная (например, SSD-LM): наиболее простой подход — использовать что-то вроде one-hot представления, где каждый элемент словаря размера \(V\) сопоставлен с \(V\)-мерным вектором, состоящим из \(V-1\) нулей и одной единицы. Поскольку словарь — это множество, для присвоения представлений его элементам требуется произвольно выбрать конкретный порядок. Такое пространство эмбеддингов может быть неудобным для современных языковых моделей, так как \(V\) сейчас обычно очень велико. Возможный обходной путь — использовать компактные битовые паттерны, как в Analog Bits.

  • Предобученная (например, SED): можно использовать стратегию обучения представлений, чтобы получить эмбеддинги, а затем переиспользовать их в диффузионной языковой модели. Например, их можно взять из автогрегрессивной языковой модели или из двунаправленной модели вроде BERT. Их также можно сделать контекстными, то есть эмбеддинг конкретного токена может зависеть не только от него самого, но и от соседних токенов, что даёт более богатое пространство эмбеддингов.

  • Совместно обучаемая (например, CDCD): можно попытаться обучить эмбеддинги вместе с моделью-денойзером в рамках единой процедуры обучения, позволяя им совместно адаптироваться.

Последний вариант может показаться наиболее естественным, поскольку совместное обучение эмбеддингов работает для DDLM и автогрегрессивных LLM. Сквозной одностадийный подход к обучению сегодня также широко считается наиболее привлекательным как с концептуальной, так и с практической точки зрения. Но повышенная роль пространства эмбеддингов в CDLM (относительно DDLM) создаёт определённые трудности: наивные формулировки склонны к коллапсу или неконтролируемому росту эмбеддингов. Например, ошибку денойзинга можно патологически минимизировать, сделав все эмбеддинги одинаковыми — это подсказывает, что может потребоваться некий баланс между несколькими ограничениями или членами функции потерь.

В литературе много обсуждалась важность геометрии пространства эмбеддингов. Часто предполагается, что пространства эмбеддингов с содержательной семантической структурой лучше подходят для непрерывного языкового диффузионного моделирования. Конкретно это означает, что эмбеддинги должны быть организованы так, чтобы определённая степень порчи создавала соразмерную путаницу между токенами с семантической точки зрения: например, если добавить небольшой шум к эмбеддингу слова «кот», он может стать неотличимым от эмбеддинга слова «собака» при том же уровне шума, но всё ещё будет сильно отличаться от эмбеддинга слова «зонт» при том же уровне шума.

Насколько это действительно важно, если цель — чистая производительность языкового моделирования, пока неясно. Этот фактор обычно не рассматривается в контексте DDLM или автогрегрессивных LLM. В литературе высказывалось предположение, что некоторые стратегии и цели обучения для CDLM обладают рассеивающим эффектом (то есть раздвигают эмбеддинги семантически связанных токенов, а не сближают их), и что это может быть нежелательно — что выглядит вполне правдоподобно.

С этим связан вопрос о том, должны ли непрерывные эмбеддинги представлять отдельные токены, токены в контексте (контекстные эмбеддинги) или что-то более иерархическое — последовательности токенов или даже целые предложения и абзацы. Хотя в фокусе остаются подходы на уровне токенов, более высокоуровневые альтернативы (часто называемые «латентной диффузией для языка») кратко обсуждаются позже.

Поскольку цель CDLM — в конечном счёте сгенерировать дискретную последовательность токенов, нужна и стратегия обратного эмбеддинга. Нейросети для задач классификации используют softmax-нелинейность для предсказаний в категориальном пространстве, интерпретируя выходы сети как вероятности (которые сами непрерывны). Этот подход можно использовать и для денойзеров: даже если денойзим непрерывные векторы, можно использовать знание о том, что каждый из них представляет один из конечного числа дискретных элементов словаря, чтобы ограничить предсказания (в CDCD этим воспользовались и назвали «интерполяцией скора», представив её как альтернативу «сопоставлению скора»). Однако в большинстве работ предсказания делаются непосредственно в непрерывном пространстве эмбеддингов без таких ограничений, а финальный шаг дискретизации выполняется в конце сэмплирования — часто простым округлением эмбеддингов до ближайшего элемента словаря, хотя процедура может быть и более сложной.

Функции потерь 📉

В функциях потерь, используемых для обучения CDLM, наблюдается интересное разнообразие. Обычно выбор функции потерь тесно связан со стратегией обратного эмбеддинга. Если денойзер делает предсказания непосредственно в непрерывном пространстве эмбеддингов, обычно используется привычная потеря среднеквадратичной ошибки (MSE), как в непрерывных диффузионных моделях для аудиовизуальных данных.

Если денойзер выдаёт вероятности по элементам словаря, его можно обучать с помощью потери категориальной кросс-энтропии, что делает подход похожим на автогрегрессивную схему. Этот подход работает только с эмбеддингами на уровне токена и несовместим с контекстными или более высокоуровневыми эмбеддингами: предсказание вероятностей для каждого возможного выхода осуществимо на уровне отдельного токена, если размер словаря не слишком велик, но не более того.

Другой подход — отталкиваться от принципа максимального правдоподобия и вывести цель, которая ограничивает правдоподобие снизу (аналогично тому, как обучаются вариационные автоэнкодеры). Некоторые варианты CDLM, совместно обучающие эмбеддинги и денойзер, добавляют дополнительные члены потерь для их регуляризации или ограничения, но иногда эти ограничения реализуются через параметризацию (например, принуждение эмбеддингов быть нормализованными векторами).

В нескольких работах исследовались способы ограничить процесс непрерывной диффузии \(V\)-симплексом — пространством допустимых категориальных распределений вероятностей по \(V\) категориям. В такой постановке промежуточные шумные векторы сами ограничены быть валидными распределениями вероятностей по всем элементам словаря, что также требует альтернативных функций потерь. Хотя теоретически идея выглядит привлекательно, на практике это обычно добавляет значительную сложность и не масштабируется на большие словари. Наиболее успешные применения этой идеи на самом деле встречаются в биологии, где существуют интересные задачи моделирования дискретных последовательностей с гораздо меньшими словарями (например, \(V=4\) для ДНК, \(V\approx22\) для аминокислот).

Графики шума 📻

Процесс порчи диффузионной модели управляется графиком шума, который определяет скорость роста уровня шума в ходе процесса. Дилеман подробно писал о графиках шума для непрерывных диффузионных моделей в отдельном материале.

В идеале график выбирается так, чтобы информация разрушалась постепенно, позволяя разбить генеративный процесс на небольшие подзадачи, каждая из которых снимает небольшую порцию неопределённости. Плохо выбранный график шума приводит к тому, что на больших участках процесса порчи почти ничего не происходит (информация почти не теряется, и денойзеру нечему учиться), а на некоторых участках сразу разрушается огромный объём информации, что делает задачу денойзинга крайне сложной.

Для CDLM правильный подбор графика шума особенно важен, поскольку наивная стратегия почти наверняка приведёт к крайне неравномерному процессу порчи. Это прямое следствие того, что эмбеддинги обычно представляют собой высокоразмерные векторы, отражающие дискретные категории. В такой обстановке содержательная порча происходит в относительно узком диапазоне уровней шума. Большинство уровней шума либо почти не разрушают информацию об идентичности токена (слишком низкий уровень), либо разрушают почти всю информацию (слишком высокий). Важно избегать трат вычислительной ёмкости денойзера на эти уровни шума, поскольку там ему нечему учиться.

Распространённая стратегия — явно адаптировать график шума к геометрии пространства эмбеддингов, либо офлайн, либо через онлайн-адаптацию графика шума во время обучения. Это создаёт петлю обратной связи, где предсказания модели используются для определения интересующих уровней шума, а распределение уровней шума, выбираемых для порчи обучающих примеров, подстраивается так, чтобы обучение фокусировалось именно на этих уровнях.

Первоначальным источником вдохновения для таких механизмов онлайн-адаптации была работа о variational diffusion models (VDM), где эта идея использовалась для минимизации дисперсии цели обучения ради ускорения сходимости. В контексте CDLM этот подход адаптировали для получения сбалансированного процесса порчи с фокусом на уровнях шума, при которых степень порчи оптимальна для обучения содержательной структуры. Этого можно достичь, обучив график \(\sigma(t)\), линеаризующий энтропию предсказаний денойзера (по \(t\)), либо частоту ошибок декодирования. Если \(t\) сэмплируется равномерно, линеаризация энтропии обеспечивает, что каждый шаг сэмплирования диффузии снимает одинаковое количество бит информации.

time warping
Иллюстрация из статьи CDCD, показывающая эффект адаптации графика шума во время обучения. Относительный вес разных уровней шума (средний график) становится крайне неравномерным, и фокус смещается на те уровни, где энтропия меняется быстрее всего. В терминах выученного графика (здесь называемого «равномерным временем») энтропия растёт примерно линейно. Если шаги сэмплирования равномерно распределены в этом «равномерном времени», объём снимаемой энтропии примерно постоянен.

Self-conditioning (самообусловливание) 🔄

Сэмплирование диффузии по своей природе безсостояние (stateless): следующий шаг обновления в процедуре сэмплирования зависит только от текущего «холста». Сам холст можно считать формой состояния, но принципиально важно, что он всегда полностью наблюдаем. У модели нет дополнительного скрытого контекста, который она могла бы манипулировать во время сэмплирования — именно поэтому процедуру сэмплирования часто формулируют в терминах дифференциальных уравнений.

Это заставило некоторых задуматься, не выполняют ли денойзеры, используемые для сэмплирования диффузии, избыточную работу: на каждом шаге сэмплирования они вычисляют оптимальное направление денойзинга, наблюдая только текущий шумный холст, без доступа к собственным предыдущим предсказаниям с более ранних шагов. Но если шаги достаточно малы, оптимальное направление денойзинга может оказаться довольно близким к предыдущему предсказанию, так что это выглядит как потенциальная потеря вычислений.

Self-conditioning был предложен как решение этой проблемы: предыдущее предсказание денойзера просто передаётся на следующий шаг как дополнительный вход. Это позволяет денойзеру учиться корректировать грубую оценку, а не делать предсказания с нуля. Для обучения такого денойзера дополнительный вход «предыдущее предсказание» иногда оставляют пустым, а иногда предоставляют во время обучения, используя сам денойзер для получения предсказания с нуля (отсюда «само»-обусловливание). Этот приём гарантирует, что денойзер продолжает работать, когда предыдущего предсказания нет, но также умеет использовать его, когда оно доступно.

self-conditioning
Иллюстрация self-conditioning из статьи Analog Bits, где этот приём был впервые предложен.

Для CDLM довольно быстро выяснилось, что self-conditioning даёт огромный прирост производительности, поэтому практически все работы в этой области его используют. Это несмотря на то, что приём нарушает предположение о безсостоянии, встроенное в различный диффузионный аппарат, в первую очередь в алгоритмы сэмплирования на основе дифференциальных уравнений (ODE и SDE). Разумно предположить, что это, вероятно, смещает моделируемое распределение труднообъяснимыми способами, но все продолжают использовать приём, потому что он даёт настолько огромную разницу в качестве сэмплов, что отказ от него был бы просто саботажем.

Почему именно этот приём так хорошо работает для языковой диффузии, до сих пор неясно — особенно учитывая, что попытки применить ту же идею к аудиовизуальному генеративному моделированию были куда менее успешны (заметное исключение — Recurrent Interface Networks). Похоже, здесь играет роль лежащая в основе дискретная структура выходного пространства. Недавняя статья Ю с соавторами переосмысливает диффузию с self-conditioning как эффективную аппроксимацию модели с неподвижной точкой (fixed-point), вложенной в диффузионную модель — почти как вложенный цикл for. Такой взгляд объясняет, почему состояние денойзеров с self-conditioning на практике не создаёт проблем: это просто побочный эффект приближения вложенного цикла одним плоским циклом.

Несколько «домашних рецептов» 🧑‍🍳

В качестве иллюстрации того, как эти компоненты сочетаются на практике, стоит вспомнить несколько ранних работ в области CDLM, к которым Дилеман имел отношение. Все они датируются концом 2022 года — после этого работу над языковыми моделями пришлось прекратить.

Simplex diffusion использует негауссов процесс порчи — так называемый процесс Кокса — Ингерсолла — Росса (CIR). Он определён на строго положительных вещественных значениях и изначально применялся для моделирования процентных ставок. Встроенное предположение о неотрицательности ставок сделало метод менее популярным для этой цели после 2008 года, но зато он хорошо подходит для моделирования (ненормализованных) вероятностей. В работе использовался score-based SDE-формализм (📉) с этим альтернативным процессом, что (несколько неожиданно) даёт разрешимые, хотя и слегка экзотические, формулы для всех интересующих величин. Например, переходная плотность оказывается нецентральным хи-квадрат распределением вместо привычного гауссова. Это была теоретическая проработка в рамках проекта, который позже стал CDCD (см. ниже). Дальше идею не развивали, поскольку она плохо масштабировалась на большие словари.

Self-conditioned embedding diffusion (SED) построена на предобученных эмбеддингах (📍), полученных с помощью модели BERT, слегка модифицированной с низкоранговым «бутылочным горлышком» — оказалось, что диффузия на эмбеддингах меньшей размерности работает лучше. Хотя эмбеддинги происходят из BERT, сами они являются подтокенными, а не контекстными. Функция потерь — комбинация обычной денойзинговой MSE и unembedding-потери на основе кросс-энтропии (📉), график шума — косинусный (📻, довольно стандартный для того времени), а self-conditioning — важный компонент (🔄, отражённый прямо в названии).

Continuous diffusion for categorical data (CDCD) построена на принципе, что языковая диффузия имела бы больше шансов на широкое внедрение, если бы максимально напоминала уже привычные LLM-практики. Статья представляет метод как версию BERT, но с гауссовым шумом вместо маскирования. Используется стандартная гауссова диффузия, но с потерей на основе кросс-энтропии (📉 интерполяция скора) и эмбеддингами, обучаемыми «на лету» совместно с денойзером (📍). Поскольку это делает эмбеддинги склонными к неконтролируемому росту, применяется слой нормализации, принуждающий их иметь единичную норму. Метод также сильно зависит от self-conditioning для достижения хорошей производительности (🔄). Ещё один ключевой фактор производительности — адаптивный график шума на основе эвристики линеаризации энтропии (📻 искажение времени), который обеспечивает, что и обучение, и сэмплирование тратят больше времени и ёмкости на наиболее важные уровни шума.

К удовлетворению автора этих ранних работ, многие ингредиенты CDCD стали довольно распространёнными в современных работах по CDLM (некоторые из них обсуждаются далее). Адаптивные графики встречаются часто, и в них нередко используется какая-то форма линеаризационной эвристики. Стратегия интерполяции скора, изначально позволившая обучать непрерывные денойзеры с помощью кросс-энтропии, была переоткрыта в более современной постановке (flow matching и flow maps) и получила более прочное теоретическое обоснование. Self-conditioning теперь используется повсеместно.

Недавнее возвращение

embers

После 2023 года эта область долгое время оставалась тихой, поскольку внимание сосредоточилось на дискретной диффузии. Обычно используются две стратегии дискретной порчи: маскированная дискретная диффузия портит токены, постепенно заменяя их на маскирующие токены, пока последовательность не станет полностью замаскированной. Дискретная диффузия с равномерным состоянием портит токены, заменяя их на случайные, пока последовательность не станет полностью случайной. У первого подхода единственное детерминированное поглощающее конечное состояние (полностью замаскировано), тогда как в конечном состоянии второго подхода все возможные последовательности токенов равновероятны (равномерное категориальное распределение).

Во второй половине 2025 года начались попытки вернуть немного «непрерывного вкуса» в форме гибридных методов, комбинирующих дискретные и непрерывные подходы в попытке взять лучшее от обоих миров. В 2026 году за этим последовало полноценное возрождение непрерывных методов.

2025: дискретное и непрерывное вместе

Эту тенденцию начали Сахоо и коллеги, заметив тесную связь между гауссовой непрерывной диффузией и дискретной диффузией с равномерным состоянием. Они обнаружили, что отображение непрерывных шумных промежуточных состояний в дискретные с помощью оператора \(\arg\max\) также неявно превращает гауссов процесс порчи в процесс порчи с равномерным состоянием. Эту связь назвали диффузионной дуальностью и использовали для применения consistency distillation к дискретным диффузионным моделям, а также для снижения дисперсии обучающей потери.

CADD, CCDD и CANDI предлагают разные способы объединить дискретную и непрерывную порчу в едином процессе. CADD использует непрерывные промежуточные представления для дополнения маскированной диффузии, чтобы обеспечить более плавную потерю информации. CCDD использует совместную диффузию по дискретным и непрерывным представлениям одновременно, чтобы воспользоваться повышенной выразительностью непрерывной диффузии, избегая при этом сложности декодирования непрерывных эмбеддингов обратно в дискретные токены.

CANDI, в свою очередь, пытается решить проблему масштабирования непрерывной диффузии для дискретных данных, названную авторами временным диссонансом: для словарей высокой размерности дискретная идентичность отдельных токенов быстро разрушается по мере продвижения процесса порчи, а их относительный ранг среди всех возможностей снижается гораздо медленнее. К моменту, когда появляется что-то интересное для изучения в семантической структуре непрерывного пространства эмбеддингов, идентичность всех токенов уже испорчена, и модели становится очень сложно выучить условные связи между токенами. Авторы называют это ключевой проблемой, тормозящей непрерывные методы, и предлагают решение через дискретное маскирование с применением гауссовой порчи только к замаскированным позициям, разъединяя таким образом эти два вида порчи.

Все эти работы появились с разницей в считанные месяцы, что почти создаёт впечатление скоординированной попытки реабилитировать непрерывную диффузию для дискретных данных, оставаясь при этом близко к доминирующей дискретной парадигме. Вскоре после этого возродился и чисто непрерывный подход.

2026: непрерывная диффузия наносит ответный удар

2025 год также принёс быструю разработку и внедрение flow maps — теме предыдущего материала Дилемана. Flow map — это, по сути, интеграл диффузионной модели. В диффузионной модели обучается денойзер, с помощью которого можно двигаться по входному пространству от шума к данным, повторяя небольшие шаги в предсказанном направлении денойзинга. Flow maps пытаются сделать это за один раз или, по крайней мере, за минимально возможное число шагов: сеть обучается напрямую приближать результат всей процедуры диффузионного сэмплирования.

Хотя дистилляция шагов диффузионных моделей была плодотворной темой исследований и до этого, появление такого мощного фреймворка, судя по всему, вдохновило несколько групп исследователей заново обратиться к непрерывным методам языкового моделирования в надежде перенести преимущества фреймворка и на этот класс моделей. В начале 2026 года быстро друг за другом появились три тесно связанные работы: Categorical Flow Maps, Flow Map Language Models и Discrete Flow Maps. Все три расширяют flow maps на дискретную категориальную постановку с помощью явных one-hot эмбеддингов (📍) и функций потерь на основе кросс-энтропии (📉), делая языковое моделирование достижимой целью для этого подхода.

Весной 2026 года последовал настоящий «кембрийский взрыв» в области CDLM — серия статей, пересматривающих и расширяющих различные рецепты:

  • LangFlow, Spherical flows и Hyperspherical flows строятся на CDCD, используя совместно обучаемые нормализованные эмбеддинги (📍), кросс-энтропийную потерю (📉) и адаптивные графики шума (📻). Две последние работы ограничивают процесс порчи сферой (в CDCD пробовали наивный вариант этой идеи под названием «ренормализация», но он показал себя не очень хорошо).

  • Latent diffusion language models (LDLM) и Embedded language flows (ELF) следуют схеме Diffusion-LM и SED, применяя стандартный рецепт непрерывной диффузии в подходящем пространстве эмбеддингов. Главное отличие — использование контекстных, а не подтокенных эмбеддингов (📍, по образцу LD4LG). В LDLM они обучаются совместно с денойзером, тогда как ELF в основном использует предобученные и замороженные эмбеддинги.

  • Continuous bitstream diffusion (CoBit) использует явные эмбеддинги в виде битовых последовательностей (📍), применяя и расширяя подход Analog Bits для языка.

  • RePlaid пересматривает Plaid и модернизирует его подход на основе likelihood (📉), заимствуя идеи из недавних DDLM.

По сравнению с предшественниками эти работы отличаются модернизированной подачей, улучшенными реализациями, новыми теоретическими выводами, обновлённой методологией оценки и увеличенным масштабом. Несколько из них утверждают, что прежний консенсус о превосходстве дискретной диффузии неверен. RePlaid и LangFlow даже делают противоположное заявление прямо в названиях статей: «Continuous Diffusion Scales Competitively with Discrete Diffusion for Language», «Continuous Diffusion Rivals Discrete in Language Modeling».

Почему непрерывное? И почему именно сейчас?

Возрождение CDLM продолжается прямо сейчас, поэтому пока рано давать исчерпывающее историческое объяснение чередования дискретных и непрерывных методов за последние пять лет. Тем не менее можно выделить несколько тенденций, которые, вероятно, на это повлияли.

Во-первых, непрерывные методы стали проще и понятнее с годами: раннее объяснение требовало понимания score matching, глубоких латентных переменных моделей или дифференциальных уравнений; современные объяснения опираются главным образом на базовые концепции, такие как линейная интерполяция между данными и шумом. Это снизило порог входа для специалистов из смежных областей, желающих исследовать эти методы.

Интерес к альтернативным парадигмам языкового моделирования за пределами автогрегрессии в целом также вырос благодаря успеху DDLM и поиску новых субстратов для рассуждений. Потенциальная выгода от нахождения «следующей большой вещи» лишь возросла по мере того, как большие языковые модели превратились в крупный бизнес: ускорение и повышение гибкости языковых моделей стало экономически очень значимым.

Попытки уменьшить число шагов, необходимых для сэмплирования из DDLM, обычно наталкиваются на стену: токены, сэмплируемые одновременно, считаются условно независимыми при данных ранее сэмплированных токенах. В пределе однопроходного сэмплирования это означает, что все токены неизбежно сэмплируются независимо, и модели фундаментально не способны учитывать корреляции между ними. Это делает дистилляцию шагов сложной задачей, а решение проблемы может требовать значительного усложнения.

Непрерывные методы полностью обходят эту проблему: методы дистилляции шагов на основе траекторий (например, flow map методы) позволяют даже однопроходным моделям учитывать все корреляции — по крайней мере в теории; на практике ограниченная ёмкость моделей всё равно делает это сложным за один шаг. Тем не менее, немногошаговое сэмплирование гораздо естественнее ложится на непрерывную постановку. Именно это преимущество в дистиллируемости, вероятно, и является главной причиной возвращения CDLM сегодня.

Дистилляция шагов не только ускоряет сэмплирование — она открывает возможности для управления через reward-функции и файнтюнинга, которые ранее было сложно достичь с диффузионными языковыми моделями. Учитывая, насколько важную роль посттрейнинг играет в успехе современных LLM, это также важное соображение.

Заменят ли так называемые flow map языковые модели текущий статус-кво полностью, пока неизвестно, но есть основания ожидать дальнейшего роста их популярности, и работы по их масштабированию уже ведутся. Отдельно рекомендуется технический разбор Флур Эйкелбум по flow-based генерации языка, а также заметка Цзямина Сона о роли диффузии и flow maps в языковом моделировании.

Интересно, что доминирующее положение непрерывных диффузионных моделей в аудиовизуальной генерации мотивировано почти совершенно другими причинами. Возможность манипулировать диффузионной потерей, чтобы подчёркивать перцептивно значимый контент — вероятно, ключевая причина их успеха в визуальной области, но это соображение совершенно не применимо к языковому моделированию.

Одним из распространённых аргументов в пользу CDLM является то, что они упрощают мультимодальную интеграцию: непрерывную диффузию можно применять сразу для всех модальностей и объединять их в единую модель. Хотя это верно, суть проблемы, похоже, немного в другом. Сложность построения мультимодальных генеративных моделей не столько в объединении разных парадигм моделирования (это на самом деле не так сложно, см. Diffusion Forcing, Transfusion), сколько в семантическом разрыве между языковыми представлениями и представлениями перцептивных сигналов, используемыми в диффузионных моделях (латентами или патчами пикселей): языковые токены семантически абстрактны, аудиовизуальные — нет. Возможно, эта тема получит продолжение в отдельном материале.

Дискретное = устаревшее?

Означает ли всё это конец дискретной диффузии? Вряд ли. Димитри фон Рютте ранее утверждал, что диффузионные языковые модели — это будущее (в частности дискретные модели с равномерным состоянием). Совсем недавно Володимир Кулешов и коллеги опубликовали материал о строительных блоках DDLM, а Джунбо Чжао написал заметку об их выходе в мейнстрим. Судя по всему, многие достаточно уверены в этом подходе, чтобы писать об этом.

Недавний релиз DiffusionGemma — открытой дискретной языковой модели с равномерным состоянием, разработанной коллегами из Google DeepMind, — а также Nemotron Diffusion от NVIDIA заметно повысили осведомлённость о том, что автогрегрессия — не единственная игра в городе.

Дистилляция шагов для DDLM тоже не является полной невозможностью: методы вроде discrete moment matching distillation (D-MMD) и inverse-distilled diffusion language models (IDLM) показывают, что некоторые подходы можно перенести из непрерывной постановки в дискретную.

Стоит отметить, что полное вытеснение автогрегрессии — не единственный способ для диффузионных языковых моделей добиться успеха. Они могут сосуществовать, иногда даже в рамках одной системы. Распространённая стратегия ускорения сэмплирования из автогрегрессивных языковых моделей — speculative decoding, при котором более быстрая модель-«черновик» предсказывает несколько токенов сразу, а затем автогрегрессивная модель параллельно их верифицирует. Дискретная диффузия всё чаще используется для составления черновика в этом контексте (например, DFlash).

Другой взгляд на ту же идею состоит в том, что автогрегрессивная верификация может смягчать влияние предположений о независимости при немногошаговом дискретном диффузионном сэмплировании. DMax вместо этого использует комбинацию непрерывных релаксаций и посттрейнинга для снижения влияния этих предположений.

Одновременно продолжают развиваться гибридные непрерывно-дискретные подходы. Sticky Jump Diffusions — попытка создать единый взгляд на гибридные методы на основе SDE-формализма, где и дискретная маскированная диффузия, и непрерывная диффузия выступают частными случаями. Posterior Refinement оборачивает непрерывную диффузию внутри маскированной. Это создаёт вложенный цикл сэмплирования, где внутренний цикл можно дистиллировать до очень малого числа шагов с помощью методов flow map. В результате получается форма маскированной диффузии, где каждый шаг также способен учитывать корреляции между одновременно размаскированными токенами (в отличие от стандартной маскированной диффузии, которая предполагает их условную независимость).

Что дальше?

Текущая тенденция выхода диффузионных языковых моделей в мейнстрим не показывает признаков замедления. Какие методы — дискретные или непрерывные — станут доминирующими, предсказать сложно; возможно, они будут сосуществовать наряду с автогрегрессией. По мере того как сообщество LLM отходит от чисто «чинчилловской» перспективы (сфокусированной исключительно на эффективности обучения), альтернативные парадигмы моделирования постепенно получают больше внимания, и диффузионные языковые модели явно этим выигрывают. В более долгосрочной перспективе может возрасти значимость ещё одного аспекта диффузионных моделей — их повышенной эффективности использования данных по сравнению с автогрегрессией.

При этом крайне важно, чтобы исследовательское сообщество занялось общей слабой стороной статей по диффузионному языковому моделированию — методологией оценки. Благодаря гибкой процедуре сэмплирования диффузионные модели особенно легко настраивать по балансу между качеством и разнообразием на этапе сэмплирования. Если этот баланс не тщательно измеряется и учитывается, некоторые модели могут казаться значительно лучше других, хотя на самом деле они просто занимают другую точку на этой кривой. Поскольку методология оценки сейчас не стандартизирована, разные статьи используют разные подходы, и результаты могут непреднамеренно вводить в заблуждение.

Более того, поскольку многие формулировки не позволяют напрямую оценить правдоподобие или перплексию самих моделей, для их измерения часто используются суррогатные автогрегрессивные модели (так называемая generative perplexity, GenPPL), что смещает оценку в сторону возможностей и слабостей используемых суррогатов.

Патрик Пынадат и коллеги предлагают количественно оценивать этот баланс через «генеративные границы» (построение графика перплексии против энтропии). Сэм Аквавива также опубликовал материал, выявляющий несколько проблем оценки диффузионных языковых моделей и возможные способы их решения. Франка и Тонг демонстрируют, насколько легко «обмануть» метрику GenPPL, и утверждают, что её не стоит использовать даже при совпадающих энтропиях. Метрики вроде MAUVE были предложены для решения проблемы оценки открытой генерации текста, но в итоге всё равно опираются на предобученные автогрегрессивные модели.

Направление исследований, продолжающее захватывать умы — латентная диффузия для языка: изучение более высокоуровневого и потенциально более грубого непрерывного представления языка, которое легко моделировать обычной непрерывной диффузией. Основная сложность здесь по-прежнему в изучении самого латентного пространства, а не в диффузионной части. Язык — совсем другой зверь по сравнению с перцептивными сигналами, и техники обучения представлений, хорошо работающие для последних, могут полностью не сработать для первого.

Помимо уже упомянутых LD4LG и LDLM, ведётся постоянный поток работ по изучению высокоуровневых представлений языка на уровне токена, фразы, предложения или абзаца, включая Time Control, PLANNER, Large Concept Models, Segment-level Diffusion, LaDiR, Latent Thought Flows и AURORA-LM. Подробное картографирование этой области увело бы слишком далеко, но упомянуть это направление, говоря о CDLM, необходимо, даже если оно не в фокусе данного материала.

Заключительные мысли

eclipse sunset

Основные выводы:

  • С этого года CDLM снова «в меню» — во многом благодаря их преимуществу в дистиллируемости. Дистилляция шагов ускоряет сэмплирование, но также открывает новые возможности для посттрейнинга и управления во время сэмплирования.
  • Уровень интереса к CDLM относительно DDLM с годами то рос, то падал, но сейчас — прилив! Новые воплощения повторяют предшественников, но расширяют и улучшают их разными способами (в том числе, но не только, за счёт масштабирования).
  • Подходов много, и на данный момент единого рецепта не сложилось. Это делает область особенно интересной с исследовательской точки зрения.
  • Некоторое время в сообществе существовал неявный консенсус, что DDLM работают лучше CDLM в масштабе, но он, похоже, ослабевает. Как и во многом другом в машинном обучении, коллективная убеждённость в идее и усилия, вложенные в её реализацию, могут существенно повлиять на результат.
  • Чтобы это направление исследований продолжали воспринимать серьёзно, критически важно разобраться с методологией оценки — сейчас это слабое место многих работ в области.

Стоит также отметить несколько предстоящих воркшопов по диффузионному языковому моделированию: Non-Autoregressive Language Models for Fast & Flexible Text Generation на COLM 2026 в Сан-Франциско, Diffusion Language Models: Foundations, Efficiency, and Reasoning на NeurIPS 2026 в Сиднее, и Beyond Next-Token Prediction — Diffusion & Flow Models for Next-Generation Decoding также на NeurIPS 2026 в Сиднее.