Исследовательская группа под названием DiffusionGemma Team, в которую вошли более 40 специалистов, опубликовала технический отчёт о DiffusionGemma — экспериментальной языковой модели с открытыми весами, генерирующей текст с помощью дискретной диффузии. В отличие от классических авторегрессионных (AR) моделей, декодирующих текст токен за токеном, DiffusionGemma итеративно уточняет блоки по 256 токенов параллельно, обходя тем самым узкое место последовательного декодирования.

Вместо обучения с нуля модель получена путём дообучения Gemma 4 — модели с архитектурой mixture-of-experts, у которой 3,8 млрд активных параметров и 25,2 млрд параметров суммарно. Двухэтапный пайплайн обучения оказался экономичным по вычислениям: он использует менее 10% от исходного токенового бюджета, потраченного на обучение AR-модели.

Как устроено обучение

На первом этапе применяется supervised fine-tuning, обучающий модель двунаправленному шумоподавлению (denoising). Второй этап сочетает обучение с подкреплением и дистилляцию сэмплера — это позволяет одновременно улучшать качество генерации и эффективность инференса.

DiffusionGemma establishes a new Pareto frontier for the trade-off between generation speed and model capability.

По заявлению авторов, в среднем по полному набору тестов модель генерирует около 20 токенов за один forward pass и достигает приблизительно 1500 выходных токенов в секунду на одном GPU NVIDIA H100. Это заметно быстрее AR-моделей даже с учётом современных техник спекулятивного декодирования.

Что осталось от исходной модели

DiffusionGemma сохранила ключевые возможности Gemma 4: поддержку режима "размышления" (thinking mode), мультимодальные входные данные и работу с длинным контекстом. Несмотря на диффузионное дообучение, модель по-прежнему способна генерировать текст в авторегрессионном режиме — с лишь небольшой потерей качества. Это, по мнению авторов, открывает путь к гибридному диффузионно-авторегрессионному декодированию.

Публикация

Препринт опубликован на arXiv 31 июля 2026 года в разделе Computation and Language (cs.CL) с дополнительной классификацией по Artificial Intelligence (cs.AI). Полный текст статьи, PDF и исходники доступны на сайте arXiv под лицензией CC BY 4.0.