О чём работа

Исследовательская группа из Jinli Hu, Ross M. Clarke, Yichuan Zhang и José Miguel Hernández-Lobato подготовила статью о новом подходе к архитектуре языковых моделей — так называемых Infinite-Parameter LLM. Работа опубликована на arXiv (2609.18842) и объединяет идеи из области масштабирования моделей с концепцией адаптации в реальном времени.

Проблема традиционного подхода

Современные языковые модели работают по принципу статической архитектуры: веса заморожены после предварительного обучения. Когда модель развёртывается в боевом режиме, она встречает данные, которые не входили в её обучающий набор — это могут быть факты, которые сообщил пользователь, исправления или уточнения. Традиционно такая информация помещается в контекст запроса, многократно перечитывается на каждом шаге и теряется после завершения сессии.

Масштабирование языковых моделей демонстрирует, что они становятся способнее с увеличением числа параметров и объёма данных обучения. Архитектуры Mixture-of-Experts (MoE) применили эти законы масштабирования на практике, активируя лишь часть огромного хранилища параметров для каждого токена. Но этот успех построен на статических данных обучения.

Предложенное решение: Infinite-Parameter LLM

Авторы предлагают фундаментально другой подход. Вместо хранения фиксированного набора параметров, модель использует компактную гиперсеть, которая генерирует веса из данных, поступающих во время взаимодействия. Это позволяет превратить информацию, получаемую в реальном времени, не в часть контекста, а в часть самих весов модели.

Ключевое отличие от предыдущих подходов к генерации весов заключается в использовании байесовского подхода. Вместо того чтобы однократно прочитать контекст и зафиксировать веса, модель поддерживает байесовское распределение над скрытым кодом генератора и обновляет его в ходе сессии. Это означает, что эффективные веса переопределяются по мере развития взаимодействия, а не остаются статичными после первого считывания.

Практические преимущества

Архитектура сохраняет фиксированный объём памяти, но эффективно генерирует бесконечное число вариантов весов в зависимости от данных сессии. Такой подход даёт несколько преимуществ:

  • Вычислительная амортизация: знания и поведение, поступившие во время сессии, хранятся в весах, а не в контексте, что экономит вычисления.
  • Освобождение контекстного окна: информация не занимает ценное место в prompt, позволяя модели сосредоточиться на других задачах.
  • Персистентность через обороты: данные, собранные в текущей сессии, не теряются и могут повлиять на последующие запросы.
  • Улучшенная генерализация: встроенные в веса знания обобщаются лучше, чем только внутриконтекстное использование.

Оценка и протокол тестирования

Авторы указывают, что разработали специальный протокол оценки, который непосредственно сравнивает предложенный подход с внутриконтекстным обучением и методами поиска. Это позволит объективно оценить, насколько предложенная архитектура способна учиться из живых данных более эффективно.