World Labs представила Atlas — модель мира нового поколения, обученную с нуля для нативной работы с текстом, изображениями, видео и 3D. Это мультимодальный авторегрессивный диффузионный трансформер: все входные данные объединяются в общий пространственный контекст. Atlas использует этот контекст, чтобы генерировать продолжение, сохраняя согласованность в 3D со всем увиденным и достраивая то, что находится за пределами видимого.

Производительность модели растёт вместе с объёмом вычислений при обучении, и в World Labs ожидают, что эта тенденция сохранится при дальнейшем масштабировании.

Atlas способна решать широкий спектр задач в областях генерации, реконструкции и симуляции миров:

  • Генерация с управлением камерой: Atlas создаёт изображения и видео из одного или нескольких снимков с точным (пиксель в пиксель) управлением камерой, выдавая до 1 минуты видео в разрешении 1440p.
  • Пространственная реконструкция: Atlas восстанавливает сцены реального мира из одного или нескольких десятков входных изображений, генерируя как кадры с новых ракурсов, так и явные 3D-выходы, превосходя специализированные модели 3D-реконструкции.
  • Симуляция пространства и времени: Atlas моделирует пространство и время по входным видео, позволяя перекадрировать видео для эффектных визуальных решений и открывая рабочие процессы Real-to-Sim для робототехники.
  • Генерация изображений: Atlas создаёт изображения и 360-градусные панорамы из текста, следуя сложным запросам, отрисовывая текст и генерируя разнообразные визуальные стили.

Atlas ляжет в основу будущих версий Marble и других продуктов World Labs.

Генерация с управлением камерой

Atlas принимает одно или несколько референсных изображений и генерирует новые ракурсы при любом заданном положении и угле камеры. Сгенерированные виды соответствуют содержанию и геометрии входных изображений, плавно экстраполируя за их пределы и достраивая части сцены, невидимые на входных данных.

Модель работает с широким диапазоном типов сцен, визуальных стилей и движений камеры.

Точное управление камерой

Atlas использует точную геометрию камеры как нативный тип входных данных, выходя за рамки грубых текстовых инструкций по управлению камерой. Это позволяет выстраивать каждый кадр и контролировать каждое движение.

В демонстрационных примерах Atlas генерирует полную сцену из одного входного изображения. Модель использует содержимое исходного снимка вместе с широкими знаниями о мире, чтобы представить, как сцена должна выглядеть с новых ракурсов. Например, она достраивает заднюю часть робота и предполагает, что рядом с бассейном должен быть газон.

Генерация с пространственным контекстом

Подобно LLM, Atlas сначала кодирует входные данные в контекст, а затем генерирует выходные данные, опираясь на этот контекст. Однако особенность Atlas в том, что каждое изображение привязано к определённой позиции в 3D-пространстве — так формируется пространственный контекст.

Управление таким контекстом открывает совершенно новые виды творческого контроля. Например, можно поместить в контекст два не связанных между собой референсных изображения и разместить их в 3D-пространстве — Atlas сгенерирует мир, плавно интерполирующий между ними.

Такие примеры демонстрируют знание мира моделью и её творческий потенциал: она достраивает дверные проёмы, коридоры, ниши и другие переходы между иначе не связанными парами изображений.

Управляемые длинные видео

Atlas позволяет генерировать длинные видео с точным контролем, сочетая управление движением камеры с управлением пространственным контекстом. Пользователь сам проектирует каждую сцену и каждый ракурс камеры — это ставит его в кресло режиссёра, а не превращает в игрока игрового автомата.

В примере ниже сгенерировано минутное видео в разрешении 1440p с использованием небольшого числа референсных изображений. Путь камеры через сцену задан вручную, а Atlas сгенерировала согласованный мир. Остальные видео на странице сжаты для оптимизации производительности.

Пространственная реконструкция

Atlas восстанавливает сцены реального мира из одного или нескольких входных изображений. Для точной реконструкции объектов и сцен не требуется специальное оборудование для съёмки или сотни плотных ракурсов. В World Labs считают Atlas значительным шагом вперёд к решению проблемы синтеза новых ракурсов из разреженных входных изображений — фундаментальной задачи компьютерного 3D-зрения, которой уже несколько десятилетий.

Реконструкция по нескольким изображениям

Atlas может принимать переменное число входных ракурсов сцены. Когда некоторые части мира не видны на входных изображениях, модель достраивает правдоподобный вариант, опираясь на богатые знания о мире.

Но иногда воображение не нужно — требуется точная реконструкция реального места. Передача большего числа входных изображений даёт Atlas больше контекста: чем больше она видит, тем меньше домысливает. Как правило, Atlas даёт достоверные реконструкции уже при двух-трёх изображениях, превосходя результаты современных моделей, специально обученных только для 3D-реконструкции. При этом Atlas способна использовать в пространственном контексте свыше сотни входных изображений, что позволяет точно воссоздавать реальные окружения.

В первом примере Atlas генерирует вид с воздуха всего по одному наземному фото. Сад, видимый на исходном снимке, точно воссоздаётся в результате работы модели, а остальная часть сцены достраивается воображением. После добавления второго реального изображения — коттеджа рядом с садом — на выходе модели появляются и сад, и коттедж, но дом слева всё ещё домысливается. После добавления третьего изображения главного дома вся сцена воспроизводится точно.

Во втором примере поэтапно воссоздаётся главный двор Стэнфорда — начиная с травяного главного входа и заканчивая цветными мозаиками, украшающими фасад Мемориальной церкви. Хотя Atlas получает лишь от двух до двадцати пяти наземных входных изображений, модель способна генерировать траектории облёта кампуса с высоты птичьего полёта.

Реконструкция разнообразных траекторий

Atlas может генерировать множество различных траекторий через одну и ту же сцену, открывая новые ракурсы на одни и те же входные изображения. Сколько бы раз ни менялся путь камеры, сцена остаётся согласованной.

В примере ниже показано, что при небольшом наборе входных изображений Atlas способна генерировать множество траекторий камеры через одну сцену. Разные траектории могут подчёркивать различные части сцены или менять настроение за счёт скорости, длины или сложности движения.

Явные 3D-выходы

В приведённых выше результатах Atlas выдавала 2D-изображения и видео, что достаточно для ряда применений. Но рабочие процессы в робототехнике, играх, дизайне, визуальных эффектах и других областях часто требуют явных 3D-выходов. Atlas нативно работает как с 2D-кадрами, так и с картами глубины в 3D, что позволяет выводить миры в виде облаков точек или 3D-гауссовых сплатов.

Из одного входного изображения Atlas строит полноценный 3D-мир, совместно генерируя новые ракурсы и оценивая их геометрию. По видео реального пространства модель предсказывает глубину каждого кадра и объединяет их в 3D-реконструкцию. В обоих случаях Atlas достраивает области, которые ни разу не попадали в кадр камеры.

Облака точек оценивают геометрию сцены, но именно 3D-гауссовы сплаты делают её пригодной к использованию. Atlas заполняет оставшиеся пробелы и превращает облако точек в полноценную сцену-сплат, которая рендерится на устройстве с высоким разрешением и частотой кадров. Это то же представление, что используется в Marble, что позволяет Atlas естественно интегрироваться с остальными продуктами World Labs.

Симуляция пространства и времени

Atlas выступает в роли симулятора мира: она понимает как пространственную структуру мира, так и то, как мир меняется во времени. Сочетание пространственных и временных способностей открывает новые применения для визуальных эффектов, робототехники и других областей.

Перекадрирование видео

Atlas превращает съёмку с нескольких обычных камер в подобие студии многоракурсной съёмки для эффекта «bullet time». Имея материал всего с трёх камер, модель способна «заморозить» время и перекадрировать кадры, позволяя увидеть события с невозможных ракурсов.

Примечательно, что для таких кадров не потребовались профессиональные операторы или специализированное оборудование. Каждую сцену снимали несколько инженеров и исследователей обычными телефонами на штативах и креплениях, помещающихся в рюкзак. Atlas реконструирует сцену по трём-пяти ракурсам камер, после чего кадры можно перекомпоновать произвольным образом.

Симуляция для робототехники

Atlas открывает новые способы масштабирования подхода Real-to-Sim как для навигации, так и для манипуляций.

Помимо реконструкции пространства в явном 3D по нескольким изображениям, для робототехники важна ещё одна половина задачи: пока смоделированный робот перемещается в пространстве, Atlas генерирует данные RGB и глубины, которые его сенсоры наблюдали бы по пути. Мир и взгляд робота на него формируются одной и той же моделью.

В приведённых примерах два крупных пространства были засняты на видео с телефона — по 24 кадра для каждой реконструкции. Традиционно сканирование подобных пространств требует сложного и дорогостоящего оборудования. Затем моделируются разные типы роботов, движущихся по разным траекториям, и Atlas генерирует изображения с точки зрения камер, установленных на корпусе робота.

Манипуляции роботов — задача ещё сложнее. По нескольким непринуждённым записям Atlas помогает построить симуляцию, которая также фиксирует, как объекты двигаются и взаимодействуют друг с другом. Как только задача смоделирована, её легко варьировать: менять объекты, их положение, движение робота, освещение и фон. Результат — разнообразные обучающие данные и тестовые среды для робототехники в промышленных масштабах.

Генерация изображений

Основной фокус Atlas — моделирование мира, и каждое изображение — это окно в возможный мир. Хотя генерация изображений не главная задача модели, Atlas показывает себя как способный генератор изображений: следует сложным запросам, отрисовывает текст и создаёт разнообразные визуальные стили.

Atlas также генерирует 360-градусные изображения по текстовым или графическим запросам, демонстрируя широкое разнообразие типов сцен и визуальных стилей.

Технические детали

Архитектура модели

Atlas — универсальная модель, спроектированная для решения множества задач и работы со множеством типов входных и выходных данных в рамках единой архитектуры, где пространственный контроль лежит в самой основе. Эти цели потребовали отойти от стандартных архитектур, используемых как в LLM, так и в видеомоделях, и спроектировать новую базовую архитектуру как фундамент для будущих моделей мира.

Atlas — это мультимодальный авторегрессивный диффузионный трансформер. Модель работает с мультимодальными последовательностями, генерируя каждый новый элемент по одному за раз. Эти архитектурные свойства работают вместе для достижения поставленных целей и в совокупности открывают новую парадигму генерации на основе пространственного контекста. Разберём эти идеи по порядку:

  • Мультимодальность: Atlas способна нативно обрабатывать множество различных типов данных. На данный момент это текст, изображения, положения камеры и карты глубины в 3D; видео представлено как последовательность изображений. Каждое изображение и карта глубины привязаны к явному положению камеры, что делает пространственный контроль центральным элементом архитектуры.
  • Авторегрессивность: Atlas работает с последовательностями элементов, где каждый элемент относится к одному из перечисленных мультимодальных типов данных. Каждый выходной элемент генерируется по одному, с учётом предыдущих частей последовательности. Такой гибкий дизайн естественным образом адаптируется под самые разные задачи: каждая задача — это просто своя последовательность, где за входными данными следуют выходные.
  • Диффузия: Atlas — это модель rectified flow, генерирующая результаты путём постепенного удаления шума. Диффузионные модели отлично справляются с моделированием многомерных непрерывных данных, таких как изображения и видео, и позволяют естественным образом менять баланс между скоростью и качеством, варьируя число шагов удаления шума при инференсе.
  • Трансформер: архитектура трансформера состоит преимущественно из крупных операций матричного умножения и хорошо адаптирована под современное оборудование. Это надёжная основа для моделирования мира.

Atlas сочетает идеи современных LLM и видеомоделей, получая преимущества от архитектурных, алгоритмических и системных достижений, характерных для обоих типов моделей.

Подобно LLM, будучи авторегрессивным трансформером, Atlas может использовать наработки, применяемые для обслуживания и ускорения языковых моделей, включая KV-кэширование, маршрутизацию с учётом кэша, разделённое обслуживание (disaggregated serving) и другие подходы. Подобно современным моделям изображений и видео, будучи латентной диффузионной моделью, Atlas может применять такие алгоритмы, как дистилляция диффузии, guidance без классификатора, смещённые расписания шума и последние достижения в проектировании VAE.

Бенчмарки

Atlas — универсальная модель для моделирования мира, решающая множество задач, поэтому единого бенчмарка, полностью отражающего её универсальность, не существует. В World Labs выделяют количественные оценки Atlas по двум ключевым задачам: генерация с управлением камерой и 3D-реконструкция. По обеим задачам модель превосходит более узкоспециализированные решения.

Для сравнения по задаче генерации с управлением камерой были выбраны лучшие на текущий момент видеомодели. В каждом испытании одно входное изображение сочеталось с последовательностью из одного-трёх кинематографических движений камеры (панорамирование, тревеллинг, кран и т.д.).

Каждой модели передавалось одно входное изображение и целевая траектория камеры. Для Atlas траектория кодировалась в её нативном формате входных данных о камере. Остальные модели не принимают камеру как нативный формат входных данных, поэтому траектория описывалась в текстовом запросе с использованием стандартных кинематографических терминов. Более продуманная инженерия запросов или творческие мультимодальные подсказки, возможно, улучшили бы следование камере для некоторых моделей, но текст был выбран как наиболее распространённая модальность для описания движений камеры.

Независимые эксперты-люди оценивали, какая модель лучше следует заданной траектории камеры. Результаты подтверждают, что Atlas превосходит современные видеомодели в генерации с управлением камерой, причём это преимущество растёт по мере усложнения траекторий камеры.

Дополнительно Atlas оценивалась на задаче 3D-реконструкции по разреженным входным ракурсам. В каждом испытании модель получает набор изображений и их положения камеры и предсказывает 3D-точку, соответствующую каждому входному пикселю. Эта задача давно привлекает внимание научного сообщества, и за последние годы разработано немало специализированных моделей реконструкции.

Atlas — универсальная модель, выполняющая как генерацию, так и реконструкцию. Несмотря на свою универсальность, Atlas превосходит лучшие специализированные модели реконструкции с открытым исходным кодом.

Оценка проводилась на нескольких современных бенчмарках для данной задачи, при этом результаты всех базовых моделей воспроизводились заново для обеспечения единого и честного протокола оценки для всех методов.

Масштабирование модели

Большая часть прогресса в современном ИИ обусловлена масштабированием: модели улучшаются во многом за счёт увеличения объёма данных и вычислений при использовании относительно простых алгоритмов.

В World Labs видят убедительные доказательства того, что Atlas продолжит улучшаться при масштабировании. Модель была обучена с нуля на большом и разнообразном мультимодальном корпусе данных. В процессе разработки была обучена серия моделей возрастающего размера и объёма вычислений, и каждый новый уровень вычислительных мощностей открывал новые возможности модели. В компании уверены, что будущие модели мира продолжат эту тенденцию, значительно расширяя свои возможности по мере дальнейшего масштабирования.

Работа с Atlas

Atlas выходит в режим раннего доступа для избранных партнёров. Желающие поработать с моделью могут запросить доступ — с ними свяжутся. В World Labs рассчитывают, что Atlas станет основной моделью мира для генерации, реконструкции и симуляции любых миров, и готовы сотрудничать с партнёрами в этом направлении.

World Labs также ведёт набор исследователей и инженеров для развития направления пространственного интеллекта.