Возможности модели

Beam разработана с особым упором на кодирование и агентные задачи. Модель продвигает границу открытых моделей на Западе и конкурентна с более крупными открытыми моделями вроде GLM 5.2, приближаясь к Qwen 3.8-Max по кодированию и агентным задачам. Там, где передовые открытые модели вроде Kimi K3 остаются впереди по абсолютной производительности, преимущество Beam — эффективность на этапе инференса.

На приведённой ниже таблице показана производительность Beam по кодированию, агентным задачам, рассуждениям и тестам STEM. NR обозначает результаты, которые не были опубликованы.

Кодирование и работа с терминалом
Тест Beam Inkling Nemotron 3 Ultra GLM 5.2 GLM 5.3 Kimi K3 Qwen 3.8 Max DeepSeek V4.1 Flash
DeepSWE v1.1 44.4 NR NR 44.0 61.0 68.0 51.0 74.2
SWE Bench Pro v2-Hard 77.2 56.9 NR NR 84.3 88.2 NR NR
SWE Bench Pro v1 65.5 54.3 46.4 62.1 NR NR 67.7 NR
Terminal Bench v2.1 80.1 63.8 56.4 81.0 88.2 88.3 86.6 90.6
SWE Atlas Codebase QnA 34.6 NR NR NR 61.0 68.0 NR NR
SWEBench Multilingual 78.0 NR 67.7 NR NR NR NR NR
SWEBench Verified 80.9 77.6 70.7 NR NR NR NR NR
Рассуждения
Тест Beam Inkling Nemotron 3 Ultra GLM 5.2 GLM 5.3 Kimi K3 Qwen 3.8 Max DeepSeek V4.1 Flash
AIME 2026 97.8 97.1 NR 99.2 NR NR NR NR
HLE no tools 36.2 29.7 26.7 40.5 42.3 46.9 43.6 39.1
SciCode 49.7 46.1 44.6 NR 59.0 58.7 52.1 52.0
CriPT AA 16.3 5.4 3.1 20.9 19.1 23.4 20.0 14.3
GPQA Diamond 90.5 87.2 87 91.2 91.7 93.5 92.6 90.9
Работа с инструментами и поиск
Тест Beam Inkling Nemotron 3 Ultra GLM 5.2 GLM 5.3 Kimi K3 Qwen 3.8 Max DeepSeek V4.1 Flash
AutomationBench public 37.0 NR NR 26.2 48.2 46.7 39.8 54.8
MCP Atlas 78.7 76.0 63.1 77.8 84.2 82.3 84.5 NR
tau3 banking 38.0 25.0 22.6 37.1 NR 37.1 55.2 NR
BrowseComp w/ context management 77.4 77.1 44.4 NR NR 91.2 NR NR
DeepSearchQA w/context management 80.1 NR NR NR NR 95.0 NR NR
Общие способности
Тест Beam Inkling Nemotron 3 Ultra GLM 5.2 GLM 5.3 Kimi K3 Qwen 3.8 Max DeepSeek V4.1 Flash
AA-LCR 79.3 77.3 79.3 78.3 79.7 88.7 80.3 84.0
LongBench v2 65.5 NR 61.9 64.0 NR NR 66.3 NR
IFBench 79.7 79.8 81.7 73.3 NR NR 82.8 NR
AA Omniscience (index) - public split only 13.0 14.2 8.6 NR 22.6 NR NR 6.6

Beam сочетает способности кодирования и агентные возможности с высокоэффективным рассуждением. На продвинутых тестах рассуждений модель показывает результаты, сравнимые с GLM-5.2, но использует при этом в 3–4 раза меньше вычислений инференса. Выигрыш в эффективности ещё более заметен при сравнении с моделями в семействе 2T+ параметров вроде Qwen 3.8-Max, требующими значительно больше вычислений на токен.

Эти результаты переводятся в большую «интеллектуальность на токен», обеспечивая сильные способности модели при более низкой стоимости — именно то, что нужно для использования в корпоративных задачах кодирования и агентных рабочих нагрузок.

Efficiency comparison chart
Beam демонстрирует эффективность уровня frontier как в FLOPS, так и в количестве токенов на DeepSWE, Humanity's Last Exam (HLE) и Terminal Bench 2.1. Расчёты выполнены на основе данных Artificial Analysis и DataCurve. Для моделей MoE использовались активированные параметры на токен, а не общий размер. Оценки исключают prefill промптов и зависящие от контекста операции внимания.

Обучение с подкреплением высокой сложности

Beam разработана с фокусом на обучение с подкреплением как на центральную ось масштабирования, инвестируя в науку RL, данные и инфраструктуру, чтобы преобразовать больше вычислений в более сильные способности. Масштабирование RL позволяет более обширное исследование стратегий решения проблем, а более длинные rollout'ы поддерживают многошаговое рассуждение, использование инструментов и адаптацию к обратной связи окружения.

Для масштабирования обучения с подкреплением развёрнуто 10.5K NVIDIA GB300 GPU на четыре недели, генерирующих более 100 миллионов rollout'ов с максимальной длиной контекста 256K токенов. Обучение и оценка использовали примерно 1.3 миллиарда песочниц. Для управления run'ом такого масштаба привлечено один миллион высокачественных кодирования, агентных и STEM окружений. Это один из крупнейших масштабов RL run'ов, проведённых открытой лабораторией. На всём наборе оценок способности продолжали улучшаться по мере увеличения RL вычислений, без признаков плато.

RL scaling curve
Результаты Terminal-Bench 2.1, HLE и DeepSWE в зависимости от кумулятивного количества RL rollout'ов во время обучения рассуждающего специалиста Beam. Для сравнения: Inkling обучена на 30M rollout'ов, MiMo на 753K.

Beam обучена с использованием асинхронных градиентов политики. На таких масштабах устаревание политики становится серьёзным источником нестабильности для этих методов. Длительные rollout'ы содержат токены, генерированные несколькими контрольными точками модели, при этом более ранние токены становятся всё более устаревшими относительно текущей политики. Численное несовпадение между обучающей и инфернс-ными движками усугубляет эту проблему.

Разработаны новые алгоритмы для поддержания стабильного обучения при этих условиях, систематически снижая несовпадение между обучением и инферснсом по всему pipeline'у. Эти авансы позволяют полностью асинхронное RL в масштабе, остающееся стабильным даже при обучении на взаимодействиях, генерированных более суток назад.

Policy staleness stability
Стабильное обучение продолжается по мере нарастания устаревания. На верхнем графике показана самая старая выборка в батче, на нижнем демонстрируется стабильная численность. Даже при обучении Beam с однодневным устареванием — 107 версий весов позади текущей политики — численность остаётся стабильной.

Обучение эффективному рассуждению

Beam обучена с управляемой штрафом за длину, вознаграждающей успешные решения и отбивающей ненужные токены. На ранних этапах RL производительность улучшалась даже при снижении длины завершения: модель научилась эффективнее решать задачи с меньшим рассуждением. Позже, по мере развития более сильных агентных способностей, длины завершения снова выросли, но эти дополнительные токены поддержали дальнейшие улучшения в производительности. На всём протяжении обучения RL улучшал компромисс между способностью и использованием токенов.

Reasoning effort evolution
Результаты DeepSWE на части RL run'а. Каждая точка соответствует разному уровню усилий рассуждения. Граница Парето движется в два этапа. Сначала сужается при обучении модели быть более токен-эффективной. Затем более высокие усилия расширяют наружу для достижения высокой производительности.

Пользователи могут управлять этим компромиссом через параметр усилия рассуждения Beam: низкие настройки благоприятствуют более коротким ответам, высокие позволяют более длинное рассуждение для повышения производительности на сложных задачах. Это даёт пользователям гибкость в выборе усилия рассуждения в соответствии с задачей и бюджетом вычислений.

Как поведение обобщается с RL

RL обучение Beam разработано так, чтобы развивать рассуждение и агентные способности, обобщающиеся за пределы обучающих задач. Во время фазы обучения на задачах рассуждения, инженерии и терминала наблюдались последовательные улучшения в просмотре несмотря на отсутствие задач просмотра в RL смеси. Это предполагает, что Beam училась более широким агентным способностям, обобщающимся через доменов. При получении доступа в интернет органически научилась искать и запрашивать другие большие языковые модели, а также использовать OCR API для чтения документов.

Демонстрации ниже показывают применение Beam этих способностей по исследованию, разработке приложений, игровым задачам и ML workflow'ам. Примеры варьируются от построения live NYC subway dashboard с использованием открытых данных до создания интерактивных приложений и подготовки ноутбуков для fine-tuning моделей. Хотя Beam работает только с текстом, она может работать с информацией из других модальностей когда те представлены как текст. На другом примере out-of-distribution домена Beam также создала ноутбук fine-tuning'а для самой новой и малейшей модели Gemma-4 на задаче Text2SQL.

Вместе эти демонстрации показывают широту задач, которые Beam может решать, комбинируя рассуждение, кодирование и использование инструментов. Каждый пример включает начальный запрос и результирующий вывод, вместе с релевантной установкой и итерациями пользователя.

Astronaut game demo
Игра Astronaut Free-Fall: Beam получила задачу создать 3D игру на p5.js где астронавт свободно падает на Землю. Персонаж должен избежать астероидов или уничтожить их с помощью «лучей». Beam не мультимодальна, но способна рассуждать о том как должна выглядеть визуальная часть игры в тексте.
Land or water puzzle
Эксперимент обобщения Land or Water: Пересоздали вирусный X пазл попросив Beam создать фиксированную сетку 180×90 для долгот -179° до 179° и широт -89° до 89° с 16,200 пунктами. Этот пазл вирусный всего несколько дней назад, таким образом не мог появиться в обучающих данных, тестируя обобщение модели. Beam получает 95.5% покрытия правильно, ставя нас между Opus 5 (92.5%) и Fable 5 (97.8%), что показывает насколько хорошо обобщается на новые задачи.
NYC Subway live map
Карта NYC Subway в реальном времени: Попросили Beam создать live updating карту метро NYC используя публично доступные MTA данные. Модель ищет документацию, проверяет требования аутентификации, находит геометрии метро и карт, и творчески движет поезда между станциями. Beam создаёт правильный frontend и backend и обеспечивает сервер для live обновлений.
Model fine-tuning notebook
Ноутбук Model Fine-tuning: Запустили Beam на OpenCode, попросили посмотреть на Unsloth и создать fine-tuning ноутбук для последней и малейшей модели Gemma-4 на задаче Text2SQL — out of distribution домен для Beam. Модель успешно исследует model card'ы, документацию Unsloth и доступные README'ы, и реализует логику fine-tuning'а и окружающую её механику. В результате Beam успешно finetune'ит Gemma, увеличивая точность Gemma на её held-out test set на 66.5%.

Масштабирование сред обучения с подкреплением

Frontier-масштабное обучение с подкреплением требует большой объём сложных, высококачественных задач. Построена база почти один миллион сред, в основном через pipeline'ы синтетических данных, дополненные собственными данными поставщиков и open-source источниками.

Полагались сильно на итеративный процесс кураторства. Сначала синтезировали или привлекали среды в широком наборе доменов, включающих инженерию ПО, работу с терминалом, конкурентное кодирование, STEM, веб-поиск, использование инструментов и общую интеллектуальную работу. Во-вторых, сильно фильтровали задачи по сложности (гарантируя что они ни постоянно разрешимы, ни невозможны для модели) и качеству (например, не недоуточненные, не вводящие в заблуждение, не угадываемые, не hackaбельные, или иначе поломаны или шумны). В-третьих, тестировали задачи через RL, что позволило идентифицировать дальнейшие проблемы качества или сложности и информировать следующей итерацией sourcing'а и фильтрации.

На всём протяжении разработки Beam обнаружили что компромиссы в качестве данных привели к плато способностей и другим проблемам обучения. Систематические улучшения качества задач были существенны для поддержания выигрыша способностей на всём run'е, завершившемся без признаков насыщения.

Frontier RL инфраструктура

Высокосложное агентное RL требует генерирования rollout'ов, исполнения инструментов, оценки исходов и обновления модели в масштабе. Построена асинхронная платформа позволяющая этим процессам работать независимо при координировании потока опыта и обновлений модели.

Во время обучения Beam поддерживали в среднем 110K одновременных rollout'ов. Семь способностей сделали это практичным:

Полностью асинхронное исполнение: Агенты генерируют rollout'ы в то время как тренер обучается и публикует новые версии модели. Каждый токен помечается версией её произведшей, позволяя алгоритму обучения учитывать устаревание политики когда завершённые rollout'ы текут в обучение.

Гибкое распределение вычислений: Корректировались баланс между инферснсом и обучением по мере эволюции нагрузки, работая при соотношениях GPU инференса к тренингу от 3.9:1 до 5.4:1. Изменяли размер тренера через пять конфигураций GPU сетки в одной обучающей lineage без потери состояния обучения.

Быстрые обновления модели: Новые веса достигали инференс флота в median'е примерно 12 секунд. Иерархичное распределение передаёт веса через rack'и над RoCE, потом разделяет их локально через NVLink. По сравнению с каждой репликой напрямую pulling'ом весов, это снизило cross-rack трафик на 75% и сделало fleet-wide adoption новых весов в 2.2× быстрее.

Устойчивость к отказам инференса: Во время run'а 71 инференс incident обработаны без terminating обучающей job. Инференс ёмкость восстанавливалась в median'е восьми минут, с потеряной ёмкостью учитывающей всего 0.02% elapsed serving GPU-minutes.

Окружения в масштабе: Поддерживали вплоть до 170K одновременных песочниц во время run'а. На платформе обработали более один миллион запросов создания песочницы, охватывающих более 20 кластеров, два облака и четыре региона. 90% новых песочниц были готовы менее чем в 10 секунд.

Эффективная packing'а тренера: Динамическая packing'а держала обучающие батчи в среднем на 99.99% полными, держа пропускную способность на GPU тренера в пределах 1.5% по мере роста средней длины rollout'а почти на 70%.

Observability и целостность награды: Per-token записи позволили численные consistency checks между тренингом и инферснсом в каждом шаге. Независимые судьи повторно скринировали passing решения для verifier exploits, в то время как replayable записи сделали награды и их использование в обучении inspectable'ными.

Вместе эти способности позволили тренировать на более длинных взаимодействиях и более требовательных окружениях при поддержании пропускной способности, восстановлении от отказов и проверке целостности процесса обучения.

Pretraining как основание для рассуждения

Обучение с подкреплением стоит на основе прочной базовой модели. Для облегчения рассуждения обеспечили что основание Beam имело богатое знание в кодирующих доменах, врождённые агентные способности которые могли быть увеличены, и стабильную MoE динамику оптимизации.

Во время разработки Beam pretrainировали series из итеративно больших моделей для установления и верификации нашей scaling recipe. Делая их производительность predictable'ной требовала тщательно проектировать model tiers'ы, курировать диверсные in-house code и web validation sets, и агрессивно decontaminate все обучающие данные против них. Scaling held; final Beam Base совпадает с его predicted производительностью, и также совпадает или outperforms accessible similar-sized open-source базовые модели.

Pretraining scaling laws
Beam's pretraining recipe масштабируется predictable'но через четыре порядка величины compute'а. Достигает Pareto-optimal loss – compute производительность на decontaminated code и web validation данных среди всех comparable open базовых моделей.

Стабильная и сбалансированная MoE оптимизация

Архитектура Beam и recipe оптимизации подчёркивает numerically здоровое основание для sustained downstream RL. Комбинирует interleaved локальное и глобальное внимание, fine-grained routed experts'ов, контролируемый residual stream, и множественные формы load balancing'а для обеспечения стабильного, сбалансированного expert использования и healthy signal propagation через residuals.

Для expert использования, построили на auxiliary-loss-free load balancing'е, представляя cosine decay expert-bias обновлений для снижения routing perturbation'ов позже в обучении. Sequence-level balancing дополнительно поощряет сбалансированное expert использование на данных вне pretraining распределения, preparing модель для changing распределения downstream RL. В результате final pretrained база имеет почти-perfect uniform использование, обеспечивая все experts могут быть использованы для learned рассуждения.

Expert utilization
Beam's expert использование почти-uniform. Busiest expert's load, усреднённая через MoE layers'ы, достигает всего 1.04× на pretraining завершение.

Для residual stream, разработали depth-based scaling подход который counteract'ит activation growth когда sublayer выводы accumulate'ся, помогая держать residual norm'ы стабильными по мере增加 глубины модели. Комбинировано с SandwichNorm, elementwise внимание gating'ом и FP32 residual accumulation'ом — которое уменьшает rounding error при добавлении малых обновлений потоку — этот recipe контролирует activation growth и outlier'ов, thereby обеспечивая healthy signal propagation через все layer'ы Beam. Эта стабильность persists через pretraining'е, reinforcement обучение и alignment'е.

Residual stream stability
Residual stream стабильность через pretraining'е и RL. Глубины и residual norm'ы остаются well-behaved даже с depth'ом модели и во время intensive RL training'а.

Безопасность и выравнивание

Инвестировали в безопасность и выравнивание Beam параллельно с development'ом. Использовали red-teaming'е и alignment training'е методы для обеспечения что модель responsible и helpful.

Путь вперёд

Beam в финальных этапах red-teaming'а и оценок. Можно зарегистрироваться здесь для раннего доступа к модели. Выпустим веса, technical report, model card и developer artifacts позже в этом месяце.