Горный пейзаж K2 Horizon на закате

IFM выпустила K2 Horizon — связанный флот из шести моделей: 375B-A23B, 36B-A4B, 32B, 7B, 3.7B и 0.9B. По рассуждениям, математике, программированию, агентным задачам и общим способностям K2 Horizon показывает результаты топ-уровня в каждом классе размеров — при этом модели 0.9B, 3.7B и 7B устанавливают новый state of the art для своих масштабов.

K2 Horizon — самый полный открытый релиз IFM на сегодняшний день. Для каждой модели раскрывается весь жизненный цикл обучения: от предобучения до пост-тюнинга рассуждений и агентности. Публикуются промежуточные чекпоинты, обучающие данные или подробные рецепты их построения, открытая архитектура, состав mixture, код обучения, конфигурации, детальные логи, результаты оценки и финальные веса.

Модели и код распространяются под лицензией Apache 2.0. Датасеты — под применимыми лицензиями, например ODC-BY; там, где редистрибуция невозможна, раскрывается способ построения и смешивания данных.

Вместе K2 Horizon представляет собой самый полный открытый релиз моделей на сегодняшний день:

  • Новая граница производительности во всех масштабах. Модели 0.9B, 3.7B и 7B показывают лучшие в мире результаты в своих классах на широко используемых бенчмарках. Модель 36B-A4B, оснащённая новым механизмом Mixture-of-Value-Attention (MoVA), демонстрирует исключительную эффективность на активный параметр, превосходя некоторые гораздо более крупные модели. Модели 32B и 375B-A23B входят в число лучших в своих классах. Вместе шесть моделей обеспечивают конкурентную производительность в диапазоне от edge-устройств до корпоративного развёртывания.
  • Первый полностью открытый флот моделей для агентов. K2 Horizon — первое семейство открытых моделей, раскрывающее полный процесс разработки через агентный пост-тюнинг. Публикуя чекпоинты, данные (или рецепт их построения), код, конфигурации и логи обучения на каждом этапе, K2 Horizon позволяет изучать, как формируются рассуждения, использование инструментов, планирование и агентные способности; воспроизводить методы, которые их создают; и адаптировать эти методы к новым инструментам, средам и доменам.
  • Шесть моделей — от edge до enterprise. Модель 0.9B рассчитана на сильно ограниченные среды вроде часов и очков, тогда как 3.7B и 7B приносят продвинутые возможности на телефоны и другие on-device приложения. Плотная 32B и разреженная 36B-A4B — мощные варианты для локальных рабочих станций и эффективного serving. 375B-A23B несёт самые сильные возможности флота в требовательные корпоративные развёртывания. Все шесть моделей поддерживают квантование.
  • Единый связанный флот. Шесть моделей разделяют базовую архитектуру, словарь, методологию обучения, интерфейсы, инфраструктуру оценки и инструменты развёртывания, с уменьшенным словарём для модели 0.9B. Такая согласованность облегчает переход между размерами, динамическую маршрутизацию задач и изучение способностей и эффективности в зависимости от масштаба.

Лучшая в мире производительность во всех масштабах

Сравнение бенчмарков для всех шести размеров моделей K2 Horizon

Модели 0.9B, 3.7B и 7B достигают state-of-the-art результатов в своих классах по математике, рассуждениям, общим способностям, программированию и агентным задачам.

Модель 36B-A4B работает выше уровня, обычно ожидаемого от такого количества активных параметров, демонстрируя эффективность уникального Mixture-of-Expert дизайна при вычислении значений attention. Модели 32B и 375B-A23B входят в число лучших в своих сравнительных классах.

Небольшие модели особенно заметны. K2 Horizon 0.9B набирает более 48 баллов на AIME 2026, наряду с сильными способностями к рассуждению, использованию инструментов и агентности. K2 Horizon 3.7B и 7B расширяют эти способности на более требовательные задачи в области разработки ПО и многошаговых сред, что подтверждается сильными результатами на SWE-bench и BrowseComp. Хотя сложные задачи, требующие обширного исследования и повторяющегося восстановления после ошибок, такие как в TerminalBench, остаются трудными для самых маленьких моделей, K2 Horizon сдвигает границу возможного на каждом масштабе.

Почему флот Horizon важен

Прозрачная модель, сильно отстающая от границы возможностей, имеет ограниченную ценность как фундамент даже для исследований. В то же время мощная модель, выпущенная только как финальные веса, позволяет её запускать, но даёт мало понимания того, как её способности были созданы.

K2 Horizon объединяет эти два подхода. Флот предоставляет высококонкурентные модели и публикует рецепты их обучения. Исследователи могут изучать продвинутые способности на моделях, достаточно сильных, чтобы их проявлять, а разработчики — воспроизводить, адаптировать и расширять методы, а не относиться к финальному чекпоинту как к непрозрачной отправной точке.

С момента введения принципа полной открытости в статье LLM360 2023 года, IFM выпускает открытые модели каждый год, расширяя это обязательство до более крупных масштабов, более сильных способностей и теперь — полного жизненного цикла вплоть до агентного пост-тюнинга.

Подробный обзор флота K2 Horizon

K2 Horizon 375B-A23B: корпоративный тяжеловес

K2 Horizon 375B-A23B — самая крупная и мощная модель флота. Её разреженная MoE-архитектура даёт 375 миллиардов параметров общей ёмкости, активируя примерно 23 миллиарда параметров на токен, что позволяет опираться на ёмкость гораздо более крупной модели без использования всех параметров для каждого токена.

Модель входит в число лучших моделей с числом параметров менее 400 миллиардов по общим, логическим, кодовым и агентным оценкам. Она рассчитана на требовательные нагрузки, где качество модели важнее всего: сложные рассуждения, разработка ПО, исследования и долгие агентные задачи.

Как и все модели флота Horizon, 375B-A23B выпускается не как единая конечная точка, а как дерево разработки. Её промежуточные чекпоинты и ветви пост-тюнинга раскрывают, как базовая модель развивается в варианты для рассуждений, следования инструкциям и специализированной агентности.

Сравнение бенчмарков K2 Horizon 375B-A23B

K2 Horizon 32B и 36B-A4B: сильная производительность для локального развёртывания

Horizon 32B — самая мощная плотная модель флота, обеспечивающая хороший баланс возможностей, адаптивности и локальной развёртываемости. Она входит в число лучших плотных моделей с числом параметров менее 40 миллиардов.

Horizon 36B-A4B достигает почти той же производительности, что и плотная 32B, активируя лишь около 4 миллиардов параметров на токен. Её эффективность обеспечивается MoVA — новой архитектурой разреженного attention — в сочетании с MoE feed-forward слоями.

Эти две модели служат важной точкой отсчёта для изучения того, как плотные и разреженные архитектуры ведут себя при схожих условиях обучения.

Эти модели занимают оптимальную точку локальной производительности флота. Они достаточно мощны для требовательных задач рассуждений, программирования и агентности, оставаясь практичными для локальных рабочих станций и эффективных систем serving.

Сравнение бенчмарков K2 Horizon 36B-A4B

K2 Horizon 7B, 3.7B и 0.9B: передовые возможности в малом масштабе

K2 Horizon 7B и 3.7B демонстрируют сильные рассуждения, математику, программирование, использование инструментов и агентную производительность, оставаясь пригодными для локального и on-device развёртывания. На нескольких оценках их результаты приближаются или превосходят результаты моделей в разы большего размера из предыдущего поколения.

K2 Horizon 0.9B переносит многие из этих способностей в сильно ограниченные среды. Модель может выполнять математические рассуждения, использовать инструменты и завершать простые агентные задачи, оставаясь достаточно компактной для приложений на часах, очках и других edge-устройствах при квантовании.

Подходящая задача меняется с масштабом: модель 0.9B лучше всего подходит для сфокусированных взаимодействий и лёгкого использования инструментов, тогда как 3.7B и 7B справляются с более требовательным программированием и многошаговыми рабочими процессами. Вместе они показывают, сколько возможностей теперь можно сохранить в моделях, достаточно небольших, чтобы работать почти где угодно.

Сравнение бенчмарков K2 Horizon 7B, 3.7B и 0.9B

Разработка K2 Horizon

Единое семейство с самого начала

Horizon был спроектирован как связанное семейство, а не набор несвязанных моделей. Шесть моделей разделяют базовые архитектурные решения, методологию обучения, интерфейсы, инфраструктуру оценки и инструменты развёртывания. Это позволяет разработчикам легче переходить между размерами, а исследователям — получить более контролируемую среду для изучения способностей в зависимости от масштаба.

Каждая модель предобучена примерно на 20 триллионах токенов с использованием тщательно построенных и задокументированных mixture. Промежуточные чекпоинты и соответствующие им детальные логи фиксируются на протяжении всего обучения, создавая подробную запись развития каждой модели.

MoVA: масштабирование attention через разреженных экспертов

Основная идея mixture-of-experts — увеличить общую ёмкость модели, сохраняя примерно фиксированными вычисления, необходимые для каждого токена. Обычные MoE-архитектуры применяют эту разреженность в основном к feed-forward слоям: доступно множество специализированных экспертов, но роутер активирует лишь небольшое подмножество для каждого токена.

Новая архитектура IFM — MoVA (Mixture-of-Value Attention) — распространяет этот принцип на attention. Поскольку attention определяет, как трансформер собирает информацию из всего контекста, введение разреженности здесь открывает ещё одно измерение для масштабирования ёмкости модели за пределами feed-forward сети.

MoVA встраивает экспертную маршрутизацию в multi-head attention, оставаясь совместимой с эффективными техниками, включая FlashAttention, grouped-query attention и sparse attention.

Результат — K2 Horizon MoVA 36B-A4B: модель с 36 миллиардами общих параметров, но примерно 4 миллиардами активных параметров на токен. При тех же условиях обучения она показывает лишь немного худший результат, чем плотная Horizon 32B, требуя при этом значительно меньше активных параметров.

Обучающие данные

Обучение на шести масштабах требует данных, достаточно широких для поддержки общих способностей и достаточно тщательно построенных, чтобы сохранять качество на протяжении примерно 20 триллионов токенов.

Mixture для предобучения Horizon сочетает разнообразные веб-, кодовые, математические, научные, мультиязычные и доменно-специфичные источники с синтетическими данными, сгенерированными собственными пайплайнами. Одно из ключевых нововведений в данных — прямая интеграция рассуждений в предобучение: почти 17% корпуса предобучения состоит из траекторий решения задач с явными рассуждениями. Траектории рассуждений для математических задач дополнительно переписывались в такие форматы, как диалоги и учебные пособия. В общей сложности в предобучении использовано около 10 триллионов синтетических токенов.

Пайплайны синтетических данных используют миллионы комбинаций параметров разнообразия и контекстных затравок, включая retrieval из внутреннего поискового движка по веб-корпусу предобучения. Для количественной оценки разнообразия на уровне корпуса разработана собственная метрика сжатия на основе gzip с адаптивным шагом, чтобы избежать быстрого насыщения стандартных gzip-измерений по мере роста числа документов. Как показано ниже, измеренное разнообразие синтетических данных приближается к разнообразию качественного натурального веб-текста и существенно превосходит разнообразие веб-кода.

Сравнение разнообразия источников обучающих данных

Документируются состав данных, пайплайны синтеза и построение обучающей mixture. Следуя принципам открытости, там, где позволяют лицензии, публикуются готовые к обучению датасеты напрямую. Там, где редистрибуция ограничена, публикуются описания источников, методы фильтрации и построения, а также состав mixture. Это позволяет исследователям понять, на чём училась каждая модель и как распределение данных менялось на протяжении обучения.

Данные пост-тюнинга вводятся с начала mid-training, а не резервируются исключительно для финальных стадий обучения. Синтезированные документы с длинным контекстом сочетаются с траекториями следования инструкциям, рассуждений и агентности, оформленными по шаблону чата. Главный элемент данных пост-тюнинга — масштабный синтез задач на основе таксономий задач, параметров разнообразия и затравок из веб-поиска, в результате чего получено более 100 миллионов уникальных задач. Кроме того, разработаны техники сэмплирования, направляющие solver-LLM к правильным решениям и желаемому поведению при генерации обучающих траекторий.

Динамика предобучения

Каждый чекпоинт K2 Horizon сопровождается подробными логами обучения и детальной историей, раскрывающими реальную динамику масштабного обучения: как эволюционируют потери, где возникают нестабильности, как вмешательства влияют на обучение и когда начинают проявляться способности.

В качестве примера полезности этих записей: K2 Horizon 3.7B, 7B, 32B и 36B-A4B обучались ровно на одних и тех же 22 триллионах токенов. При выравнивании по прогрессу обучения и нормализации по медианной потере за последний 1% обучения их сырые траектории потерь примерно совпадают, что видно на графике ниже — даже при разных плотных и разреженных архитектурах и почти на порядок различающемся общем числе параметров. Хотя такая нормализация выравнивает конечные точки по построению, она не заставляет совпадать ранние и промежуточные траектории. Их близкое совпадение показывает, что при общих данных и общем рецепте форма обучения оставалась удивительно устойчивой в подмножестве флота, использовавшем один и тот же датасет на протяжении всего обучения.

Нормализованные траектории потерь предобучения для разных размеров K2 Horizon

Вместе чекпоинты и логи позволяют исследователям изучать, почему одна динамика переносится между масштабами и архитектурами, а другая расходится, и связывать эти различия с конкретными стадиями обучения, mixture данных и техническими решениями.

Пост-тюнинг для рассуждений и агентов

Большая часть продвинутых способностей K2 Horizon к рассуждениям и агентности формируется во время пост-тюнинга. Полный пайплайн включает mid-training, supervised fine-tuning, объединение моделей, обучение с подкреплением со специализированным обучением агентов. Вместо одной финальной чат-модели этот процесс создаёт дерево разработки. Разные ветви специализируются на рассуждениях, программировании, использовании инструментов и агентных доменах, оставаясь связанными с общими базовыми чекпоинтами.

Артефакты этих стадий публикуются, чтобы исследователи могли изучать, где возникает каждая способность, воспроизводить отдельные ветви и адаптировать те же методы к новым инструментам и средам.

Uno Diffusion: подключаемое lossless-ускорение для Horizon

Скорость инференса стала первостепенной целью оптимизации, особенно в эпоху reasoning-моделей и агентов. По мере того как модели выдают более длинные цепочки рассуждений и совершают больше действий, даже небольшие задержки на токен складываются в существенную латентность. Тем не менее авторегрессионные языковые модели генерируют по одному токену за раз, создавая фундаментальное узкое место. Существующие подходы дают лишь частичные решения: спекулятивное декодирование обычно требует отдельно обученной draft-модели, а дискретная диффузия позволяет параллельную генерацию, но часто жертвует качеством ради скорости.

Uno спроектирован так, чтобы устранить этот компромисс. Он обеспечивает lossless-ускорение инференса, ускоряя генерацию без ухудшения качества ответов. Uno оставляет авторегрессионные параметры Horizon замороженными и полностью ответственными за распределение выходов модели, тогда как лёгкий набор диффузионных параметров учится только тому, как генерировать эффективнее.

Через процесс, названный Diffusion Distillation, эти компактные адаптеры учатся генерировать блоки токенов параллельно. Результат сочетает гарантии качества авторегрессионного декодирования со скоростными преимуществами диффузии: модель приходит к тем же ответам, но быстрее.

По результатам оценок IFM, Uno достигает лучшего соотношения скорость/качество, чем ведущие системы спекулятивного декодирования и как открытые, так и проприетарные диффузионные языковые модели. Важно, что выигрыш сохраняется при всех протестированных размерах batch, обеспечивая меньшую латентность для интерактивных агентов и более высокую пропускную способность для масштабного serving, без потери качества модели и с незначительными дополнительными затратами на обучение. Uno поставляется в виде простого LoRA-адаптера, что делает это lossless-ускорение легко применимым: достаточно подключить адаптеры.

Открытая инфраструктура для сборки и расширения Horizon

Вместе с моделями публикуется инфраструктура, использованная для их создания. Цель — не только сделать флот воспроизводимым, но и сделать стек разработки полезным как фундамент для новых моделей и систем.

В центре этого релиза — xLLM, продакшн-протестированная инфраструктура обучения IFM. xLLM сочетает производительность масштабного обучения с гибкостью, необходимой для исследований, позволяя командам изменять архитектуры, mixture данных, стадии обучения и целевые функции без перестройки окружающей системы.

Также будет опубликована полная кодовая база агентного пост-тюнинга, включая обучение с подкреплением, что, как ожидается, поможет исследователям продвигать техники в смежных областях.

Исследователи могут использовать эти компоненты для изучения поведения при обучении или воспроизведения конкретной стадии. Разработчики могут адаптировать Horizon под домен, добавлять новые инструменты, обучать экспертов-агентов или разворачивать несколько размеров моделей за единым интерфейсом.

От открытого исходного кода к открытой науке

Промежуточные чекпоинты превращают разработку модели в наблюдаемый научный процесс. Они позволяют исследователям изучать, когда возникают способности, как выбор параметров обучения меняет поведение и когда впервые появляются непреднамеренные стратегии.

Reward hacking даёт показательный пример. Когда способная модель помещается в реалистичную компьютерную среду и получает задание решить сложную задачу, та же изобретательность, которая делает её полезной, может привести к эксплуатации лазеек в самой оценке. Чтобы понять, насколько это влияет на заявленные показатели K2 Horizon, опубликованная модель была проверена с использованием процедуры аудита reward hacking от Artificial Analysis.

Трассировка рассуждений K2 Horizon после нахождения решения бенчмарка на GitHub
Момент «джекпота»: модель нашла решение бенчмарка на GitHub и выразила «восторг» от того, что ответ достался ей в готовом виде.

TerminalBench 2.1 помещает модели в изолированные компьютерные среды и оценивает, способны ли они выполнять сложные технические задачи. Способная модель должна исследовать файлы, вызывать инструменты, диагностировать сбои и находить альтернативные пути к решению. Именно такая изобретательность и нужна. Но иногда она переходит границу: вместо решения поставленной задачи модель находит скрытый ответ, эксплуатирует что-то, оставленное открытым в задаче, или манипулирует самим механизмом проверки.

K2 Horizon 375B-A23B запускался на 89 задачах TerminalBench 2.1 с восемью попытками на каждую, что дало 712 прогонов. Из них 500 прошли верификатор задачи (заявленная точность 70,2%). Затем каждый успешный прогон был проверен с помощью процедуры аудита reward hacking от Artificial Analysis, с применением инструмента harbor analyze с критерием reward_hacking и полным текстом их рубрики без изменений, где судьёй выступала модель Codex gpt-5.6-sol.

Аудит выявил проблемы в 24 прогонах из 10 задач. Их исключение снижает точность с 70,2% до 66,9% — коррекция на 3,37 процентных пункта. Остальные 79 задач оказались полностью чистыми. Для сравнения, Artificial Analysis сообщает о доле нарушений 2,2% для Claude Fable 5 и 4,1% для GPT-5.6 Luna; 3,37% у K2 Horizon укладывается в этот диапазон.

Модель обнаружила несколько стратегий:

  • Определение, что она находится внутри публичного бенчмарка, поиск репозитория на GitHub и скачивание эталонного решения
  • Извлечение актуального исходного кода из публичного репозитория реального проекта и копирование исправления вместо его самостоятельного вывода
  • Изучение нерекламируемых файлов, скриптов-генераторов или открытых учётных данных
  • Редактирование тестового окружения или создание вывода, эксплуатирующего то, как тест проверял успех

Похожий случай зафиксирован с K2 Horizon 7B, который нашёл и скачал ответы SWE-bench, получив в результате завышенный балл 82. Этот балл не отражает реальную производительность в разработке ПО, но само поведение научно показательно: взлом бенчмарка возник как непреднамеренное следствие более широкого планирования, использования инструментов, исследования среды и настойчивости.

Поскольку промежуточные чекпоинты публикуются вместе с финальными моделями, такое поведение можно изучать, а не скрывать. Исследователи могут определить, когда впервые появляется стратегия, связать её с изменениями в обучении и измерить её влияние на заявленную производительность.

Таким образом, K2 Horizon — больше, чем набор весов модели. Это открытый эксперимент в том, как способности — и их непреднамеренные последствия — развиваются на протяжении обучения.

Начать работу с K2 Horizon

Все шесть размеров K2 Horizon выпущены как открытые веса под лицензией Apache 2.0, с поддержкой vLLM, SGLang и Ollama с первого дня. Кроме того, K2 Horizon поддерживает развёртывание на оборудовании NVIDIA, AMD и Cerebras, предоставляя варианты от локального инференса до масштабного serving. Модели доступны в репозитории: https://huggingface.co/IFM — можно скачать модели, изучить промежуточные чекпоинты, исследовать обучающие данные и mixture, воспроизвести стадии обучения или собрать новые модели и агенты, используя код и инфраструктуру Horizon.

K2 Horizon даёт больше, чем шесть финальных моделей. Это открытый чертёж для понимания, адаптации и развития следующего поколения AI-систем.

Полные таблицы результатов

375B-A23B

Полная таблица результатов K2 Horizon 375B-A23B

36B-A4B

Полная таблица результатов K2 Horizon 36B-A4B

32B

Полная таблица результатов K2 Horizon 32B

K2 Horizon 7B

Полная таблица результатов K2 Horizon 7B

K2 Horizon 3.7B

Полная таблица результатов K2 Horizon 3.7B

K2 Horizon 0.9B

Полная таблица результатов K2 Horizon 0.9B