Что такое Kolibri?
Kolibri — это открытая языковая модель (LLM) от Aleph Alpha для немецкого и английского языков: mixture of experts с 78 миллиардами параметров, из которых активно используется около 3,5 миллиарда на каждый читаемый или создаваемый токен. Модель вышла 3 октября 2026 года под лицензией Apache 2.0, веса доступны на Hugging Face, и обучение проводилось с нуля на инфраструктуре в Германии и Финляндии. (Kolibri по-немецки означает колибри — забавное название для модели, главная фишка которой в лёгкости.)
Разработчик живёт в Германии, и на SmashingConf New York в 2024 году поделился впечатлением о том, что услышал в США, когда сказал, откуда он: «you regulate, you don't innovate» — вы регулируете, а не инновируете. Это больно слышать, и на сцене хотелось найти золотую середину: «правильный баланс между инновациями и регулированием вокруг приватности данных, управления данными, экологических ограничений и требований к энергопотреблению». Kolibri — это почти прямой ответ на эту проблему: немецкая команда создала модель с учётом EU AI Act «с самого начала», и в собственной оценке Aleph Alpha она показывает результаты выше, чем любая сравниваемая модель того же размера на обоих языках.
Огромные поздравления всем в Aleph Alpha, кто создавал Kolibri, включая хорошего друга Michael Hofmann!
Статья рассказывает, как работает Kolibri, где она сильна, где слаба, как её запустить и когда это правильный выбор. Все данные взяты из 189-страничного технического отчёта Aleph Alpha, карточки модели и их поста о запуске, плюс один эксперимент с токенизатором.
| Kolibri 1 | |
|---|---|
| Параметры | 78,1 миллиарда всего, 3,46 миллиарда на токен (4,4%) |
| Языки | Немецкий и английский |
| Контекст | 262 144 токена нативно, тестировано до 1 048 576 |
| Лицензия | Apache 2.0 для весов и файлов конфигурации (Aleph Alpha сохраняет права на тренировочный код и методы) |
| Память | около 78 ГБ весов в 8-битовой плавающей точке (FP8) |
| Рассуждение | 4 уровня: none, low, medium и high |
| Вызов функций | Да |
| Дата обновления знаний | 18 июня 2026 |
| Обучение | около 24 триллионов токенов, более пятой части на немецком, на 768 NVIDIA B200 GPU |
Aleph Alpha называет Kolibri суверенной моделью, и в посте о запуске это означает 2 вещи. Первое — как она была создана: «команды создали модель в Германии, обучили её на инфраструктуре в Германии и Финляндии, в соответствии с европейским и немецким законодательством, без иностранного контроля». Второе — что получают клиенты: «полная свобода развёртывания и защита интеллектуальной собственности, поэтому соответствие требованиям становится унаследованным свойством». Проще говоря, министерство или поставщик автомобилей могут запустить её на собственных серверах, данные никогда не покидают здание, и никто не может изменить или отключить модель у них. Aleph Alpha также подписала General-Purpose AI (GPAI) Code of Practice Европейского Союза.
Суверенность не означает, что ничего из-за пределов Европы не вошло: карточка модели говорит об этом явно. Английский веб-текст был перефразирован с помощью Gemma 4 от Google, немецкий — с помощью Mistral-NeMo, а Qwen3-32B предоставила размеченные данные для фильтров качества. Затем тренировочные данные отфильтровали по политическим смещениям, которые могут быть в таких моделях — сама Aleph Alpha измеряла это в китайских открытых моделях.
Как работает Kolibri
Kolibri — это 6 идей, уложенных одна на другую, и каждая нужна, чтобы сделать немецкий дешевле, длиннее или честнее.
1. 384 специалиста, и каждый токен видит 6
В обычной (плотной) модели каждый токен проходит через все параметры. В mixture of experts (MoE) каждый слой имеет толпу маленьких под-сетей, называемых экспертами, и роутер, который выбирает несколько из них для каждого токена. Kolibri имеет 50 слоёв, каждый со 384 экспертами плюс 1 общий эксперт, через которого проходит каждый токен, и роутер отправляет каждый токен к 6 из 384. Вот как 78,1 миллиарда параметров превращаются в 3,46 миллиарда реальной работы на токен.
В 2024 году было дано выступление «Why Small Language Models are the future», где утверждалось в пользу «меньших языковых моделей с меньшим количеством параметров и меньшим количеством мест, где всё может пойти не так, требующих меньше вычислений». Аналогия была врачом, прочитавшим все медицинские книги в мире, против специалиста по гематологии: приди со своим кровяным расстройством к первому, и «он может не разобраться, потому что знает слишком много». Mixture of experts помещает больницу, полную специалистов, внутри одной модели, и роутер — это администратор, который направляет каждый токен к нужным 6.
Аналогия ломается в 2 местах, однако. Эксперты — не аккуратные темы, как «немецкое право»: когда исследователи заглядывают внутрь MoE моделей, они в основном находят экспертов по паттернам токенов — пунктуация или собственные имена, а не темы, которые выбрал бы человек. И больница должна держать всех 384 специалистов на персонале, даже если вы видите только 6, поэтому Kolibri считает, как модель с 3,5 миллиарда параметров, но нуждается в памяти модели со 78 миллиардами параметров. Карточка модели говорит это ясно: «полная модель должна находиться в памяти, даже несмотря на то, что активна только часть её».
2. Токенизатор, который читает длинные немецкие слова
Модель не читает буквы или слова, она читает токены: куски текста из фиксированного словаря, выбранные при обучении токенизатора. Немецкий склеивает слова в длинные составные слова, а токенизатор, выученный в основном на английском, разрубает их на куски. Вот немецкое название Федерального конституционного суда, разбитое токенизатором, который используют GPT-4o и GPT-5 (o200k_base, через tiktoken от OpenAI), и Kolibri:
o200k_base (GPT-5): Bund | es | ver | fass | ungs | gericht 6 токенов
Kolibri: Bundes | verfassungsgericht 2 токена
Токенизатор Kolibri имеет 128 000 токенов, обучен новым алгоритмом, который Aleph Alpha называет UniBPE: он сохраняет восходящее слияние byte-pair encoding (BPE) и выбирает каждое слияние другой функцией оценки (целью Unigram), которая уважает, как немецкий строит слова. Отчёт говорит, что для немецкого текста нужно на 11,2% меньше токенов, чем для токенизатора GPT-5, лучше всех из 9 других измеренных.
Захотелось проверить это самому, поэтому запустили 6 токенизаторов на всём Основном законе Федеративной Республики Германии, немецкой конституции (185 КБ очень немецкого юридического текста), и на его официальном английском переводе:
| Токенизатор | Немецких токенов | Больше, чем Kolibri | Английских токенов | Больше, чем Kolibri |
|---|---|---|---|---|
| Kolibri 1 | 35 190 | 39 875 | ||
o200k_base (GPT-4o, GPT-5, GPT-OSS) |
41 482 | 17,9% | 39 737 | -0,3% |
| Qwen3.5 35B-A3B | 42 907 | 21,9% | 41 650 | 4,5% |
| Mistral Small 4 | 43 478 | 23,6% | 41 301 | 3,6% |
| Gemma 4 | 43 850 | 24,6% | 41 564 | 4,2% |
На юридическом немецком Kolibri понадобилось на 15% меньше токенов, чем токенизатор GPT-5 — даже больше, чем собственные 11,2% у Aleph Alpha, — а на английском он сравнялся с ним. Дикий результат. Меньше токенов означает меньше шагов, чтобы прочитать или написать одинаковый немецкий текст, и больше немецкого поместится в одном окне контекста. (Каждый считался со своим tokenizer.json через библиотеку tokenizers Hugging Face, кроме o200k_base, который считался через tiktoken.)
3. Большинство слоёв смотрят только рядом
40 из 50 слоёв Kolibri используют sliding-window attention: каждый токен видит только 512 токенов перед ним. Каждый пятый слой видит всё перед ним. Это как читать длинный контракт, в основном сосредоточиваясь на предложении, которое читаешь, и каждые несколько страниц останавливаясь, чтобы подумать обо всём, и это то, что делает контекст из 1 миллиона токенов доступным по стоимости.
Там есть умная деталь. Только слои с sliding-window знают, где находится токен (через rotary position embeddings), а слои полного внимания не знают, поэтому контекст растягивается дальше 262 144 токенов, на которых обучалась модель, без каких-либо дополнительных позиционных трюков. Aleph Alpha валидировала это до 1 048 576.
В выступлении «Unlocking Value with AI Today» конечный контекст был назван одной из «трёх больших» проблем генеративного AI, вместе с галлюцинациями и датой截断 знаний, и Kolibri атакует все 3. При 1 миллионе токенов, на тесте RULER с длинным контекстом, базовая модель Kolibri набирает 63,2 против 57,5 для базовой модели Qwen3.5 35B-A3B.
4. Она думает по-немецки
Модели рассуждения думают перед тем, как ответить, и даже на немецких подсказках они в основном думают по-английски. Aleph Alpha опубликовала об этом 24 сентября и описала это как «Through the Valley of Tears»: они генерировали около 800 000 примеров немецкого рассуждения и обнаружили, что немного данных немецкого рассуждения хуже, чем никакие. Оценка её немецкой математики упала с 70,2 до 48,3, потому что её немецкие мысли продолжали ходить кругами и никогда не заканчивались, и только поднялась обратно (до 67,3) с намного больше немецких данных.
Kolibri получила всё это в полном объёме. Она рассуждает по-немецки на немецких подсказках, и её немецкие оценки по математике — лучшие среди моделей примерно с 3 миллиардами активных параметров: 87,5 на American Invitational Mathematics Examination (AIME) 2025 на немецком, против 84,4 для следующей лучшей, Nemotron 3 Nano от NVIDIA.
5. Она обучена говорить «я не знаю»
Галлюцинация была номер 1 из моей большой тройки, и решение в этом выступлении было retrieval augmented generation (RAG): вы ищете хорошую, авторитетную информацию и кладёте её в подсказку. RAG работает только если модель признаёт, когда документов нет ответа, однако, и для этого Aleph Alpha обучили, со своим методом, Merlin-Arthur protocol.
Это работает как игра с 3 игроками. Артур — это модель, и она получает вопрос с частями вспомогательного документа скрытыми. Мерлин скрывает части так, чтобы правильный ответ было легче найти, и Артура обучают на эти. Морганы скрывают доказательство, на котором зависит ответ, и Артура обучают говорить, что он не знает. Артур никогда не знает, какого из 2 он встречает, поэтому единственный способ выиграть — действительно проверить, поддерживают ли доказательства перед ним ответ.
Это видно. На тесте Omniscience от Artificial Analysis, когда Kolibri не знала ответ, она это говорила (или давала частичный ответ) 44% времени вместо того, чтобы придумать. Qwen3.5 35B-A3B делала это 11,1% времени и GPT-OSS 120B 23,7%. Из всех моделей mixture-of-experts, которые Aleph Alpha сравнивала, только Qwen3.6 35B-A3B делала лучше, при 56,7%.
6. Вы выбираете, как усердно она думает
Каждый запрос может устанавливать reasoning_effort на none, low, medium или high, поэтому быстрый поиск отвечает сразу, а сложный вопрос получает длительное размышление, от одной и той же модели на одном сервере.
На что Kolibri хорошо способна
Это строки, где Kolibri опережает открытые модели своего размера в оценке Aleph Alpha, которая запускает каждую модель через одну и ту же установку с рекомендуемыми её создателями параметрами выборки:
| Что | Kolibri | Ближайшая модель примерно с 3 миллиардами активных параметров |
|---|---|---|
| Общая оценка, английский | 75,5 | 74,7 (Qwen3.5 35B-A3B) |
| Общая оценка, немецкий | 70,8 | 69,8 (Qwen3.5 35B-A3B) |
| AIME 2025, английский | 96,9 | 89,6 (Nemotron 3 Nano) |
| AIME 2025, немецкий | 87,5 | 84,4 (Nemotron 3 Nano) |
| Вопросы о ненаблюдаемых корпоративных документах, английский | 89,7 | 87,0 (Qwen3.5 35B-A3B) |
| Длинный контекст при 1 миллионе токенов (базовая модель) | 63,2 | 58,5 (Nemotron 3 Nano) |
Математика — это звёзда: на AIME 2025 и 2026 на английском она опережает каждую модель MoE в сравнении, включая те, у которых 12 миллиардов активных параметров, и только плотная Qwen3.8 27B набирает выше. Строка корпоративных документов — это 5 тестов, которые Aleph Alpha создала из похожей на клиентов работы в полупроводниках, немецком государственном секторе, аэрокосмической промышленности, поставщике автомобилей и промышленных приводах, запущенных на документах и вопросах, которые модель никогда не видела в обучении.
На что Kolibri плохо способна
Aleph Alpha публикует слабейшие строки прямо рядом со своими лучшими в карточке модели, поэтому вот они:
- Она знает меньше по памяти. Она последняя из 12 моделей в тесте без закрытой книги (Retrieval-Augmented Generation Benchmark's вопросы без документов, 51,0), и она отвечает правильно на только 14,8% вопросов Omniscience, против 22,2% для Qwen3.5 35B-A3B. Она знает, когда не знает, что хорошо, но она также знает меньше: хорошо с документами в подсказке, плохо как оракул мелочей.
- Вызов функций в несколько ходов слабее. На мультиходовых тестах Berkeley Function Calling Leaderboard она набирает 39,8, против 58,2 для GLM-4.7 Flash и 54,0 для Qwen3.5 35B-A3B.
- Это не лучший агент кодирования. Она набирает 27,7 на Terminal-Bench 2.1 против 39,7 для Qwen3.5 35B-A3B, и 66,4 на SWE-bench Verified против 73,8 для Qwen3.6 35B-A3B.
- Длинный контекст падает в середине. При 128 000 токенов на RULER, базовая модель Qwen3.5 набирает 89,9 против 67,9 Kolibri. Kolibri только вырывается вперёд на очень длинных дистанциях.
- Память. 78 ГБ весов означает GPU дата-центра или два, никогда ноутбук, что бы ни предлагали 3,5 миллиарда.
- Слантроп новый. Ей нужен плагин vLLM Aleph Alpha, который поддерживает одну версию vLLM за раз (0.29 сегодня), и в день запуска никакой размещённый провайдер не служит её.
- 2 языка только. Это специально: карточка модели называет это «преднамеренный выбор глубины над широтой».
- Более крупная плотная модель её побивает. Qwen3.8 27B набирает 80,2 на английском и 79,9 на немецком, но использует почти в 8 раз больше параметров на каждый токен, и это компромисс, вокруг которого построена Kolibri.
Как запустить Kolibri
Нужно около 78 ГБ памяти GPU: минимум 2 NVIDIA A100 или H100 с 80 ГБ каждый, или один H200, B200 или B300. Модель себя ещё не запускали, так как нужен GPU дата-центра и никто её пока не размещает, поэтому это прямо из карточки модели. Сначала плагин, который устанавливает vLLM версию, которую он поддерживает:
pip install 'aleph-alpha-inference>=1'
vllm serve Aleph-Alpha/Kolibri-1 --kv-cache-dtype fp8 \
--reasoning-parser kolibri1 \
--tool-call-parser kolibri1 \
--enable-auto-tool-choice
Это даёт вам совместимый с OpenAI сервер, поэтому любой клиент OpenAI говорит с ним, и усилие рассуждения идёт через шаблон чата:
# из карточки модели Kolibri (обрезано)
from openai import OpenAI
client = OpenAI(base_url="http://localhost:8000/v1", api_key="EMPTY")
response = client.chat.completions.create(
model="Aleph-Alpha/Kolibri-1",
messages=[{"role": "user", "content": "Erkläre kurz, was ein Mixture-of-Experts-Modell ist."}],
extra_body={"chat_template_kwargs": {"reasoning_effort": "high", "enable_thinking": True}},
)
print(response.choices[0].message.content)
Карточка модели рекомендует temperature=1.0, top_p=0.97 и top_k=128, и контексты максимум 262 144 токена для чего-то, чувствительного к задержке. Для полного миллиона, запустите её с 2 дополнительными флагами:
vllm serve Aleph-Alpha/Kolibri-1 --kv-cache-dtype fp8 \
--max-model-len 1048576 \
--hf-overrides '{"max_position_embeddings": 1048576}'
Когда использовать Kolibri
Kolibri — это выбор, когда немецкий текст и собственная аппаратура оба важны: государственный орган, банк, производитель или поставщик аэрокосмической промышленности, который должен хранить свои документы, хочет ответы на немецком, которые думают по-немецки, и предпочли бы услышать «я не знаю», чем уверенный неправильный ответ. RAG над длинными немецкими документами (законы, контракты, руководства) играет в каждую силу выше: токенизатор, контекст 1 миллиона токенов и воздержание.
Это вид проекта, над которым работают прямо сейчас, с Prof. Dr. Heinrich Audebert, который возглавляет неврологию в Campus Benjamin Franklin, одной из больниц Charité в Берлине. Сегодня пациент с неврологической жалобой идёт к своему врачу общей практики (GP), и GP должен его видеть, что очень требовательно для занятой практики. В том, что создают, пациент сидит за компьютером в практике GP, аватар AI проводит его через батарею тестов, и она оценивает, насколько срочны его симптомы: направление к специалисту прямо сейчас, или они могут подождать немного. Разговоры на немецком, они о здоровье людей, и модель должна работать там, где её контролируют, поэтому думают использовать Kolibri.
Это неправильный выбор для агента кодирования, где Qwen3.6 35B-A3B ведёт, для вопросов, на которые модель должна ответить по памяти, для любого языка кроме немецкого и английского, и для кого-то, кто не может пожертвовать 78 ГБ памяти GPU. Для последнего случая, маленькая специализированная модель, за которую выступали в 2024, всё ещё ответ: для поиска подкастов fine-tuned Mistral 7B на ноутбуке Apple silicon вместо того, чтобы платить за GPT-4o.
Какой лучше для своих документов, больница специалистов, как Kolibri, или одна маленькая модель, обученная на одну работу, показывает только когда пробуешь оба на своих данных. Менять модель под агентом без её перелома — это то, что мастерская по надежным AI агентам покрывает: guardrails и retries, которые работают, какая модель ни сидела бы под ними.