Что изменилось со времени первого выпуска Bonsai 27B
Первый выпуск Bonsai 27B стал важной вехой, предложив практичный способ запускать 27B-класс нейросетей на локальных устройствах. Bonsai 2 27B сосредоточена на следующем шаге: улучшении качества модели и производительности во время выполнения, необходимых для реальных локальных приложений. По сравнению с предыдущим поколением Bonsai 27B, новая версия приносит:
- более мощную базовую модель, Qwen3.8 27B;
- более высокую сохранность совокупной производительности — 98,2% от полноточной модели;
- улучшенные рассуждения, кодирование, зрение и производительность долгого горизонта агентов.
Более высокие возможности на той же точке развёртывания
На наборе тестов, охватывающих рассуждение, математику, кодирование, следование инструкциям, зрение и применение инструментов агентами, Ternary Bonsai 2 27B набирает 83,9 балла, сохраняя 98,2% совокупной производительности Qwen3.8 27B.
| Возможность | Ternary Bonsai 2 27B |
Qwen3.8 27B |
Qwen3.6 27B |
|---|---|---|---|
| Использование агентов и вызов инструментов τ²-bench, BFCLv3 | 77,57 | 79,74 | 80,05 |
| Кодирование HumanEval+, LiveCodeBench v6, MBPP+, BigCodeBench | 81,58 | 82,17 | 82,57 |
| Следование инструкциям IFBench, IFEval | 82,66 | 81,25 | 74,53 |
| Знание и рассуждение MMLU-Redux, GPQA Diamond, AA-LCR | 83,95 | 86,66 | 84,71 |
| Математика AIME 2026, AIME 2025, GSM8K, MATH-500 | 96,57 | 97,06 | 94,64 |
| Зрение CharXiv, A-OKVQA, OmniDocBench v1.6, RealWorldQA, OCRBench v2 | 78,59 | 81,64 | 79,82 |
| В целом | 83,9 | 85,4 | 83,6 |
Рисунок 1: Результаты тестов Ternary Bonsai 2 27B (режим мышления) в сравнении с полноточными базовыми моделями Qwen3.8 27B и Qwen3.6 27B. Полные результаты по каждому тесту доступны в техническом отчёте.
Ключевой результат — не только совокупный балл, но и то, где сохранилась производительность. Агенты кодирования, системы использования инструментов, мультимодальные рабочие процессы и задачи с долгим горизонтом особенно чувствительны к деградации модели, потому что небольшие ошибки могут накапливаться на многих шагах. Bonsai 2 27B сохраняет большую часть производительности полноточной модели ровно в этих областях, работая при этом на долю от объёма памяти.
По сравнению с полноточной моделью и другими низкобитовыми альтернативами, Bonsai 2 27B выделяется как выброс с точки зрения плотности интеллекта. Многие низкобитовые альтернативы становятся развёртываемыми только ценой значимой потери производительности в кодировании, зрении или использовании инструментов агентами. Bonsai 2 27B подвигает границу в сторону как более высокой производительности, так и меньшего потребления памяти.

С помощью Bonsai 2 27B локальные модели могут начать браться за реальную интеллектуальную работу: циклы агентов кодирования, рабочие процессы взаимодействия с компьютером, приватный анализ документов, мультимодальное отладку и гибридную оркестрацию, где локальные модели обрабатывают чувствительные или высокочастотные задачи, а облако привлекается избирательно.
Пропускная способность и энергоэффективность
Ternary Bonsai 2 27B достигает до 143 токенов/секунду на NVIDIA GeForce RTX 5090 и 46,8 токенов/секунду на M5 Max. На RTX 4090, Ternary Bonsai 2 27B потребляет всего 0,714 мВт·ч/токен, что на 40% более энергоэффективно, чем 8B модель в полной точности.
Для помощников по кодированию более высокая пропускная способность означает более быстрые циклы редактирования-отладки. Для мультимодальных агентов это означает более быстрые итерации по скриншотам, документам и вызовам инструментов. Для приватных локальных рабочих процессов лучшая энергоэффективность означает более полезный вывод на том же устройстве, более длительное время автономной работы и более реалистичный путь к помощникам, которые могут оставаться доступными в фоне, не постоянно обращаясь к облаку.
Значимость этого выпуска
По сравнению с Ternary Bonsai 27B, новый Ternary Bonsai 2 27B закрыл разрыв сохранения между полноточной моделью с 95% до более чем 98%. Это значительное улучшение, которое делает текущий выпуск практически «безвредным». Это еще больше подтверждает идею о том, что низкобитовые модели могут быть лучшим способом развёртывания ИИ.
Это имеет последствия далеко за пределами локального вывода. Низкобитовые модели могут изменить экономику и архитектуру систем ИИ по всем устройствам, рабочим станциям и центрам обработки данных: размещать более крупные модели в том же пространстве памяти, обслуживать больше пользователей на одном оборудовании, снижать потребление энергии на вывод и включать гибридные системы, которые динамически решают, что должно запускаться локально, а что в облаке.
Вопрос будет всё чаще касаться не только того, насколько способна модель, но и сколько полезного интеллекта можно доставить в рамках определённого бюджета памяти, вычислений и энергии. Если производительность может продолжить масштабироваться, пока эти требования резко падают, возможности развёртывания будущих моделей расширяются по всему стеку: от персональных устройств до крупномасштабных центров обработки данных.
Поддержка платформ
Bonsai 2 27B работает на GPU NVIDIA через CUDA и на устройствах Apple (Mac, iPhone, iPad) через MLX благодаря пользовательским низкобитовым ядрам. Веса модели доступны сегодня под лицензией Apache 2.0.
Полные технические детали нашего сжатия, оценки и процессов тестирования доступны в нашем техническом отчёте.
Работайте с нами
Мы работаем с командами над адаптацией моделей Bonsai к их приложениям — от постобучения на специализированных данных до оптимизации вывода для целевого оборудования. Если вы создаёте AI-продукты с жёсткими требованиями к памяти, задержке или энергии, нам бы очень хотелось изучить, как Bonsai может помочь. Свяжитесь с нами по адресу contact@prismml.com.
Присоединяйтесь к нам
PrismML возникла из команды исследователей Калтеха и была основана при поддержке Khosla Ventures, Cerberus и Google, с продолжающейся поддержкой Samsung. Мы потратили годы на решение одной из самых сложных проблем в этой области: сжатие нейросетей без снижения их способности к рассуждению.
Если вы хотите помочь создавать следующее поколение передовых AI-систем, мы с удовольствием услышим от вас. Посетите нашу страницу карьеры.