16 августа Alibaba выпустила Qwen 3.8 27B — мультимодальную LLM на 27 миллиардов параметров под лицензией Apache 2 от исследовательской лаборатории Qwen. Модель такого размера удобна для запуска на достаточно мощном ноутбуке, а её предшественница, Qwen 3.6 27B, уже произвела хорошее впечатление.
Собственные бенчмарки Qwen для новой модели выглядят впечатляюще: она превосходит не только Qwen 3.6 27B, но и закрытую Qwen 3.7-Plus, которая ещё в мае этого года считалась одной из сильнейших моделей Qwen вообще. Интересно будет посмотреть, что покажут независимые бенчмарки.
Модель тестировалась на двух машинах: MacBook Pro на M5 Max с 128 ГБ памяти и NVIDIA DGX Spark. На обеих использовался LM Studio с квантованной сборкой Q4_K_M весом 17 ГБ. Также модель запускалась напрямую через llama-server на Spark.
Уровень reasoning по умолчанию — extra high — приводит к колоссальному переусложнению
В документации Qwen указано, что по умолчанию используется уровень усилия рассуждений xhigh, и сборка GGUF для LM Studio сохраняет это значение по умолчанию:
Qwen3.8 официально поддерживает параметр
reasoning_effort, который позволяет настраивать глубину рассуждений и контролировать затраты:
xhigh(по умолчанию): для сложных задач, требующих тщательного анализаmedium: баланс точности и скоростиlow: эффективные рассуждения с оптимизацией по скорости и стоимости
Это забавный выбор по умолчанию. Он совершенно не подходит для повседневного использования модели, особенно на потребительском железе. Результаты подобных настроек оказались крайне занятными.
Быстро выяснилось, что стандартного контекстного лимита LM Studio в 8192 токена не хватает — Qwen тратила его полностью на размышления даже над самыми тривиальными задачами. Проблема исчезла после загрузки модели с максимальной длиной контекста 262 144 токена.
Вот SVG с пеликаном на велосипеде, полученный с первой попытки при увеличенном контексте. Генерация заняла 21 минуту: 22 276 токенов на рассуждения ради 3223 токенов итогового вывода. Полную трассировку рассуждений можно посмотреть здесь.

Это лучший SVG с пеликаном, который вообще удавалось получить от модели, запускаемой локально, — а ведь этот файл Qwen весит на диске всего 17 ГБ. В результате хорошо получилось многое:
- Рама велосипеда правильной формы
- У пеликана есть ноги по обе стороны от велосипеда — большая редкость
- Хорошо прорисован характерный мешок-клюв
- Крылья дотягиваются до руля!
- Линии движения расположены сзади, а не спереди
- Приятный фон: солнце, облака, холм, цветы и трава.
Стоило ли это 21 минуты ожидания? Определённо нет.
Тот же промпт с отключёнными рассуждениями дал другой результат — транскрипт здесь. На этот раз получилось 3715 токенов за 137 секунд — чуть больше двух минут.
Для полноты картины тот же промпт был запущен через OpenRouter на значительно более крупной Qwen 3.8 2.4T-A95B (вышла неделей ранее), что дало вот такой эффектный анимированный SVG:
Насколько сильно модель на уровне xhigh склонна к переусложнению? Проверить это решили на гораздо более простом промпте — снова при настройке по умолчанию extra high:
draw an svg of a circle
Трассировка рассуждений Qwen начиналась так:
Пользователь просит нарисовать SVG-круг. Простой запрос — но хочется сделать это тщательно продуманным произведением. Пусть будет нечто большее, чем просто
<circle>: самодостаточный SVG-файл с характером — может быть, геометрический «этюд круга», с лёгкой анимацией, слоистыми кольцами и особой палитрой.Держим рамки: просили SVG круга. Значит, ядро — круг. Но можно добавить мастерства: концентрические направляющие окружности (как при геометрическом черчении циркулем), деления, мягкая градиентная заливка основного круга, сдержанное фоновое движение (медленно вращающееся пунктирное кольцо, пульсирующее свечение). Учесть prefers-reduced-motion? Это больше про CSS; SVG SMIL или CSS внутри SVG подойдёт.
Варианты палитры: глубокие бирюзовые чернила на тёплой бумаге? Или яркий алый круг на светлом фоне с тёмно-синими вспомогательными линиями — в духе Баухауса/чертежа циркулем. Пусть будет вид «геометрического этюда»: холодный сланцевый фон или яркая белая бумага? Белая бумага подойдёт, если это не сочетание кремового с терракотовым. [...]
Спустя несколько минут модель выдала действительно красивый анимированный круг, который совершенно не соответствовал запросу!
Главная рекомендация: игнорировать настройку по умолчанию. Стоит запускать Qwen 3.8 27B на уровне low или вовсе без рассуждений. Модель отличная, но начинать с настройки по умолчанию — плохая идея.
Отлично справляется с bounding box
Один из способов проверить vision-модель — посмотреть, насколько точно она может отмечать объекты на фотографии рамками (bounding box). Предыдущие версии Qwen хорошо справлялись с этой задачей, поэтому решено было проверить, как модель справится с разметкой пеликанов на фото.
Ранее хорошие результаты давал запрос с масштабом координат 0–1000. Попробовали так:
llm -a https://static.inaturalist.org/photos/714731804/large.jpg \
-m lmstudio/qwen/qwen3.8-27b \
'Return JSON bounding boxes for the pelicans in this photo, 0-1000 scale for each dimension'Трассировка рассуждений привела к такому результату:
[
{"bbox_2d": [195, 290, 370, 780], "label": "pelicans"},
{"bbox_2d": [445, 320, 675, 850], "label": "pelicans"}
]Результат оказался очень точным. Вот как эти рамки выглядят поверх фотографии:

Инструмент для визуализации bounding box
Визуализация рамок выше сделана с помощью нового инструмента, который Qwen 3.8 27B построила по запросу, работая полностью офлайн на ноутбуке.
Забыв убавить уровень рассуждений, модель сильно переусложнила реализацию, но всё же выдала полноценный интерфейс из единственного промпта:
[ {"bbox_2d": [195, 290, 370, 780], "label": "pelicans"}, {"bbox_2d": [445, 320, 675, 850], "label": "pelicans"} ]
Build an HTML page which has an input box for accepting the URL to an image and a textarea for accepting the above style of JSON.
It appends the image to the page, measures its width and height, then treats the coords in the bbox_2d as scaled from 0-1000 and scales them against the actual width and height, then it renders labelled boxes over the image.
На скриншоте видна одна из фич, которую никто не просил, — демо-сцена на случай, если нет своей фотографии для теста:

Вот фрагмент трассировки рассуждений, где модель решила нарисовать собственных пеликанов — просто потому, что в примере JSON в промпте использовалась метка «pelicans»:
Ещё нужна кнопка «загрузить пример», использующая известное изображение? Нельзя полагаться на внешние картинки, но… поле ввода URL заполняется пользователем; можно добавить кнопку «попробовать с примером» [...] Хм, можно нарисовать простую сцену на canvas, экспортировать как data URL и загрузить в изображение — это самодостаточно и удобно для демонстрации! [...] Но координаты пользователя предназначены для реального фото с пеликанами; сгенерированная заглушка всё равно может продемонстрировать масштабирование. Сгенерировать заглушку 1000×1000: градиент воды + два силуэта-«блоба», похожих на пеликанов, размещённые по заданным bbox (в том же масштабе — мило: силуэты стоят точно на позициях 0-1000, показывая совпадение рамок). Получится забавная самодостаточная демонстрация. Сохранить простоту: градиент неба, солнце, вода, две фигуры-«пеликаны» (тело-эллипс, круглая голова, клюв). Разместить по центрам bbox.
(Есть лёгкое опасение, что модели по всему миру могут иметь склонность рисовать пеликанов при любой возможности — результат почти двух лет воздействия этого не самого серьёзного бенчмарка.)
Насколько необходимо всё это переусложнение? Возможно, хотя бы отчасти да. С отключёнными рассуждениями получилась другая версия (транскрипт здесь), которая почти работает, но показывает рамки не на своих местах:

То есть без рассуждений модель не смогла с первого раза создать полностью рабочий инструмент. Скорее всего, с уточняющими промптами задача была бы решена, но это хороший пример того, насколько reasoning может повлиять на результат.
Да, модель способна управлять coding-агентами
Один из главных вопросов о локальных моделях — хватает ли им мощности для полноценной работы в цикле coding-агента. Такие агенты требуют длинного контекста, качественной генерации кода и надёжного вызова инструментов. На бумаге у Qwen 3.8 27B есть всё три составляющие — стоило проверить это на практике.
Первые эксперименты с Pi оказались весьма многообещающими. Pi выбрали из-за более короткого системного промпта по сравнению с большинством альтернатив — это удобнее для тестирования моделей меньшего размера.
Pi настроили на использование Qwen 3.8 27B, запущенной в LM Studio на Spark (доступ через tailscale serve), добавив в ~/.pi/agent/models.json следующее:
{
"providers": {
"spark": {
"baseUrl": "https://spark-18b3.tail68a31.ts.net/v1",
"api": "openai-responses",
"apiKey": "dummy",
"models": [
{
"id": "qwen3.8-27b",
"reasoning": true
}
]
}
}
}Затем запустили pi --provider spark --model qwen3.8-27b в папке ~/dev/datasette и задали вопрос:
how does auth work?
После серии рассуждений и вызовов инструментов, обращавшихся к разным файлам проекта, модель выдала весьма достойный ответ.
Возникла лишь одна сложность: захотелось поделиться этим транскриптом. Тогда Pi и Qwen 3.8 27B направили на JSONL-файл транскрипта в ~/.pi/agent/sessions/--Users-simon-Dropbox-dev-datasette-- с запросом:
Write Python code to convert this jsonl to markdown
В результате был создан и протестирован скрипт pi_jsonl_to_md.py, который выполнил задачу в точности как требовалось. Вот транскрипт той сессии, опубликованный с помощью только что созданного инструмента.
В погоне за скоростью
Пока всё выглядит очень многообещающе. Есть модель весом 17 ГБ, которая работает на высокопроизводительном потребительском железе, умеет писать код, управлять инструментами, размечать изображения и в целом справляется со всем, что нужно от LLM для реальной работы.
Но есть один существенный нюанс: модель ощущается медленной — особенно когда начинает переусложнять рассуждения, но и без этого проворности ей не хватает.
Скорость в LM Studio составляла примерно 15-30 токенов в секунду. Не ужасно, но достаточно медленно, чтобы было сложно предпочесть эту модель хостед-API-моделям, которые выдают результат гораздо быстрее. Artificial Analysis отслеживает скорость генерации токенов и показывает, что OpenAI 5.6 Sol выдаёт 74 токена/сек, а 5.6 Luna — впечатляющие 184 токена/сек.
Хорошая новость в том, что сообщество уже ищет способы ускорения — модель вышла всего два дня назад.
Одна из самых перспективных оптимизаций встроена в саму модель. Qwen поддерживает Multi-Token Prediction — архитектурный приём, при котором более дешёвый механизм заранее угадывает несколько токенов вперёд, а основная модель быстро проверяет правильность догадок. Это может заметно повысить производительность инференса.
Опираясь на твит создателя llama.cpp Георгия Герганова, модель запустили с MTP на Spark таким образом:
llama serve \ -hf ggml-org/Qwen3.8-27B-GGUF:Q4_K_M \ -hfd ggml-org/Qwen3.8-27B-GGUF:Q4_0 \ --spec-default \ --spec-type draft-mtp \ --reasoning-preserve
И действительно, это дало заметный прирост скорости. GPT-5.6 в Codex прогнала сравнительный бенчмарк на Spark, и сервер с флагом --spec-type draft-mtp обошёл стандартную сборку GGUF из LM Studio примерно на 72%.
В ближайшие недели стоит ожидать ещё больше нововведений в области ускорения обслуживания этой модели. Сообщество MLX, вероятно, тоже готовит свои приёмы.
Наблюдения
То, что файл весом 17 ГБ способен на всё это на домашних машинах — настоящее чудо. Прогресс локальных моделей за этот год впечатляет и радует снова и снова. Год назад подобные результаты были бы конкурентоспособны с лучшими и самыми дорогими проприетарными моделями — сегодня это работает на обычном ноутбуке.
Единственное, что мешает сделать эту модель основным рабочим инструментом на каждый день, — производительность. Она ощущается довольно медленной как на M5 Mac, так и на DGX Spark. Это особенность плотных (не Mixture-of-Experts) моделей — им требуется огромная пропускная способность памяти для хорошей работы, а обе доступные машины не являются лидерами именно в этом показателе.
Самое важное в Qwen 3.8 27B — то, что она демонстрирует. Модель с открытыми весами общего назначения, с длинным контекстом, эффективным вызовом инструментов, сильными возможностями компьютерного зрения и достойной генерацией кода — и всё это помещается в файл размером всего 17 ГБ.
Модели такого размера продолжают улучшаться впечатляющими темпами. Уже не нужно тратить полмиллиона долларов на оборудование дата-центрового класса, чтобы получить достойную модель.