Последние 10 дней Qwen3.8 27B тихо работала на Mac Studio в роли фонового ассистента: собирала утренний дайджест из RSS-лент, переименовывала и раскладывала по папкам отсканированные PDF, делала любые задачи на суммаризацию. Рутина — и именно поэтому эта модель стала первой локальной LLM, которой можно доверить рутину без присмотра.

На прошлой неделе модель внезапно оказалась во всех лентах r/LocalLLaMA, появилось множество бенчмарк-графиков — но не хватало главного: машины, способной запустить модель по-настоящему, и замеров производительности на ней.

macmon на Mac Studio M3 Ultra во время генерации: GPU загружен на 100% и потребляет 64Вт, CPU — 6Вт

Тест провели полноценно: пять замеров времени на модель, одинаковые промпты, одна и та же машина, плюс эксперимент с 1-битным квантованием, который дважды удивил. Ниже — все измерения и что они значат для железа, на котором эту модель можно запустить самостоятельно.

Коротко

  • Qwen3.8 27B (Q4_K_M, 17 ГБ) генерирует текст со скоростью ~14 токенов/с на Mac Studio M3 Ultra через Ollama. Предшественник qwen3.6:27b выдаёт ~28.6 токенов/с на той же машине.
  • При этом ответы на те же промпты умещаются примерно в треть токенов, поэтому по реальному времени на готовый ответ разница почти нивелируется.
  • 1-битный квант (6.7 ГБ) работает со скоростью 27 токенов/с в llama.cpp и правильно помнит факты, но не может довести ответ до финальной точки.
  • Нужен llama.cpp свежей сборки — за последние пару недель. Старые версии падают с ошибкой unknown model architecture: 'qwen35'. Столкнулись с этим лично.
  • 32 ГБ ОЗУ комфортно тянут Q4. 16 ГБ хватает на Q2. Таблица ниже даёт цифры по каждому кванту.

Так что такое Qwen3.8 27B?

Qwen3.8-27B — плотная модель на 27,3 млрд параметров с гибридной архитектурой внимания (в GGUF архитектура помечена тегом qwen35, это важно, речь об этом ещё зайдёт). Модель мультимодальна: встроено понимание изображений и видео, поддерживает нативное контекстное окно на 262 144 токена, распространяется по лицензии Apache 2.0. Официальная карточка модели заявляет 61,7 на SWE-bench Pro и 89,2 на GPQA Diamond — год назад такие цифры были уделом ведущих лабораторий.

Реакция сообщества, впрочем, прошла мимо таблицы с бенчмарками. Обсуждение разгорелось вокруг того, что люди успели сделать с моделью за первую неделю: одна команда встроила её в свой конвейер написания кода вместо платной API-модели и заявила, что она справляется не хуже, а тестировщики OCR утверждали, что качество распознавания выше некоторых коммерческих облачных решений. Запомнилась фраза из самого популярного треда: «это первая локальная модель, которая ощущается как нечто большее, чем игрушка».

Главный вклад в эту картину — измерение, которого не хватало большинству графиков: что модель реально делает на доступном сегодня железе Apple.

Цифры: 3.8 против 3.6 на одной и той же машине

Основная рабочая машина — Mac Studio M3 Ultra с 256 ГБ единой памяти, тот же аппарат, что использовался для гайда по DeepSeek V4 Flash. Для каждой модели сделали пять замеров через ollama run --verbose, разные технические промпты, ответы по 200-500 слов, статистику усреднили. Обе модели — стандартный квант Ollama Q4_K_M, обе занимают почти ровно 17 ГБ на диске.

Два терминальных окна рядом: qwen3.6 27B на 28 токенов/с и qwen3.8 27B на 13 токенов/с

qwen3.6:27bqwen3.8:27b
Скорость генерации (среднее по 5 запускам)28.6 ток/с14.0 ток/с
Обработка промпта95.0 ток/с93.1 ток/с
Разброс между запусками28.5-28.8 (стабильно)13.2-15.4
Токенов на ответ1 950-3 340890-1 090

Главная цифра сразу: новая модель генерирует текст вдвое медленнее предшественника. Тот же объём параметров, тот же размер кванта, та же машина. Гибридная архитектура внимания новая, и Metal-ядра в Ollama явно ещё не подстроились под неё. Разрыв, вероятно, сократится по мере созревания движков — то же самое уже случалось с другими новыми архитектурами.

Впрочем, времени это не отняло. Qwen3.8 отвечала на те же промпты примерно 1000 токенами, тогда как 3.6 растекалась мыслью на 2000-3300. Арифметика простая: 2058 токенов при 28.6 ток/с — это 72 секунды, 955 токенов при 14.2 ток/с — 67 секунд. Медленнее на токен, но быстрее на весь ответ.

Во время генерации процессор почти не нагружается, поскольку на кремнии Apple инференс идёт на GPU через Metal. Обложка этого материала — как раз тот момент, снятый утилитой macmon в разгар генерации: GPU загружен на 100%, потребляя 63,95 Вт, CPU потягивает всего 6 Вт, ответ при этом непрерывно генерируется.

Приложение Stats в строке меню рассказывает ту же историю со стороны GUI: все 60 ядер GPU на 100%, общее энергопотребление системы достигает 291 Вт:

Панель GPU в приложении Stats: Apple M3 Ultra, 60 ядер на 100% загрузки, потребление 291Вт во время генерации Qwen3.8

Эксперимент с 1-битным квантованием: измеренные повреждения «мозга»

Самый популярный тред недели про Qwen3.8 восхищался 1-битным квантом от Unsloth — файлом на 6,7 ГБ, который автор поста ласково назвал «квантом с повреждением мозга». 27-миллиардная модель в объёме памяти 7-миллиардной. Не попробовать было нельзя.

Модель запускается и работает быстро:

Результаты llama-bench для 1-битного кванта Qwen3.8 27B: 309 токенов/с обработка промпта, 27 токенов/с генерация

309 ток/с на обработку промпта, 27,2 ток/с на генерацию. Почти вдвое быстрее квантования Q4, при этом занимает менее 8 ГБ ОЗУ.

Дальше пошли вопросы к модели. С фактическими знаниями всё было честно хорошо: модель знала, что Канберра — столица Австралии, и правильно объяснила компромисс между Сиднеем и Мельбурном, который к этому привёл. Но на просьбу написать простую однострочную команду bash модель выдала рабочий вариант, а затем не смогла остановиться, сомневаясь в себе — потратила 400 токенов на перебор альтернатив, так и не зафиксировав итоговый ответ.

Это совпадает с тем, что говорит сам Unsloth: в документации по квантованию прямо указано, что 1-бит не годится для агентных задач и вызова инструментов, а тесты на расхождение показывают, что при 1-бите точность на длинных задачах рушится, тогда как общие знания сохраняются. Заявленный минимум для вызова инструментов — квант Q2_K_XL на 9,8 ГБ.

Вывод из этого опыта: 1-битный квант — забавный трюк, который преподаёт настоящий урок. Квантование не деградирует модель равномерно. Факты выживают, решительность гибнет. Если задача — «быстро отвечать на викторину на картофелине вместо процессора», это реально работает. Если задача агентная — доплатите лишние 3 ГБ за Q2.

Сколько ОЗУ нужно под каждый квант

Unsloth публикует полную лестницу GGUF-квантов, вот её практическая версия. Закладывайте размер файла плюс несколько гигабайт под контекст и визуальный проектор.

КвантРазмер файлаРеалистичный минимум ОЗУНа чём запускается
UD-IQ1_M (1-бит)6.7 ГБ16 ГБЛюбой современный мини-ПК
UD-Q2_K_XL9.8 ГБ16 ГБЛюбой современный мини-ПК
UD-Q4_K_XL / Q4_K_M16-17.6 ГБ32 ГБМини-ПК среднего уровня
UD-Q6_K22 ГБ32 ГБ (впритык) / 48 ГБКонфигурации с большим объёмом ОЗУ
Q8_029 ГБ48-64 ГБStrix Halo, единая память Mac
BF1654.7 ГБ96 ГБ+128 ГБ Strix Halo, Mac Studio

Для уровня 32 ГБ такие устройства, как GEEKOM A6 с Ryzen 7 6800H и 32 ГБ или GMKtec M6 Ultra с DDR5, справляются с квантом Q4 так же, как в описанных выше замерах, только медленнее: речь об однозначных числах токенов в секунду при инференсе на CPU вместо 14. Для фоновых задач вроде тех, что описаны выше, этого достаточно; для интерактивного чата темп будет испытывать терпение.

Мини-ПК GEEKOM A6 с Ryzen 7 6800H и 32 ГБ DDR5

Если нужна реальная скорость без покупки техники Apple, консенсус сообщества — платформа AMD Strix Halo. Проект strix-halo-guide измерил официальный квант Q4_K_M: 20,4 ток/с на генерации и 292 ток/с на обработке промпта на Ryzen AI Max+ 395, с приложенными исходными CSV-файлами. GMKtec EVO-X2 с 64 ГБ — доступная точка входа в эту платформу за $1 999, а конфигурации на 128 ГБ вроде BOSGAME M5 открывают доступ к строкам таблицы с Q8 и BF16, а заодно к куда более крупным моделям. Выбор платформы подробно разбирался в материале про лучшие мини-ПК для локальных LLM.

Мини-ПК GMKtec EVO-X2 с Ryzen AI Max+ 395 и 64 ГБ единой памяти

Мини-ПК BOSGAME M5 с Ryzen AI Max+ 395 и 128 ГБ LPDDR5X

Предупреждение о текущем рынке: цены на ОЗУ всё ещё завышены. Комплект DDR5 SODIMM на 64 ГБ сейчас стоит $750-870. Если мини-ПК покупается специально под локальные LLM, брать его сразу с нужным объёмом памяти сейчас выгоднее, чем апгрейдить позже — что противоречит всякой интуиции, накопленной за двадцать лет покупки компьютеров.

Комплект памяти Crucial 64 ГБ DDR5 SODIMM для ноутбуков, две планки по 32 ГБ

Владельцы дискретных GPU масштабируются иначе: по сообщениям сообщества, связка из двух RTX 3090 даёт около 60 ток/с, а RTX 5090 — 75-140 ток/с в зависимости от движка, при этом 16-гигабайтные карты справляются с квантами IQ4 с квантованным KV-кешем.

Как запустить (и подвох, который стоил 20 минут)

Ollama — самый короткий путь. Страница модели: ollama.com/library/qwen3.8:

# загружает стандартный Q4_K_M, 17 ГБ
ollama pull qwen3.8:27b

# --verbose выводит статистику токенов/с, показанную на скриншотах выше
# --think=false пропускает рассуждения-преамбулу для быстрых ответов
ollama run qwen3.8:27b --verbose --think=false "your prompt"

При запуске с флагом --verbose каждый ответ завершается блоком статистики, вот таким:

Блок статистики Ollama в режиме verbose для qwen3.8 27b на Mac Studio M3 Ultra с показателями eval rate и prompt eval rate

Потребуется Ollama версии 0.32.12 или новее — метаданные модели заявляют этот минимум.

Для llama.cpp есть подвох. Установленная через Homebrew версия llama.cpp была всего на пару недель устаревшей, но модель попросту отказалась загружаться:

llama_model_load: error loading model: unknown model architecture: 'qwen35'

Гибридной архитектуре нужны свежие ядра. Команда brew update && brew upgrade llama.cpp всё исправила, и то же требование по свежести касается любого фронтенда на базе llama.cpp (LM Studio, Jan, koboldcpp): если Qwen3.8 не грузится, сначала стоит обновить движок, и только потом искать другие причины.

# возьмите квант из репозитория Unsloth GGUF, затем:
llama-bench -m Qwen3.8-27B-UD-IQ1_M.gguf     # проверка скорости
llama-cli -m Qwen3.8-27B-UD-IQ1_M.gguf -p "your prompt" -st

Чем модель реально занимается целый день

Цифры бенчмарков не так важны, как то, чем модель занимается с момента загрузки: неброская фоновая работа, которая раньше либо не выполнялась вовсе, либо утекала в облачный API.

Утренний дайджест лент: задача launchd за ночь собирает непрочитанные материалы из RSS, а qwen3.8 сжимает их в одну сводку — читается за утренним кофе. Контекст на 262 тысячи токенов позволяет уместить недельную порцию лент в один промпт.

Раскладка сканов: бумажную почту сканируют, модель читает текст каждого PDF и переименовывает файл по схеме ГГГГ-ММ-поставщик-суть. Способность работать с изображениями означает, что модель справляется даже со сканами, которые ломают обычный OCR.

А когда форумный тред разрастается до 400 комментариев, его целиком вставляют модели на суммаризацию с указанием позиций участников. Исследование для этого материала породило несколько таких тредов — приятная закольцованность процесса.

Ни один из этих сценариев не зависит от токенов в секунду. Требования простые: модель, достаточно умная, чтобы не занести письмо от страховой в папку с меню на вынос, железо, которое уже есть под рукой, и данные, не покидающие дом. Это и есть настоящий аргумент в пользу локальных моделей в 2026 году — тот же, что звучал в материале про революцию самостоятельного хостинга: даже небольшие облачные зависимости стоит заменять.

Частые вопросы

Можно ли запустить Qwen3.8 27B на 16 ГБ ОЗУ? Да, при 1-битном или 2-битном квантовании (файлы 6,7-9,8 ГБ). 2-бит — наименьший квант, который Unsloth считает пригодным для вызова инструментов. Для качества уровня Q4 нужно 32 ГБ.

Она лучше Gemma 4? Это разные по устройству модели. Gemma 4 (26B-A4B) — разреженная MoE-модель, которая генерирует текст намного быстрее на том же железе (цифры есть в отдельном гайде по Gemma 4). Qwen3.8 27B — плотная модель, медленнее на токен, но сообщество сейчас ставит её заметно выше в задачах кодинга и агентной работы. Для фонового ассистента выбор — Qwen3.8; для интерактивного чата на скромном железе смысл в Gemma 4 сохраняется.

Почему модель медленнее qwen3.6 даже на этой машине? Гибридная архитектура внимания новая, и рантаймы (Ollama Metal, llama.cpp Vulkan/CUDA) ещё не полностью оптимизированы под неё. Ожидается, что разрыв сократится с обновлениями. Частичное утешение: модель тратит куда меньше токенов на ответ, поэтому по времени до готового ответа разница меньше, чем кажется по разнице в ток/с.

Работает ли распознавание изображений локально? Да. Сборка Ollama включает визуальный проектор (около 460 млн параметров), и ввод изображений работает из коробки. Поддержка понимания видео в локальных рантаймах пока нестабильна.

А что с Qwen3.8-Flash-Next? Веса этой модели вышли прямо во время подготовки материала: MoE на 180 млрд параметров, около 110 ГБ при Q4. Это совершенно другой класс железа: нужна единая память уровня 128 ГБ, а сегодня это либо аппарат на Strix Halo от $3 500, либо крупный Mac. Если заявления об «неожиданной пригодности для локального запуска» подтвердятся, тема заслуживает отдельного материала.

Источники