Репозиторий содержит веса модели и файлы конфигурации для дообученной версии в формате Hugging Face Transformers.
Артефакты совместимы с vLLM, SGLang, TokenSpeed и другими фреймворками.
Для тех, кому нужен управляемый масштабируемый инференс без обслуживания инфраструктуры, доступен официальный API-сервис Qwen Cloud.
В частности, Qwen3.8-Max — официальная версия на основе Qwen3.8-2.4T-A95B с дополнительными возможностями: поддержкой визуального ввода и режима без «размышления», контекстом в 1 млн токенов по умолчанию, встроенными инструментами и другими функциями. Подробности — в обзоре Qwen3.8-Max.
После широкого признания серий Qwen3.5 и Qwen3.6 в сообществе команда Qwen представила Qwen3.8 — самую производительную модель в открытом семействе Qwen на сегодняшний день.
Qwen3.8 впервые доводит модель уровня Qwen-Max до открытого релиза. Построенная на архитектурной основе Qwen3.5, она демонстрирует существенный прирост в кодинге, профессиональных задачах, исследовательской работе и долгих агентных сценариях. Помимо более точных ответов на сложные вопросы, модель рассчитана на надёжное доведение до конца комплексных многошаговых задач.
Ключевые особенности Qwen3.8
Qwen3.8 получила следующие улучшения:
- Базовые возможности: комплексный прирост в кодинге, профессиональной работе, исследованиях и долгих агентных задачах.
- Выполнение агентных задач: более уверенное автономное планирование и обработка обратной связи от среды, что повышает надёжность выполнения задач от начала до конца.
- Совместимость с внешними инструментами: расширена поддержка популярных harness-фреймворков и средств разработки, что упрощает интеграцию в существующий стек.
- Гибкое управление «размышлением»: глубина рассуждений настраивается параметром
reasoning_effort, а контекст рассуждений из предыдущих сообщений сохраняется черезpreserve_thinking.
Подробности — в блог-посте Qwen3.8-Max.
Обзор модели
- Тип: каузальная языковая модель
- Этап обучения: предобучение и дообучение
- Языковая модель
- Количество параметров: 2,4 трлн всего, 95 млрд активных
- Размерность скрытого состояния: 8192
- Токен-эмбеддинги: 248 320 (с паддингом)
- Число слоёв: 92
- Структура слоёв: 23 × (3 × (Gated DeltaNet → MoE) → 1 × (Gated Attention → MoE))
- Gated DeltaNet:
- Число голов линейного внимания: 128 для V и 16 для QK
- Размерность головы: 128
- Gated Attention:
- Число голов внимания: 64 для Q и 4 для KV
- Размерность головы: 256
- Размерность вращающихся позиционных эмбеддингов (RoPE): 64
- Mixture of Experts:
- Число экспертов: 512
- Число активных экспертов: 10 маршрутизируемых + 1 общий
- Промежуточная размерность эксперта: 2048
- Выход LM: 248 320 (с паддингом)
- MTP (Multi-Token Prediction): обучение с несколькими шагами предсказания
- Длина контекста: 262 144 токена нативно, расширяемая до 1 010 000 токенов.
Результаты бенчмарков
| Opus 4.8 | Fable 5 | GPT 5.6 Sol (max) | Qwen3.7-Max | Qwen3.8-Max | |
|---|---|---|---|---|---|
| Кодинг-агент | |||||
| Terminal Bench 2.1 | 84.6 | 84.6 | 88.8 | 74.5 | 86.6 |
| SWE-bench Pro | 69.2 | 80.0 | 64.6 | 60.6 | 67.7 |
| DeepSWE 1.1 | 59.0 | 70.0 | 73.0 | 21.6 | 56.6 |
| NL2Repo-Bench | 69.4 | -- | -- | 47.2 | 55.9 |
| FrontierSWE | 70.0 | 88.8 | -- | 40.7 | 73.5 |
| MLS-Bench-Lite | 42.8 | 49.9 | 46.2 | 31.7 | 41.0 |
| PaperBench | 80.3 | 88.8 | 90.5 | 64.8 | 93.0 |
| AndroidBench | 69.8 | 84.5 | 74.0 | 56.5 | 75.1 |
| QwenSWEBench | 84.0 | 86.3 | 73.5 | 63.4 | 80.7 |
| QwenQoderBench | 62.7 | 63.1 | 53.8 | 36.8 | 58.4 |
| QwenReactBench | 1694 | 1770 | 1564 | 1538 | 1724 |
| QwenSVGBench | 1648 | 1690 | 1758 | 1499 | 1713 |
| Универсальный агент | |||||
| CoWorkBench | 72.3 | 75.9 | 71.5 | 64.6 | 74.8 |
| WorkSpaceBench | 66.8 | 68.7 | 65.6 | 61.4 | 67.7 |
| JobBench | 48.4 | 57.4 | 45.4 | 31.3 | 53.4 |
| SkillsBench | 65.1 | 70.9 | 73.5 | 61.2 | 70.2 |
| Agents' Last Exam (Pass / Score) | 27.0 / 45.1 | -- / -- | 30.6 / 53.6 | 11.8 / 31.1 | 27.0 / 52.4 |
| Automation-Bench (Pass@1) | 27.2 | 29.1 | 29.7 | 14.2 | 27.3 |
| Toolathlon Verified (Pass@1) | 76.2 | 77.9 | 74.9 | 49.7 | 72.5 |
| WideSearch | 72.9 | 81.2 | -- | 75.2 | 81.9 |
| HLE w/ tools | 57.9 | 64.5 | 58.0 | 53.5 | 56.2 |
| Общие возможности | |||||
| GPQA Diamond | 92.0 | 92.6 | 94.1 | 92.4 | 92.6 |
| HLE | 45.7 | 53.3 | 47.2 | 41.4 | 43.6 |
| IFBench | 62.2 | 63.5 | 72.7 | 79.1 | 82.8 |
| $OneMillion-Bench (expert score) | 41.8 | 55.9 | 53.8 | 44.4 | 52.5 |
| HealthBench | 52.4 | -- | 55.3 | 54.5 | 60.2 |
| PLawBench | 69.6 | 70.2 | 72.3 | 58.9 | 73.2 |
| PRBench-Legal | 52.7 | 57.6 | 57.6 | 48.5 | 57.6 |
| PRBench-Finance | 51.9 | 55.8 | 55.5 | 46.8 | 58.3 |
| MRCR v2 256K (8-needle) | 83.2 | -- | 93.8 | 86.7 | 92.9 |
| LongBench v2 | 69.1 | -- | 67.1 | 65.3 | 66.3 |
1. Результаты Fable5 могут включать fallback-случаи.
2. Terminal Bench 2.1: оценка с Claude Code (avg@10), таймаут 5 часов, max_tokens=131 072. Для остальных моделей приведены лучшие опубликованные результаты по разным harness: Claude Opus 4.8 и Claude Fable 5 с Terminus 2 от Artificial Analysis (https://artificialanalysis.ai/evaluations/terminalbench-v2-1); GPT-5.6 Sol с Codex (https://openai.com/index/previewing-gpt-5-6-sol/).
3. SWE-bench Pro: оценка через Claude Code harness, temp=1.0, top_p=0.95, контекст 256K. Проблемные задачи исправлены, все базовые модели оценены на уточнённом бенчмарке.
4. DeepSWE 1.1: оценка через Claude Code и mini-SWE-agent harness, temp=1.0, top_p=0.95, контекст 256K. Указан лучший результат среди двух harness; Qwen3.8-Max показывает лучший результат на Claude Code.
5. NL2Repo-Bench: оценка через Claude Code harness. Чтобы избежать «взлома» вознаграждения, отключены Bash-команды доступа к конкретному репозиторию, такие как pip download, pip install и git clone.
6. FrontierSWE: оценка через Claude Code harness. Остальные доступные результаты MEAN@5 взяты с официального лидерборда FrontierSWE (https://www.frontierswe.com) по состоянию на 3 августа 2026 года. Dominance-оценки пересчитаны из исходных баллов по официальному скрипту оценки. «--» означает отсутствие официального результата MEAN@5 на указанную дату.
7. MLS-Bench-Lite: оценка с Claude Code, таймаут 5 часов, max_tokens=131 072. Остальные результаты взяты с официального лидерборда.
8. PaperBench: оценка в режиме BasicAgent под Code-Dev, судья — Claude Opus 4.6, усреднение по 3 прогонам (до 12 часов каждый).
9. AndroidBench: оценка на публичном подмножестве из 95 задач, приведены значения avg@3.
10. QwenSWEBench: внутренний бенчмарк по software engineering. Оценка через Claude Code harness. avg@3, таймаут 8 часов, max_tokens=32 768, temperature=1.0, контекст 256K токенов.
11. QwenQoderBench: внутренний бенчмарк для оценки пользовательского опыта в Qoder. Оценка через Claude Code harness. avg@5, таймаут 6 часов, max_tokens=32 768, temperature=1.0, контекст 256K токенов.
12. QwenReactBench: внутренний бенчмарк по сборке React-проектов через Claude Code harness, билингвальный (EN/CN), 7 категорий; авто-рендер + мультимодальный судья; рейтинг BT/Elo.
13. QwenSVGBench: внутренний бенчмарк генерации SVG-кода; билингвальный (EN/CN), авто-рендер + мультимодальный судья; рейтинг BT/Elo.
14. CoWorkBench: внутренний бенчмарк для оценки долгих задач в информатике, финансах, праве, медицине и других прикладных областях.
15. SkillsBench: оценка на публичном бенчмарке SkillsBench v1.1, 87 задач, усреднение по трём прогонам на задачу. Opus 4.8 и Fable 5 оцениваются на Claude Code; GPT-5.6 Sol — на Codex; серия Qwen — на OpenCode. Все результаты получены собственным тестированием.
16. Automation-Bench: оценка на публичном подмножестве из 600 задач.
17. WideSearch: оценка через Claude Code harness для внешних моделей и Qwen-Agent harness для собственных, усреднение item-F1 по четырём прогонам.
18. $OneMillion-Bench: оценка с использованием gemini-3.1-pro-preview.
19. PLawBench: оценка с использованием gemini-3.1-pro-preview.
20. Пустые ячейки («--»): результаты пока недоступны или неприменимы.
Быстрый старт
Для упрощённой интеграции рекомендуется использовать Qwen3.8 через API.
Развёртывание Qwen3.8
Эффективность и пропускная способность инференса заметно различаются между фреймворками. Рекомендуется использовать последние версии фреймворков для оптимальной производительности и совместимости. Для промышленных нагрузок или сценариев с высокой пропускной способностью рекомендуются специализированные движки инференса, такие как SGLang, vLLM или TokenSpeed.
Qwen3.8 можно развернуть с популярными фреймворками для инференса, например:
Использование API
Qwen3.8-2.4T-A95B — текстовая модель, для которой режим «размышления» обязателен во всех взаимодействиях. Мультимодальный ввод не поддерживается, а отключить «размышление» нельзя. Каждый ответ автоматически начинается с рассуждений, заключённых в
<think>\n...</think>\n\n, перед итоговым выводом.
Рекомендуемый набор параметров сэмплирования для генерации:
temperature=1.0, top_p=0.95, top_k=20, min_p=0.0, presence_penalty=0.0, repetition_penalty=1.0Обратите внимание, что поддержка параметров сэмплирования зависит от используемого фреймворка инференса.
Qwen3.8 официально поддерживает параметр reasoning_effort, позволяющий регулировать глубину рассуждений и контролировать затраты:
xhigh(по умолчанию): для сложных задач, требующих тщательного анализаmedium: баланс между точностью и скоростьюlow: эффективные рассуждения с оптимизацией по скорости и стоимости
Кроме того, параметр preserve_thinking по умолчанию включён для всех нагрузок ради лучшего пользовательского опыта из коробки.
Chat Completions API
Chat Completions API можно использовать с большинством фреймворков инференса, а также с Qwen Cloud. Перед началом работы убедитесь, что установлен Python SDK от OpenAI, а также настроены API-ключ и базовый URL API, например:
pip install -U openai
# Set the following accordingly
export OPENAI_BASE_URL='your-base-url'
export OPENAI_API_KEY='your-api-key'
Только текстовый ввод
from openai import OpenAI
# Configured by environment variables
client = OpenAI()
messages = [{"role": "user", "content": "Write a Python function to merge two sorted linked lists."}]
completion = client.chat.completions.create(
model="Qwen/Qwen3.8-2.4T-A95B",
messages=messages,
extra_body={
"chat_template_kwargs": {
"enable_thinking": True, # on by default; should not be turned off
"preserve_thinking": True, # on by default
},
},
reasoning_effort="xhigh", # xhigh by default; supported levels are xhigh, medium, and low
stream=True,
stream_options={"include_usage": True},
)
reasoning_content = ""
answer_content = ""
is_answering = False
print("\n" + "=" * 20 + "Reasoning" + "=" * 20 + "\n")
for chunk in completion:
if not chunk.choices:
print("\nUsage:")
print(chunk.usage)
continue
delta = chunk.choices[0].delta
if hasattr(delta, "reasoning_content") and delta.reasoning_content is not None:
if not is_answering:
print(delta.reasoning_content, end="", flush=True)
reasoning_content += delta.reasoning_content
if hasattr(delta, "content") and delta.content:
if not is_answering:
print("\n" + "=" * 20 + "Answer" + "=" * 20 + "\n")
is_answering = True
print(delta.content, end="", flush=True)
answer_content += delta.content
При использовании API от Qwen Cloud, помимо изменения
model, следует передаватьextra_body={"enable_thinking": True, "preserve_thinking": True}вместоextra_body={"chat_template_kwargs": {"enable_thinking": True, "preserve_thinking": True}}.
Рекомендации по эксплуатации
Для достижения оптимальной производительности рекомендуются следующие настройки:
Параметры сэмплирования:
- Рекомендуемый набор параметров сэмплирования:
temperature=1.0,top_p=0.95,top_k=20,min_p=0.0,presence_penalty=0.0,repetition_penalty=1.0
- В поддерживаемых фреймворках параметр
presence_penaltyможно настраивать в диапазоне от 0 до 2, чтобы снизить бесконечные повторы. Однако более высокое значение может иногда приводить к смешению языков и небольшому снижению качества модели.
- Рекомендуемый набор параметров сэмплирования:
Достаточная длина вывода: для оптимальной работы в агентных задачах рекомендуется выделять достаточную длину вывода, чтобы модель могла генерировать подробные и исчерпывающие ответы. Для фреймворков, поддерживающих раздельные лимиты токенов для внутренних рассуждений и итогового вывода, в рамках контекста в 1 млн токенов рекомендуется следующая конфигурация:
- Содержимое рассуждений: максимальная длина вывода — 262 144 токена.
- Итоговый ответ: максимальная длина вывода — 131 072 токена.
Эти настройки обеспечивают необходимый запас для сложных рассуждений при достаточном пространстве для качественного итогового результата.
Цитирование
При использовании этой работы можно сослаться на неё следующим образом.
@misc{qwen38,
title = {{Qwen3.8-Max}: A New Bar for Coding and Cowork},
url = {https://qwen.ai/blog?id=qwen3.8},
author = {{Qwen Team}},
month = {August},
year = {2026}
}