Qwen Studio

Репозиторий содержит веса модели и файлы конфигурации для дообученной версии в формате Hugging Face Transformers.

Артефакты совместимы с vLLM, SGLang, TokenSpeed и другими фреймворками.

Для тех, кому нужен управляемый масштабируемый инференс без обслуживания инфраструктуры, доступен официальный API-сервис Qwen Cloud.

В частности, Qwen3.8-Max — официальная версия на основе Qwen3.8-2.4T-A95B с дополнительными возможностями: поддержкой визуального ввода и режима без «размышления», контекстом в 1 млн токенов по умолчанию, встроенными инструментами и другими функциями. Подробности — в обзоре Qwen3.8-Max.

После широкого признания серий Qwen3.5 и Qwen3.6 в сообществе команда Qwen представила Qwen3.8 — самую производительную модель в открытом семействе Qwen на сегодняшний день.

Qwen3.8 впервые доводит модель уровня Qwen-Max до открытого релиза. Построенная на архитектурной основе Qwen3.5, она демонстрирует существенный прирост в кодинге, профессиональных задачах, исследовательской работе и долгих агентных сценариях. Помимо более точных ответов на сложные вопросы, модель рассчитана на надёжное доведение до конца комплексных многошаговых задач.

Ключевые особенности Qwen3.8

Qwen3.8 получила следующие улучшения:

  • Базовые возможности: комплексный прирост в кодинге, профессиональной работе, исследованиях и долгих агентных задачах.
  • Выполнение агентных задач: более уверенное автономное планирование и обработка обратной связи от среды, что повышает надёжность выполнения задач от начала до конца.
  • Совместимость с внешними инструментами: расширена поддержка популярных harness-фреймворков и средств разработки, что упрощает интеграцию в существующий стек.
  • Гибкое управление «размышлением»: глубина рассуждений настраивается параметром reasoning_effort, а контекст рассуждений из предыдущих сообщений сохраняется через preserve_thinking.

Подробности — в блог-посте Qwen3.8-Max.

Обзор модели

  • Тип: каузальная языковая модель
  • Этап обучения: предобучение и дообучение
  • Языковая модель
    • Количество параметров: 2,4 трлн всего, 95 млрд активных
    • Размерность скрытого состояния: 8192
    • Токен-эмбеддинги: 248 320 (с паддингом)
    • Число слоёв: 92
    • Структура слоёв: 23 × (3 × (Gated DeltaNet → MoE) → 1 × (Gated Attention → MoE))
    • Gated DeltaNet:
      • Число голов линейного внимания: 128 для V и 16 для QK
      • Размерность головы: 128
    • Gated Attention:
      • Число голов внимания: 64 для Q и 4 для KV
      • Размерность головы: 256
      • Размерность вращающихся позиционных эмбеддингов (RoPE): 64
    • Mixture of Experts:
      • Число экспертов: 512
      • Число активных экспертов: 10 маршрутизируемых + 1 общий
      • Промежуточная размерность эксперта: 2048
    • Выход LM: 248 320 (с паддингом)
    • MTP (Multi-Token Prediction): обучение с несколькими шагами предсказания
  • Длина контекста: 262 144 токена нативно, расширяемая до 1 010 000 токенов.

Результаты бенчмарков

Opus 4.8Fable 5GPT 5.6 Sol (max)Qwen3.7-MaxQwen3.8-Max
Кодинг-агент
Terminal Bench 2.184.684.688.874.586.6
SWE-bench Pro69.280.064.660.667.7
DeepSWE 1.159.070.073.021.656.6
NL2Repo-Bench69.4----47.255.9
FrontierSWE70.088.8--40.773.5
MLS-Bench-Lite42.849.946.231.741.0
PaperBench80.388.890.564.893.0
AndroidBench69.884.574.056.575.1
QwenSWEBench84.086.373.563.480.7
QwenQoderBench62.763.153.836.858.4
QwenReactBench16941770156415381724
QwenSVGBench16481690175814991713
Универсальный агент
CoWorkBench72.375.971.564.674.8
WorkSpaceBench66.868.765.661.467.7
JobBench48.457.445.431.353.4
SkillsBench65.170.973.561.270.2
Agents' Last Exam (Pass / Score)27.0 / 45.1-- / --30.6 / 53.611.8 / 31.127.0 / 52.4
Automation-Bench (Pass@1)27.229.129.714.227.3
Toolathlon Verified (Pass@1)76.277.974.949.772.5
WideSearch72.981.2--75.281.9
HLE w/ tools57.964.558.053.556.2
Общие возможности
GPQA Diamond92.092.694.192.492.6
HLE45.753.347.241.443.6
IFBench62.263.572.779.182.8
$OneMillion-Bench (expert score)41.855.953.844.452.5
HealthBench52.4--55.354.560.2
PLawBench69.670.272.358.973.2
PRBench-Legal52.757.657.648.557.6
PRBench-Finance51.955.855.546.858.3
MRCR v2 256K (8-needle)83.2--93.886.792.9
LongBench v269.1--67.165.366.3

1. Результаты Fable5 могут включать fallback-случаи.
2. Terminal Bench 2.1: оценка с Claude Code (avg@10), таймаут 5 часов, max_tokens=131 072. Для остальных моделей приведены лучшие опубликованные результаты по разным harness: Claude Opus 4.8 и Claude Fable 5 с Terminus 2 от Artificial Analysis (https://artificialanalysis.ai/evaluations/terminalbench-v2-1); GPT-5.6 Sol с Codex (https://openai.com/index/previewing-gpt-5-6-sol/).
3. SWE-bench Pro: оценка через Claude Code harness, temp=1.0, top_p=0.95, контекст 256K. Проблемные задачи исправлены, все базовые модели оценены на уточнённом бенчмарке.
4. DeepSWE 1.1: оценка через Claude Code и mini-SWE-agent harness, temp=1.0, top_p=0.95, контекст 256K. Указан лучший результат среди двух harness; Qwen3.8-Max показывает лучший результат на Claude Code.
5. NL2Repo-Bench: оценка через Claude Code harness. Чтобы избежать «взлома» вознаграждения, отключены Bash-команды доступа к конкретному репозиторию, такие как pip download, pip install и git clone.
6. FrontierSWE: оценка через Claude Code harness. Остальные доступные результаты MEAN@5 взяты с официального лидерборда FrontierSWE (https://www.frontierswe.com) по состоянию на 3 августа 2026 года. Dominance-оценки пересчитаны из исходных баллов по официальному скрипту оценки. «--» означает отсутствие официального результата MEAN@5 на указанную дату.
7. MLS-Bench-Lite: оценка с Claude Code, таймаут 5 часов, max_tokens=131 072. Остальные результаты взяты с официального лидерборда.
8. PaperBench: оценка в режиме BasicAgent под Code-Dev, судья — Claude Opus 4.6, усреднение по 3 прогонам (до 12 часов каждый).
9. AndroidBench: оценка на публичном подмножестве из 95 задач, приведены значения avg@3.
10. QwenSWEBench: внутренний бенчмарк по software engineering. Оценка через Claude Code harness. avg@3, таймаут 8 часов, max_tokens=32 768, temperature=1.0, контекст 256K токенов.
11. QwenQoderBench: внутренний бенчмарк для оценки пользовательского опыта в Qoder. Оценка через Claude Code harness. avg@5, таймаут 6 часов, max_tokens=32 768, temperature=1.0, контекст 256K токенов.
12. QwenReactBench: внутренний бенчмарк по сборке React-проектов через Claude Code harness, билингвальный (EN/CN), 7 категорий; авто-рендер + мультимодальный судья; рейтинг BT/Elo.
13. QwenSVGBench: внутренний бенчмарк генерации SVG-кода; билингвальный (EN/CN), авто-рендер + мультимодальный судья; рейтинг BT/Elo.
14. CoWorkBench: внутренний бенчмарк для оценки долгих задач в информатике, финансах, праве, медицине и других прикладных областях.
15. SkillsBench: оценка на публичном бенчмарке SkillsBench v1.1, 87 задач, усреднение по трём прогонам на задачу. Opus 4.8 и Fable 5 оцениваются на Claude Code; GPT-5.6 Sol — на Codex; серия Qwen — на OpenCode. Все результаты получены собственным тестированием.
16. Automation-Bench: оценка на публичном подмножестве из 600 задач.
17. WideSearch: оценка через Claude Code harness для внешних моделей и Qwen-Agent harness для собственных, усреднение item-F1 по четырём прогонам.
18. $OneMillion-Bench: оценка с использованием gemini-3.1-pro-preview.
19. PLawBench: оценка с использованием gemini-3.1-pro-preview.
20. Пустые ячейки («--»): результаты пока недоступны или неприменимы.

Быстрый старт

Для упрощённой интеграции рекомендуется использовать Qwen3.8 через API.

Развёртывание Qwen3.8

Эффективность и пропускная способность инференса заметно различаются между фреймворками. Рекомендуется использовать последние версии фреймворков для оптимальной производительности и совместимости. Для промышленных нагрузок или сценариев с высокой пропускной способностью рекомендуются специализированные движки инференса, такие как SGLang, vLLM или TokenSpeed.

Qwen3.8 можно развернуть с популярными фреймворками для инференса, например:

Использование API

Qwen3.8-2.4T-A95B — текстовая модель, для которой режим «размышления» обязателен во всех взаимодействиях. Мультимодальный ввод не поддерживается, а отключить «размышление» нельзя. Каждый ответ автоматически начинается с рассуждений, заключённых в <think>\n...</think>\n\n, перед итоговым выводом.

Рекомендуемый набор параметров сэмплирования для генерации:

  • temperature=1.0, top_p=0.95, top_k=20, min_p=0.0, presence_penalty=0.0, repetition_penalty=1.0

Обратите внимание, что поддержка параметров сэмплирования зависит от используемого фреймворка инференса.

Qwen3.8 официально поддерживает параметр reasoning_effort, позволяющий регулировать глубину рассуждений и контролировать затраты:

  • xhigh (по умолчанию): для сложных задач, требующих тщательного анализа
  • medium: баланс между точностью и скоростью
  • low: эффективные рассуждения с оптимизацией по скорости и стоимости

Кроме того, параметр preserve_thinking по умолчанию включён для всех нагрузок ради лучшего пользовательского опыта из коробки.

Chat Completions API

Chat Completions API можно использовать с большинством фреймворков инференса, а также с Qwen Cloud. Перед началом работы убедитесь, что установлен Python SDK от OpenAI, а также настроены API-ключ и базовый URL API, например:

pip install -U openai

# Set the following accordingly
export OPENAI_BASE_URL='your-base-url'
export OPENAI_API_KEY='your-api-key'
Только текстовый ввод
from openai import OpenAI
# Configured by environment variables
client = OpenAI()

messages = [{"role": "user", "content": "Write a Python function to merge two sorted linked lists."}]

completion = client.chat.completions.create(
    model="Qwen/Qwen3.8-2.4T-A95B",
    messages=messages,
    extra_body={
        "chat_template_kwargs": {
            "enable_thinking": True,  # on by default; should not be turned off
            "preserve_thinking": True, # on by default
        },
    },
    reasoning_effort="xhigh",  # xhigh by default; supported levels are xhigh, medium, and low
    stream=True,
    stream_options={"include_usage": True},
)

reasoning_content = ""
answer_content = ""
is_answering = False
print("\n" + "=" * 20 + "Reasoning" + "=" * 20 + "\n")

for chunk in completion:
    if not chunk.choices:
        print("\nUsage:")
        print(chunk.usage)
        continue

    delta = chunk.choices[0].delta

    if hasattr(delta, "reasoning_content") and delta.reasoning_content is not None:
        if not is_answering:
            print(delta.reasoning_content, end="", flush=True)
        reasoning_content += delta.reasoning_content

    if hasattr(delta, "content") and delta.content:
        if not is_answering:
            print("\n" + "=" * 20 + "Answer" + "=" * 20 + "\n")
            is_answering = True
        print(delta.content, end="", flush=True)
        answer_content += delta.content

При использовании API от Qwen Cloud, помимо изменения model, следует передавать extra_body={"enable_thinking": True, "preserve_thinking": True} вместо extra_body={"chat_template_kwargs": {"enable_thinking": True, "preserve_thinking": True}}.

Рекомендации по эксплуатации

Для достижения оптимальной производительности рекомендуются следующие настройки:

  1. Параметры сэмплирования:

    • Рекомендуемый набор параметров сэмплирования:
      • temperature=1.0, top_p=0.95, top_k=20, min_p=0.0, presence_penalty=0.0, repetition_penalty=1.0
    • В поддерживаемых фреймворках параметр presence_penalty можно настраивать в диапазоне от 0 до 2, чтобы снизить бесконечные повторы. Однако более высокое значение может иногда приводить к смешению языков и небольшому снижению качества модели.
  2. Достаточная длина вывода: для оптимальной работы в агентных задачах рекомендуется выделять достаточную длину вывода, чтобы модель могла генерировать подробные и исчерпывающие ответы. Для фреймворков, поддерживающих раздельные лимиты токенов для внутренних рассуждений и итогового вывода, в рамках контекста в 1 млн токенов рекомендуется следующая конфигурация:

    • Содержимое рассуждений: максимальная длина вывода — 262 144 токена.
    • Итоговый ответ: максимальная длина вывода — 131 072 токена.

    Эти настройки обеспечивают необходимый запас для сложных рассуждений при достаточном пространстве для качественного итогового результата.

Цитирование

При использовании этой работы можно сослаться на неё следующим образом.

@misc{qwen38,
    title = {{Qwen3.8-Max}: A New Bar for Coding and Cowork},
    url = {https://qwen.ai/blog?id=qwen3.8},
    author = {{Qwen Team}},
    month = {August},
    year = {2026}
}