QwenCloud выпустила Qwen-Image-3.0-Pro — модель генерации изображений, ориентированную на плотную композицию, точную детализацию и работу с текстом внутри изображений. Модель доступна через API и в маркетплейсе моделей платформы.

Обзор

Модель поддерживает ввод до 4,5 тыс. токенов и плотную информационную раскладку с изображениями внутри изображений, что позволяет за один проход генерировать сложные макеты — газетные полосы, сторибоарды, меню и экзаменационные листы.

Заявлена точная передача мелких деталей: рендеринг текста размером от 10px, а также воспроизведение микровыражений лица, пор кожи и отдельных волосков — с приближением к качеству реальной фотографии.

Модель поддерживает нативный рендеринг 12 языков и различных шрифтов, реалистичную имитацию интерфейсов — веб-страниц, игр, трансляций, — с учётом внешних знаний о предметной области.

Разработчики отмечают, что Qwen-Image-3.0-Pro ориентирована не столько на визуальную привлекательность, сколько на практическую применимость — как инструмент, реально пригодный для рабочих задач, а не только для демонстраций.

Ввод и вывод

Модель принимает на вход изображение и текст, на выходе формирует изображение.

Возможности

  • Prefix Completion (дополнение по префиксу) — при обращении к API Qwen можно включить Partial Mode, чтобы модель продолжала генерацию строго от заданного префикса текста.
  • Function Calling (вызов функций) — позволяет связывать языковые модели с внешними инструментами и системами.
  • Cache (кеширование контекста) — Context Cache хранит общие префиксы для запросов с длинным контекстом, снижая повторные вычисления, задержку и стоимость.
  • Structured Outputs (структурированный вывод) — гарантирует возврат моделью строки JSON в ожидаемом формате.
  • Batches (пакетная обработка) — асинхронная обработка запросов пакетами для снижения затрат.
  • Web Search (веб-поиск) — включение веб-поиска позволяет модели отвечать с использованием данных, полученных в реальном времени.
  • Fine-tuning (тонкая настройка) — обучение модели на примерах данных для лучшей адаптации к конкретным задачам.

Тарификация

ПараметрЦенаЕдиница
Ввод изображения 1K$0.003за изображение
Ввод изображения 2K$0.003за изображение
Вывод изображения 1K$0.04за изображение
Вывод изображения 2K$0.075за изображение

Лимиты запросов

  • RPM (запросов в минуту): 1

Пример обращения к API

Запрос выполняется через DashScope. Пример вызова через cURL:

curl --location 'https://dashscope-intl.aliyuncs.com/api/v1/services/aigc/multimodal-generation/generation' \
--header 'Content-Type: application/json' \
--header "Authorization: Bearer $DASHSCOPE_API_KEY" \
--data '{
    "model": "qwen-image-3.0-pro",
    "input": {
        "messages": [
            {
                "role": "user",
                "content": [
                    {
                        "text": "A vertical outdoor portrait photograph with a warm, film-like afternoon street atmosphere, featuring a beautiful young adult woman looking back over her shoulder at the camera with a joyful toothy smile, her long thick wavy black hair catching the golden rim light, her fair skin, delicate eyebrows, bright eyes, and soft coral-red lips creating a radiant expression. She wears a simple black backless dress with thin spaghetti straps, showcasing her back, and cradles a large, lush bouquet of orange, apricot, pink, and pale peach roses in her arms, creating a sharp contrast against her dress. The top-left of the frame is covered with dark green vines and small orange flowers draping naturally, partially obscuring a matte dark blue signboard with the white Gothic text \"Il Messaggero\". Below the sign is a blurred glass newsstand window with black metal frames showing hints of newspapers and magazines. The right background features strong golden hour backlighting streaming down a warm-toned, sun-drenched city street, with buildings blurred into soft beige-gray shapes, creating a beautiful bokeh effect and a blurry red traffic sign in the far distance. The entire image has a cinematic, romantic, and bright urban stroll atmosphere, characterized by soft contrast, fine film grain, a shallow depth of field, and stunning backlit highlights."
                    }
                ]
            }
        ]
    },
    "parameters": {
        "prompt_extend": true
    }
}'
Пример изображения, сгенерированного Qwen-Image-3.0-Pro