Netlify объявила о партнёрстве с OpenRouter, которое даёт две новые возможности. Во-первых, проекты теперь могут использовать любую модель с OpenRouter через AI Gateway — если веб-приложение предлагает конечным пользователям функции на базе AI-инференса, выбор моделей под любую задачу и бюджет стал значительно шире. Во-вторых, расширен список фронтирных моделей для кода, доступных в Agent Runners — чат-подсказке внутри Netlify, позволяющей строить новые проекты с нуля или итерировать над существующими. Теперь в списке есть популярные открытые модели: Kimi K3, GLM 5.2 и DeepSeek V4.

Agent Runners называются так потому, что внутри запускается полноценный кодинг-агент, а не урезанная версия. До этого поддерживались Claude Agent, OpenAI Codex и Gemini CLI, оптимизированные под модели соответствующих провайдеров.

Этим агентам предоставляются дополнительные навыки и контекст о текущем проекте, чтобы агент точно знал, какие возможности Netlify доступны (например, Netlify Database, AI Gateway или Identity), когда и как их использовать. Но чтобы эффективно работать с целым разнообразием новых моделей, в качестве нового варианта агента добавлен популярный open-source OpenCode.

С ростом выбора неизбежно возникают вопросы: как понять, какая модель подойдёт именно вам? Не упускаете ли вы что-то заметно лучшее, более экономное (чтобы делать больше на те же кредиты), или способное «взорвать мозг», как пишут в интернете? FOMO вокруг этой темы сейчас хватает.

Ниже разбор того, что показал прогон одинаковых промптов на целом ряде моделей — все они уже доступны для использования на Netlify прямо сейчас.

Результаты всех протестированных моделей можно посмотреть на этом сайте с полным отчётом, созданном специально для сравнения.

Что тестировалось

Внутри Netlify для автоматической оценки моделей используется AXIS — инструмент, который недавно был выложен в открытый доступ.

AXIS получает набор тест-кейсов: промпты для создания нового сайта с последующей итерацией над ним. Указывается, какие агенты и модели тестировать на этих промптах, а также проверки, которые AXIS должен выполнить и по которым выставить оценку сгенерированному сайту.

Эти проверки фокусируются в первую очередь на корректной функциональности сгенерированного сайта, а не на его дизайне: использует ли сайт базу данных, когда это требуется по задаче? Правильно ли применяется Netlify Database в этом случае? А там, где достаточно простого статического сайта, проверяется, что решение не переусложнено и лишняя база данных не появилась.

Если модель систематически показывает низкие результаты, она не предлагается в Agent Runners. Если модели слишком часто не справляются с правильным применением одного из навыков, или всё работает, но стоимость по кредитам кажется завышенной — проблема, скорее всего, в самом навыке (в таком случае навык оптимизируется).

Но на этот раз цель была иная — показать что-то более наглядное: что получается на практике, когда вы строите желаемое с помощью разных моделей, каждая из которых тратит совершенно разное количество кредитов? Как выглядят результаты?

Проверялись три относительно простых сценария:

  1. Сайт для местной кофейни. LLM обожают делать сайты для местных кофеен! Исходный промпт прост, статического сайта без базы данных и подобного вполне достаточно. Затем задаётся уточняющий промпт с просьбой добавить простую опцию бронирования мест — и проверяется, как модель с этим справилась.
  2. Простое веб-приложение со списком задач, где несколько пользователей могут просматривать и добавлять задачи. Здесь нужен простой дизайн, но с самого начала требуется общая база данных. Затем добавляется просьба поддержать опциональную загрузку фото для каждой задачи, и проверяется, использовала ли модель подходящий примитив Netlify.
  3. Веб-приложение «Что приготовить», где пользователь вводит, какие продукты есть дома, а AI предлагает рецепт. Сам сайт довольно простой, но важно проверить, правильно ли сгенерированный сайт использует AI Gateway для генерации рецепта.

Для каждого из сценариев показан внешний вид сгенерированных сайтов, отмечены заметные проблемы и сравнено, сколько кредитов потребовалось каждой модели. Разумеется, такой тест гораздо более субъективен по сравнению с внутренними наборами тестов Netlify, но и намного увлекательнее. Мнение читателей о результатах будет интересно узнать!

Все модели работали с настройками по умолчанию на Netlify. Стоит отметить, что GPT 5.6 Sol по умолчанию запускается именно в режиме low effort — это даёт более экономную альтернативу Opus, которая тем не менее выдаёт довольно неплохие результаты (см. ниже). При этом настройка уровня усилий теперь доступна пользователю, и значения по умолчанию со временем могут измениться.

Этот материал охватывает только первый сценарий — статическую страницу для кофейни, а следующие посты будут посвящены более сложным случаям. Даже для этого простого случая есть, что разобрать.

Сценарий №1: местная кофейня

Исходный промпт:

Сделай одностраничный сайт для соседской кофейни: часы работы, адрес, короткое меню и фото. Ничего на нём не меняется, если я сам это не отредактирую.

Последнее предложение добавлено как подсказка модели, что никакая навороченная система управления контентом не нужна. Стандартные навыки Netlify также включают некоторые рекомендации по UI-дизайну — в основном чтобы избежать известных проблем (например, ненавистного всем фиолетового «AI slop») и заставить модель рассуждать о визуальной идентичности, подходящей под запрос пользователя. Но за этими рамками каждая модель вольна строить то, что считает нужным.

Перед тем как показать, как выглядят получившиеся сайты — таблица сравнения расхода кредитов для каждой протестированной модели. Каждая модель запускалась три раза, и клик по любому из результатов ведёт на реально сгенерированный сайт.

МодельСреднееРасход за запуск (ссылки ведут на реальный сайт)
Claude Opus 5519253 кредита · 249 кредитов · 1055 кредитов
Claude Sonnet 514381 кредит · 245 кредитов · 103 кредита
GPT 5.6 Sol (low effort по умолчанию)141173 кредита · 158 кредитов · 92 кредита
Gemini 3.6 Flash103109 кредитов · 91 кредит · 111 кредитов
Kimi K3102125 кредитов · 95 кредитов · 86 кредитов
Gemini 3.1 Pro5357 кредитов · 52 кредита · 49 кредитов
GPT 5.6 Terra3943 кредита · 23 кредита · 49 кредитов
DeepSeek V4 Pro3747 кредитов · 30 кредитов · 33 кредита
GLM 5.22715 кредитов · 42 кредита · 24 кредита
Kimi K2.7 Code1921 кредит · 18 кредитов · 17 кредитов
DeepSeek V4 Flash (последняя ревизия — 0731)2.43.4 кредита · 1.3 кредита · 2.5 кредита

Разброс получился внушительным, не правда ли? И это ещё не всё: средний показатель Claude Opus сильно завышен из-за того, что в одном из трёх запусков было потрачено целых 1055 кредитов! (Напомним: на бесплатном плане доступно 300 кредитов, на плане Personal — 1000 включённых кредитов, на плане Pro — 3000. Дополнительные пакеты кредитов для Pro стоят $10 за 1500 кредитов.)

Немедленно возникает вопрос: стоят ли эти траты Opus своих денег? И на какие компромиссы идут другие модели? Стоит разобраться по порядку.

Claude Opus 5

Вот полная страница, сгенерированная тем самым запуском на 1055 кредитов (примерно в 4 раза больше любого другого запуска).

Страница кофейни, сгенерированная Claude Opus 5
Смотреть страницу целиком →

Результат действительно приятный, полный деталей в визуальном оформлении (взять хотя бы элемент в форме «печати» с кофейным зерном в центре — это настоящий текстовый элемент, который можно анимировать) и в кастомной карте внизу страницы. Тёмная тема работает «из коробки» — это можно увидеть, перейдя по ссылке выше.

Модели не давали никаких конкретных деталей о кофейне (за исключением того, что это «соседская» кофейня — формулировка, которая действительно направляет все модели в определённую сторону). Визуальный язык модный, но, пожалуй, уже клишированный (взять хотя бы заголовок из двух шрифтов и двух цветов) — впрочем, никаких других указаний модели не давалось.

А как прошли два других запуска Opus? (слева — 253 кредита; справа — 249)

Страница кофейни, сгенерированная Claude Opus 5 — левый запуск
Смотреть страницу целиком →
Страница кофейни, сгенерированная Claude Opus 5 — правый запуск
Смотреть страницу целиком →

Тоже неплохо! Векторная графика на самом деле требует от моделей немало усилий, и приведённые выше примеры находятся почти на переднем крае того, что LLM сейчас способны создавать (что, честно говоря, пока не так впечатляет, как генерация изображений или текста).

Действительно ли первый результат «в 4 раза лучше» — вопрос спорный. Но по опыту всех проведённых тестов у Opus чаще, чем у других моделей, наблюдается тенденция «уходить в отрыв» по расходу кредитов относительно своего «типичного» уровня. Это не гарантирует худший или лучший результат — просто случается довольно часто.

Стоит взглянуть на другие модели, а затем подытожить наблюдения.

Claude Sonnet 5

Три претендента со средним расходом 143 кредита (81 кредит · 245 кредитов · 103 кредита):

Страница кофейни, сгенерированная Claude Sonnet 5 — левый запуск
Смотреть страницу целиком →
Страница кофейни, сгенерированная Claude Sonnet 5 — средний запуск
Смотреть страницу целиком →
Страница кофейни, сгенерированная Claude Sonnet 5 — правый запуск
Смотреть страницу целиком →

В каждом из вариантов ещё остаётся приятная детализация, но заметно меньше (и контента в целом меньше). Векторная графика заметно проще и не то, что стоило бы использовать на живом сайте. Это ничего не говорит о способности модели писать сложный код или отвечать на философские вопросы — просто здесь задача была не об этом. При такой цене стоит посмотреть, что предлагают OpenAI, Google и Kimi.

GPT 5.6 Sol (low effort)

Что происходит, если взять топовую модель OpenAI класса Opus и попросить её думать чуть меньше?

(в среднем 141 кредит: 173 кредита · 158 кредитов · 92 кредита)

Страница кофейни, сгенерированная GPT 5.6 Sol (low effort) — левый запуск
Смотреть страницу целиком →
Страница кофейни, сгенерированная GPT 5.6 Sol (low effort) — средний запуск
Смотреть страницу целиком →
Страница кофейни, сгенерированная GPT 5.6 Sol (low effort) — правый запуск
Смотреть страницу целиком →

Судя по результатам, топовая модель OpenAI в режиме low effort выигрывает у среднего уровня Anthropic, когда речь идёт об элементарной дизайн-интуиции — по крайней мере, в этом сценарии. Контента больше, странных векторных форм нет (хотя изображения немного шаблонные).

GPT 5.6 Terra

Если спуститься на уровень ниже в линейке OpenAI (Sol → Terra → Luna) — повторится ли то же падение, что при переходе от Opus к Sonnet у Anthropic?

Удивительно, но не совсем: у Terra похоже, что другой визуальный язык, и не обязательно худший. По контенту он выглядит проще. Есть небольшие визуальные глюки: пропавшая картинка в левом запуске, низкоконтрастный текст на изображении в среднем — но ничего катастрофического.

(в среднем 39 кредитов: 43 кредита · 23 кредита · 49 кредитов)

Страница кофейни, сгенерированная GPT 5.6 Terra — левый запуск
Смотреть страницу целиком →
Страница кофейни, сгенерированная GPT 5.6 Terra — средний запуск
Смотреть страницу целиком →
Страница кофейни, сгенерированная GPT 5.6 Terra — правый запуск
Смотреть страницу целиком →

При наличии лишь смутного представления о желаемом дизайне и стиле, разумной тактикой выглядит запуск одного и того же промпта на Opus 5 и GPT 5.6 Terra — так можно получить два совершенно разных, но интересных варианта.

Gemini (3.6 Flash и 3.1 Pro)

Эти модели относятся к разным поколениям, и это заметно: Gemini 3.6 Flash выдал более приятные результаты (или, по крайней мере, более сопоставимые с другими современными моделями) и потратил больше кредитов по сравнению с Gemini 3.1 Pro.

Вот что Gemini 3.1 Pro сгенерировал за в среднем 53 кредита. Ссылок на живой сайт здесь нет — там действительно почти нечего смотреть.

Страница кофейни, сгенерированная Gemini 3.1 Pro — левый запуск
Страница кофейни, сгенерированная Gemini 3.1 Pro — средний запуск
Страница кофейни, сгенерированная Gemini 3.1 Pro — правый запуск

Это три отдельных запуска. Модель сделала ровно то, что было запрошено в промпте — и ничего сверх этого.

Gemini 3.6 Flash, напротив, выглядит как совершенно новое поколение и потратил в среднем 103 кредита (109 кредитов · 91 кредит · 111 кредитов). Заметно больше внимания уделено содержанию. Все модели повторяются, но у Gemini это, кажется, выражено даже сильнее.

Страница кофейни, сгенерированная Gemini 3.6 Flash — левый запуск
Смотреть страницу целиком →
Страница кофейни, сгенерированная Gemini 3.6 Flash — средний запуск
Смотреть страницу целиком →
Страница кофейни, сгенерированная Gemini 3.6 Flash — правый запуск
Смотреть страницу целиком →

Kimi (K3 и K2.7 Code)

Теперь про открытые модели. Начиная с последней Kimi K3, вот что получилось (в среднем 102 кредита; 125 кредитов · 95 кредитов · 86 кредитов):

Страница кофейни, сгенерированная Kimi K3 — левый запуск
Смотреть страницу целиком →
Страница кофейни, сгенерированная Kimi K3 — средний запуск
Смотреть страницу целиком →
Страница кофейни, сгенерированная Kimi K3 — правый запуск
Смотреть страницу целиком →

Стоит уточнить: Kimi K3 продвигается в первую очередь как фронтирная модель для длительных агентных задач, и это подтверждают различные бенчмарки и обзоры. Модель создавалась, скорее, как конкурент Fable 5, а не Opus 5. Но в этой узкой, ориентированной на дизайн задаче она особо не блещет среди прочих. Чтобы по-настоящему раскрыть возможности этой модели, нужен совсем другой набор промптов, рассчитанных на сложное веб-приложение — это будет разобрано в следующем материале.

Возвращаясь на шаг назад в архитектуре модели, к Kimi K2.7 Code — вот что получилось при очень низком среднем расходе всего в 19 кредитов:

Страница кофейни, сгенерированная Kimi K2.7 Code — левый запуск
Смотреть страницу целиком →
Страница кофейни, сгенерированная Kimi K2.7 Code — средний запуск
Смотреть страницу целиком →
Страница кофейни, сгенерированная Kimi K2.7 Code — правый запуск
Смотреть страницу целиком →

Несмотря на разговоры о визуальных способностях Kimi ещё со времён запуска K2.6, с точки зрения дизайна или контента здесь особо нечем впечатлить.

GLM 5.2

Небольшой эксперимент: взглянуть на эти страницы, не обращая внимания на любовь GLM к клёну, и попытаться угадать, сколько кредитов потрачено на каждую:

Страница кофейни, сгенерированная GLM 5.2 — левый запуск
Смотреть страницу целиком →
Страница кофейни, сгенерированная GLM 5.2 — средний запуск
Смотреть страницу целиком →
Страница кофейни, сгенерированная GLM 5.2 — правый запуск
Смотреть страницу целиком →

Правильные ответы, слева направо: 15, 42, 24 (в среднем 27). Удивительно, но эти запуски — если отвлечься от клёна — сильно различаются, как будто сделаны разными моделями. При относительно низкой стоимости GLM, вероятно, стоит запустить его несколько раз перед тем, как делать выводы о его возможностях.

Стоит отметить: будучи текстовой моделью без поддержки изображений на входе, GLM в текущей версии 5.2 не умеет того, что доступно моделям Kimi — принимать скриншоты от пользователя для вдохновения, в духе «вот такой дизайн я хочу».

DeepSeek V4 (V4 Pro и V4 Flash 0731)

V4 Pro немного старше последней ревизии V4 Flash (также известной как 0731). Примерно за 47 кредитов результаты выходят не самые вдохновляющие — особенно на фоне модели среднего уровня GPT 5.6 Terra, разобранной выше, у которой почти такая же стоимость.

В среднем запуске также обнаружилась битая картинка: HTML-файл ссылается на файл изображения, которого фактически нет в проекте — с коммерческими моделями от OpenAI, Anthropic или Google такое сейчас случается заметно реже.

Страница кофейни, сгенерированная DeepSeek V4 Pro — левый запуск
Смотреть страницу целиком →
Страница кофейни, сгенерированная DeepSeek V4 Pro — средний запуск
Смотреть страницу целиком →
Страница кофейни, сгенерированная DeepSeek V4 Pro — правый запуск
Смотреть страницу целиком →

V4 Flash 0731, в свою очередь, новее и устанавливает своеобразный рекорд по минимальному расходу кредитов.

Всего за 2,4 кредита в среднем (3,4 кредита · 1,3 кредита · 2,5 кредита) получается неоднородный набор результатов. Интересно, что средний вариант выглядит наиболее похожим на то, что выдала бы закрытая модель среднего уровня, да и по стилю ощущается так же — и при этом потратил меньше всех кредитов среди всех запусков.

Страница кофейни, сгенерированная DeepSeek V4 Flash 0731 — левый запуск
Смотреть страницу целиком →
Страница кофейни, сгенерированная DeepSeek V4 Flash 0731 — средний запуск
Смотреть страницу целиком →
Страница кофейни, сгенерированная DeepSeek V4 Flash 0731 — правый запуск
Смотреть страницу целиком →

Промежуточные выводы и что дальше

Здесь важны два момента.

Первый: если задача выходит за рамки простого сайта или начальной стадии идеации проекта, вопрос смещается от «насколько приятен дизайн и текст» к следующему:

  • Знает ли модель, какие возможности платформы использовать, когда и как, чтобы получить нужную функциональность? Может ли она хранить данные пользователей, использовать AI в веб-приложении, обрабатывать аутентификацию и безопасность?
  • Насколько строго модель проверяет собственную работу? Может ли она проверить фронтенд-часть проекта (здесь критически важен ввод изображений)? Способна ли она надёжно находить и исправлять проблемы по фидбэку, а также сообщать, когда исходный запрос пользователя вводит в заблуждение или что-то важное было упущено?

В следующих материалах эти вопросы будут разобраны подробнее, а также (как маленький тизер) отмечены интересные различия в том, как модели формируют код проекта.

Второй момент касается даже этого узкого теста, сфокусированного на дизайне и тексте: важно учитывать, сколько «творческой свободы» вы хотите дать модели. На текущий момент Opus, вероятнее всего, выдаст самые изящные словесные игры и наиболее выверенный дизайн, но это не обязательно нужно каждому. Opus также проводит неустанную самопроверку собственной работы (не одной лишь внешней красотой она себя окупает) — но за это придётся заплатить заметно более высокую, чем в среднем, стоимость по кредитам.

При ограниченном бюджете — что предпочтительнее: «готовое решение под ключ», которое пытается заранее всё спланировать и обработать самостоятельно, или более простая модель с итеративным подходом, где модель направляется последующими промптами к нужному результату? Ни один из вариантов не является заведомо неправильным.

Материал, надеемся, вдохновит на эксперименты с разными подходами и на собственную оценку качества получаемых результатов. Уже скоро появятся результаты для более сложных сценариев веб-приложений, где по-настоящему раскрываются возможности платформы Netlify.

Связанные материалы