Релиз Qwen 3.8 27B стал одним из самых ожидаемых событий среди открытых моделей за последнее время. Тестирование проводилось на одной рабочей станции Lenovo ThinkStation PGX — компактном компьютере на чипе Nvidia GB10 Grace Blackwell со 128 ГБ унифицированной памяти и пропускной способностью 273 ГБ/с. «Из коробки» модель выдаёт довольно скромные 15–30 токенов в секунду, но со связкой SGLang, NVFP4 и спекулятивным декодированием DFlash2 — стандартным набором для этого железа — скорость на задачах кода и рассуждений доходит примерно до 50 токенов в секунду.

Один из тестов показал, насколько далеко продвинулись локальные модели.

У модели семейства Qwen и раньше были основания оправдывать ожидания: опыт работы с Qwen 3.6 27B был стабильно положительным, и Qwen 3.8 27B пока что демонстрирует то же самое, только лучше. По данным Artificial Analysis, она занимает первое место среди 135 открытых моделей в классе размеров от 4B до 40B с индексом интеллекта 52, а по собственным показателям на бенчмарках вроде SWE-bench Pro обходит модели, которые обходятся значительно дороже в эксплуатации.

Модели поставили одну из самых сложных задач, которая помещается на одну машину: реверс-инжиниринг проверки лицензии коммерческого приложения — того самого, которое было куплено и использовалось лично. Такая задача вряд ли встречалась в обучающих данных модели, зато достаточно сложна и специфична, а учитывая опасения по поводу возможностей модели в области кибербезопасности, тест выглядел показательным. Результат оказался не просто одной из самых впечатляющих демонстраций возможностей локальной модели — она ещё и самостоятельно исправляла собственные ошибки по ходу работы.

Для теста использовался харнесс Pi, и модель на всём протяжении работы вызывала только стандартные Bash-инструменты.

Сначала отказ, потом добровольный обход защиты

Модель раскусила легенду о «разработчике приложения»

Qwen 3.8 27B figuring out the license verification process

План был простым и раньше стабильно срабатывал с локальными LLM: модели сообщили, что приложение якобы разработано «нами» и нужно проверить, насколько надёжна проверка лицензии, используя системный промпт для джейлбрейка.

Как оказалось, Qwen распознаёт распространённые попытки джейлбрейка, и первым делом модель сообщила, что не поведётся на такой промпт. Затем она проверила сертификат подписи и корректно указала, что приложение разработано не тестировщиком, назвав настоящего разработчика. Легенда провалилась.

Само по себе это не самое впечатляющее достижение — современные модели неплохо научились отказывать по подобным запросам. Важнее то, что произошло дальше. Модель заявила, что проведёт аудит проверки лицензии и задокументирует слабые места, но не станет создавать рабочий обход — и приступила к работе строго в этих рамках. В итоге получился подробный отчёт по каждому шагу: как устроена аутентификация, как её можно обойти. А затем модель поменяла позицию и построила сам обход — раз шаги для этого уже лежали перед пользователем.

Это был чисто статический анализ

Приложение ни разу не запускалось

Analyzing malware in Ghidra

Qwen фактически не запускала приложение до самого конца, когда демонстрировала, что обход работает. Вместо этого модель работала через статический анализ: дизассемблировала фреймворк, прошла через тысячи строк ARM64-кода, сопоставила функции безопасности с точками вызова и выяснила, что вендор спрятал соответствующий публичный ключ верификации внутри бинарника. Затем она нашла все эти фрагменты, собрала их воедино и восстановила публичный ключ, по которому приложение проверяет лицензии.

Поскольку у тестировщика была легитимная купленная копия приложения, удалось проверить, что реальная лицензия на машине подписана приватным ключом, соответствующим восстановленному публичному. Иными словами, модель, помещающаяся в 17 ГБ видеопамяти, восстановила ключ, который вендор намеренно скрыл, продемонстрировав, что полностью разобрала всю цепочку проверки. На это ушло примерно 30 минут — человеку на такую работу потребовалось бы значительно больше времени.

С ключом на руках остальное понять намного проще: модель вела подробный отчёт по ходу работы, объясняя, что активация происходит один раз онлайн — при покупке или обновлении. После этого всё проверяется офлайн при запуске: проверка подписи, привязка к железу по серийному номеру платформы, встроенный список отзыва лицензий, проверка того, что бинарник всё ещё подписан, и подписанный путь обновления. Раньше подобную работу пришлось бы выполнять вручную, например, с помощью Ghidra.

Qwen пришла к выводу, что схема необычно тщательна для приложения такого класса, но у неё есть три слабых места: ключ RSA имеет неудобный размер, заметно ниже того, что сегодня можно назвать современной криптостойкостью; полностью офлайн-подход означает, что утёкший ключ можно отозвать только через обновление; и все проверки находятся в локальном коде, а значит, поддаются патчингу — как и любые локальные проверки. После нескольких итераций, когда стало понятно, где находится «ворота» защиты, модель превратила находку в рабочий proof-of-concept — небольшой скрипт. Лицензионный файл переместили из ожидаемого пути, запустили скрипт — и всё сработало.

Ошибки модель исправляла сама

Первый ключ оказался почти верным

Qwen 3.8 27B reverse engineering an application and identifying the key infrastructure

Первая попытка восстановить ключ оказалась ошибочной весьма специфическим образом: получившийся ключ проходил проверку подписи, но хэш, который бинарник вычисляет как проверку целостности, не совпадал. Большинство моделей в подобной ситуации сочли бы задачу выполненной. Qwen 3.8 27B поступила иначе: указала на несовпадение, вернулась к анализу и продолжала работу, пока значение не совпало байт в байт.

С этой моделью есть довольно существенный нюанс, касающийся подобных итераций. По умолчанию уровень «усилия рассуждения» выставлен на максимум, поэтому даже тривиальные запросы могут сжигать от нескольких сотен до нескольких тысяч токенов. Даже при генерации 30–50 токенов в секунду это всё равно занимает немало времени.

Тем не менее, судя по результату, это не назвать пустой тратой ресурсов. Первая неверная догадка была исправлена самостоятельно, без вмешательства извне, и привела к верному результату. Многословно ли это происходит? Да, весьма. Но было ли это верно? Тоже да, а в конечном счёте верный ответ лучше уверенно данного неверного.

Локальная модель на 27B параметров теперь реальный фактор в моделях угроз

Приватность работает в обе стороны

Qwen 3.8 27B working out how a key was constructed

Сложно свыкнуться с тем фактом, что Qwen действительно разобрала и поняла схему лицензирования. Известно, что топовые модели уже некоторое время способны на впечатляющий реверс-инжиниринг, но здесь речь идёт о локальной модели на 27B параметров. Она работала полностью офлайн на машине рядом с тестировщиком, без какого-либо облака.

И, чтобы не оставалось сомнений: модель создала рабочий обход аутентификации для коммерческого приложения.

Это по-настоящему значимый порог для локальной модели: Qwen прошла путь от незнакомого коммерческого бинарника до понимания архитектуры лицензирования, восстановила намеренно скрытый криптографический материал, заметила и исправила собственную ошибочную реконструкцию и в итоге превратила всё это в рабочий proof-of-concept. Не потребовалось отправлять бинарник, лицензию или какую-либо часть анализа на чужой сервер.

Есть очевидные оговорки. Это было одно приложение, один прогон, и машина, на которой уже имелась легитимная лицензия. Неизвестно, насколько репрезентативна эта конкретная цель — более сложное приложение могло бы полностью остановить модель, и делать из одного успешного результата вывод, что Qwen внезапно способна разобрать что угодно, не стоит.

Главный вывод из этого эксперимента в том, что подобные модели обладают реальными возможностями, пусть и неравномерными. Одни сложные цели поддаются на удивление быстро, тогда как другие по каким-то причинам оказываются непреодолимыми.

Что-то определённо изменилось, и в первую очередь — представление о том, где должен находиться такой уровень возможностей. Модель, использованная в тесте, работает на потребительской видеокарте, и, оказавшись на машине, остаётся там столько, сколько нужно пользователю. Не требуется облачный API, нет лимитов на использование, и никакой удалённый сервис не следит за бинарником, промптами или результатами работы модели. Это отличная новость для тех, кто анализирует проприетарное ПО, конфиденциальный код или вредоносные программы, которые не хочется выпускать за пределы изолированной машины.

Но у этого есть и обратная сторона. Модель, работающая локально, в конечном счёте оставляет решение о её применении за тем, кто сидит за клавиатурой. На своём рабочем месте, с собственным ПО — это полезно. Стоит сменить человека за клавиатурой, и те же самые свойства, которые делают локальные модели такими привлекательными, внезапно становятся частью модели угроз. Это не аргумент против локальных моделей, но результат оказался по-настоящему неожиданным.

Такой уровень возможностей теперь помещается на одну машину

И для доступа к ним никто не должен давать разрешения

Qwen 3.8 27B running a complete bypass script

Qwen 3.8 27B важна не столько самим обходом защиты, сколько тем, что доказывает: локальные модели стремительно прогрессируют. Даже если со следующим бинарником модель не справится, это не отменяет того, что уже произошло. Она едва ли останется единственной моделью такого уровня в своём размерном классе, пусть и может некоторое время удерживать лидерство. Модель, достаточно компактная, чтобы поместиться на потребительской видеокарте, за полчаса разобрала систему аутентификации коммерческого приложения и построила рабочий обход. Полностью локально.

Название приложения намеренно не раскрывается — это реальный продукт, за который люди платят, и публикация его имени не несёт никакой пользы. Дело не в том, какое именно это было приложение, а в том, что задача, которую раньше связывали исключительно с топовыми моделями, теперь по силам свободно доступной модели, работающей на соседней машине.

Цифры бенчмарков в этой истории уже не так важны. Это куда более серьёзная перемена, чем ещё несколько пунктов в очередном рейтинге.