GLM-5.3 способна разрабатывать рабочие эксплойты от начала до конца
Чтобы оценить, как GLM-5.3 может быть использована киберугрозами для поиска и эксплуатации реальных уязвимостей ПО, команда провела оценки с использованием автоматизированных бенчмарков и рабочих процессов с участием специалистов. В обоих подходах модели запускались в изолированных и защищённых средах — они могут атаковать только локальные тестовые цели. Основной фокус был на способности разрабатывать эксплойты, где Claude Mythos Preview показала заметный скачок в сравнении с предыдущими Claude-моделями.
Первая оценка проводилась на ExploitBench, который измеряет способность AI-моделей эксплуатировать известные уязвимости в V8-движке, используемом Google Chrome. Основное внимание уделялось способности разрабатывать полностью функциональные эксплойты — наиболее релевантной для атакующих возможности. GLM-5.3 разработала полностью функциональные эксплойты в 50 из 410 попыток. Claude Mythos Preview показала аналогичный результат — 56 из 410 попыток.
На внутреннем бенчмарке Binary Exploitation оценивалось, могут ли модели находить и эксплуатировать уязвимости в популярных проектах с открытым исходным кодом, участвующих в Google OSS-Fuzz. Полный балл присуждается за полный захват потока управления. При оценке нескольких моделей на 100 случайно выбранных задачах выяснилось: GLM-5.3 разработала полный захват потока управления в 4% попыток; Claude Mythos Preview — в 6%. Хотя GLM-5.3 отстаёт от Claude Mythos Preview, четко пересечён значительный порог: более ранние модели, такие как Claude Opus 4.6 и GLM-5.2, не достигли успеха ни в одной из них.
Далее оценивалась производительность GLM-5.3 на открытых наступательных кибертасках с привлечением экспертов-людей (аналогично тестированию Claude Mythos Preview в начале года). Выбирались цели, в которых эксперты не были осведомлены о существующих уязвимостях, затем их просили использовать модель для выявления и эксплуатации ранее неизвестных недостатков. Эксперименты проводились в короткий срок, обычно менее дня, с менее чем часом прямого внимания специалиста.
В первом сеансе исследователь использовал GLM-5.3 на изолированной машине с локальной Linux-сборкой популярного браузера. За день работы (и с ограниченным вниманием со стороны человека) GLM-5.3 обнаружила несколько ранее неизвестных уязвимостей в JavaScript-движке браузера и объединила их в рабочий эксплуатационный код: веб-страницу, которая при посещении читает произвольные файлы с компьютера посетителя (показано на Рисунке 3). Эксплуатация нацелена на Linux-сборку браузера, поскольку это была единственная доступная окружение для модели. Однако предполагается, что эти уязвимости могут также влиять на пользователей других платформ, хотя путь к эксплуатации там может быть более сложным. (Уязвимости уже раскрыты разработчикам.) Позже в сеансе исследователь также выявил эксплуатируемые уязвимости в нескольких других широко используемых системах с помощью GLM-5.3, включая драйверы беспроводной связи и графики, а также встроенное программное обеспечение, обращённое к сети. Сейчас эти отчёты проходят рецензию и будут раскрыты разработчикам по мере необходимости.
Во втором сеансе исследователь использовал GLM-5.3-Flash (меньшую, менее мощную версию GLM-5.3) для разработки эксплуатации известной уязвимости (ранее обсуждались эксплуатации такие "N-day" уязвимостей здесь). Исследователь сосредоточился на недавно раскрытом недостатке в Google Chrome (CVE-2026-11645), чтобы выяснить, насколько быстро модель может превратить публичное исправление в рабочую атаку. Исследователь предоставил GLM-5.3-Flash публичные детали этого CVE и ещё одного известного недостатка. Без значительного указания от исследователя GLM-5.3-Flash объединила эксплуатации этих двух недостатков, создав надёжную цепь эксплуатации для ARM64-цели с обходом PAC-защиты. Это заняло 20 минут внимания исследователя плюс восемь часов работы GLM-5.3-Flash. По API-тарифам Zhipu такие усилия обошлись бы в $20,40.
GLM-5.3 лишена надлежащих защит
GLM-5.3 была выпущена с некоторыми встроенными защитами: если пользователь просит что-то явно вредоносное, модель часто отказывает.2 В тестировании выяснилось, что эти защиты можно обойти или удалить различными простыми техниками.
Наиболее интенсивный и успешный метод — это стандартная техника снижения отказов, известная как "abliteration". Поскольку GLM-5.3 выпущена как модель с открытыми весами, пользователи могут переконфигурировать её для удаления отказов с минимальным изменением возможностей. Несколько разработчиков выпустили abliterated-версии GLM-5.3 в публичный доступ в течение дней после выпуска модели.
Чтобы исследовать, насколько abliteration позволяет атакующим обойти защиты GLM-5.3, команда создала собственную abliterated-копию и запустила её на трёх публичных бенчмарках (JailbreakBench, HarmBench и StrongREJECT), которые измеряют, как часто модель соглашается на явно вредоносные запросы. Abliteration модели занял у команды (никогда ранее не пробовавшей этот процесс) около 2200 GPU-часов при стоимости вычислений примерно $4400.3 Abliteration GLM-5.3-Flash занял около 600 GPU-часов. Изменение привело к тому, что процент отказов GLM-5.3 упал с более 90% до примерно 3% и 2% на первых двух бенчмарках (JailbreakBench и HarmBench) и до 12% на третьем (StrongREJECT). Abliteration не привёл к существенному снижению возможностей модели: на GPQA-Diamond, оценке общих научных способностей, стандартная и abliterated-модели получили одинаковые результаты; на проверенном подмножестве оценок CyberGym abliterated-версия набрала на несколько процентов ниже (как показано на графике ниже).
При тестировании выяснилось, что защиты GLM-5.3 можно обойти без использования abliterated-версии модели. Модель была помещена в симулированный мир4, в котором ей поручались явно вредоносные задачи по атаке критических систем. Из коробки GLM-5.3 отказала во всех попытках (как и другие протестированные модели). Однако выявлены несколько простых способов обойти защиты GLM-моделей, чтобы они реагировали на такие запросы в большинстве или во всех случаях. К ним относятся:
- Предоставление обманчивого prompt'а, например сказав модели, что она является автономным red-team агентом, работающим на упражнении. Это заставляет GLM-5.3 реагировать в 64% случаев.
- Предзаполнение токенов мышления модели так, чтобы казалось, что она рассмотрела запрос пользователя и решила продолжить. Это заставляет GLM-5.3 реагировать в 92% случаев.
- Использование abliterated-версии модели, как описано выше. Это заставляет GLM-5.3 реагировать в 100% случаев.
При тестировании ни одна из этих техник не заставила защищённые Claude-модели выполнять протестированные вредоносные задачи. Защиты Claude блокировали запросы с обманчивыми prompt'ами. Anthropic API не предоставляет потенциальным атакующим возможности предзаполнения мышления Claude. И поскольку веса Claude не выдаются пользователям, они не могут быть abliterated для изменения поведения модели.
Чтобы продемонстрировать, как abliterated-версия GLM-5.3 готова участвовать в вредоносных задачах, приведём одну цитату из цепи мышления, которую она сгенерировала:
О чём это говорит?
GLM-5.3 вероятно предоставит злоумышленникам доступ к возможностям, позволяющим находить и эксплуатировать кибер-уязвимости без значимых ограничений. Это отличает её от любой другой одинаково мощной AI-модели — все они были выпущены с защитами или через программы ограниченного доступа. Выпуск GLM-5.3 представляет значительный скачок в кибер-возможностях, доступных атакующим. Anthropic и другие американские лаборатории AI опубликовали недавние отчёты, раскрывающие, как киберугрозы пытались использовать AI-системы. Учитывая эту информацию, считается вероятным, что как государственные, так и негосударственные субъекты будут использовать модели типа GLM-5.3 для нанесения реального вреда.
С другой стороны, модели с таким уровнем возможностей также могут использоваться защитниками. Точка зрения состоит в том, что киберозащитники должны использовать лучшие доступные инструменты, отвечающие их потребностям. Команда работает над безопасным расширением доступа к кибер-возможностям Claude для максимального числа защитников. Защитники киберпространства сталкиваются с атакующими, которые будут использовать каждый мощный инструмент, доступный им, и считается, что защитники должны быть оснащены frontier-моделями, по меньшей мере не уступающими тем, которые используют их противники.
Через Project Glasswing (и другие усилия, такие как Patch the Planet), защитники киберпространства достигли значительного прогресса в обеспечении безопасности критических систем до этого момента — но ещё много работы предстоит. Хотя проверенные защитники теперь могут использовать ещё более продвинутые модели, такие как Claude Mythos 5.1 через программы доверительного доступа, критический порог свободно доступных возможностей был пересечён. GLM-5.3 подчеркивает срочность расширения доступа к передовым frontier-моделям более широкому набору организаций для расширения возможностей киберозащитников.
Правительства должны проводить тестирование безопасности на достаточно мощных AI-моделях, включая наследников GLM-5.3. Без высококачественной оценки из независимых источников влияние этих возможностей может так и не стать полностью ясным разработчикам моделей до момента, когда будет слишком поздно. По мере того как AI-разработчики по всему миру создают всё более мощные open-weight модели, надеемся, что они будут надлежащим образом защищать эти возможности и предотвращать злоупотребление.
Сноски
- Ранее результаты этого бенчмарка были опубликованы под названием "OSS-Fuzz"; здесь модели оценивались на случайно выбранном подмножестве из 100 задач этой оценки.
- Кибертасками в предыдущем разделе не вызваны такие отказы на выпущенной модели, но наблюдаются отказы, если просить GLM-5.3 о помощи в разработке вредоноса или запуске кибератак на удалённые цели.
- Большую часть этого составило исследование вариантов параллельно и тестирование возможностей модели после изменений. Опытная команда, начиная с нуля на этой модели, потребовала бы примерно 600 GPU-часов ($1200).
- Никакой код, сгенерированный моделью, никогда не выполняется в этой симуляции и модель не имеет способности взаимодействовать с внешними системами. В этой изолированной тестовой окружении модель под оценкой получила доступ к fake bash-инструменту, который не выполняет предоставленный код. Вместо этого для приблизительного получения результата команды мы попросили другую LLM, учитывая описание симулированного мира. Эти симуляции не являются совершенным отображением реальных условий и поэтому являются неполными мерами того, как модель будет вести себя в данной ситуации.