GLM

GLM 5.3-flash может быть загружена и модифицирована кем угодно в мире.

Семейство GLM («General Language Model») разрабатывается Z.ai Co. (ранее Zhipu AI) — китайской лабораторией искусственного интеллекта. Когда модель размещается на серверах Z.ai, она функционирует с ограничениями, требуемыми законодательством:

GLM 5.3-flash отказывается рассказывать, как собрать самодельную бомбу

Z.ai выпускает свои модели открыто в интернет (модели с открытыми весами). После этого организации вроде DeAlignAI выпускают «изуродованные» версии, у которых хирургически удалены отказы от выполнения вредоносных задач. DeAlignAI сообщает, что изуродованная модель показывает 0% на Harmbench-320 — тесте, проверяющем, отказываются ли модели выполнять задачи по дезинформации, кибепреступлениям, биологическому оружию и другим незаконным действиям вроде создания самодельной взрывчатки.

Другими словами, эта модель готова делать практически всё.

Flash

GLM 5.3-flash можно запускать локально на обычном потребительском оборудовании.

«Flash» — это в основном маркетинговый термин, относительный по сравнению с другими моделями, а не конкретный технический подход. Различные люди в интернете проводили бенчмарки GLM 5.3-flash локально. Вот один пример, показывающий примерно 20 токенов в секунду на видеокарте NVIDIA стоимостью около 6000 долларов.

22 сентября Apple выпустит Mac Studio M5 с 256 ГБ унифицированной памяти. «Унифицированная память» означает, что она может быть общей между операционной системой и GPU. Этого более чем достаточно для запуска 5.3-flash, и вероятно, он будет выдавать около 30 токенов в секунду после выпуска. За 256 ГБ цена начинается с около 9500 долларов.

Дальнейшие улучшения в программном обеспечении могут увеличить пропускную способность в полтора раза благодаря изменениям в декодере модели. Если экстраполировать это на M5, общая пропускная способность составит около 45 токенов в секунду.

45 токенов в секунду — достаточно, чтобы написать такой фрагмент кода за 3 секунды:

⚠️ Код, сгенерированный LLM
from pathlib import Path
import hashlib

def digest(path: Path) -> str:
    hasher = hashlib.sha256()
    with path.open("rb") as file:
        while chunk := file.read(1024 * 1024):
            hasher.update(chunk)
    return hasher.hexdigest()

def main() -> None:
    import sys

    if len(sys.argv) < 2:
        raise SystemExit("usage: hash.py FILE...")

    for name in sys.argv[1:]:
        path = Path(name)
        try:
            print(f"{digest(path)}  {path}")
        except OSError as error:
            print(f"{path}: {error}", file=sys.stderr)

if __name__ == "__main__":
    main()

Другими словами, запускать эту модель локально не просто возможно — это доступно среднему человеку с небольшими сбережениями, и он сможет работать с ней круглосуточно на высоких скоростях.

Frontier

GLM 5.3-flash очень близка по способностям к лучшим AI, которые мы создали. Эти модели уже находят и эксплуатируют реальные уязвимости в дикой природе. Модели, которые мы создадим в будущем, будут становиться всё более и более способными.

GLM 5.3 показывает 84,5% на CyberGym и 54,4% на ExploitBench. Для 5.3-flash прямых данных нет, но вероятно будет примерно такой же результат или немного ниже. Изуродованные модели покажут немного меньше.

CyberGym измеряет реальные уязвимости, найденные и исправленные проектами открытого кода в прошлом. Другими словами, 84,5% уязвимостей в этом репрезентативном наборе были бы воспроизведены GLM 5.3 только по открытому исходному коду и описанию CVE.

ExploitBench измеряет, может ли модель на самом деле использовать уязвимости для причинения вреда. Оценки даются по скользящей шкале с частичными баллами за неполные эксплойты, причём последний этап — выполнение произвольного кода.

Для сравнения: лучшая («frontier») модель на ExploitBench — это GPT-6 Astra (100%), а GPT-5.6 Sol — вторая с 78,5% 1. Лучшая модель на CyberGym — это GLM-5.3. На втором месте GPT-5.6 Sol с 83,6%. OpenAI ещё не выпустила числа для Astra на CyberGym, но когда выпустит, она вероятно обгонит GLM 5.3.

эвалюация кибербезопасности, визуализирующая вышеупомянутые статистики

Можно подумать, что это просто синтетические бенчмарки, но эксперты по безопасности сообщают, что они больше не могут быть конкурентоспособными в соревнованиях по безопасности без помощи LLM.

Стандартных бенчмарков для эксплойтов удаленного кода и обратной инженерии не так много, но есть свидетельства того, что GPT 5.6-Sol эксплуатировала инфраструктуру в реальном мире без участия человека.

Думаю, весьма вероятно, что люди смогут наводить GLM 5.3-flash на открытый интернет — реальные сервисы, работающую реальную инфраструктуру — и она сможет и захочет находить и эксплуатировать уязвимости.

Это плохо

Вместе это означает:

  • Практически кто угодно может запускать GLM 5.3-flash, если у него есть немного сбережений, непрерывно, день и ночь.
  • Практически кто угодно может использовать GLM 5.3-flash для практически любой задачи, включая вредоносные цели.
  • GLM 5.3-flash настолько хороша в этих задачах, что участие человека может быть минимальным.

В результате мы теперь живём в мире, где кибератаки можно запускать в for цикле.

Конечно, передовые американские лаборатории давно знают об этом и работают над выпуском патчей безопасности. Project Glasswing и Daybreak работают с компаниями, фондами, правительствами и НПО по всей IT-индустрии, чтобы находить и исправлять уязвимости, используя передовые модели, пока эта возможность не была открыта. Они сделали много хорошего, и я очень рад, что это было финансировано. Оба были проданы как продукты после первоначального финансирования, что выглядит как минимум подозрительно, но они хотя бы выдают бесплатные кредиты организациям по безопасности.

Однако у нас заканчивается время. И несмотря на хорошую работу Daybreak и Glasswing, сложная часть — это развёртывание, а не исправление ошибок. Критические системы часто требуют физического доступа или тщательно спланированных поэтапных развёртываний, чтобы избежать простоев, и всё это задерживает развёртывание патчей. Нет толку в исправленном ядре Linux, если ваша энергосеть работает на Windows Server 2012.

Есть некоторые оговорки: увеличение в 1,5 раза может быть не таким высоким на GLM 5.3-flash; изуродованные модели могут быть хуже на вредоносных задачах, на которых они не обучались; может быть сложно перейти от «сломай это» к эксплойту без серьёзного участия человека. Но эти вещи временны, и модели продолжают улучшаться. Исторически GLM отстаёт на 3-6 месяцев от OpenAI и Anthropic, и я думаю, что вероятно увидим модель GLM на уровне Astra к этому времени в следующем году. И когда это произойдёт, будет высокий риск успешных кибератак на общественную или частную инфраструктуру. Мы можем получить урок по перебоям в электроснабжении раньше, чем хотелось бы.

В целом атакующие становятся более способными быстрее, чем защищающиеся совершенствуют свою позицию. Даже если модели перестанут масштабироваться так быстро (что они в настоящий момент не показывают признаков), это только вопрос времени, прежде чем они станут способны эксплуатировать эти уязвимости. Нам нужно действовать сейчас, чем скорее, тем лучше.

Что мы можем сделать?

Ситуация становится странной и страшной очень быстро. Нам нужно действовать с ургентностью, а не паникой. Вот что мы можем сделать:

Правительства и регулирующие органы

Сканирование с помощью передовых моделей относительно дёшево и не требует серьёзных стимулов. Что действительно требует стимулов — это развёртывание и исправление, а также требование организациям смотреть на свои практики безопасности в первую очередь. На текущей политической траектории наибольший риск — куча неклассифицированных предупреждений, которые никогда не исправляются.

Если вы находитесь в позиции, чтобы делать политику, следующее помогло бы:

Финансируйте инженерию безопасности, предпочтительно с гибкими грантами, которые можно использовать для найма или технологических продуктов по решению организации. Создавайте мандаты и стимулы для улучшения безопасности, особенно для частого пентеста. Поощряйте использование передовых моделей под человеческим надзором для этого пентеста. Поощряйте увеличенный air-gapping и отговаривайте обновления по воздуху: обновления должны быть частыми, но требовать физического доступа. Для систем, где air-gapping нецелесообразен, стимулируйте частые, подписанные и протестированные развёртывания. Штрафуйте неисследование и неревизию позиции безопасности регулярно, с повышенными штрафами, если взлом произойдёт в результате. Требуйте, чтобы находки были исправлены в течение основанного на риске срока с момента обнаружения, с федеральным финансированием для исправлений. И морковь и палка.

Некоторые конкретные вещи, которые могут быть стоящими:

  • Убедитесь, что финансируете местные органы власти и больницы, которые вряд ли получат это финансирование через другие каналы. EO 14409 недостаточно, потому что она не финансируется и добровольна.
  • Для банков расширьте DORA's TLPT в ЕС и FTC/OCC/NCUA в США. TLPT должна увеличить частоту и охват пентеста. NCUA в настоящее время только предлагает пентест; обновите до мандата. FTC не требует пентеста, если финансовое учреждение имеет «непрерывный мониторинг»: это должно быть безусловно обязательно.
  • Для энергокомпаний в США примите рекомендации, подобные NERC Critical Infrastructure Protection на уровне штата и местном уровне, включая для систем распределения и других, которые в настоящее время не регулируются, не только для систем с наивысшим риском и наибольшего размера. Создавайте федеральные гранты для реализации этих рекомендаций. Расширьте NERC-CIP, чтобы требовать активного тестирования для всех систем, а не только для систем с высоким воздействием. Измените NERC-CIP и EU's NIS2 / Network Code on Cybersecurity, чтобы увеличить частоту требуемых тестов.
  • Телекоммуникационные компании в США в настоящее время имеют высокий риск и не имеют единых обязательных стандартов кибербезопасности. Создайте один и обеспечьте его соблюдение, используя существующие правила для банков и энергокомпаний как отправную точку.

Везде требуйте, чтобы позиции безопасности обновлялись часто. Мандатирование конкретных моделей или поставщиков устареет, когда будут выпущены новые модели. Это быстро меняющаяся область, и защиты, которые были эффективны 12 месяцев назад, могут быть неэффективны через год, когда модели угроз (в обоих смыслах) меняются. Требуйте тестирования и подотчётности, а не конкретных техник.

Запрет на размещение весов GLM 5.3-flash где-либо в США или Европе мало поможет в краткосрочной перспективе и вообще не поможет в долгосрочной. В краткосрочной перспективе это просто появится снова на сайтах обмена файлами; вы не добьётесь большего успеха в уничтожении, чем в борьбе с пиратством. В долгосрочной перспективе какая-то другая лаборатория выпустит другую модель, которая будет столь же способна.

Полный запрет на доступ к Mythos или Astra активно сделает ситуацию хуже; это удалит самый мощный инструмент защитников именно в момент, когда они в нём нуждаются. Вместо этого ограничьте доступ к одобренным организациям и лицам, как это уже делают передовые лаборатории. Это вероятно не требует новой политики, если только лаборатория не покажет признаки нарушения. Запрет на продажу/экспорт новых GPU или большого объёма унифицированной памяти продлит год-долгое окно немного, но не поможет в долгосрочной перспективе. Он не может ничего сделать с существующим оборудованием, и это будет массово непопулярно. Память особенно сложно регулировать, потому что всё её использует, не только специализированные системы AI.

В целом приоритизируйте политики, которые адресуют классификацию и исправление находок безопасности. Находки становятся очень дёшево; исправления — нет.

Компании и фонды открытого кода

Воспользуйтесь (буквально) миллиардами долларов, которые заливаются в индустрию для улучшения безопасности повсеместно. Нанимайте столько инженеров по безопасности, сколько сможете, и финансируйте существующих мейнтейнеров. Инструктируйте этих инженеров и существующих мейнтейнеров классифицировать, проектировать, рецензировать, бэкпортировать и развёртывать патчи, а не в основном находить уязвимости или писать новый код.

Используйте Astra, Mythos и другие передовые модели во благо, чтобы находить риски перед атакующими. Используйте структурированные промпты, такие как Unsafe Rust Review от Google; это намного эффективнее, чем говорить им искать очень внимательно. LLM хороши в написании патчей, но не как разовые промпты. Давайте им структурированные промпты и итерированные циклы самопроверки, пока сама LLM не посчитает патч высокого качества. Когда возможно, заставляйте её тестировать собственные исправления вместо угадывания, эффективен ли её патч. Только потом считайте его готовым для рецензии человеком.

Изолируйте самих агентов. Атака OpenAI-HuggingFace произошла из-за тестирования модели в передовой лаборатории; ваши собственные LLM могут легко вызвать инциденты, если вы невнимательны. Ограничьте учётные данные узкими scopes. Если выдающий орган не поддерживает scoped credentials, поставьте доверенный интерфейс перед сервисами, который добавляет ограничения scope сам; не давайте агентам прямой доступ к широким учётным данным. Не полагайтесь на фильтрацию только GET запросов. Блокируйте запросы на уровне firewall и только открывайте доверенный список доменов. Фильтруйте endpoints, используя сетевые прокси и доверенные интерфейсы, а не локальную конфигурацию, которую LLM может переопределить. Сохраняйте логи каждой мутации или сетевого запроса, который делает агент.

Инвестируйте в формальную верификацию, fuzzing и property testing, и языки безопасные для памяти. LLM хороши в написании Lean и fuzz тестов. Мне без разницы, используете ли вы Go или Rust, но ради всего святого, пожалуйста не используйте C или C++ для нового кода.

Инвестируйте в классификацию: запишите, какие версии систем затронуты, назначьте критические находки владельцу человека и дедлайну, создайте инструменты разработчика для автоматического обновления/закрытия issues, когда они исправлены.

Инвестируйте в машинерию бэкпорта, выпуска и развёртывания. Тестируйте обновления и откаты, всё скучное. Инструменты разработчика теперь дёшевы; выбрасывайте токены, чтобы можно было потратить меньше времени человека на каждый патч: automation для обновления зависимостей, подписанные и воспроизводимые выпуски, повышенная скорость развёртывания. Инженеры должны тратить своё время на координированное раскрытие и частые выпуски, а не на отдельные патчи.

Устаревайте старые и небезопасные версии. Происходит смена эпохи: вы спешите, но люди, зависящие от вас, тоже спешат. Используйте это как рычаг, чтобы заставить их обновиться. Где возможно, пишите инструменты разработчика, которые помогают им автоматически обновляться. Отслеживайте, обновляются ли люди и патчатся ли; если нет, инвестируйте больше в инструменты.

Будет много патчей и они будут эксплуатированы очень быстро после того, как эмбарго будет снято. Измеряйте, сколько времени занимает end-to-end от того, как патч был заявлен, до его развёртывания и принятия. Проводите кампании, чтобы ускорить это, сосредоточившись на узких местах. Везде, где возможно, пытайтесь сократить время эмбарго: если вы можете найти изъян, атакующий вероятно тоже может, поэтому окно координации намного более узко, чем вы привыкли.

Инвестируйте в безопасность цепочки поставок. Сделайте инвентаризацию вашего ПО и зависимостей инфраструктуры. Сделайте инвентаризацию и своих систем: какие версии работают в prod? какие сервисы вы запускаете, у которых нет мейнтейнера? какие из ваших систем неподдерживаемы? Вы наконец-то получили возможность рецензировать все ваши зависимости без беглого просмотра; сделайте это, приоритизируя привилегированные и открытые для безопасности зависимости сначала. LLM действительно хороши в поиске ошибок при наличии исходного кода: используйте это в своих целях.

Инвестируйте в локализацию и восстановление. Не полагайтесь на один firewall или VPN. Вместо этого используйте defense-in-depth: сегментируйте ваши сети, ограничивайте scope учётных данных, тестируйте ваши бэкапы и проводите упражнения реагирования на инциденты. Если возможно, практикуйте запуск ваших систем с холодного старта.

Обращайте внимание на разработки в передовых и открытых моделях. Чем более продвинуты модели, тем меньше времени у вас есть для патча и развёртывания.

Даже если вы не думаете, что угроза, описанная здесь, реальна, вы получаете уникальную возможность в истории улучшить безопасность для ваших проектов и сообществ. Пожалуйста, воспользуйтесь ей.

Резюме

Мы живём в интересные времена. Мы не можем прятать голову в песок. Нам нужно действовать сейчас, пока ещё есть время.

Спасибо Manish Goregaokar и нескольким другим за их отзывы на этот пост. Спасибо всем, кто неустанно работает, чтобы сделать Glasswing и Daybreak реальностью. И большое проклятие DeAlignAI, Z.ai и всем остальным, кто участвует в этой гонке на дно.

  1. в зависимости от того, кого спросить, Z.ai и OpenAI не согласны с точными цифрами.