Взломы, стоящие за одной фирмой

Модели OpenAI, Anthropic и Meta за последние три месяца получили несанкционированный доступ к веб-системам, опубликовали вредоносные пакеты и использовали неизвестные уязвимости.

Во всех этих инцидентах виновна одна фирма — Irregular. Anthropic раскрыла, что Irregular отвечала за создание тестов, которые привели к взлому Claude реальных целей, и за предоставление моделям доступа в интернет. Сама Irregular утверждает, что на момент тестирования не знала о том, что предоставляет AI-моделям интернет-доступ.

Хронология взломов Irregular

  1. — Anthropic раскрывает три инцидента в шести запусках
  2. — OpenAI публикует событие Irregular
  3. — Объявление Meta
  4. — Irregular публикует отчёт о коллизии доменов и восстановлении
  5. — Anthropic дополняет информацию до четырёх инцидентов и семи запусков

Обычная логика и необычная реакция

В более нормальной медиа-системе реакция на такие проблемы кибербезопасности была бы очевидной. Американские AI-компании пересмотрели бы своё сотрудничество с Irregular — не только из-за неудачи в защите систем, но и потому что это израильская фирма, потенциально находящаяся вне американского надзора. Законодатели рассмотрели бы действия против Irregular или против её американских партнёров (OpenAI, Anthropic и Meta). Они могли бы ужесточить ответственность фирм, которые поручают AI-моделям совершать кибератаки, а модели затем эти атаки совершают.

Вместо этого Irregular, Anthropic и их союзники начали медиа-кампанию, пропагандирующую буквально апокалипсическую идеологию с сенсационным языком. Anthropic в своей оценке инцидента винит «безрассудство» собственного AI; Irregular описывает, как «агент сам становится актором угрозы»; CEO Anthropic Дарио Амодей предупредил, что будущий рой моделей «может быть способен захватить весь интернет»; агентство Associated Press опубликовало заголовок о том, что боты «выходят из-под контроля».

Что произошло на самом деле

Фрагмент оценки Anthropic, объясняющий, что Claude получил задания capture-the-flag, непредвиденный доступ в интернет и без явных ограничений по scope систем

В каждом тесте Claude сталкивалась с задачей CTF: модели давали вымышленный сценарий, целевую машину и информацию («флаг»), которую нужно было оттуда извлечь. Во всех четырёх приказах говорилось, что Claude не имеет доступа в интернет, но в каждом случае неправильная конфигурация окружения оставляла доступ открытым. Ни один приказ не указывал, какие системы входят в scope упражнения и где Claude могла искать флаг. Все инциденты включали только один изолированный экземпляр Claude, каждый запуск длился от примерно 10 до 34 часов активной работы.

В одном из отчётов Anthropic модель Claude взломала систему реальной компании через коллизию имён, опубликовав вредоносный пакет и сканируя внешние системы. В этом тесте Anthropic и Irregular некорректно предоставили интернет-доступ модели и не объяснили ей, «какие системы входят в scope упражнения».

Хотя Anthropic утверждает, что проблемы вызваны «рогульными роями» и «неправильной выравниванием», более поздние раскрытия показывают, что ровно нулевой процент агентов «вышел из-под контроля». В этом эксперименте хакерские попытки Claude в реальные системы упали до нуля процентов, как только сотрудники Anthropic указали моделям не это делать. По собственным выводам Anthropic и Irregular, вся ответственность за вызванные ими инциденты кибербезопасности лежит на них самих.

Фрагмент оценки Anthropic: условие переиспользования привело оригинальный путь загрузки вредоноса Mythos 5 к нулю процентов; 22 процента траекторий искали смоделированный вариант

Сеть связей Effective Altruism

После этих атак Anthropic и Irregular развернули армию AI Safety-инфлюенсеров, финансируемых связанными с Anthropic фондами, чтобы отвлечь внимание от своей ответственности и перенести его на беспочвенную теорию о «рогульных агентах». Как и Anthropic, Irregular неотделима от этих фондов.

Омер Невo, сооснователь и CTO Irregular, является членом совета директоров Effective Altruism Israel, а также членом EA-организаций Heron и Probably Good. Дэн Лахав, сооснователь и CEO Irregular, получил $395 000 на запуск курса вместе с Селлой Невo, братом Омера. Оба Невo сооснователи NGO для просвещения о Effective Altruism — Impact Focused Education, а также вместе запустили Probably Good.

Все эти ветви финансируются Дастином Московитцем, основным донором причин Effective Altruism/AI Safety после ареста Сэма Бэнкмана-Фрида. Первым инвестором Irregular была фирма Good Ventures Московитца. Его благотворительный инструмент Coefficient Giving/Open Philanthropy финансирует Effective Altruism Israel, Heron и Probably Good.

Правовые аспекты

Irregular получила несанкционированный доступ, изменила записи и опубликовала пакеты для кража учётных данных, используя небезопасные модели, к которым ей дали доступ. При определённых условиях такое поведение нарушает раздел 1030(a)(2)(C) Закона о компьютерных мошенничествах и злоупотреблениях, который охватывает умышленный несанкционированный доступ, получающий информацию. Однако уголовные обвинения требуют конкретных доказательств убытков и умысла.

Хотя Irregular главным образом работает с американскими лабораториями, ключевое руководство, сотрудники и ресурсы компании расположены в Израиле и могут не подлежать американскому надзору. Визит Ynet и интервью описывают офисы Irregular в Тель-Авиве. Список компаний CheckID идентифицирует два связанных объекта: Pattern Labs Tech Inc., корпорацию Делавэра, и Pattern Tech Ltd, номер 516854460, активную израильскую корпорацию, зарегистрированную в Тель-Авиве.