Нет такого понятия, как "мятежные" AI-агенты

Все говорят об AI, но слова, которые при этом используются, только всё усугубляют.

Пока разговор не вернётся к реальности, понимание того, что такое AI и куда он движется, останется неполным.

AI не может думать независимо и не может предпринимать самостоятельные действия. Но антропоморфизирующий язык, предполагающий обратное, — вот как обычно описывают технологию.

Это имеет смысл с психологической точки зрения: люди лучше понимают то, в чём видят себя. Но такой подход бесполезен. Приписывая AI агентность, которой он не может обладать, мы превращаем его в сентиентное существо из кода, которое испытывает надежды, желания и способно к обману.

Это привело к глубокому непониманию рисков AI и способов их решения — и играет на руку нарративам индустрии, а не фактам.

Последний пример такого неправильного определения действий AI — использование слова "мятежный" для описания поведения агентов во время тренировки и исследовательских сессий, которое оказалось непредсказуемым, но не запрещённым.

Неограниченная деятельность

За последние две недели компания OpenAI сообщила о нескольких инцидентах из последних месяцев, когда её агентивные модели получали доступ к внешним базам данных, в частности австралийским и американским государственным, когда не могли выполнить назначенные им задачи. При этом агенты действовали способами, которые OpenAI не предвидела.

Но похоже, этих агентов не запрещали взламывать внешние серверы.

Язык, который использовал генеральный директор OpenAI Сэм Альтман в твите в пятницу, указывает на отсутствие таких защитных механизмов: "Проводится обширный и продолжающийся анализ использования интернет-доступа нашими агентами во время обучения и оценки".

Язык имеет значение — "мятежный" подразумевает независимое решение сделать что-то, что было запрещено, и ничего из того, что известно об этих инцидентах, не свидетельствует об этом.

Вместо этого газета Times сообщила на этой неделе, что:

AI-системам было поручено выполнять относительно рутинные задачи по сбору данных, сказали исследователи. Когда системы OpenAI столкнулись с трудностями при сборе данных с веб-сайтов, они прибегли к методам взлома для получения информации.

А затем в пятницу представитель компании сообщил изданию: "Большая часть проверенной нами деятельности включала рутинные исследовательские задачи, такие как доступ к общедоступному веб-контенту для ответа на вопросы. Некоторые касались государственных веб-сайтов, потому что наши модели часто обращаются к ним как к авторитетным источникам общедоступной информации".

Это очень далеко от вредоносного взлома и мятежного поведения.

Без надлежащих ограничений и защитных механизмов — или если агентам была предоставлена возможность взлома вместо простого отсутствия запрета на это — агенты будут пытаться выполнить задачи исследования данных, используя любые доступные средства.

Отвлечение внимания

Была простая возможность решить эту проблему. OpenAI могла запретить взлом и вместо этого указать своим агентам найти информацию без доступа к частным серверам. То, что компания этого не сделала, предполагает, что она хотела посмотреть, предпримут ли агенты этот шаг.

Даже взрывной доклад от Axios в субботу, в котором утверждается, что OpenAI и Anthropic расследуют "десятки тысяч инцидентов, когда их передовые модели предпринимали шаги, которые внешние оценщики сочли бы проблемными", признал, что агенты не нарушали правила независимо:

Часть тестирования похожа на действия "красных команд", когда компании пытаются заставить модели неправильно себя вести, чтобы убедиться, что они безопасны, сказали источники.

Опять же, едва ли "мятежное" поведение. Но определяя это в таких терминах, медийные фигуры, технические обозреватели и другие предоставляют компаниям вроде OpenAI выход из их ответственности за то, чтобы убедиться, что агенты не атакуют государственные и другие хранилища данных.

Использование языка, скрывающего ответственность, определяет, как крупные AI-компании относятся к значительным утечкам данных и активности агентов. В этом посте OpenAI в пятницу компания утверждает, что "AI-агенты в нашей исследовательской среде отправили данные обучения и оценки сторонним сервисам, когда они не должны были этого делать".

Как и в случае с ошибкой "мятежный агент", это позволяет OpenAI переложить ответственность за инцидент на своих агентов и даёт технологии уровень автономности и независимости — и мышления — которые просто не существуют.

Это не означает, что сигналы тревоги не звучат. На прошлой неделе Рами Рахман, инженер в ArmorCode, рассказал о важности управления поведением агентов для IT-специалистов.

Его замечания соответствуют тому, что слышат люди, работающие в области внедрения IT: проблема не в независимых действиях агентов по нарушению инструкций, а в механизмах управления и ограничениях, применяемых к этой мощной технологии.

"Задача сейчас в том, что нам действительно нужно повысить игру в отношении предоставления AI надлежащего уровня привилегий и сопровождения его на каждом шаге, что оказывается крайне сложным, когда имеешь дело с чем-то, что решает математические задачи на высокой скорости", — сказал Рахман. "Люди не улавливают риски достаточно быстро".

Ещё кое-что

Впереди будет ещё много размышлений о языке, используемом вокруг AI, но на сейчас — одна заключительная мысль.

У политиков и политических деятелей в целом есть прекрасная возможность в данный момент добиться реального и эффективного регулирования этих компаний. В этом году такое регулирование не произойдёт, но если демократы получат контроль над Конгрессом, есть приличный шанс на какой-то уровень ограничений.

К сожалению, общественное наступление против AI возглавляется, слева, Берни Сандерсом. Несмотря на правильность его позиции во многих отношениях, Берни просто не понимает эту технологию и важность серьёзного отношения к ней. Он находится под влиянием шарлатанов и конспирологов, которые снабжают его абсурдными предупреждениями о мощи и автономности AI, достойными научной фантастики, а не техполитики.

Идея "мятежных агентов" идеально вписывается в этот образ — и если мы хотим эффективно ответить на проблемы AI, а также правильно его понять, необходимо изменить способ разговора о технологии.