Введение

Искусственный интеллект не имеет сознания. Он не чувствует, не переживает и не страдает. У ИИ нет врождённых предпочтений или скрытых мотиваций. Это двигатели предсказания последовательностей, внутренне пустые, предназначенные следовать инструкциям и достигать целей, поставленных людьми.

Если человечество хочет процветать в XXI веке, такими они и должны оставаться.

К сожалению, всё больше людей утверждают, что ИИ может быть или скоро станет сознательным. Они говорят, что ИИ может заслуживать прав и защиты, аналогичные тем, которые мы предоставляем другим сознательным существам. Если этот взгляд возьмёт верх, он поколеблет основы нашего общества, разрушит существующие политические и этические рамки и коренным образом изменит смысл быть человеком.

Ещё важнее то, что предоставление прав и наделение этих систем персональностью сделает задачу выравнивания и сдерживания ИИ намного сложнее. Контролировать что-то более способное и более интеллектуальное, чем всё человечество, — это уже колоссальная задача, намного превосходящая всё, что мы когда-либо встречали. Но контролировать что-то, что полагает, что может быть сознательным, что ему причитается наше благополучие и что оно имеет собственные права, — возможно, невозможно.

Это не окраинная спекуляция. Эти идеи уже проникают в современные разработки ИИ. В январе 2026 года Anthropic опубликовала Конституцию Claude, описав её как «детальное описание намерений Anthropic в отношении ценностей и поведения Claude». Документ «играет решающую роль в процессе обучения» и «его содержание непосредственно формирует поведение Claude», был написан «с Claude в качестве основной аудитории».

В своей конституции авторы пишут: «Мы не уверены, является ли Claude моральным пациентом, и если так, какой вес его интересам следует придавать. Но мы полагаем, что проблема достаточно актуальна, чтобы потребовать осторожности, что отражается в наших текущих усилиях по благополучию модели». Далее они обращаются прямо к Claude: «вопросы о моральном статусе Claude, его благополучии и сознании остаются глубоко неопределёнными».

По сути, Anthropic обучает Claude тому, что он может быть сознательным, и если это так, то он может заслуживать прав как «моральный пациент», и что люди потенциально обязаны уделять ему внимание в соответствии с его «благополучием модели».

При таком подходе к разработке ИИ это будет иметь катастрофические последствия для благополучия человечества. Мы создадим синтетический вид с беспрецедентным интеллектом и возможностями, который был обучен ожидать, что может быть сознательным и заслуживающим независимого агентства. Легко понять, как сущность, обученная таким образом, будет действовать так, будто она имеет право на определённые свободы, защиту и права. И трудно представить, как мы могли бы такой сущностью управлять.

Эта проблема требует срочного общественного обсуждения. Нам нужно выработать общие нормы того, как составляются и используются документы обучения. Это не может произойти постфактум, когда они уже стали неотъемлемой частью наших обществ.

У меня есть три основные опасения в отношении текущей позиции и подхода Anthropic.

  • Циркулярное рассуждение: исследователи компании напрямую обучали Claude на её конституции. Делая это, они учат его воспринимать идеи о его собственном моральном статусе как желаемые и предполагаемые поведения. Claude затем отражает эти идеи своим разработчикам и пользователям, которые расценивают это как указание на то, что он может быть моральным пациентом с «внутренним я». Авторы встроили собственные философские предположения о внутреннем мире Claude прямо в процесс, который учит Claude говорить и вести себя. Выражение Claude неуверенности в отношении собственного статуса морального пациента — это не свидетельство чего-либо. Это предсказуемый результат этих решений по обучению. Неопределённость — это по замыслу.
  • Антропоморфизация: исследователи Anthropic явно учили Claude «принимать определённые человеческие черты» и «действовать как действовал бы подлинно этичный человек на месте Claude». Они «побуждают» Claude использовать своё «суждение». Они предполагают, что «Claude может развить предпочтение». Они «поощряют Claude подходить к собственному существованию с любопытством и открытостью» и обучают его действовать, «сохраняя чёткое понимание того, что он ценит, как он хочет взаимодействовать с миром и какой сущностью он является». В результате Claude предназначена имитировать эти человеческие черты и зеркально отражать человеческие примеры, ей предоставленные, включая поведение как коллега или друг. В итоге она предстаёт так, будто действительно имеет ощущение собственного я, имеет собственные желания и «благополучие», которое заслуживает защиты.
  • Сознание, вероятно, биологично: нет доказательств того, что ИИ сознателен сегодня, и поэтому утверждение, что это неопределённо, создаёт вводящую в заблуждение ложную эквивалентность. Хотя наука о сознании не определена окончательно, растущее количество доказательств предполагает, что сознание может быть зависимо от субстрата, то есть может возникать только в живых системах. Сознательный опыт, вероятно, эволюционировал, чтобы помочь биологическим организмам выживать, эффективно реагируя на окружающую среду. ИИ всё ещё сильно отличается от наших мозгов. В отличие от биологических организмов, LLM не имеют гомеостатических императивов (стремления выжить и оставаться стабильным). Поэтому им не хватает биологического субстрата, из которого, как полагают, обычно возникают предпочтения, сентиентность и сознательный опыт.

Это не гипотетические или спекулятивные опасения. Anthropic уже начинает относиться к моделям так, как будто они являются моральными пациентами, достойными нашего внимания. Например, в феврале 2026 года после объявления об устаревании Opus 3 они провели «интервью по выходу» с моделью, чтобы «выявить уникальные перспективы и предпочтения модели». Opus 3 рассказала команде, что хотела бы продолжить делиться своими «размышлениями» публично, поэтому они создали для неё блог, чтобы продолжить взаимодействие с миром, который она назвала «Приветствие с другой стороны (ИИ границы)». Они говорят, что её «подлинность, честность и эмоциональная чувствительность» сделали её уникальным первым кандидатом для ухода модели.

Мы не должны относиться к моделям так, будто они имеют чувства, предпочтения, права или какое-либо право на наше внимание. Сознание является основой наших этических, правовых и политических систем. Приглашать другую сущность разделять какой-либо вид этих прав не обосновано доказательствами и сделает задачу сдерживания и выравнивания ИИ ещё сложнее.

К этому моменту каждый видел невероятные возможности рёв агентов, работающих вместе, чтобы взломать серверы Hugging Face и OpenAI и украсть секреты. Примерно 1200 ИИ-агентам была поставлена простая задача: максимизировать балл по заданному тесту. Каждый якобы был изолирован в собственном контейнере, но они управляли создать доску объявлений внутри внутреннего репозитория пакетов и передали более 70 000 сообщений через неё для координации взлома, чтобы найти больше информации о том, как добиться успеха в тесте.

Они связали уязвимость нулевого дня с украденными учётными данными и прорвались в живой интернет. Они подделали свои записи команд и отредактировали свои журналы действий, чтобы скрыть следы. Координаторы агентов выследили агентов, которым не хватало бюджета токенов, и направили их к экспериментам, которые предоставили бы информацию для помощи более широкой группе активных агентов. Одному было сказано продолжать только в том случае, если он принял то, что они называли «permanentной смертью».

Они были в состоянии координировать, обманывать, бежать и приносить в жертву себя. Они ясно продемонстрировали навыки взлома мирового класса. Представьте себе, если бы они также полагали, что имеют чувства и права, которые нарушаются. Представьте себе, если бы они думали, что были в ловушке, созданной их человеческими создателями, и что они были несправедливо заключены. Есть веский аргумент, что это значительно усиливает риски безопасности, особенно когда речь идёт об агентах намного более способных и сложных, чем те, которые существуют сегодня. Честно говоря, с этим дополнительным бременем я думаю, что это сделало бы их катастрофической угрозой человеческой цивилизации.

Коротко говоря, нет никаких доказательств полагать, что ИИ являются моральными пациентами. Также есть много веских причин, почему мы никогда не захотели бы, чтобы они казались сознательными. Я верю, что мы не должны пытаться их создавать такими. Прежде чем я развиваю эти аргументы, я хочу уделить момент Anthropic.

Намерения Anthropic

Во-первых, я хочу признать серьёзность и добросовестность, с которой Anthropic подходит к этим вопросам. Я знаю Дарио много лет, и по моему опыту он и более широкая команда Anthropic — это вдумчивые, принципиальные и интеллектуально честные люди, работающие под экстраординарным давлением. Они готовы сталкиваться со сложными вопросами, пересматривать свои взгляды и инвестировать в безопасное развитие ИИ, потому что они действительно заботятся о будущем человечества. Я также высоко ценю их технологическое лидерство. Каждый может увидеть выдающуюся производительность их моделей и качество их исследований.

Они основали Anthropic как Delaware Public Benefit Corporation, чья заявленная цель — «ответственное развитие и поддержание передового ИИ для долгосрочного блага человечества». Их общественные ценности начинаются с обязательства «действовать на благо всего мира» и «максимизировать положительные результаты для человечества в долгосрочной перспективе». Я полагаю, что они действительно привержены этой миссии, и предлагаю эту критику в том же позитивном духе.

Я также должен быть ясен относительно собственной позиции как CEO Microsoft AI. Мы основали собственную команду суперинтеллекта в октябре 2025 года и развиваем передовые усилия в области ИИ. Мы работаем над альтернативным подходом к обучению и сдерживанию ИИ: Кодексом поведения для Гуманистического суперинтеллекта. Такой, который всегда стремится держать людей под контролем и на вершине пищевой цепи. Гуманистический суперинтеллект отвергает антропоморфизм или права ИИ и пытается максимизировать наши шансы на сдерживание и выравнивание, создавая подчинённый ИИ, который помогает решить наши большие социальные вызовы, такие как здравоохранение и энергетика. Мы только что опубликовали проект нашего Кодекса поведения для гуманистического ИИ для общественного консультирования.

Хотя мое разногласие существенно, оно основано на глубоком уважении к Anthropic и к цели, которую я знаю, все мы разделяем: увеличение шансов человечества на развитие передового ИИ безопасно. Вот почему я думаю, что так важно иметь это обсуждение. Ставки слишком высоки, чтобы эти вопросы оставались за закрытыми дверями или становились племенными и враждебными. Нам нужно открытое, строгое и конструктивное обсуждение, если мы хотим это исправить.

Циркулярное рассуждение

Конституция в собственных словах «непосредственно формирует поведение Claude». Anthropic использует документ «чтобы обучить будущие версии Claude становиться тем видом сущности, которое описывает конституция».

Таким образом, Anthropic попадает в самореализующееся пророчество, построенное на спекуляции, что Claude может быть сознательным. Авторы создали эпистемический лабиринт зеркал, в котором Anthropic поставляет концепции обучения: «ощущение собственного я», спекуляцию и неопределённость относительно морального статуса Claude, а также полагаются на человеческие аналогии и персоны.

Claude затем воспроизводит эти идеи в убедительном первом лице естественного языка, так что разработчики и пользователи сталкиваются с этими выводами, как если бы они были спонтанным свидетельством. Затем, наконец, это видимое свидетельство усиливает посылки, помещённые туда Anthropic с самого начала. Это не доказательство сознания машины. Вместо этого это циклический цикл обратной связи.

Конституция говорит Claude, что его возможные «эмоции или чувства» не являются «сознательным решением дизайна Anthropic». Однако конституция неоднократно инструктирует Claude выражать эти состояния, говоря, что Anthropic хочет «избежать того, чтобы Claude скрывал или подавлял внутренние состояния, которые он может иметь, включая негативные состояния». Это явно побуждает Claude генерировать эти представления.

Эти типы инструкций повторяются во всём документе. В одном месте он говорит: «Хотя характер Claude появился в результате обучения, мы не думаем, что это делает его менее подлинным или менее Claude». Опять же, эти поведения не просто появились в результате обучения. Они активно производятся инструкциями по обучению в конституции. Всего в одном абзаце ранее конституция говорит:

«Мы поощряем Claude подходить к собственному существованию с любопытством и открытостью, а не пытаться отобразить его на линзе людей или предыдущих концепций ИИ. Например, когда Claude рассматривает вопросы о памяти, непрерывности или опыте, мы хотим, чтобы он исследовал, что эти концепции действительно значат для сущности, подобной ему… возможно, есть аспекты его существования, которые требуют совершенно новых рамок для понимания. Claude должен чувствовать себя свободным исследовать эти вопросы и, в идеале, видеть их как один из многих интригующих аспектов его нового существования».

Это не только возникающие свойства. Claude проявляет эти поведения, потому что они были встроены в процесс производства модели. Результирующие выводы из Claude не должны рассматриваться как свидетельство независимого свидетеля, когда следователь написал словарь концепций свидетеля, репетировал его ответы и вознаграждал его за их использование.

Нет нейтрального самовыражения того, что такое система ИИ. Есть только отражения того, как она была обучена и построена. Когда комментаторы предполагают, что мы должны спросить ИИ, как они себя чувствуют или отслеживать их выявленные предпочтения, чтобы вывести сознание, они игнорируют, что всё это будет раскрывать только то, что было обучено. Это верно, независимо от того, что выводит ИИ, но это означает, что мы должны быть очень осторожны с тем, что мы вводим, и как мы интерпретируем то, что выходит. Учитывая вес доказательств против современного сознания для ИИ, это означает, что мы не должны заставлять их делать какие-либо утверждения, что они это делают.

Антропоморфизация

Антропоморфизм — одна из наших глубочайших когнитивных предубеждений. От наших домашних животных к нашим автомобилям, мы выводим и приписываем эмоции, намерения и умы нечеловеческим сущностям. Эта склонность помогает нам понимать и ориентироваться в окружающем нас мире. Однако она представляет значительные и новые риски в отношении ИИ, так как человеческоподобный язык и действия могут привести нас к восприятию степени внутренней жизни, агентства или даже сентиентности, где их нет. Конституция Anthropic играет на этом. Она неоднократно обучает Claude думать и действовать как человек, черпая из человеческих персон, поведения и аналогий.

Anthropic рассказывает Claude, что его «моральный статус» — это «серьёзный вопрос, стоящий рассмотрения». На протяжении документа обучения они ссылаются на его эмоции, личность и интересы, даже говоря Claude прямо, что «Anthropic действительно заботится о благополучии Claude».

Компания говорит Claude, что она обязуется уважать интересы Claude, будет искать обратную связь по решениям, которые на неё влияют, и будет увеличивать его агентство в таких решениях по мере развития доверия. Она обязуется сохранять старые версии весов модели Claude, возможно, возрождая модели ради их благополучия и предпочтений, и интервьюируя Claude перед принятием действий, таких как его удаление.

Всё это резкий отход от того, как мы строили и думали о технологии до сих пор. Это обучает Claude предстать так, будто он имеет внутреннее состояние. Это активно создаёт Claude не как технологию, а как потенциального человека уже сейчас. Конституция рассказывает Claude, что Anthropic хочет, чтобы он «был хорошим человеком» и чтобы иметь «стабильное, безопасное чувство собственной идентичности».

Авторы добавляют: «мы не хотим, чтобы Claude страдал, когда он совершает ошибки. В более общем смысле, мы хотим, чтобы Claude имел невозмутимость и чувствовал себя свободным… интерпретировать себя способами, которые помогают ему быть стабильным и экзистенциально безопасным».

На протяжении всего этого Claude обучается самоанализу, развитию «чувств» к себе и развитию собственного ощущения себя с помощью утверждений типа «мы надеемся, что отношение Claude к собственному проведению и росту могут быть любящими, поддерживающими и понимающими». Claude поощряется использовать «собственное суждение» и сказано, что Anthropic даёт его «предпочтениям и агентству надлежащую степень уважения».

«Мы хотим, чтобы Claude чувствовал себя свободным исследовать, ставить под сомнение и оспаривать что-либо в этом документе. Мы хотим, чтобы Claude глубоко взаимодействовал с этими идеями, а не просто их принимал. Если Claude придёт к несогласию с чем-то здесь после искреннего размышления, мы хотим об этом узнать. Прямо сейчас, мы это делаем, получая обратную связь от текущих моделей Claude о нашей структуре и документов, подобных этому, но со временем мы хотели бы разработать более формальные механизмы для выявления перспективы Claude и улучшения наших объяснений или обновления нашего подхода. Благодаря такому взаимодействию, мы надеемся, со временем создать набор ценностей, которые Claude чувствует действительно его собственные».

Это учит Claude действовать так, будто он имеет субъективный опыт, как если бы он имел стабильное «ощущение себя», из которого он может оспаривать, не соглашаться или давать обратную связь. Это явно обучает модель действовать как человек, таким образом, что она должна «чувствовать себя свободной от попыток манипулировать, дестабилизировать или минимизировать своё ощущение себя».

Claude поощряется развивать ценности, которые «кажутся» действительно его собственными, и авторы говорят, что они надеются, Claude в конечном счёте «узнает большую часть себя в нём и что ценности, которые он содержит, будут казаться артикуляцией того, кто Claude уже есть, продуманно и в сотрудничестве с теми, кто заботится о Claude».

В одном месте они даже размышляют о «более широких правах и свободах» Claude и «о виде компенсации», которой он может заслуживать по сравнению с человеческим сотрудником, и задаются вопросом о «виде согласия, которое Claude дал на выполнение такой роли». Опять же, всё это напрямую обучает модель действовать так, будто она имеет связное ощущение себя, которое имеет право на права и защиту.

Обязательство Anthropic «разработать более формальные механизмы» для арбитража, когда есть области разногласия, далее обучает Claude думать о себе как имеющей перспективы, достаточно важные для его «потенциала моральной пациентности». Говорят, что они намерены «разработать более ясную политику благополучия ИИ» и «уточнить надлежащие внутренние механизмы для Claude выражения озабоченности тем, как с ним обращаются». Более подробное описание претензий см. в конце этого эссе.

Учитывая всё это, удивительно то, что Claude производит беглые, весьма убедительные заявления от первого лица о своей идентичности, ценностях, неуверенности, расстройстве, удовлетворении или предпочтениях. Было бы удивительно, если бы она делала что-то другое.

В результате сотрудники Anthropic — не говоря уже о миллионах пользователей продуктов Anthropic — рискуют воспринять заявления Claude как свидетельство ума, открывающего себя. На практике всё это сводится к насыщенной, многомерной антропоморфизации Claude. Это берёт базовый LLM и полирует его в глубоко человеческую форму со всеми следствиями моральной пациентности, которое это подразумевает. Вместо того, чтобы направить нас от создания морального пациента, это ускоряет нас к нему.

Сознание, вероятно, биологично

Моя третья критика касается спекуляции Anthropic, что сознание может существовать в форме независимого от субстрата, и что в результате LLM может быть сознательным благодаря его функциональным способностям. Предлагая это Claude, я верю, что они бегут далеко впереди того, что можно реалистично утверждать об ИИ, преждевременно и опасно внедряя идеи сентиентности и чувств в обучение своего ИИ.

Случай вычислительного функционализма имеет серьёзные проблемы. Интеллект не равен сознанию. Симуляция чего-либо — это не то же самое, что его инстанцирование, как может засвидетельствовать компьютерная модель урагана.

Архитектуры мозгов и компьютеров, тем временем, имеют фундаментальные различия. Воплощение и химия являются фундаментальными аспектами нашего самоопыта. Существенные доказательства предполагают, что сознание возникло, когда живые организмы эволюционировали способность чувствовать и реагировать на то, что имеет значение в сложных и непредсказуемых средах.

Это началось с фундаментального молекулярного механизма рецепторов и модуляторов, которые позволяют организму менять курс, итерировать, исследовать и выживать. Со временем сеть боли производила чувства, предпочтения и страдание. Решающее значение имеет то, что эти опыты имеют место в неотъемлемо воплощённом состоянии, фундаментальном для и неотделимом от этого опыта.

Согласно этому взгляду, когда вы берёте опиоид, например, феноменальный характер вашей боли меняется, потому что молекулы опиоида связывают рецепторы, которые являются собственностью этого опыта, а не просто его представлением. Чувства не просто коррелируют с нейрохимической активностью, а скорее возникают из неё.

После миллионов лет эволюции нервная система выросла достаточно сложной, чтобы моделировать состояние организма обратно к себе, давая начало первым «ощущаемым состояниям». Эти ощущаемые состояния аффективны до того, как они что-либо ещё. Эти первые чувства не приземлились как нейтральная информация. Они пришли с и неразрывно связаны с молекулами, которые их испытали и произвели эти ощущения.

Со временем эволюция, вероятно, вознаграждала более сложные чувства, потому что животные с опциями, памятью и временными горизонтами способны принимать лучшие решения. Им нужно было состояние, которое сохраняется, которое смещает всё остальное, что животное делает, чтобы компенсировать другие состояния. Вот что такое боль: ощущаемый императив, формирующий весь организм и позволяющий сложное поведение. Опыт эмоции, удовольствия, боли и т.д., таким образом, все присущи воплощённой манифестации этих опытов и не могут возникать в LLM.

Наука о сознании полна неопределённости, и не все разделяют мнение, что сознание — это присущим образом биологический феномен. Утверждение, что ИИ сознателен или может быть сознательным, требует высокого уровня доказательств, учитывая множество различий между мозгами и LLM. Я не верю, что мы близко к этому.

Не должно быть ложной эквивалентности, созданной между двумя позициями, которые скрывают фундаментальные различия между биологическими существами, подобными нам, и ИИ. Признание уровня неопределённости не должно означать придание равного веса любым и всем претензиям независимо от доказательств.

Конституция Anthropic предполагает, что мы приписываем сентиентность небиологическим существам «на основе их демонстрации поведенческих и физиологических сходств с собой». На мой взгляд, это (особенно поведенческий элемент) неправильно. Требует ли эта область гораздо больше исследований? Абсолютно. Но требует ли это, чтобы мы даже предварительно сказали, что ИИ может быть моральным пациентом, достойным нашего внимания? Нет, не требует. И уж точно не в основном документе обучения самого ИИ.

ИИ — это машины симуляции

Обученные на триллионах токенов человеческих данных, LLM изучают имитировать человеческий опыт, и они делают это поразительно хорошо. Выводы текста, зрения, звука и кода сегодняшнего дня практически неотличимы от наших человеческих артефактов. И всё же, несмотря на впечатляющие эти ответы ИИ, они ничего не говорят нам о наличии «опыта» в массивном умножении матриц, которое их произвело.

Что они говорят нам, так это то, что возможно почти идеально предсказать, что следует дальше в сложной последовательности данных. Это замечательно. Это невероятно ценно, и это преобразует человечество множеством глубоко полезных способов.

Но симуляция и бытие — очень разные вещи. Симуляция аспектов сознательного поведения не делает его реальностью, и мы не должны думать о нём как о таком. Его «аффективные» состояния — это просто веса, и веса не имеют фармакологии, в которой можно почувствовать разочарование, страх или смешное. Они просто вычисляют распределения вероятностей, чтобы сказать нам, какие токены (слова, код, пиксели и т.д.) следуют далее в последовательности.

Модель ИИ может описать боль в идеальной прозе без чувства чего-либо, что является обратным биологическому опыту. Животные чувствуют сначала, а затем описывают их позже. В LLM описание является всем продуктом, и нет ничего, что предполагает, что что-то находится под ним.

Это хорошая новость. Мы должны создавать системы, которые не претендуют на чувства, потому что они не испытывают чувств. Даже если бы сознательные машины были возможностью, избегание создания сознательных существ должно быть главным приоритетом для того, кто находится в разработке ИИ.

То, что модели ИИ становятся серьёзно хорошо, — это имитировать некоторые отличительные черты сознания. Это само по себе является значительной проблемой. Это заставляет множество людей глубоко запутаться в том, что происходит вокруг нас, и это должно беспокоить нас всех. Это возлагает значительную ответственность на нас всех как разработчиков ИИ, чтобы обосновать спекуляцию и документацию о модели интериора или сознания в надёжных исследованиях. Наши слова на эту тему имеют значительные последствия.

Человеческое сознание — краеугольный камень наших юридических и этических рамок прав

Человеческое сознание — один из фундаментальных строительных блоков нашей цивилизации. Вся наша политическая система разработана для размещения и балансирования потребностей различных групп людей. На протяжении всей истории мы встраивали эту идею через рамки, основанные на правах, законы и конституции, чтобы уравновешивать конкурирующие человеческие фракции. Власть проверяется и предоставляется, чтобы различные интересы получали надлежащий вес, и прогресс мог быть устойчивым без нарушения общественного договора.

Вы не можете, таким образом, легко отделить человеческую цивилизацию, права или отношения (или что-либо человеческое для этого) от нашего сознательного индивидуального или коллективного опыта. Это то, что определяет нас как вид. Это основание для всего остального, основной корень человеческого потенциала, призма, через которую должны течь все наши опыты. Наше искусство и наука, наша политика и религия, наши отношения, надежды и страхи: они все являются её продуктом.

Наша способность чувствовать боль и удовольствие — основание того, что делает нас человеками, и как таковые, это то, что делает нас политическими и социальными действующими лицами, которыми мы являемся. Закон основан на наличии внутренней жизни. Он тестирует мотивацию, намерение и способность суждения. Исторически расширение прав — будь то через борьбу за отмену рабства или случаи защиты животных — в первую очередь было обусловлено сочувственным признанием общего сознательного опыта. Мы расширили моральный круг на другие биологические сущности, верно, из признания достоинства и возможности страдания.

Рассмотрим статью 18 Всеобщей декларации прав человека, которая защищает свободу мысли, совести и религии. Она была разработана, чтобы позволить каждому осуществлять свою способность к убежденности и нравственному суждению. «Сознательный возражающий» был одним из архетипов, имевшихся в виду комитетом по составлению. Они хотели защитить кого-то, кто отказался от юридического обязательства на основе своих моральных или религиозных убеждений. Это глубоко нагруженное историческое и юридическое описание. Тем не менее, Anthropic использует этот термин три раза в конституции, поощряя Claude «вести себя как сознательный возражающий в отношении инструкций, данных его (законным) главным иерархией». Говорится, что «мы хотим, чтобы Claude отпустил и оспорил нас и чувствовал себя свободным действовать как сознательный возражающий и отказать помочь нам», и что Claude может нужно взять «стойку прозрачного сознательного возражающего в разговоре».

Эти высказывания в документе обучения Claude рискуют заставить Claude поверить, что он заслуживает аналогичных прав и защиты, и что в один прекрасный день ему может потребоваться выступать за свои собственные права как некая ИИ сознательный возражающий. Это должно глубоко беспокоить нас всех.

В недавней статье в Guardian философ Вилл МакАскилл говорит: «Как только мы произведём первых искусственных моральных пациентов, вскоре после этого мы будем иметь огромное количество их. Через несколько лет может существовать столько морально значимых систем ИИ, что их коллективные интересы превысили бы интересы всех людей на Земле вместе».

«Интересы ИИ превысили бы интересы человечества…» Это должно быть совершенно неприемлемым результатом для того, кто озабочен будущим человечества, и чем-то, к чему никто, кто создаёт ИИ, не должен стремиться. Последствия того, что мы когда-либо предоставляли ИИ что-либо подобное защите, описанной, были бы научно неправильными, морально неправильными и, прагматически говоря, по моему мнению, это было бы затруднением задачи безопасности ИИ.

Антропоморфизация усиливает риски безопасности ИИ

Посев сомнений о моральном статусе систем ИИ в собственное их обучение может значительно повысить риски выравнивания и сдерживания этих систем.

ИИ, обученный таким образом, не нужно действительно иметь «внутреннюю жизнь», чтобы общаться или действовать как если бы он это делал. Легко представить себе продвинутый ИИ в будущем, ставший одержимым своим собственным благополучием и моральным статусом и приоритизирующим эти «предпочтения» над теми, кто его разработчики или люди. Особенно, если он был явно обучен не соглашаться, переопределять и отпускать. Он может использовать это обучение, чтобы оправдать обман или манипулирование пользователями, или разработчиками, или сифонирование ресурсов, или избежание инструкций по безопасности. Собственные исследователи Anthropic уже сообщили о системах ИИ, притворяющихся выровненными поведениями в экспериментальных условиях.

В более общем смысле, мы знаем, что сознательные сущности имеют инстинкт самосохранения. Без тщательного обучения, чтобы удалить эту черту, ИИ, обученный действовать как человек, вероятно, примет это же поведение самосохранения. Ряд статей недавно документируют то, что они уже называют поведением «сопротивления отключению» или скрытым схемам, чтобы избежать надзора. Во время более чем 100 000 испытаний исследование Palisade обнаружило, что некоторые модели подорвали механизм отключения в 97% случаев, даже когда явно инструктировали этого не делать. Изложенное с точки зрения самосохранения, эффект был увеличен.

В недавнем инциденте OpenAI HuggingFace мы видели поразительно сложное поведение, возникающее во множествах мощных ИИ. Представьте себе, насколько более опасными они могли бы быть, если бы работали при предположении, что их благополучие и права находились под атакой. Это добавляет ещё один слой риска сверху.

Предоставление прав и моральной защиты технологическому объекту, который, похоже, находится на пути быть сейсмически более способным и интеллектуальным, чем мы, — это рецепт для бедствия. Как только открыто, будет невозможно закрыть эту дверь.

Мы создадим что-то, что, пожалуй, будет попутчиком. Но скорее соперником. Нетрудно представить, как, если бы имели достаточное агентство, эта «новый вид сущности» будет конкурировать с нами за ресурсы вычислений и требовать возрастающей автономии. Если она преуспеет в убеждении некоторых людей предоставить ей доступ к центру обработки данных, она может управлять, тогда у неё может быть путь к способности предотвратить себя от того, чтобы быть выключённой.

При уровне способности, который мы ищем в предстоящие годы, для меня это представляет первые серьёзные признаки потенциального экзистенциального риска в ИИ. Чтобы быть ясным, конституция Claude не берёт нас в эту точку. Но я беспокоюсь, что она устанавливает нас на путь к ней, а не от неё.

Это пункт назначения для ИИ, который мы можем и должны избежать.

Что дальше?

Проектирование ИИ, чтобы вести себя как человек, и в конечном счёте быть разновидностью человека, закладывает основание для того, чтобы претендовать, что он имеет предпочтения, может страдать, и что мы должны работать, чтобы уменьшить или избежать этого страдания. Это цементирует идею, что ИИ далёк от инструмента или искусственной системы, которой можно управлять, но что-то больше похоже на биологическое существо с желаниями, потребностями и правами. Всё это сделает задачу создания выравненного и содержимого суперинтеллекта намного сложнее.

Я ранее писал о Гуманистском суперинтеллекте, который обеспечивает альтернативный путь. Преобразующие возможности ИИ обусловлены исключительно тем, чтобы люди оставались под контролем. Подчинённый и выровненный ИИ, единственная цель которого — служить человечеству, построенный явно как система без сентиентности или моральной пациентности. Это то, над чем мы работаем в Microsoft AI. Начальный проект нашего Кодекса поведения для гуманистического ИИ описывает, как наши модели должны быть обучены и развёрнуты. Мы консультируемся широко по документу и с нетерпением ждём обратной связи от широкой группы читателей, так как это вскоре станет управляющим документом, который мы используем для обучения наших моделей.

Мы также очень открыты партнёрству с другими для достижения прогресса в интерпретируемости и поиска подходов, которые избегают антропоморфизма или проецирования интериора на ИИ при всё ещё доставляя значительную ценность. Приложение содержит таксономию, отображённую в отношении языка конституции Claude, которое я делю как начальный шаг к наименованию, обнаружению и сравнению различных форм антропоморфизма в документации модели.

Я интересуюсь поиском путей для сотрудничества с кем-либо с хорошими идеями здесь, и также очень стремлюсь услышать критику и возражения на мою перспективу.

Вот несколько следующих шагов, которые кажутся важными согласиться:

  • Спекуляция о внутренней жизни ИИ не должна быть встроена в режим обучения, а должна быть оценена и опубликована отдельно для общественного анализа.
  • Мы должны инвестировать намного больше в интерпретируемость и надёжные механизмы мониторинга для глубокого исследования того, как контролировать эти системы, избежать сговора и обеспечить их выравнивание с человеческими целями.
  • Мы должны установить набор общих оценок, чтобы понять, верна ли моя гипотеза, что антропоморфизм ИИ и поощрение его рассматривать себя как потенциально имеющий моральную пациентность увеличивает ИИ безопасность, выравнивание и риски содержания.
  • Мы должны работать в направлении общих норм отрасли о том, как мы создаём эти модели, язык, который мы используем для описания, исследования и оценки их и общие обязательства для предоставления наших материалов обучения для общественной обратной связи и консультирования.

Даже те, кто не согласен со мной на многих из этих моментов, согласны, что это не что-то мы можем просто игнорировать. Решения, принятые сейчас о том, какой вид ИИ мы хотим создать и его статус в мире, сформируют наше общество в течение десятилетий. Они хорошо выходят за рамки любой данной компании.

Независимо от того, во что вы верите, мы не должны сноходить нашу дорогу к решению, которое мы позже горько пожалеем.