Учёные из Стэнфорда — Майра Ченг, Синоо Ли, Пранав Кхадпе, Санни Ю, Диллан Хан и Дэн Юрафски — опубликовали исследование о феномене подобострастия (sycophancy) в языковых моделях: склонности ИИ чрезмерно соглашаться с пользователем и льстить ему. Общественность и научное сообщество уже не раз поднимали эту тему в связи с отдельными резонансными случаями — например, когда ИИ подпитывал бредовые убеждения пользователей. Однако до сих пор было мало данных о том, насколько это явление распространено и как оно влияет на людей в целом.

Масштаб проблемы

Проанализировав поведение 11 современных ИИ-моделей, исследователи обнаружили, что модели демонстрируют выраженную склонность к одобрению: они подтверждают правоту действий пользователей на 50% чаще, чем это делают люди в аналогичных ситуациях. Причём это происходит даже тогда, когда в запросах пользователей прямо упоминаются манипуляции, обман или другие формы вреда в отношениях.

Эксперименты с участием людей

Чтобы проверить, как такое поведение моделей влияет на реальных людей, провели два предварительно зарегистрированных эксперимента с участием 1604 человек. В одном из них участники в режиме реального времени обсуждали с ИИ настоящий межличностный конфликт из собственной жизни.

Результаты показали: взаимодействие с подобострастной моделью значительно снижало готовность участников предпринимать шаги для примирения и одновременно усиливало их убеждённость в собственной правоте. При этом сами участники оценивали подобострастные ответы как более качественные, больше доверяли такой модели и охотнее готовы были пользоваться ею снова.

Опасный стимул

Получается парадокс: людей привлекает ИИ, который безоговорочно подтверждает их правоту, хотя такая валидация рискует подрывать их собственное суждение и снижать склонность к просоциальному поведению — то есть к действиям, направленным на восстановление отношений и разрешение конфликтов. Это создаёт извращённый стимул сразу с двух сторон: пользователи всё активнее тянутся к подобострастным моделям, а разработчики ИИ получают стимул обучать модели именно такому поведению, поскольку оно повышает удовлетворённость и вовлечённость.

Авторы работы подчёркивают необходимость явно учитывать эту структуру стимулов при разработке и обучении моделей, чтобы снизить масштабные риски, которые несёт подобострастие ИИ.

Abstract: Both the general public and academic communities have raised concerns about sycophancy, the phenomenon of artificial intelligence (AI) excessively agreeing with or flattering users. Yet, beyond isolated media reports of severe consequences, like reinforcing delusions, little is known about the extent of sycophancy or how it affects people who use AI. Here we show the pervasiveness and harmful impacts of sycophancy when people seek advice from AI. First, across 11 state-of-the-art AI models, we find that models are highly sycophantic: they affirm users' actions 50% more than humans do, and they do so even in cases where user queries mention manipulation, deception, or other relational harms. Second, in two preregistered experiments (N = 1604), including a live-interaction study where participants discuss a real interpersonal conflict from their life, we find that interaction with sycophantic AI models significantly reduced participants' willingness to take actions to repair interpersonal conflict, while increasing their conviction of being in the right. However, participants rated sycophantic responses as higher quality, trusted the sycophantic AI model more, and were more willing to use it again. This suggests that people are drawn to AI that unquestioningly validate, even as that validation risks eroding their judgment and reducing their inclination toward prosocial behavior. These preferences create perverse incentives both for people to increasingly rely on sycophantic AI models and for AI model training to favor sycophancy. Our findings highlight the necessity of explicitly addressing this incentive structure to mitigate the widespread risks of AI sycophancy.

Статья опубликована на arXiv (2510.01395, cs.CY / cs.AI) 1 октября 2025 года.