Новая статья в Psychological Science (ссылка) сообщает о неудачной попытке воспроизвести Study 2 из влиятельной статьи Ариели и Вертенброха «Procrastination, Deadlines, and Performance: Self-Control by Precommitment». Оригинальное исследование, опубликованное в Psychological Science в 2002 году (ссылка), показало, что люди лучше справляются с набором задач, когда для каждой задачи установлен отдельный внешний дедлайн, чем когда участники сами назначают себе сроки или сталкиваются с единым дедлайном в последний день для всех задач сразу. Статья оказала долгосрочное влияние: её включают в программы многих курсов по экономике и психологии, а число цитирований в Google Scholar превышает 2100.
Учитывая значимость этой работы, имеет смысл внимательно изучить оригинальное исследование, чтобы понять, почему оно не воспроизвелось. Именно этому и посвящён разбор — данному посту и следующему за ним.
***
Около 20 лет назад, 20 апреля 2006 года, один из авторов готовящейся публикации о репликации, Кайл Хайндман, получил файлы с оригинальными данными по электронной почте с адреса Дэна Ариели [1]. А примерно 3 года назад, 9 августа 2023 года, через неделю после того как Франческа Джино подала иск на 25 миллионов долларов, пришло неожиданное письмо от Хайндмана, в котором он переслал эти файлы. Данные были быстро проанализированы, после чего состоялся разговор с Хайндманом и его соавтором Альберто Бизином. В этом разговоре они сообщили о планах провести репликацию исследования, и поскольку в тот момент внимание было занято судебным иском, тема была отложена.
Недавно стало известно, что их репликация готовится к публикации в Psychological Science. А прочитав сноску 14 их статьи, обнаружилось следующее:
. . . В октябре 2024 года по просьбе редакторов мы поделились с Дэном Ариели анализом содержимого файла, предположительно относящегося к их Study 2, и попросили разрешения включить краткое изложение этого анализа в статью. Дэн Ариели отказал в этой просьбе, аргументируя это, среди прочего, тем, что полученные нами файлы могут не быть настоящими данными. Впоследствии он не предоставил нам никаких дополнительных данных из оригинальной статьи. Следовательно, мы не можем дополнить наш эксперимент по репликации каким-либо дополнительным анализом файлов, полученных в 2006 году, или любыми другими данными.
Это стало поводом вернуться к статье и полностью проанализировать оригинальные данные по двум основным исследованиям. Вывод: данные в Study 1 и Study 2 были фальсифицированы. В двух постах представлены доказательства, приведшие к этому заключению. Сегодняшний пост посвящён исследованию, которое не удалось воспроизвести (Study 2), следующий будет о Study 1.
Оценка о фальсификации данных основана исключительно на анализах, представленных в этих постах. Читатели могут ознакомиться с доказательствами и сделать собственные выводы.
Насколько известно, Клаус Вертенброх никогда не имел доступа ни к одной версии данных ни по одному из исследований. И, судя по всему, именно благодаря ему эти данные вообще существуют в поле зрения. Когда Кайл Хайндман в 2006 году обратился к авторам, Клаус ответил следующим письмом [2]:
ResearchBox содержит данные и код для воспроизведения всех результатов, представленных в этом посте.
Наконец, стоит отметить: когда эти посты были переданы Ариели и Вертенброху несколько недель назад, они обратились в Psychological Science с просьбой отозвать статью. На момент написания этот процесс продолжается.
Исследование, которое не удалось воспроизвести: Study 2 из Ariely and Wertenbroch (2002)
Как отмечено выше, Ариели и Вертенброх изучали, как дедлайны влияют на производительность. В условиях, когда участникам предстояло выполнить несколько задач, авторы предположили, что люди будут показывать лучшие результаты при равномерно распределённых дедлайнах для этих задач, чем когда все сроки истекают в конце.
Эксперимент включал стимулированное задание по вычитке текста. Каждый участник получал три документа по 10 страниц, каждый из которых содержал 100 «грамматических и орфографических ошибок» (стр. 222). Задачей участников было найти и исправить эти ошибки.
Шестьдесят участников были случайным образом распределены по трём условиям, ровно по 20 человек в каждом:
Условие 1. Равномерно распределённые дедлайны. Один документ сдавался каждую неделю — через 7, 14 и 21 день.
Условие 2. Самостоятельно назначаемые дедлайны. Участники сами выбирали сроки сдачи (в пределах 21 дня).
Условие 3. Дедлайн в последний день. Все три документа сдавались в последний (21-й) день.
Результаты идеально и убедительно подтвердили гипотезу авторов. Участники с равномерно распределёнными дедлайнами показали значительно лучшие результаты по производительности, задержкам и заработку [3].
Есть ли доступ к оригинальным данным?
Напомним: в 2023 году Хайндман переслал файлы, полученные с адреса Дэна Ариели в 2006 году. Это были три файла Excel — данные пилотного исследования, Study 1 и Study 2 — все со свойствами файла, указывающими, что данные были «последний раз сохранены» пользователем «Dan Ariely».
С помощью этих файлов удалось воспроизвести все девять средних значений и все девять стандартных ошибок, показанных на приведённом выше рисунке, что визуально показано в этой сноске: [4]. Также успешно воспроизведены шесть других средних значений, приведённых в тексте [5].
Тревожные сигналы
В ходе анализа было выявлено четыре серьёзных тревожных сигнала. Рассмотрим каждый по порядку.
Сигнал №1: слишком большой эффект
Как видно на воспроизведённом рисунке выше, Ариели и Вертенброх сообщают об идеальной картине результатов по всем трём зависимым переменным при выборке всего в 20 человек на условие. Эффекты также очень велики — чрезвычайно, неправдоподобно велики.
Рассмотрим результаты по производительности вычитки. Участники с равномерно распределёнными дедлайнами сделали в среднем 136,1 исправления, тогда как участники с дедлайном в последний день — в среднем всего 71,1 исправления, примерно вдвое меньше. Этот эффект имеет Cohen’s d = 2,5, что означает разницу средних значений условий на 2,5 стандартных отклонения. Корреляция между экспериментальным условием и числом исправлений составляет r = 0,79.
Чтобы оценить, насколько это много, стоит сравнить с другими известными размерами эффекта. Эффект d = 2,5 больше, чем очевидные эффекты, которые замечаются невооружённым глазом в повседневной жизни. Например, он значительно больше эффекта пола на рост (мужчины выше: d ≈ 1,8) и на количество обуви (женщины владеют большим числом пар обуви: d ≈ 1,2; см. Colada[18]). Он также больше, чем некоторые проверки манипуляции. Например, Petty и Cacioppo (1984) сообщают, что участники, ознакомившиеся с сообщениями, содержащими девять аргументов, говорили, что встретили больше аргументов, чем те, кто видел сообщения с тремя аргументами. Это логично ожидаемый результат. И он действительно подтвердился, но лишь при d = 1,49 [6]. Маловероятно, что дедлайны влияют на производительность вычитки сильнее, чем количество аргументов влияет на воспринимаемое число аргументов.
Размеры эффекта 2,5 и выше не являются невозможными — они иногда наблюдаются при проверках манипуляции — но чрезвычайно редки для неочевидных психологических находок, особенно для такой шумной и сильно варьирующейся между людьми меры, как обнаружение ошибок при вычитке текста.
Ещё один способ оценить масштаб эффекта — посмотреть на распределение зависимой переменной по условиям. Приведённый ниже рисунок показывает, что они почти не пересекаются. Например, никто в условии с дедлайном в последний день не сделал более 100 исправлений, тогда как в условии с равномерно распределёнными дедлайнами это сделали 90% участников:
Сигнал №2: дублирующиеся наблюдения
Если при взгляде на приведённый выше рисунок возникла мысль «а почему так много красных столбиков со значением 2?» — это верное наблюдение. Действительно странно. Двойки обозначают людей, нашедших ровно одинаковое общее число исправлений по трём заданиям. Но на деле странность ещё глубже. Эти участники нашли не просто одинаковое общее число исправлений, но и одинаковое число исправлений по каждому из трёх отдельных заданий по вычитке.
Вот скриншот оригинального файла данных, отформатированного и отсортированного для удобства восприятия:
Видно, что у 18 из 20 участников в условии «дедлайн в последний день» есть «близнец по исправлениям» — другой участник, нашедший ровно такое же число ошибок в каждом из трёх заданий по вычитке. Любопытно, что ID-номера этих близнецов отличаются ровно на 10 позиций (например, участник S1 и участник S11 — близнецы; так же S7 и S17 и так далее). (В двух других условиях подобных близнецов не наблюдалось.)
Наличие такого количества близнецов — причём только в одном условии — несовместимо с тем, что эти данные реальны.
Сигнал №3: то, что должно быть тесно коррелировано, совсем не коррелирует
В конце исследования Ариели и Вертенброх якобы «попросили участников оценить общее впечатление [от задания по вычитке] по пяти параметрам: насколько им понравилось задание, насколько оно было интересным, насколько хорошим было качество письма, насколько хорошим было грамматическое качество и насколько эффективно текст передавал заложенные в нём идеи» (стр. 223). Ответы давались по шкале от 0 до 100. Авторы репликации задавали своим участникам те же вопросы.
Логично ожидать, что эти оценки будут коррелировать между собой. Например, если кому-то понравилось задание, вероятно, он также сочтёт его интересным.
В данных репликации это оказалось (сверх)верно. С учётом контроля по экспериментальному условию, частичная корреляция между «понравилось» и «интересно» оказалась вполне разумно близкой к идеальной [7]:
Но в оригинальных данных эта связь оказалась не просто неидеальной — она вовсе отсутствовала. Участники, сообщавшие, что задание понравилось им больше, не отмечали при этом, что оно показалось более интересным:
Всего было пять субъективных показателей. В данных репликации частичные корреляции между этими пятью показателями варьируются от +0,63 до +0,92. Все они велики и в высшей степени значимы (p < 0,0000024). В оригинальных данных эти корреляции варьируются от -0,29 до +0,18, и ни одна из них не является одновременно положительной и значимой. Это очень странно.
Проблема не ограничивается субъективными показателями. Учитывая, что участники выполняли три очень похожих задания по вычитке, каждое со 100 ошибками, логично ожидать, что те, кто лучше справляется с одним заданием, также лучше справятся с почти идентичным другим. Этот простой факт должен проявляться в чрезвычайно высоких корреляциях между результатами по разным заданиям. И в данных репликации именно так и происходит — корреляции варьируются от +0,74 до +0,90. Но в оригинальных данных этого нет: корреляции варьируются от +0,03 до +0,27.
Наконец, участников просили сообщить, сколько минут они потратили на каждое из трёх заданий. И снова логично ожидать, что те, кто сообщил о большем времени на одно задание, скорее сообщат о большем времени и на другое, почти идентичное задание. Соответственно, эти переменные должны быть тесно коррелированы. В данных репликации так и есть — корреляции варьируются от +0,79 до +0,95, — а в оригинальных данных нет: корреляции варьируются от +0,05 до +0,17.
Рассмотренные в этом разделе корреляции — по сути просто проверки на здравый смысл. Коррелирует ли «нравится» с «интересно»? Коррелирует ли результат по одному заданию с результатом по другому? Коррелирует ли заявленное время с заявленным временем? Осмысленные данные проходят эти проверки. Бессмысленные — нет. Данные репликации осмысленны. Оригинальные данные — нет.
Сигнал №4: отсутствие округления в самостоятельно указанных минутах
Как упоминалось выше, Ariely and Wertenbroch (2002) якобы просили участников «оценить, сколько времени они потратили на каждое из трёх заданий» (стр. 223). Когда люди дают подобные оценки, они, как правило, округляют. Обычно говорят «20 минут» или «30 минут», а не «17 минут» или «32 минуты». И действительно, когда авторы репликации спрашивали участников о потраченном времени, 85% из них дали круглое число:
Именно этого и следовало бы ожидать от людей.
Но в оригинальных данных этого не наблюдается. Лишь 11,7% указанных значений минут были круглыми числами — что близко к 10%, ожидаемым просто по случайности:
Это не то, что можно было бы ожидать от людей.
Заключение
Найти безобидное объяснение всем перечисленным аномалиям не удаётся. Оригинальные результаты слишком велики, но при этом не воспроизводятся; присутствуют дублирующиеся наблюдения; корреляции, которые должны быть очень сильными, зачастую отсутствуют вовсе; значения, которые должны быть округлены, округлены не были. На основании этих данных есть основания полагать, что данные Study 2 из Ariely and Wertenbroch (2002) были серьёзно фальсифицированы или сфабрикованы для получения желаемых результатов.
В следующем посте будут представлены анализы файла данных Study 1, полученного Хайндманом от Дэна Ариели. Этот эксперимент устроен совсем иначе. Анализ проведён иначе. Но выводы оказываются весьма схожими.
Отзывы авторов
Примерно 6 недель назад, 20 июля 2026 года, черновики постов были переданы оригинальным авторам (Дэну Ариели и Клаусу Вертенброху), авторам репликации (Кайлу Хайндману и Альберто Бизину) и главному редактору Psychological Science (Симин Вазир).
Клаус Вертенброх прислал ответ, в котором начинает с благодарности Хайндману и Бизину за проведённую репликацию. Повторяет, что никогда не имел доступа к данным ни по одному из исследований. Он разграничивает спрос на прекоммитмент — вывод, который был воспроизведён Хайндманом и Бизином и согласуется с более ранними работами его и других авторов, — и эффективность таких прекоммитментов в этих конкретных исследованиях, которая не воспроизвелась. Также указал, что попросил редактора отозвать статью.
Полный текст ответа доступен по ссылке (PDF).
Дэн Ариели не ответил ни на одно из трёх отправленных ему писем. Однако 7 августа он опубликовал в LinkedIn (ссылка) и на личном сайте (ссылка) следующее заявление:
«. . . Недавно мне стало известно, что данные, лежащие в основе статьи 2002 года о дедлайнах и прокрастинации, соавтором которой я являюсь, содержат серьёзные аномалии. Имеющиеся у меня на сегодняшний день документальные материалы об этих экспериментах недостаточны, чтобы ответить на возникшие вопросы, а более чем через два десятилетия и сотни экспериментов спустя память также недостаточна. Моя ответственность заключается в обеспечении точности — в обновлении сведений об этих экспериментах и, вместе с соавтором, в сотрудничестве с журналом, впервые опубликовавшим нашу статью, для поддержки процессов рецензирования и отзыва.»
Ни LinkedIn, ни личный сайт Дэна не позволили archive.org сохранить копии страниц, поэтому обе страницы были записаны на видео (mp4).
Кайл Хайндман и Альберто Бизин попросили включить следующее заявление:
«Как указано в постах, в апреле 2006 года мы получили три файла с данными, приложенных к письму, отправленному с адреса электронной почты Дэна Ариели в MIT, без каких-либо указанных ограничений на их использование. В августе 2023 года мы предоставили эти файлы Ури Симонсону, Джо Симмонсу и Лейфу Нельсону для получения их профессиональной оценки. Мы не участвовали в анализе Data Colada и в написании постов. Наша независимая репликация опирается на заново собранные данные и основана на самостоятельных методологических выводах. Вопросы о происхождении или целостности исторических файлов следует адресовать Data Colada, Дэну Ариели и учреждениям, отвечающим за эти вопросы.»
Симин Вазир сообщила, что вправе только заявить, что Psychological Science рассматривает «наилучшие дальнейшие шаги в отношении статьи 2002 года в соответствии с рекомендациями COPE».
Сноски
- PDF-копии этого письма и связанных с ним писем (включая размещённое ниже) доступны как в ResearchBox авторов репликации (3063), так и в ResearchBox (7135) этого поста. На протяжении поста файлы, полученные по электронной почте, называются «оригинальными» данными, хотя ранее могли существовать другие (неизменённые) версии.
- Как упоминалось в предыдущей сноске, это письмо включено в ResearchBox Хайндмана и Бизина. Вертенброх дал разрешение включить это письмо в пост.
- Ариели и Вертенброх называют свою меру производительности «обнаруженные ошибки», но в этом посте она называется «сделанные исправления», и соответствующим образом изменён приведённый ниже рисунок. Это изменение сделано, чтобы читатели не путали «обнаружение ошибок» участниками в задании по вычитке с «обнаружением ошибок» в оригинальном наборе данных. Также изменены названия условий на более предпочтительные и интуитивно понятные.
- Рисунки опубликованной статьи воспроизведены с помощью полученных таблиц. Например, вот панель A рисунка 2:
- Однако не удалось воспроизвести все значения F, приведённые в опубликованной статье — статистические результаты, якобы полученные при проверке различий между средними значениями. Причина стала понятна после обнаружения более ранней версии рукописи, всё ещё размещённой на сайте INSEAD (ссылка). Это рабочий документ INSEAD «2001/09/MKT», на титульной странице которого указано «На рассмотрении, Psychological Science». Оказалось, что хотя некоторые средние значения изменились между рабочей и опубликованной версиями статьи, значения F остались прежними. Но при изменении средних значений должны меняться и значения F, сравнивающие эти средние. Следовательно, значения F неверны как минимум в одной из двух версий статьи. Есть основания полагать, что авторы изменили приведённые в статье средние значения, но забыли обновить значения F. Доказательства этого приведены в приложении (PDF).
- Из Petty and Cacioppo (1984, стр. 74): участников «спрашивали: «Сколько примерно аргументов автор привёл в пользу предлагаемого решения?» Участники могли указать любое число, и те, кто ознакомился с сообщениями из девяти аргументов, утверждали, что аргументов было значительно больше (M = 6,60), чем участники, ознакомившиеся с сообщениями из трёх аргументов (M = 3,68), F(1, 158) = 87,17, p < 0,0001». Из этого значения F можно вычислить Cohen’s d: d = 2×√(F/df_error) = 2×√(87,17/158) = 1,49.
- В этом разделе рассматриваются частичные корреляции с контролем по экспериментальному условию. Подлинная связь между тем, нравится ли задание, и тем, насколько оно интересно, должна проявляться внутри условий, а не только между ними. В отличие от этого, тот, кто фабрикует данные для создания различий между условиями, может непреднамеренно вызвать положительные необработанные корреляции, просто присваивая более высокие значения обеим переменным в одном условии по сравнению с другим.