Новые рассекреченные материалы в исковом заявлении, которое The New York Times подала против OpenAI и Microsoft три года назад, раскрывают признания того, что использование контента для обучения AI означает кражу, и что AI-продукты угрожают существованию издательств.

По материалам иска, один из топ-менеджеров Microsoft частным образом назвал практику обучения AI обеих компаний «кражей», а руководство OpenAI признало, что его модели AI представляют «экзистенциальную угрозу» для издателей и журналистов, чьи материалы использовались при обучении.

Рассекреченные материалы также описывают, как компании получали и использовали контент, обходя платные подписки незаметно, создавали датасеты путём массового скрепинга и целенаправленно удаляли уведомления об авторских правах из данных обучения.

Стоит отметить, что большая часть новой информации исходит из самого иска The Times, а не из приложений, которые остаются под грифом «секретно». Цитаты ниже приводятся без исходного контекста.

Рассекреченный документ — это последний этап в трёхлетнем судебном разбирательстве, где The New York Times первоначально утверждала, что компании нарушили авторское право, обучая генеративные модели AI на её контенте.

Вопрос о том, имеют ли компании право использовать защищённый авторским правом материал для обучения AI, не имеет однозначного ответа, но судьи в целом поддерживали позицию AI-компаний о том, что такое использование является «добросовестным использованием» (fair use). Это правовое положение позволяет людям использовать защищённые авторским правом произведения без разрешения в определённых случаях, таких как пародия, журналистское освещение или критика. В начале этого месяца администрация Трампа подала ходатайство в поддержку лицензированного использования OpenAI защищённого авторским правом материала для обучения LLM.

Однако несколько новых признаний противоречат аргументам OpenAI о добросовестном использовании, в частности требованию того, что такое использование не должно наносить ущерб рынку оригинального произведения или его конкурировать с ним.

Например, собственные данные Microsoft показывают, что Copilot «answer engine» привёл к снижению переходов на домен The New York Times на целых 93% по сравнению с традиционным поиском Bing. Внутренняя презентация Microsoft, подготовленная директором Applied Science Брентом Хехтом в январе 2024 года, описывает это снижение как «doom loop», которое будет «вредить производительности наших моделей и всей паутине одновременно».

«Чрезвычайно необычно, что конечный продукт угрожает экономическому фундаменту своих важнейших поставщиков, но это именно та ситуация, которую мы создали для нашего бизнеса LLM с точки зрения его 'цепочки поставок контента'»
, — говорится в документе Microsoft, процитированном в иске.

CEO Microsoft Сатья Наделла также дал показания на допросе в начале этого года, что «всё, что защищено платной подпиской, должно быть лицензировано любым, кто хочет использовать его… для обучения или грунтования», и дал ясно понять, что если бы он узнал, что OpenAI скреплила и обучила модели на информации, защищённой платной подпиской, он бы «потребовал от OpenAI переобучить свои модели».

Другие признания противоречат разным аспектам теста добросовестного использования: глава ChatGPT в OpenAI Ник Турли написал во внутреннем сообщении, что издатели сталкиваются с «экзистенциальной угрозой» от продуктов вроде чатбота, которые являются «в значительной степени замещающими» и «будут становиться всё более замещающими по мере совершенствования».

Президент OpenAI Грег Брокман описал модели как «отличные в новостях». Наделла согласился под присягой в начале этого года, что общение с чатботами «заменило… предоставление вам информации прямо на веб-сайте через AI-платформу вместо необходимости перейти на исходный источник».

Такой язык свидетельствует о том, как технология может напрямую конкурировать с оригинальным произведением, а не его преобразовывать.

В документе Microsoft говорится о «реальном риске» того, что генеративный AI мог бы «существенно нарушить работу людей, которые создали данные, на которых была обучена базовая модель».

Масштаб копирования поражает воображение. Документы впервые раскрывают, что только в датасетах OpenAI mid-training содержится более 91 692 копии работ, опубликованных в The New York Times, Daily News и Center for Investigative Reporting. Датасет, полученный из Common Crawl, включал более 2 миллионов документов только с nytimes.com.

В служебной записке от января 2023 года Брент Хехт назвал это

«astonishing theft of unprecedented proportions» и «крупнейшей кражей труда в истории человечества»
.

Судебный документ подробно описывает, как OpenAI и Microsoft получали контент истцов, в том числе скреплением из Bing Index.

«OpenAI передала весь датасет обучения GPT-3 в Microsoft, который использовал его для оценки того, как внедрить модели OpenAI в свои собственные коммерческие продукты. Microsoft также предоставила данные обучения OpenAI через инициативы, называемые Project Taxi и Project Mango»
, — говорится в иске.

Компании предположительно собрали данные Project Mango в датасет обучения, содержащий копии как минимум 160 903 уникальных работ от издательств-истцов.

Чтобы получить максимум от скрепинга, сотрудники OpenAI разработали план обхода платных подписок без обнаружения. В судебных материалах показано, что когда исследователь OpenAI Ник Райдер рассказал Брокману о «взломе для обхода платной подписки nytimes», Брокман ответил: «ах, круто».

Сотрудники OpenAI также предположительно создавали датасеты обучения вроде WebText и WebText2, которые в непропорциональной мере полагались на скреплированный контент новостей. Они также извлекли миллионы статей из Common Crawl — свободного, открытого репозитория веб-данных. Результаты также описывают целенаправленные попытки удалить уведомления об авторских правах из данных обучения до того, как они попадали в модель, так как исследователи «не хотели, чтобы модель выводила» уведомления об авторских правах пользователям.

«Свидетельства, впервые раскрытые здесь, показывают, что OpenAI и Microsoft знали, что то, что они делали, неправильно», — сказал Стивен Либерман, адвокат New York Daily News, в заявлении, предоставленном TechCrunch.

OpenAI и Microsoft не ответили на запросы о комментариях.

Microsoft CEO Satya Nadella speaks during the OpenAI DevDay event on November 06, 2023 in San Francisco
Фото: Justin Sullivan / Getty Images