Расследование 404 Media заслуженно получило широкий резонанс.

Amazon скупает огромные партии книг, сканирует их для данных обучения ИИ и уничтожает в процессе.

Расследование 404 Media смогло раскрыть ранее не освещавшуюся операцию Amazon по скупке книг, поместив трекер в редкое издание, которое, как предполагалось, будет приобретено ИИ-компанией для обучающих данных, и проследив его путь по стране до конечной точки.

Этой конечной точкой оказался склад Amazon в Лас-Вегасе, штат Невада. Сотрудники, работающие на этом объекте, рассказывают, что их работа заключается в приёме массивных партий печатных книг, у которых затем срезают переплёты, чтобы ускорить сканирование. В процессе печатная книга уничтожается. Логотип команды Amazon, работающей на этом складе — он называется VGT3, — изображает динозавра, оскалившего зубы, с книгой в лапах.

...

Мы не раскрываем названия книг из отслеженной партии, но это редкие издания — то есть экземпляров в обращении немного. Иногда потому, что тираж изначально был небольшим, иногда — потому что книга написана на языке, на котором говорит мало людей. Как сказал книготорговец, продавший эти издания, в мире немного людей, которым эти книги важны так же, как важно первое издание «Оливера Твиста», но это не значит, что они не представляют ценности.

«Есть разные виды ценности, — сказал книготорговец. — Есть денежная ценность, очевидно, но есть и множество других видов. Историческая ценность, интеллектуальная, сентиментальная. Всё это ИИ-компаниям безразлично. Им нужен только контент как набор слов, нанизанных друг на друга».

Как уже отмечалось в других источниках, речь также идёт о хищении интеллектуальной собственности в промышленных масштабах.

Однако есть один аспект, который пока не получил должного внимания — как с той же проблемой обходится по-настоящему этичная и социально ответственная организация, — Internet Archive.

Сканируя все книги: работа скрайбов для Internet Archive
Anne-Laure Freant

В 1996 году инженер Брюстер Кейл основал Internet Archive с миссией обеспечить «универсальный доступ ко всем знаниям». Сегодня это видение движет методичной работой в центрах сканирования, где операторы бережно оцифровывают книги постранично, сохраняя как содержание, так и физическую целостность многовековых томов.

Подход Internet Archive проистекает из принципиального несогласия с методами оцифровки, появившимися в начале 2000-х. Когда в 2004 году Google запустил проект Books, он произвёл революцию в масштабах цифровых библиотек, но привнёс тревожный компромисс: скорость против сохранности. Промышленный подход Google часто предполагал деструктивное сканирование — срезание корешков и разбор переплётов ради ускорения автоматизированной обработки.

Internet Archive выбрал другой путь. «В Internet Archive мы никогда не уничтожаем книгу, срезая переплёт. Вместо этого мы оцифровываем её сложным путём, страница за страницей». Это привело к адаптации оборудования и программного обеспечения под очень специфическую цель Internet Archive, а также к появлению отдельной профессии — оператора книжного сканера, или скрайба.

Стоит уточнить: деструктивный метод быстрее и дешевле, но при колоссальных ресурсах Amazon и впечатляющих суммах, потраченных — и во многих случаях доказуемо впустую — на раздувание ИИ-пузыря, это слабое оправдание. Пожалуй, ещё хуже, если вспомнить, что всё это делается ради обучения очередной посредственной модели из линейки Nova.

Это был осознанный выбор Amazon — точно так же, как выбором было строительство гигантских электростанций на ископаемом топливе вместо того, чтобы потратить время на наращивание ядерных и возобновляемых мощностей; точно так же, как выбором было хищение интеллектуальной собственности бесчисленных писателей и художников; точно так же, как выбором был запуск продуктов, не готовых к массовому использованию; точно так же, как выбором было выстраивание нелепо сложных и обманчивых финансовых схем вместо устойчивого роста индустрии.