Loading prices...
Все новости
Плоская векторная иллюстрация раскрытой книги, светящейся ярко-голубым, с лучами света и частицами данных, вырывающимися со страниц — символ сканирования редких книг для обучения ИИ-моделей Nova от Amazon

Amazon сканирует и уничтожает редкие книги ради обучения Nova

Компания, начинавшая как продавец книг, теперь скупает их лишь для того, чтобы уничтожить. Расследование 404 Media поместило трекер внутрь редкой книги и проследило её путь до VGT3 — объекта Amazon в Лас-Вегасе, где, по словам сотрудников, вся их работа сводится к тому, чтобы принимать крупные партии печатных книг, обрезать корешки для ускорения сканирования и передавать сканы в обучающие данные для ИИ-моделей Nova компании Amazon, сообщил TechCrunch 17 августа со ссылкой на оригинальное расследование 404 Media.

Логика проста, хотя метод груб: общедоступный текст в открытом интернете уже в основном собран и использован, а повторное использование сгенерированного ИИ контента для обучения более крупных моделей рискует запустить хорошо описанный сбой под названием коллапс модели, когда модели, обученные на собственных выдачах (или выдачах друг друга), постепенно деградируют. Редкие, давно не переиздававшиеся книги обходят обе проблемы: в них текст, которого ни одна модель ещё не видела, написанный исключительно людьми, и его можно легально получить, просто купив экземпляр, без лицензионной сделки с издателем. Продавцы, имевшие дело с такими покупателями, подозревают, что операция систематически проходит по номерам ISBN, а не выбирает названия случайно, — фактически обрабатывая рынок редких и букинистических книг как ещё не тронутый датасет.

Покупает книги через коммерческие каналы, чтобы улучшать продукты и сервисы, которыми пользуются клиенты.

Amazon, заявление для прессы

Практика вызвала публичную критику, в том числе со стороны Илона Маска, который после публикации расследования попросил собственную ИИ-команду SpaceX сохранять редкие книги и сканировать их без обрезки корешков — это более щадящая версия той же идеи, а не отказ от сканирования книг для обучения как такового. Напряжение здесь не новое, просто меняются мишени: вопрос источников обучающих данных постоянно всплывает как практическое узкое место за более громкими заголовками об ИИ, а споры о том, как именно эти данные добываются, уже приводили к реальным юридическим и финансовым последствиям в других частях отрасли — включая соглашение Anthropic примерно на $1,5 млрд по искам о книгах, пиратски полученных для обучения, а не купленных.

На фоне этого соглашения подход Amazon интересен тем, что на бумаге он противоположен: покупка физических экземпляров через обычные коммерческие каналы полностью снимает вопрос о пиратстве, но поднимает другой — приемлемая ли это цена за обучающий датасет, если уничтожаются единственные сохранившиеся экземпляры давно не переиздававшихся книг, особенно тех изданий, которые библиотека или архив, возможно, никогда не успеют оцифровать, если последний экземпляр в обращении уже лишился корешка. Это напоминание, что борьба за то, как строятся ИИ-модели, разворачивается далеко не только вокруг кода чат-ботов и исков между ИИ-лабораториями, — тот же спор о том, кому принадлежат и кто контролирует обучающие материалы, не раз всплывал в делах вроде иска Apple о краже торговых секретов против OpenAI. Сама по себе практика от этого не становится незаконной — купить книгу и отсканировать её куда чище с юридической точки зрения, чем украсть пиратскую копию, — но это означает, что спор об обучающих данных расширяется за пределы вопросов согласия и лицензирования в сторону вопросов сохранности: скан и физический, доступный для сверки оригинал — не одно и то же, если оригинала больше нигде не осталось, чтобы этот скан с ним сверить.

Материал носит информационный характер и не является инвестиционной рекомендацией.

Опубликовано: 21:15 · 17.08.2026
Maks

Автор

Maks

Трейдер

Долгое время интересуюсь рынком криптовалют, являюсь трейдером, пишу статьи и новости о своем опыте простыми словами.

Комментарии (0)

Пока нет комментариев — будь первым!