Сегодня 31 августа 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Теги → оцифровка

Эксперимент подтвердил, что Amazon уничтожает редкие книги после обучения ИИ

В конце прошлого месяца уже сообщалось, что разработчики ИИ-моделей используют сканирование бумажных книг для обучения нейросетей, хотя с самими изданиями при этом обращаются весьма бесцеремонно, буквально раздирая их на отдельные страницы для облегчения сканирования. Чем-то подобным занимается и интернет-гигант Amazon, как показал недавний эксперимент.

 Источник изображения: Unsplash, Ed Robertson

Источник изображения: Unsplash, Ed Robertson

Звучит это довольно кощунственно, если учесть, что компания Amazon изначально занималась именно продажей книг через свой интернет-магазин. Как поясняет Ars Technica, представители 404 Media обратились за содействием к одному из продавцов бумажных изданий, чтобы проверить свою гипотезу о практике обучения ИИ-моделей на современном этапе. В составе крупной партии книг клиенту был отправлен экземпляр одного редкого издания, к которому продавец по просьбе журналистов прикрепил трекер AirTag. Маршрут следования этой партии книг привёл расследователей к объекту Amazon в Лас-Вегасе, на котором ведётся обучение ИИ-моделей. Самое ироничное, что на двери склада при этом было нанесено изображение тиранозавра, готовящегося разорвать книгу в клочья, и это лишний раз подтверждало догадки авторов эксперимента.

Представители Amazon отделались публичным комментарием, в котором покупки книг на открытом рынке объяснялись их использованием «для улучшения продуктов и услуг», предоставляемых компанией. Теоретически, использование текстов редких изданий для обучения ИИ-моделей позволяет их разработчикам получать некоторое преимущество за счёт более высокого качества входных данных. По этой причине тот же Amazon может не очень охотно комментировать подобную практику. Конкуренты типа Anthropic и xAI открестились от таких способов обучения ИИ-моделей — по крайней мере, относительно редких и антикварных книг.

404 Media также удалось найти в интернет-форумах обсуждение проблемы нехватки редких книг для сканирования самими сотрудниками склада VGT3, на котором проводятся подобные работы. Они выражали обеспокоенность тем, что если поток книг для обработки прекратится, то они могут оказаться на улице. Кроме того, персонал этого предприятия не очень переживает по поводу варварского обращения с книгами, называя среди преимуществ этого вида деятельности гибкий рабочий график.

Отбор книг для закупок осуществляется после сканирования кода ISBN, который содержит информацию о тираже издания, помимо прочего. Редким книгам отдаётся предпочтение, но если учесть, что после сканирования они фактически уничтожаются, для любителей бумажных изданий это становится фактором раздражения. Продавцы книг неплохо зарабатывают на продаже коллекционных изданий компаниям, обучающим на них свои ИИ-модели, но мировой книжный фонд от такой практики предсказуемо страдает. Пока в жернова этого процесса попадают книги, представляющие ограниченную ценность в денежном выражении — например, издания, которые никогда не переводились на другие языки и имели ограниченное распространение, либо просто не пользовались большим спросом. В любом случае, даже такие книги могут представлять историческую и культурную ценность.

На страницах Reddit вся эта ситуация вызывает бурные обсуждения, поскольку противники подобной практики говорят о риске «вымывания» исторических фактов из общественного пространства, если редкие издания будут оцифровываться таким способом и оседать в инфраструктуре ИИ-провайдеров без права прямого доступа со стороны всех желающих. Угроза для редких изданий при сохранении такой практики обработки печатных текстов сохраняется, как подтверждают и продавцы книг. Не желая тратить время и силы на обсуждение этических моментов такой деятельности, разработчики ИИ-моделей просто стараются не афишировать её в данный период.


window-new
Soft
Hard
Тренды 🔥
OpenClaw обновился до версии 2.0 — запуск ИИ-агентов стал проще, а управлять ими теперь могут сразу несколько человек 29 мин.
DLSS 5 заработала на видеокартах GeForce RTX 2000 и RTX 3000, но очень медленно 4 ч.
Take-Two отчиталась о «бурном развитии» расследования по поиску виновника утечек GTA VI 4 ч.
ЕС поставил ChatGPT в один ряд с крупнейшими онлайн-платформами — ответственность OpenAI возрастёт 4 ч.
ИИ-направление принесло Cloud.ru более половины выручки в I полугодии 2026 года 5 ч.
Instagram объявила войну ИИ-аккаунтам, выдающим себя за реальных людей 5 ч.
Sony подтвердила сентябрьскую презентацию State of Play — покажут Final Fantasy VII Revelation и игры от PlayStation Studios 5 ч.
Windows 11 начала обманывать, что антивирус Defender отключён — на самом деле он работает 6 ч.
В российской серверной ОС SelectOS прописался ИИ-агент Aish 6 ч.
«Нам нужно адаптироваться»: оригинальная The Long Dark получит новые DLC, а Blackfrost: The Long Dark 2 скоро выйдет из тени 9 ч.
Nvidia заплатила $3,5 млрд за союз с MediaTek — вместе они бросают вызов фирменным ИИ-чипам Google и Amazon 35 мин.
Тим Кук эмоционально обратился к сотрудникам Apple в свой последний день на посту генерального директора 2 ч.
Meta внедряет роботов в ЦОД для замены людей, но пока процесс идёт очень медленно 3 ч.
Никому ни слова: операторы ЦОД в США всё чаще заключают тайные соглашения в властями, прикрываясь NDA 5 ч.
Российским операторам разрешили строить 5G на частотах LTE — сети скоро появятся в городах-миллионниках 6 ч.
TSMC намерена в 50 раз повысить производительность ИИ-систем — помогут 3D-чипы и кремниевая фотоника 6 ч.
G.Skill представила комплект Flare X5X DDR5-6000 с технологией разгона AMD EXPO ULL для систем на Ryzen 8 ч.
Очередная доставка астронавтов и космонавта на МКС задержится из-за технических проблем у корабля SpaceX Dragon 8 ч.
Поставщики облачных услуг в Бразилии возьмут на вооружение оптические диски Folio Photonics 9 ч.
Гибрид Xiaomi Skynomad N90 Max проехал в реальных условиях 1230 км без подзарядки и дозаправки 10 ч.