ИИ-компании массово скупают подержанные книги, чтобы обучать нейросети на качественных данных вместо «загрязнённого» сетевого содержимого
Один книготорговец зафиксировал рост продаж с 20 книг в неделю до нескольких сотен — это в пять раз выше обычного объёма
Для перевода книг в цифру применяют разрушающий метод: у изданий срезают корешок и прогоняют отдельные страницы через высокоскоростной промышленный сканер
Anthropic согласилась выплатить 1,5 млрд долларов по мировому соглашению из-за хранения около 7 миллионов пиратских книг, использованных при разработке модели Claude
Пополняя и без того растущий дефицит памяти и хранилищ, компании в сфере искусственного интеллекта, похоже, наметили новую цель — письменное наследие человечества. По данным расследования издания 404 Media, они через посредников скупают миллионы подержанных книг: так они получают высококачественные данные для обучения своих ИИ-моделей и одновременно стараются избежать общественного недовольства.
Источник изображения — tomshardware.com
Почему ИИ охотится за книгами из «доцифровой» эпохи
Искусственный интеллект развивается на огромных объёмах данных, но не любых, а именно качественных. Беда в том, что посредственные тексты, сгенерированные самими же нейросетями (их часто называют «ИИ-мусором», или AI slop), заполонили сеть. Такое содержимое отравляет общий массив данных и мешает обучению: модель рискует «питаться собственными отходами» и постепенно деградировать. Поэтому ведущие разработчики обратились к знаниям, созданным человеком, — прежде всего к печатным изданиям, вышедшим до 2022 года. Именно они с наибольшей вероятностью содержат оригинальный, ещё не загрязнённый материал.
У бумажных книг есть и второе преимущество. Авторы начали давать отпор с помощью «отравления данных»: инструментами вроде Nightshade они вплетают в текст символы, которые человек читает как обычно, а модель воспринимает искажённо. По оценкам, на которые ссылается сама отрасль, достаточно всего 250–500 специально подготовленных документов, чтобы внедрить скрытую «закладку» в массив из триллионов фрагментов текста. Издания, напечатанные до появления таких приёмов, эту проблему обходят стороной — а заодно дают юристам чистую цепочку происхождения данных.
Как устроена массовая скупка
Сетевая база ISBNdb, где, по заявлениям её владельцев, собрано более 111 миллионов книг, долгие годы была удобным местом для книготорговцев, библиотек и распространителей. На волне бурного роста ИИ-отрасли ISBNdb переориентировалась и стала предлагать отдельную услугу — оптовую закупку книг для разработчиков нейросетей. По сведениям 404 Media, один заказ может насчитывать от 1000 до миллиона экземпляров, а личность покупателя скрывают строгими соглашениями о неразглашении. Показательно, что после публикации расследования компания незаметно убрала со своих страниц рекламу этой услуги.
Прямых доказательств, что за закупками стоит именно та или иная ИИ-компания, нет, но настораживающих признаков хватает. Во-первых, в крупных заказах фигурируют только книги с Международным стандартным книжным номером (ISBN) — уникальным 13-значным кодом. Во-вторых, в подборках не прослеживается никакой логики по темам, жанрам или авторам. В-третьих, покупатели словно не смотрят на цену и берут издания по любой стоимости, даже явно завышенной.
Всплеск продаж — от одиночек до мировой сети
Один профессиональный книготорговец, пожелавший остаться неназванным, рассказал 404 Media о небывалом росте продаж, начавшемся в апреле. Раньше в удачную неделю он сбывал около 20 книг, а в последние месяцы недельные продажи взлетели до нескольких сотен — это пятикратный рост по сравнению с обычным объёмом. О похожих скачках оптовых заказов сообщают и продавцы на площадках вроде Alibris и Biblio.
Явление вышло далеко за пределы одной страны. О массовых заказах на редкие и узкоспециальные издания сообщают букинисты из Нидерландов, Германии, Швейцарии и Испании. Отношение у самих продавцов двойственное: сделки приносят доход и помогают распродать залежавшийся товар, но многие понимают, что речь, скорее всего, идёт об уничтожении книг ради обучения нейросетей.
Судебные прецеденты: от Anthropic до Google
Опыт использования бумажных книг у ИИ-разработчиков уже есть. Компания Anthropic, не раз фигурировавшая в исках, по имеющимся данным вложила миллионы долларов в извлечение текста из множества печатных изданий для своих моделей Claude — после чего книги уничтожались. В июне 2025 года суд под председательством Уильяма Алсапа признал, что обучение нейросети на легально приобретённых книгах подпадает под добросовестное использование. Однако отдельной проблемой стало хранение около 7 миллионов пиратских книг, скачанных с «теневых» библиотек. В итоге Anthropic согласилась на рекордное мировое соглашение: около 1,5 млрд долларов — примерно по 3000 долларов за каждую из почти полумиллиона книг, а также обязательство уничтожить спорные массивы данных.
Схожие претензии звучат и в адрес других гигантов. Группа издателей недавно подала иск против Google, обвинив корпорацию в незаконном использовании миллионов защищённых авторским правом книг при разработке моделей Gemini.
Как книги превращают в данные — и уничтожают
На процессе против Anthropic Том Харви — один из создателей Google Books, позже возглавивший проект оцифровки Project Panama в Anthropic, — подтвердил, что компания привлекала несколько подрядчиков по сканированию. Среди них была Datamation Information Services, предлагающая как щадящее, так и разрушающее сканирование. В первом случае используют книжные, планшетные или V-образные сканеры, оставляя книгу целой. Во втором — из книги вырезают блок страниц и по одной прогоняют их через высокоскоростной промышленный сканер. Разрушающий метод быстрее и дешевле, поэтому ИИ-компании чаще выбирают именно его. Итог — уничтожение миллионов книг.
Этическая дилемма: знание, недоступное будущим поколениям
Печатные книги — настоящая сокровищница сведений для искусственного интеллекта. Но многие сомневаются в этичности их изъятия из оборота: неясно, отделяют ли компании редкие и вышедшие из печати издания от рядовых при оцифровке. Ещё тревожнее то, что отсканированные тексты попадают напрямую в закрытые массивы для обучения нейросетей, к которым у широкой публики нет доступа.
Получается противоречие: мы можем получить более умный ИИ, но заплатим за это тем, что часть человеческого знания станет недоступной для будущих поколений — исчезнув в частных хранилищах, куда посторонним хода нет.















