Пополняя и без того растущий дефицит памяти и хранилищ, компании в сфере искусственного интеллекта, похоже, наметили новую цель — письменное наследие человечества. По данным расследования издания 404 Media, они через посредников скупают миллионы подержанных книг: так они получают высококачественные данные для обучения своих ИИ-моделей и одновременно стараются избежать общественного недовольства.

Стопки бумажных книг, которые ИИ-компании скупают для обучения нейросетейИсточник изображения — tomshardware.com

Почему ИИ охотится за книгами из «доцифровой» эпохи

Искусственный интеллект развивается на огромных объёмах данных, но не любых, а именно качественных. Беда в том, что посредственные тексты, сгенерированные самими же нейросетями (их часто называют «ИИ-мусором», или AI slop), заполонили сеть. Такое содержимое отравляет общий массив данных и мешает обучению: модель рискует «питаться собственными отходами» и постепенно деградировать. Поэтому ведущие разработчики обратились к знаниям, созданным человеком, — прежде всего к печатным изданиям, вышедшим до 2022 года. Именно они с наибольшей вероятностью содержат оригинальный, ещё не загрязнённый материал.

У бумажных книг есть и второе преимущество. Авторы начали давать отпор с помощью «отравления данных»: инструментами вроде Nightshade они вплетают в текст символы, которые человек читает как обычно, а модель воспринимает искажённо. По оценкам, на которые ссылается сама отрасль, достаточно всего 250–500 специально подготовленных документов, чтобы внедрить скрытую «закладку» в массив из триллионов фрагментов текста. Издания, напечатанные до появления таких приёмов, эту проблему обходят стороной — а заодно дают юристам чистую цепочку происхождения данных.

реклама кормит Уточку 🦆

Как устроена массовая скупка

Сетевая база ISBNdb, где, по заявлениям её владельцев, собрано более 111 миллионов книг, долгие годы была удобным местом для книготорговцев, библиотек и распространителей. На волне бурного роста ИИ-отрасли ISBNdb переориентировалась и стала предлагать отдельную услугу — оптовую закупку книг для разработчиков нейросетей. По сведениям 404 Media, один заказ может насчитывать от 1000 до миллиона экземпляров, а личность покупателя скрывают строгими соглашениями о неразглашении. Показательно, что после публикации расследования компания незаметно убрала со своих страниц рекламу этой услуги.

Прямых доказательств, что за закупками стоит именно та или иная ИИ-компания, нет, но настораживающих признаков хватает. Во-первых, в крупных заказах фигурируют только книги с Международным стандартным книжным номером (ISBN) — уникальным 13-значным кодом. Во-вторых, в подборках не прослеживается никакой логики по темам, жанрам или авторам. В-третьих, покупатели словно не смотрят на цену и берут издания по любой стоимости, даже явно завышенной.

реклама кормит Уточку 🦆

Всплеск продаж — от одиночек до мировой сети

Один профессиональный книготорговец, пожелавший остаться неназванным, рассказал 404 Media о небывалом росте продаж, начавшемся в апреле. Раньше в удачную неделю он сбывал около 20 книг, а в последние месяцы недельные продажи взлетели до нескольких сотен — это пятикратный рост по сравнению с обычным объёмом. О похожих скачках оптовых заказов сообщают и продавцы на площадках вроде Alibris и Biblio.

Явление вышло далеко за пределы одной страны. О массовых заказах на редкие и узкоспециальные издания сообщают букинисты из Нидерландов, Германии, Швейцарии и Испании. Отношение у самих продавцов двойственное: сделки приносят доход и помогают распродать залежавшийся товар, но многие понимают, что речь, скорее всего, идёт об уничтожении книг ради обучения нейросетей.

реклама кормит Уточку 🦆

Судебные прецеденты: от Anthropic до Google

Опыт использования бумажных книг у ИИ-разработчиков уже есть. Компания Anthropic, не раз фигурировавшая в исках, по имеющимся данным вложила миллионы долларов в извлечение текста из множества печатных изданий для своих моделей Claude — после чего книги уничтожались. В июне 2025 года суд под председательством Уильяма Алсапа признал, что обучение нейросети на легально приобретённых книгах подпадает под добросовестное использование. Однако отдельной проблемой стало хранение около 7 миллионов пиратских книг, скачанных с «теневых» библиотек. В итоге Anthropic согласилась на рекордное мировое соглашение: около 1,5 млрд долларов — примерно по 3000 долларов за каждую из почти полумиллиона книг, а также обязательство уничтожить спорные массивы данных.

Схожие претензии звучат и в адрес других гигантов. Группа издателей недавно подала иск против Google, обвинив корпорацию в незаконном использовании миллионов защищённых авторским правом книг при разработке моделей Gemini.

реклама кормит Уточку 🦆

Как книги превращают в данные — и уничтожают

На процессе против Anthropic Том Харви — один из создателей Google Books, позже возглавивший проект оцифровки Project Panama в Anthropic, — подтвердил, что компания привлекала несколько подрядчиков по сканированию. Среди них была Datamation Information Services, предлагающая как щадящее, так и разрушающее сканирование. В первом случае используют книжные, планшетные или V-образные сканеры, оставляя книгу целой. Во втором — из книги вырезают блок страниц и по одной прогоняют их через высокоскоростной промышленный сканер. Разрушающий метод быстрее и дешевле, поэтому ИИ-компании чаще выбирают именно его. Итог — уничтожение миллионов книг.

Этическая дилемма: знание, недоступное будущим поколениям

Печатные книги — настоящая сокровищница сведений для искусственного интеллекта. Но многие сомневаются в этичности их изъятия из оборота: неясно, отделяют ли компании редкие и вышедшие из печати издания от рядовых при оцифровке. Ещё тревожнее то, что отсканированные тексты попадают напрямую в закрытые массивы для обучения нейросетей, к которым у широкой публики нет доступа.

Получается противоречие: мы можем получить более умный ИИ, но заплатим за это тем, что часть человеческого знания станет недоступной для будущих поколений — исчезнув в частных хранилищах, куда посторонним хода нет.