ИИ-компании скупают старые книги тоннами. Потом срезают корешки, сканируют и уничтожают
В последние месяцы букинисты в Европе и США заметили странную закономерность: книги, которые годами пылились на полках, уходят пачками. Заказы приходят ночью, часто на сотни и тысячи наименований сразу: академическая литература, региональная история, лингвистика, право, экономика 1970–2010-х годов. Романы почти не берут. После покупки физические экземпляры, как правило, исчезают.
Дело вот в чём. Владельцы ИИ компаний сели и подумали — интернет уже сильно загрязнён текстами, которые написали нейросети, если продолжать кормить модели этим нейрослопом, возникает риск model collapse — модели начинают деградировать, воспроизводя свои же ошибки и упрощения. Печатные книги, изданные до массового появления генеративного ИИ становится одним из последних крупных источников чистого человеческого текста.
Компания ISBNdb, долгие годы занимавшаяся метаданными книг для продавцов и библиотек, теперь открыто предлагает лабораториям ИИ услугу оптовой закупки. На сайте звучит почти рекламный слоган и примерно выглядит так: «Лучшие в мире обучающие данные для ИИ лежат на полке». Книги называют тщательно отобранными, прошедшими экспертную оценку, специализированными знаниями и старательно структурированными. Это вам не дешёвый нейрослоп, который прёт сейчас из всех щелей.
Объёмы — от тысячи до миллиона экземпляров за заказ. Полный NDA, анонимность покупателя, стратегия и цели не разглашаются. Площадки вроде Alibris и Biblio фиксируют появление новых крупных оптовых клиентов, которые скупают целые списки по ISBN. Букинисты говорят о кратном росте продаж: вместо обычных 20 книг в хорошую неделю — сотни.
Самый громкий кейс принадлежит компании Anthropic и их внутренний проект Panama (начало 2024 года). Из судебных документов следует, что компания целенаправленно скупала миллионы подержанных книг, в том числе через Better World Books. Затем они применяли классическое разрушающее сканирование: гидравлические резаки срезают корешок, страницы идут в промышленные сканеры, бумага затем утилизируется. Внутренние документы показывали крайне амбициозный настрой: «destructively scan all the books in the world» (просканируем и разрушим все книги в мире). Операцию держали в секрете именно из-за репутационных рисков. Никто не оценит новостные заголовки типа: ИИ компании уничтожают миллионы книг. Но они где-то явно просчитались.
Суд в деле Bartz v. Anthropic (июнь 2025) признал такой подход честным и никак не нарушающим закон: книги были легально куплены, физический экземпляр уничтожался, цифровая копия никуда дальше не распространялась и использовалась только для обучения, то есть авторское право никак не нарушили и ладно. Отдельно компания урегулировала претензии по пиратским цифровым источникам на 1,5 млрд долларов.
Неразрушающие методы существуют (роботы вроде Treventus ScanRobot), но они медленнее и дороже. Когда речь идёт о сотнях тысяч и миллионах томов, скорость и себестоимость решают. Разрушающее сканирование — давно известная практика библиотек и коммерческих оцифровщиков. Разница в масштабе и в том, что конечный продукт почти никогда не становится публичным.
Модель не хранит книгу как файл. Она извлекает статистические закономерности языка, ну а после обучения физический объект и даже цельный текст в привычном виде больше не нужны. Получается односторонняя переработка: книга исчезла, обратно её уже не восстановить.
Если речь о массовом тираже, который и так лежит в десятках библиотек и на вторичном рынке, уничтожение одного экземпляра выглядит прагматично. Книга становится доступнее в цифровом виде (хотя бы внутри модели), а физический носитель и так избыточен.
Проблема начинается там, где встречаются редкие, давно вышедшие из печати, почти уникальные издания. Антиквары в Германии и Нидерландах уже бьют тревогу: уходят книги, которыми годами никто не интересовался, включая узкоспециализированные и региональные работы. Для коллекционера или историка такой экземпляр настоящий артефакт: бумага, переплёт, владельческие пометки, особенности издания.