В 2024 году Anthropic запустила внутренний проект с почти пародийным названием Project Panama. Его цель в одном из внутренних документов формулировалась так:
Project Panama — наша попытка деструктивно отсканировать все книги в мире.
Формулировка содержалась во внутренних документах Anthropic, раскрытых в рамках коллективного иска авторов к компании.
Реальный масштаб операции впечатляет: компания покупала миллионы бумажных книг, срезала с них корешки, сканировала страницы промышленным оборудованием, а оставшуюся бумагу отправляла на переработку.
История интересна не только необычным способом сбора датасета. В ней сошлись сразу несколько важных вопросов:
- где AI‑компании берут данные для обучения;
- можно ли обучать LLM на книгах без разрешения авторов;
- меняется ли правовой статус копирования, если физическую книгу после сканирования уничтожить;
- зачем AI‑компаниям понадобились старые бумажные книги;
- действительно ли из‑за AI начали исчезать редкие издания.
Попробуем отделить подтверждённые факты от наиболее громких интерпретаций.
Сначала Anthropic скачала миллионы пиратских книг
До Project Panama Anthropic уже собрала крупную цифровую библиотеку книг.
Согласно материалам дела Bartz v. Anthropic, компания скачивала книги из пиратских источников, включая:
- LibGen;
- Pirate Library Mirror, или PiLiMi.
Размер этой библиотеки превышал семь миллионов книг.
Anthropic использовала часть произведений для обучения своих моделей, но не удаляла все исходные файлы после формирования конкретных обучающих датасетов. Компания создала постоянную внутреннюю библиотеку, из которой книги можно было выбирать для разных экспериментов и последующих запусков обучения.
Позже это разделение окажется принципиально важным для суда:
- использование произведений непосредственно для обучения модели;
- скачивание и хранение пиратской библиотеки как самостоятельного ресурса.
Суд оценил эти действия по‑разному.
Зачем было покупать бумажные книги
По мере роста юридических рисков Anthropic понадобился более защищённый способ получать книги.
Решением стала схема:
- легально купить бумажный экземпляр;
- самостоятельно его оцифровать;
- уничтожить физическую копию;
- оставить одну внутреннюю цифровую копию.
В начале 2024 года эта работа была оформлена как Project Panama.
Для проекта Anthropic привлекла Тома Тёрви — бывшего сотрудника Google, работавшего с партнёрствами Google Books. Компания начала закупать большие объёмы подержанных книг у крупных продавцов, включая:
- Better World Books;
- World of Books;
- The Strand и других поставщиков.
Проект не предполагалось афишировать. В другом внутреннем документе Anthropic говорилось:
Мы не хотим, чтобы стало известно, что мы над этим работаем.
Подробности Project Panama были опубликованы Washington Post после изучения более чем четырёх тысяч страниц документов из судебного процесса
Как выглядело деструктивное сканирование
Обычную книгу можно аккуратно фотографировать постранично, не повреждая переплёт. Но такой процесс слишком медленный для обработки миллионов экземпляров.
Anthropic использовала destructive scanning — деструктивное сканирование.
Технологический процесс выглядел примерно так:
- Книгу закрепляли в гидравлической резательной машине.
- Корешок или часть переплёта срезали.
- Освободившиеся страницы загружали в высокоскоростной промышленный сканер.
- Из изображений создавали цифровую и машиночитаемую текстовую копию.
- Бумажные остатки утилизировали или отправляли на переработку.
После удаления корешка вернуть книгу в исходное состояние практически невозможно. Поэтому слово «деструктивное» здесь используется буквально.
В судебном постановлении процесс описан следующим образом: Anthropic покупала печатные экземпляры, удаляла переплёт, сканировала страницы и уничтожала бумажную копию.
По данным Washington Post, проект обошёлся компании в десятки миллионов долларов. В документах также фигурировало требование к подрядчику быть способным обработать от 500 тысяч до 2 миллионов книг за шесть месяцев.
Таким образом, Anthropic приобрела и деструктивно отсканировала миллионы физических книг.
Почему книгу после сканирования обязательно уничтожали
На первый взгляд решение выглядит странно. Если книга уже куплена, почему бы не сохранить её на складе или передать библиотеке?
Ответ связан с авторским правом.
При обычном сканировании возникает две копии одного произведения:
- купленная бумажная;
- новая цифровая.
Anthropic строила процесс как one‑to‑one format shifting: один легально приобретённый экземпляр заменяется одной цифровой копией.
Физическая книга уничтожается — цифровая занимает её место.
Именно эту логику позже принял судья Уильям Олсап. В постановлении используется формулировка:
one replaced the other
То есть одна копия заменила другую.
Для суда было важно, что Anthropic:
- легально приобрела физическую книгу;
- не оставила одновременно и бумажную, и цифровую копию;
- не продавала и не распространяла цифровую версию;
- использовала её во внутренней библиотеке.
Это не означает, что уничтожение книги автоматически делает любое сканирование законным. Но в обстоятельствах конкретного дела оно стало важной частью аргументации fair use.
Что именно решил суд
В июне 2025 года судья Уильям Олсап вынес решение по части требований в деле Bartz v. Anthropic.
В медиа его часто пересказывают так:
Суд разрешил Anthropic обучаться на купленных книгах, если после сканирования книги уничтожаются.
Это не совсем точное описание. Суд отдельно рассмотрел два вида использования.
1. Использование произведений для обучения LLM
Суд признал обучение моделей Anthropic допустимым в рамках fair use.
В решении обучение было названо exceedingly transformative — исключительно трансформативным использованием.
Аргументация состояла в том, что модель не просто распространяет копии книг, а использует их для создания технологии, способной генерировать новые ответы и тексты.
Это не универсальное решение вопроса о законности любого AI training. Постановление относится к конкретному делу, конкретным доказательствам и американской доктрине fair use.
2. Оцифровка легально приобретённых бумажных экземпляров
Суд отдельно признал fair use создание внутренней цифровой копии из купленной бумажной книги, когда физический экземпляр после сканирования уничтожался.
Это было признано допустимым не потому, что обучение LLM автоматически оправдывает любое копирование, а по отдельной причине: одна приобретённая копия заменялась другой, выполненной в новом формате.
В резолютивной части постановления это разделение указано прямо:
Суд удовлетворяет требование Anthropic и признаёт использование для обучения добросовестным. Кроме того, переход из печатного формата в цифровой также признаётся добросовестным, но по другой причине.
Разборы:
- Reuters: Anthropic wins key ruling in AI authors’ copyright lawsuit
- The Verge: Anthropic wins a major fair use victory
- WIRED: Anthropic’s AI copyright victory still leaves piracy problem
А что с пиратскими книгами
Решение суда не было полной победой Anthropic.
Судья разделил использование книг при обучении и способ, которым компания получила исходные копии.
Даже если обучение модели признаётся трансформативным, из этого не следует, что компания может безнаказанно:
- скачать миллионы книг из пиратских библиотек;
- создать из них постоянное внутреннее хранилище;
- использовать его как замену легально приобретённой коллекции.
Суд отказался признать fair use создание и хранение центральной библиотеки из пиратски скачанных файлов:
использование произведения в конкретном трансформативном процессе может быть fair use, но получение и хранение незаконной исходной копии оценивается отдельно.
Судебный процесс должен был перейти к вопросу о размере потенциального ущерба, однако стороны заключили мировое соглашение.
Anthropic согласилась выплатить 1,5 миллиарда долларов по требованиям, связанным с пиратски полученными книгами. Соглашение охватило примерно 482 тысячи произведений — около 3 тысяч долларов на одно включённое произведение.
20 июля 2026 года федеральный суд окончательно одобрил settlement.
Почему старые бумажные книги снова стали ценным датасетом
В 2026 году история вышла за пределы одной Anthropic.
Издание 404 Media обнаружило, что ISBNdb — коммерческий поставщик книжных данных — открыто предлагает AI‑компаниям услуги массовой закупки физических книг.
Диапазон предложения — от тысяч экземпляров до заказов примерно на миллион наименований.
Маркетинговый тезис ISBNdb звучит так:
The world’s best AI training data is sitting on a shelf.
Компания предлагает искать преимущественно книги, изданные до 2022 года: в них почти наверняка нет текста, сгенерированного современными LLM.
Если новые модели обучаются на результатах работы старых моделей, возникают риски накопления ошибок, снижения разнообразия и так называемого model collapse.
На этом фоне старые книги обладают несколькими преимуществами:
- текст почти наверняка написан человеком;
- материал прошёл редактуру;
- книги содержат длинные связные повествования;
- в них есть специализированные знания, которых может не быть в открытом интернете;
- бумажный экземпляр иногда проще легально купить, чем получить цифровую лицензию.
ISBNdb называет книги до 2022 года «структурно гарантированно свободными от этого загрязнения».
AI‑компании действительно уничтожают редкие книги?
Книготорговцы из Европы и США сообщают о необычных крупных заказах:
- покупатели присылают длинные списки ISBN;
- ищут малоизвестные научные монографии;
- заказывают региональные исторические работы;
- скупают иностранные и давно не переиздававшиеся книги;
- иногда не раскрывают конечного клиента.
Голландские продавцы рассказывали о запросе примерно на 3 тысячи ISBN, включавшем специализированные и редкие издания. Они подозревали, что книги собираются использовать для AI training и после сканирования уничтожить.
Источники:
- NL Times: Rare book dealers fear tech firms are destroying obscure editions
- BNR: Tweedehandsboekverkopers slaan alarm
- Futurism: AI Companies Accused of Destroying Rare Books
Создала ли Anthropic юридическую лазейку
Отчасти — да.
После решения по делу Bartz у AI‑компаний появился сильный юридический аргумент:
Мы покупаем одну физическую копию, заменяем её одной цифровой копией и не увеличиваем количество экземпляров произведения на рынке.
Кроме того, остаётся открытым политический вопрос: должно ли право разрешать частной компании уничтожать физические книги, если их цифровые копии остаются закрытыми.
С точки зрения copyright одна копия могла заменить другую.
С точки зрения культурного сохранения это не всегда равноценная замена.
Итог
История Project Panama звучит как сюжет антиутопии: одна из крупнейших AI‑компаний покупает миллионы книг, промышленно срезает с них корешки, сканирует страницы и отправляет бумагу на переработку.
Но это не тайная попытка уничтожить человеческое знание.
Гораздо точнее описать происходящее как столкновение трёх систем.
Первая — технологическая. AI‑компаниям нужны большие объёмы качественного человеческого текста.
Вторая — юридическая. Купить физическую книгу и заменить её цифровой копией оказалось безопаснее, чем скачать тот же текст из пиратской библиотеки.
Третья — культурная. Частное цифровое хранилище не обязательно заменяет книгу, доступную библиотеке, исследователю или коллекционеру.
Anthropic показала, что физическую инфраструктуру XX века можно превратить в обучающий датасет XXI века. Суд решил, что при определённых условиях такая трансформация укладывается в fair use.
Теперь главный вопрос уже не в том, возможно ли это технически или юридически.
Главный вопрос — кто должен контролировать цифровые копии знаний после того, как их физические носители уничтожены.
