Anthropic тайно уничтожила миллионы книг ради обучения Claude, а в её библиотеке нашёлся «451 градус по Фаренгейту». Разбираю Project Panama
Из рассекреченных судебных документов стало известно, что создатель Claude скупал книги миллионами, срезал корешки гидравлическим прессом, сканировал и отправлял бумагу в утиль. Внутреннее название проекта Project Panama, внутренняя цель дословно «деструктивно отсканировать все книги мира». Самое странное в этой истории то, что именно уничтожение книг сделало эту практику законной. Разбираю документы, реакции и то, почему это касается каждого, кто создаёт контент
«Жечь было наслаждением». Так начинается «451 градус по Фаренгейту» Брэдбери, роман о мире, где книги уничтожают. На этой неделе выяснилось, что этот роман оказался среди множества книг, которые компания Anthropic добыла для обучения своей нейросети Claude. А добывала она их, среди прочего, так: скупала миллионами, срезала корешки гидравлическим резаком, сканировала и отправляла бумагу в утиль.
Это не метафора и не преувеличение. Washington Post изучила больше четырёх тысяч страниц судебных документов, рассекреченных в рамках иска о нарушении авторских прав, и восстановила картину операции, которую сама Anthropic внутри называла Project Panama. Разберу факты, юридическую развязку, которая многих удивит, и практический вывод, который касается любого бизнеса, производящего контент.
Что такое Project Panama
По документам, которые цитируют Washington Post и разбиравшие их издания, проект стартовал в начале 2024 года. Anthropic потратила десятки миллионов долларов на закупку миллионов физических книг. Дальше конвейер: гидравлическая машина срезает корешок, промышленные сканеры оцифровывают страницы, бумага отправляется в переработку. Физической копии не остаётся.
Внутренние документы не оставляют пространства для интерпретаций. Цель проекта в планировочном документе сформулирована так: «Project Panama это наша попытка деструктивно отсканировать все книги мира». Из тех же документов, как отмечает разбиравшая их пресса, видно, что в компании остро осознавали, насколько негативно такой проект был бы воспринят за её пределами, и публичности вокруг него не создавали.
Масштаб операции виден по деталям. В феврале 2024 года Anthropic наняла Тома Тёрви, который раньше руководил книжными партнёрствами в Google, с задачей добыть «все книги мира». Книги закупались у крупных букинистических сетей, Washington Post называет Better World Books и World of Books. В одном из предложений подрядчика фигурировала переработка от 500 тысяч до 2 миллионов книг за шесть месяцев.
Пиратская предыстория и полтора миллиарда долларов
У легальных закупок была нелегальная прелюдия, и именно из-за неё документы вообще оказались в суде.
По материалам дела, ещё в 2021 году сооснователь Anthropic Бен Манн скачал пиратскую библиотеку Books3 почти на 197 тысяч книг, затем миллионы книг с Library Genesis и других пиратских ресурсов. Суд установил, что всего компания получила больше семи миллионов пиратских копий. Судья Уильям Алсуп отдельно отметил в решении, что у компании были законные способы получить материалы, но она выбрала пиратство, чтобы избежать того, что гендиректор Дарио Амодеи назвал «юридической и деловой волокитой».
Расплата пришла в этом году: Anthropic согласилась выплатить 1,5 миллиарда долларов, это крупнейшее урегулирование по авторским правам в истории США, примерно по три тысячи долларов за книгу. В июле выплата получила финальное одобрение суда, пиратские файлы компания обязана удалить. При этом претензии не закончились: отдельно идёт иск на 75 миллионов и иск музыкальных издателей из-за текстов песен.
Юридический парадокс. Уничтожение сделало всё законным
Теперь самая контринтуитивная часть истории. Легальную часть проекта, покупку книг с последующим уничтожением, суд признал добросовестным использованием.
Логика судьи Алсупа в решении июня 2025 года звучит так: каждая купленная печатная копия была оцифрована, печатный оригинал уничтожен, «одно заменило другое». Количество копий в мире не увеличилось, цифровая версия использовалась только внутри компании и не распространялась. Формально это трансформативное использование законно купленной вещи.
Из этого следует парадокс, который сформулировали разбиравшие дело журналисты: именно уничтожение книги и сделало практику легальной. Сохранишь бумажный оригинал рядом с цифровой копией, у тебя две копии и вопросы. Уничтожишь оригинал, копия одна, и претензий нет. Закон, писавшийся задолго до нейросетей, создал ситуацию, в которой резать книги юридически безопаснее, чем бережно хранить.
Почему именно книги. Дефицит человеческого текста
Оставался вопрос, зачем вообще нужен этот конвейер, если интернет полон текста. Ответ важнее самого скандала.
Интернет стремительно заполняется текстами, которые написали сами нейросети. Обучать модель на продукции моделей опасно: исследование в Nature в 2024 году описало эффект коллапса модели, когда качество деградирует от поколения к поколению на синтетических данных. Поэтому чистый человеческий текст превратился в дефицитный ресурс, а книги, изданные до появления ChatGPT, в его самую надёжную форму: в них гарантированно нет машинного текста.
Рынок отреагировал мгновенно. Книги, изданные до 2022 года, продаются с наценкой именно по этой причине.
Здесь же самая тревожная часть для книжного мира. Прямых подтверждений, что под резак попадали последние экземпляры уникальных изданий, в документах нет. Но необратимость процесса очевидна: если редкая или давно не переиздававшаяся книга уничтожена после сканирования, замены не существует. Именно поэтому критики называют происходящее сожжением книг, а сторонники цифровым сохранением, и оба лагеря по-своему правы.
Реакции. От «воплощённого зла» до библиотеки SpaceXAI
Публичная реакция оказалась жёстче, чем на большинство AI-скандалов. Известный инвестор Майкл Бьюрри, тот самый из «Игры на понижение», отреагировал двумя словами: «Воплощённое зло». Илон Маск сообщил, что поручил команде SpaceXAI сохранять редкие книги в библиотеке и «сканировать их трудным путём, а не просто срезая корешок».
Стоит сказать честно: Anthropic здесь не одинока, просто её документы рассекретили первыми. Из тех же материалов известно, что сотрудники Meta переживали из-за скачивания пиратских книг с рабочих ноутбуков и получили разрешение использовать LibGen для обучения Llama 3, а торренты качали через арендованные серверы, чтобы активность не связали с компанией. Часть претензий Meta отрицает. OpenAI признавала использование LibGen в прошлом и утверждает, что удалила эти данные ещё до запуска ChatGPT. Разница между игроками не в чистоте, а в том, чьи внутренние переписки уже прочитал суд.
Что это значит для всех, кто создаёт контент
Теперь вывод, ради которого я это разбираю, потому что за скандальной фактурой стоит структурный сдвиг.
Главный урок Project Panama не в жестокости к книгам, а в том, сколько нейросетевые компании готовы платить за качественный человеческий контент: десятки миллионов долларов за закупку, полтора миллиарда за ошибки, целые логистические конвейеры. Человеческий текст официально стал стратегическим сырьём, за которое воюют крупнейшие компании мира.
Для бизнеса из этого следуют две вещи. Первая: всё, что вы публикуете, уже часть этой экономики. Модели учатся на открытом контенте, и в России это теперь прямо закреплено законом: подписанный в июле 243-ФЗ легализует обучение отечественных нейросетей на публично доступных материалах. То, что вы пишете о своём продукте и рынке, буквально формирует, что нейросети будут знать и отвечать о вашей категории.
Вторая: раз ответы моделей определяются тем, что они прочитали, видимость бренда в этих ответах становится измеримой задачей. Проверить, что нейросети уже выучили о вас, можно руками за вечер, а для регулярного замера существуют GEO-сервисы вроде Profound, AI Semantica, brandfound и других.
Что в итоге
Project Panama войдёт в историю как момент, когда стало видно настоящую цену обучающих данных: миллионы уничтоженных книг, «451 градус по Фаренгейту» в обучающей библиотеке, полтора миллиарда долларов выплат и юридический парадокс, в котором уничтожение оригинала делает копирование законным.
Для индустрии это сигнал о том, что эпоха бесплатного человеческого контента заканчивается. Для авторов и брендов, как ни странно, новость скорее хорошая: ваш текст официально признан ценностью, за которую платят миллиарды. Вопрос только в том, работает ли эта ценность на вас, то есть попадает ли ваш контент в то, из чего модели собирают свои ответы. Это уже можно проверять и этим уже можно управлять.
Если разбор пригодился, буду благодарен за плюс
Источник: vc.ru
Похожие записи
Оцените материал:
Похожие записи
Усидеть на двух стульях: YouTube пытается бороться с нейрослопом, но запретить ИИ не может
21.07.2026
Созданы электрокатализаторы получения высокочистого водорода из водных растворов
23.03.2026
Nvidia выпускает свои «когти»: NemoClaw обеспечивает безопасность и масштабируемость для платформы агентов, берущей на себя управление ИИ.
22.03.2026Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
