«Google и Reddit не владеют интернетом», — заявил создатель веб-скрейпинга после победы в суде.
Использование Google и Reddit закона DMCA для борьбы с веб-скрейперами выглядит странным, считает эксперт.
Источник: showcake | iStock / Getty Images Plus Источник: showcake | iStock / Getty Images Plus
После крупного поражения в суде на прошлой неделе Google подтвердил, что не откажется от борьбы за блокировку ботов с искусственным интеллектом, которые пытаются собирать данные из результатов поиска. И Reddit, как ни странно, тоже присоединился к этой борьбе.
Любопытно, что в декабре прошлого года Google подал в суд на SerpApi, ссылаясь на Закон об авторском праве в цифровую эпоху (DMCA). Поисковый гигант обвинил веб-скрейпера в обходе его технологии защиты от сбора данных и последующей продаже контента, собранного из результатов поиска Google, через несанкционированный программный сервис «Google Search API».
По данным Google, технология защиты от сбора данных была внедрена для защиты контента, защищенного авторским правом, в результатах поиска. Предположительно, обход SerpApi угрожал нарушить отношения Google с правообладателями, включая тех, кто предоставляет Google лицензии на контент для отображения в так называемых «информационных панелях», которые показываются в некоторых результатах поиска по известным людям или организациям.
Это было странное применение DMCA, поскольку результаты поиска Google не подлежат защите авторским правом. Но Google, по-видимому, осмелился изучить эту юридическую теорию после того, как Reddit подал очень похожий иск в октябре, обвинив SerpApi и конкурента Google, компанию Perplexity, в сборе контента Reddit, который появляется в результатах поиска Google.
В своем блоге Google сослался на иск Reddit, объявляя о собственном обращении, которое, по его словам, было подано в качестве «крайней меры» для блокировки «вредоносного сбора данных», нарушающего права правообладателей на доступ к их контенту.
В частности, Google утверждал, что обход SerpApi нарушает его условия и делает невозможным получение прибыли от «миллиардов» поисковых запросов, выполняемых ботами, или компенсацию затрат на них. А до этого Reddit заявлял, что SerpApi обходит два уровня безопасности: собственные средства контроля Reddit, блокирующие сбор данных с платформы, и средства контроля Google, блокирующие сбор контента Reddit из результатов поиска.
Мередит Роуз, старший советник по вопросам политики в области DMCA в некоммерческой общественной организации Public Knowledge, заявила Ars, что Google и Reddit, похоже, «цепляются за любой доступный инструмент» в условиях внезапного и непрерывного роста использования ИИ для сбора данных за последние три года. И хотя способ использования DMCA «странный» — и «не соответствует тому, что закон предполагал в качестве варианта использования», — она говорит, что это не «удивительно». Исторически DMCA был эффективным инструментом для быстрого прекращения нежелательного использования контента и инициирования обсуждений по вопросам лицензирования, поэтому обращение к нему могло быть очевидной отправной точкой, учитывая цели Google.
Однако необычные аргументы Google и Reddit по поводу DMCA, похоже, не приносят успеха. На прошлой неделе суд предпринял довольно редкий шаг, удовлетворив ходатайство SerpApi об отклонении иска на самом раннем этапе судебного разбирательства Google. В этом случае судья постановил, что у Google нет оснований подавать иск против SerpApi на основании DMCA, поскольку компания не владеет никаким контентом в результатах поиска и не доказала, что действует от имени каких-либо правообладателей.
«Такое случается не очень часто», — сказала Роуз изданию Ars. «В конечном итоге все свелось к тому, что Google недостаточно подробно указал, какие именно защищенные авторским правом материалы он защищает».
Вероятно, время принятия этого решения оказалось неудачным для Reddit, которому в прошлый четверг предстояло слушание по ходатайству SerpApi об отклонении иска. Неясно, какое решение вынесет суд по этому делу, но Роуз сообщила Ars, что решение Google не сулит ничего хорошего для Reddit, поскольку Reddit не может утверждать, что является владельцем контента или эксклюзивным лицензиатом контента в результатах поиска.
«Судья по делу Google сказал: „Чтобы иметь право подать иск в соответствии с DMCA, вы можете быть правообладателем, эксклюзивным лицензиатом или лицом, внедряющим и производящим рассматриваемую меру технологической защиты“», — рассказала Роуз изданию Ars. «Reddit не относится ни к одной из этих категорий».
Компания SerpApi надеется, что борьба скоро закончится, и заявила изданию Ars, что дорогостоящая судебная тяжба стоит того, чтобы довести дело до конца ради защиты открытого интернета.
«В конечном итоге, похоже, что и Google, и Reddit пытаются использовать DMCA, чтобы отгородить открытый интернет, задним числом заявляя о контроле над контентом, который они не создавали и которым не владеют», — заявил SerpApi изданию Ars.
Последний шанс Google продолжить борьбу.
Хотя Роуз согласилась с SerpApi в том, что, удовлетворив ходатайство об отклонении иска, суд обеспечил SerpApi крупную победу, борьба еще не окончена, поскольку у Google остается узкий путь для продолжения своей войны с веб-скрейпингом.
Google признал, что результаты поиска не могут быть защищены авторским правом, но утверждал, что «информационные панели» иногда содержат контент, защищенный авторским правом, который Google лицензирует у правообладателей. Если Google сможет внести поправки в свою жалобу, чтобы доказать, что правообладатели напрямую уполномочили Google использовать свою технологию защиты от сбора данных для предотвращения несанкционированного доступа к контенту, то Google, возможно, сможет заблокировать очень ограниченный объем сбора данных SerpApi.
Представитель Google Хосе Кастаньеда сообщил Ars, что Google планирует внести поправки в исковое заявление и «рад видеть, что суд отклонил почти все юридические аргументы SerpApi», пытавшиеся оспорить право Google на подачу иска.
«Мы с нетерпением ждем возможности подать измененную жалобу, как и предложил нам суд, и по-прежнему привержены защите наших услуг и партнеров от несанкционированного доступа», — сказал Кастаньеда.
Однако Роуз заявила изданию Ars, что Google «в некоторой степени загнала себя в тупик, как в этом судебном процессе, так и в прошлом».
Для Google утверждать, что информационная панель «наполнена материалами, защищенными авторским правом», может быть «очень опасно», предположила Роуз. Поскольку поисковый гигант не лицензирует весь контент в информационной панели, Google рискует столкнуться с судебными исками в будущем, если алгоритмическое создание информационной панели без лицензий внезапно начнет рассматриваться как нарушение авторских прав, сказала Роуз.
«Им нужно как-то доказать, что некоторые части этого материала являются воспроизведением материалов, защищенных авторским правом, но воспроизведением материалов, защищенных авторским правом, являются только те, на которые они явно получили лицензию», — предположила Роуз. «В противном случае они признают, что воспроизводили материалы без лицензии, и это втянет их в еще один спор о добросовестном использовании, которого они, вероятно, не хотят».
Google предоставили 21 день на внесение изменений в свою жалобу, после чего станет яснее, как компания планирует найти компромиссное решение, чтобы продолжить борьбу в рамках DMCA.
SerpApi называет эту борьбу «ошибочной».
Компания Reddit не ответила на запросы Ars о комментариях, но в заявлении, поданном перед слушанием на прошлой неделе, утверждала, что готова обсудить, как проигрыш Google в суде повлиял на ее дело.
Примечательно, что, по словам SerpApi, Reddit не присутствовал в зале суда. SerpApi не стал подробно комментировать аргументы Reddit на слушании, но отметил, что судья, по всей видимости, сосредоточился на нюансах юридических вопросов. В частности, судью, похоже, интересовало, действительно ли соглашение Reddit с Google дает Google право защищать контент, защищенный авторским правом.
По всей видимости, оба суда несколько сузили круг спора до этого ключевого вопроса, но SerpApi, похоже, уверена, что ни Google, ни Reddit не смогут представить доказательства того, что сбор общедоступных результатов поиска наносит ущерб правообладателям.
В ответ на просьбу прокомментировать планы Google по внесению изменений в свою жалобу, SerpApi заявила Ars, что, возможно, нет смысла продолжать спорить из-за «фрагментов текста, которые появляются в информационных панелях Google», после того как Google начала свою атаку, якобы защищая «сотни тысяч издателей», которые отображаются в результатах поиска.
«Мы надеемся, что Google прекратит эту ошибочную атаку на открытый интернет, но если потребуется, мы готовы защищать SerpApi, наших клиентов и наши принципы», — заявили в SerpApi.
Компания SerpApi сообщила Ars, что ее бизнес продолжал расти, несмотря на судебные иски по DMCA, но ее клиенты, включая таких технологических гигантов, как Nvidia, Uber и Adobe, столкнулись с неопределенностью из-за затянувшихся судебных разбирательств.
«Они ежедневно полагаются на SerpApi для обеспечения структурированного доступа к поисковым данным, что является и всегда было законным и легитимным бизнесом», — заявили в SerpApi.
Эксперт утверждает, что SerpApi имеет право защищать открытый интернет.
Помимо собственных клиентов, заинтересованные стороны в развитии открытого интернета также размышляли о том, какое влияние может оказать победа Google, отметили в SerpApi.
«Конечно, судебные разбирательства невероятно дорогостоящи и создают множество проблем», — заявила компания SerpApi. «Однако мы твердо убеждены, что такие платформы, как Google и Reddit, не владеют Интернетом и что их попытки использовать DMCA в качестве оружия угрожают всем пользователям открытой сети».
Роуз рассказала Ars, что, хотя SerpApi и не «заслужил симпатии многих людей», она считает, что «с точки зрения политики они правы».
По словам Роуз, с лета 2023 года, когда начался своего рода «API-апокалипсис», издатели ограничивают доступ к открытому интернету, пытаясь найти способы быстро остановить массовый сбор данных с помощью ИИ, подобный тому, что делает SerpApi.
«Эта массовая реакция на парсинг» привела к «повторному закрытию значительной части интернета», — сказала Роуз. И, что вызывает беспокойство, это не только тормозит усилия по обучению ИИ, но и наносит вред исследованиям, архивированию, журналистике, освещению вопросов общественного здравоохранения и другой важной работе, которая зависит от анонимного сканирования и автоматизированного сбора данных в больших масштабах, добавила Роуз.
Компания SerpApi сообщила Ars, что получила «огромное» количество положительных отзывов от своих клиентов, исследователей и SEO-специалистов в поддержку своих усилий по защите от исков Google и Reddit. Веб-скрейпер оптимистично настроен на то, что суд удовлетворит его ходатайство об отклонении иска против Reddit, и на прошлой неделе радовался тому, что иск Google может быть рассмотрен лишь по очень ограниченным основаниям.
В результате своей победы компания SerpApi предупредила, что Reddit планирует выступать в роли «сборщика платы», требуя оплаты за парсинг контента, даже если компания не является его владельцем.
«Reddit стремится укрепить свой контроль над контентом своих пользователей, чтобы иметь возможность лучше облагать этот контент налогами. Reddit действует не для защиты своих пользователей; Reddit расчищает путь для их эксплуатации», — предупредил SerpApi.
Аналогичным образом, SerpApi обвинила Google в том, что та просила суд игнорировать тот факт, что она является «крупнейшим парсером в мире», одновременно соглашаясь лишить другие веб-парсеры доступа к информации, которая является «на 100 процентов общедоступной».
По мнению Роуз, для пользователей интернета не будет никакой выгоды, если в конце борьбы публичный доступ к данным будет прекращен.
«Сейчас очень напряженное время», — сказала Роуз, признавая, что не только Reddit и Google, но и многие издатели в интернете сейчас испытывают искушение использовать «любой доступный инструмент, чтобы помешать» сбору данных с помощью ИИ.
По словам Роуз, некоторые издатели могут руководствоваться финансовыми мотивами, как Google и Reddit, в то время как другие могут защищать свою инфраструктуру или занимать моральную позицию. Какова бы ни была мотивация, «это приводит к более масштабным последствиям для всей экосистемы — к повторному закрытию», — предупредила она.
И хотя SerpApi рассчитывает на победу, проблема с делами по DMCA, по ее словам, заключается в том, что предсказать исход бывает сложно.
«Мне очень любопытно, чем всё это закончится с Reddit», — сказала Роуз. «Я всегда немного цинична, потому что в какой-то степени, когда дело доходит до авторского права, многие судьи просто считают, что всё дело лишь в эмоциях».
Компания Advance Publications, которой принадлежит Condé Nast (владеющая Ars Technica), является крупнейшим акционером Reddit.
Источник: arstechnica.com
Похожие записи
Оцените материал:
Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
