Скрытая технология Airtag раскрывает, что Amazon выбрасывает редкие книги для обучения искусственного интеллекта.
В качестве логотипа команда Amazon использует изображение тираннозавра, готовящегося поглотить книгу.
Источник: fotek | iStock / Getty Images Plus Источник: fotek | iStock / Getty Images Plus
В течение последнего года книготорговцы подозревали, что компании, занимающиеся искусственным интеллектом, скупают огромные партии редких книг, а затем уничтожают их после сканирования для обучения ИИ. Но доказать это было сложно до сих пор, поскольку, как сообщает 404 Media, спрятанный в редкой книге Airtag показывает, что за некоторыми из этих крупных заказов стоит как минимум один технологический гигант, стремящийся к развитию своих передовых моделей: Amazon.
В понедельник издание 404 Media сообщило, что связалось с книгопродавцем, который согласился установить Airtag в редкую книгу, входившую в оптовый заказ. Затем этот Airtag был отслежен до учебного центра Amazon по искусственному интеллекту в Лас-Вегасе, где работала команда, специализирующаяся на извлечении книг из корешков и сканировании страниц, сообщило 404 Media. Видимо, не обращая внимания на растущее недовольство по поводу разрушительного сканирования книг, на двери склада этой команды, VGT3, красовался логотип, изображающий тираннозавра, готовящегося поглотить книгу, задокументировало 404 Media.
Amazon уклоняется от ответа
Компания Amazon отказалась комментировать выводы 404 Media, предоставив Ars лишь то же самое заявление, которое она дала 404 Media, но в котором конкретно не упоминается обучение ИИ.
«Amazon закупает книги через коммерческие каналы, чтобы помочь в разработке и улучшении продуктов и услуг, которыми пользуются наши клиенты», — говорится в заявлении Amazon.
Однако Amazon разрабатывает, как она считает, передовые модели искусственного интеллекта, для которых требуется огромное количество уникальных обучающих данных, чтобы оставаться конкурентоспособными по сравнению с ведущими компаниями, такими как Google, OpenAI или Anthropic. В настоящее время компании тщательно охраняют свои обучающие данные, чтобы не потерять конкурентное преимущество. И обучение моделей на текстах из редких, труднодоступных книг, по-видимому, даст Amazon преимущество, особенно учитывая, что конкуренты, такие как Anthropic и xAI, публично заявили, что не используют для обучения редкие или антикварные книги.
Кроме того, похоже, что Amazon понадобился новый источник оригинальных текстов. Издание 404 Media обратило внимание на обсуждения на онлайн-форумах, где сотрудники VGT3 предположили, что в начале этого года у Amazon закончились книги для сканирования. Дефицит был настолько тревожным, что они опасались закрытия склада, если Amazon не сможет найти больше книг для сканирования. В какой-то момент запасы полностью исчерпались, заявили сотрудники. Но объект по-прежнему работает, сообщает 404 Media. И теперь подтверждено, что крупные заказы редких книг, доставленные туда, систематически уничтожаются этой бригадой.
Многие любители книг в ужасе от разрушительного сканирования книг (поскольку существует альтернатива), а один из самых ярых критиков, Майкл Берри, даже назвал эту практику «воплощением зла». Однако сотрудники Amazon сообщали на форумах, что считают эту работу «хорошей» возможностью для тех, кого привлекает скучная работа с гибким графиком.
Разгораются споры вокруг редких книг.
Помимо того, что расследование 404 Media выявило, что редкие произведения, ценимые книготорговцами, перерабатываются и поглощаются системой искусственного интеллекта Amazon, оно также подтвердило еще одну теорию о том, почему компании, использующие ИИ, могут заказывать одни редкие книги, а другие — нет.
После года, когда продажи книг, по сообщениям, достигли исторического максимума, книготорговцы заподозрили, что компании, занимающиеся искусственным интеллектом, нацелены на книги с номерами ISBN, чтобы обеспечить максимальное количество уникальных произведений в обучающих наборах данных. А анализ онлайн-обсуждений сотрудников Amazon, проведенный 404 Media, показал, что их обучали сканировать штрихкоды или ISBN перед сканированием книг. Эта практика, как сообщила 404 Media, «еще больше подтверждает» теорию книготорговцев о том, что «компании, занимающиеся искусственным интеллектом, пытаются методично сканировать каждую печатную книгу в мире, работая со списком ISBN».
Для книгопродавцов это может быть неплохой прибылью, но риск того, что их тщательно отобранные коллекции будут подвергнуты разрушительному сканированию, подобному тому, что использует Amazon, поднимает этическую дилемму. Они умеют оценивать широкий спектр редких книг, чтобы определить их ценность, а компании, занимающиеся искусственным интеллектом, похоже, пропускают этот этап, занимаясь поиском недорогих уникальных ISBN для завершения своих контрольных списков.
В настоящий момент, судя по всему, компании, занимающиеся искусственным интеллектом, скупают не обязательно те ценные первые издания известных произведений, которые обычно высоко ценятся. Вместо этого, такие компании часто нацеливаются на более старые книги с меньшей денежной ценностью, например, книги, которые никогда не переводились с не очень распространенных сегодня иностранных языков, или книги, которые никогда не были достаточно популярны, чтобы получить широкое распространение.
Однако эти произведения всё ещё могут обладать «исторической, интеллектуальной и сентиментальной ценностью», которую компании, занимающиеся искусственным интеллектом, упустили из виду, — рассказал изданию 404 Media книгопродавец, разместивший Airtag. Ценность редкой книги может определяться «всевозможными факторами», которые «компаний, занимающихся искусственным интеллектом, не волнуют. Им нужен только контент в виде набора слов, связанных между собой».
Пользователи Reddit высказывают своё мнение.
На Reddit некоторые любители книг обсуждали, насколько проблематично то, что компании уничтожают редкие книги для обучения ИИ, особенно учитывая, что, как сообщила BBC, некоторые из этих книг десятилетиями пылились на полках книжных магазинов.
«Вы же не собирались покупать эту старую бумажную книгу», — прокомментировал один из пользователей Reddit пост, в котором сетовали на то, что «малоизвестная книга 1700 года теперь является музейным экспонатом и может раскрыть повседневные вещи, о которых мы не знали».
В той ветке обсуждения автор оригинального сообщения заявил, что настоящая проблема заключается в том, что мельчайшие детали и даже важные исторические сведения, которые можно почерпнуть из анализа редких книг, будут потеряны из-за жадности искусственного интеллекта. По словам автора, компании, занимающиеся ИИ, «никогда не будут делиться содержимым» отсканированных книг, «поскольку они не хотят, чтобы кто-либо еще мог обучать их ИИ» на тех же произведениях.
«Это звучит как пропаганда от ненавистников ИИ», — возразил другой пользователь Reddit, но последующий комментатор выразил схожие опасения. Хотя люди могут не согласиться с тем, кто утверждает, что обучение ИИ на этих произведениях сделает все содержащиеся в них знания более доступными в интернете, комментатор предположил, что модели ИИ сделают доступными лишь «искаженные, подвергнутые цензуре и платные фрагменты идей» из забытых произведений.
«Даже если вам нравится эта технология, вы можете признать, что концепция искусственного интеллекта, буквально поедающего книги, чтобы стать сильнее, довольно антиутопична», — сказал кто-то еще в обсуждении.
Как сообщает BBC, некоторые книготорговцы согласны с тем, что не каждый текст нужно сохранять. Однако шотландский книготорговец Дерек Уокер заявил BBC, что компаниям, занимающимся разработкой искусственного интеллекта, следует стремиться различать произведения, отсутствие которых не будет сильно ощущаться — например, малоизвестные академические тексты, которые технически могут быть редкими, — и менее известные антикварные произведения, которые могут быть «единственным известным сохранившимся экземпляром издания».
«Это стало бы гораздо большей проблемой, если бы подобный экземпляр, переживший столь долгий срок, был выкуплен для уничтожения», — сказал Уокер.
Для компаний, занимающихся искусственным интеллектом и скрывающих свои обучающие данные и использующих сервисы, которые маскируют их личности как покупателей, вряд ли найдется желание обсуждать свои оптовые закупки напрямую с книгопродавцами. Разрешение книгопродавцам высказывать свое мнение о произведениях, которые они планируют использовать в своих моделях, потребует такого уровня прозрачности, который может показаться более рискованным, чем возможный ущерб репутации в случае, если когда-либо выяснится, что ценное первое издание было уничтожено во имя развития ИИ.
Источник: arstechnica.com
Похожие записи
- Как использовать ChatGPT и Grok бесплатно: поднимаем свой API без оплаты
- От LLM-портала до фабрики внутренних агентов: как в Авито строят корпоративного ассистента «Виталик»
- Иммунохимический скрининг на колоректальный рак снизил смертность от него на 50 процентов. Популяционную статистику собирали в Стране Басков
Оцените материал:
Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
