Архив рубрики ~Коротко из Telegram~

Свежая исследовательская работа Виктории Граф и коллег ставит неудобный…

Свежая исследовательская работа Виктории Граф и коллег ставит неудобный…
File 553

🔥 Свежая исследовательская работа Виктории Граф и коллег ставит неудобный вопрос: что, если атаковать будущие языковые модели можно ещё до того, как их вообще начали обучать — просто массово оставляя вредоносный текст в комментариях на обычных сайтах? Раньше эксперименты по «отравлению» обучающих данных в основном строились на подконтрольных источниках вроде Wikipedia, что плохо отражает реальный масштаб и разнородность настоящих датасетов для претрейна.

Эта работа впервые честно смотрит на весь путь атакующего контента — от публикации до реального попадания в обучающую выборку модели.
Для этого авторы предложили метод HalfLife — он оценивает вероятность того, что вредоносный текст не просто появится на странице, а действительно пройдёт весь конвейер: попадёт в краулинг, сохранится в виде читаемого текста, а затем переживёт автоматические фильтры качества, которые компании и так применяют к своим корпусам. Итоговая цифра выживаемости для отравления через комментарии оказалась скромной — около 0,13%. Звучит как ничтожная величина, но важно учитывать масштаб: авторы напоминают, что по прошлым исследованиям всего 250 отравленных документов достаточно, чтобы встроить в модель бэкдор, а значит атакующему хватило бы «испортить» от 100 тысяч до миллиона веб-страниц — вполне посильная задача при наличии автоматизированной публикации комментариев и учитывая, насколько массово открытые формы для комментариев встречаются в вебе.

⚠️ Отдельно любопытный вывод — замена естественных комментариев на курируемый вредоносный контент почти не влияет на то, проходит ли текст через фильтры качества: подделка выглядит для системы фильтрации так же «нормально», как обычный человеческий комментарий.
По сути, работа переводит атаку на данные из области абстрактной теории в область измеримого практического риска — с конкретной методологией, кодом в открытом доступе и числами, а не просто «в принципе это возможно».

Насколько вас как читателя канала беспокоит эта уязвимость — или она кажется скорее теоретической угрозой, чем реальным риском для моделей, которыми вы пользуетесь?

Оцените материал:

Поделиться
Понравилась статья? Расскажите другим
ВКонтакте
Читайте также
Архив рубрики ~Лента новостей~ Как заработать на «разметке технических заданий» через ИИ. Архив рубрики ~Лента новостей~ [Перевод] ООН проголосовала за новую карту мира, показывающую истинный масштаб Африки Новости робототехники Превосходство Китая в области беспилотных летательных аппаратов проявилось в эвакуации тел и продовольствия по воздуху после наводнения в Непале. Архив рубрики ~Лента новостей~ iPhone Duo против Pixel 11 Pro Fold: противостояние двух прочных складных смартфонов. Архив рубрики ~Лента новостей~ Гарри Тан из Y Combinator хочет, чтобы американские лаборатории искусственного интеллекта с открытым доступом также «упрощали» передовые модели. Архив рубрики ~Лента новостей~ Быстрое масштабирование онлайн-хранилища для обслуживания более 1 миллиарда пользователей ChatGPT | OpenAI Архив рубрики ~Лента новостей~ Пост на 3,6 млн просмотров разобрал тарифы Claude. Там всё хуже, чем казалось Архив рубрики ~Лента новостей~ Собрал мониторинг упоминаний бренда в ChatGPT: три способа сбора данных показали три разные картины Архив рубрики ~Лента новостей~ Код как борьба. Кратчайшая история IT. 3. Клод Шеннон Архив рубрики ~Лента новостей~ Шесть китайских компаний, занимающихся искусственным интеллектом, обвиняются в агрессивном копировании передовых американских моделей. Новости робототехники Как правильно выбрать реечную систему для высокоточного линейного перемещения Архив рубрики ~Лента новостей~ Сегодня ночью украинские БЭКи атаковали район Геленджика, рядом с Новороссийском Архив рубрики ~Лента новостей~ Компания Nscale включила бывшего руководителя OpenAI Фиджи Симо в свой совет директоров в преддверии потенциального IPO. Архив рубрики ~Лента новостей~ Около 90 тысяч серверов в России могут быть уязвимы из-за критической ошибки в Windows RDS Архив рубрики ~Лента новостей~ Как заработать на «разметке технических заданий» через ИИ. Архив рубрики ~Лента новостей~ [Перевод] ООН проголосовала за новую карту мира, показывающую истинный масштаб Африки Новости робототехники Превосходство Китая в области беспилотных летательных аппаратов проявилось в эвакуации тел и продовольствия по воздуху после наводнения в Непале. Архив рубрики ~Лента новостей~ iPhone Duo против Pixel 11 Pro Fold: противостояние двух прочных складных смартфонов. Архив рубрики ~Лента новостей~ Гарри Тан из Y Combinator хочет, чтобы американские лаборатории искусственного интеллекта с открытым доступом также «упрощали» передовые модели. Архив рубрики ~Лента новостей~ Быстрое масштабирование онлайн-хранилища для обслуживания более 1 миллиарда пользователей ChatGPT | OpenAI Архив рубрики ~Лента новостей~ Пост на 3,6 млн просмотров разобрал тарифы Claude. Там всё хуже, чем казалось Архив рубрики ~Лента новостей~ Собрал мониторинг упоминаний бренда в ChatGPT: три способа сбора данных показали три разные картины Архив рубрики ~Лента новостей~ Код как борьба. Кратчайшая история IT. 3. Клод Шеннон Архив рубрики ~Лента новостей~ Шесть китайских компаний, занимающихся искусственным интеллектом, обвиняются в агрессивном копировании передовых американских моделей. Новости робототехники Как правильно выбрать реечную систему для высокоточного линейного перемещения Архив рубрики ~Лента новостей~ Сегодня ночью украинские БЭКи атаковали район Геленджика, рядом с Новороссийском Архив рубрики ~Лента новостей~ Компания Nscale включила бывшего руководителя OpenAI Фиджи Симо в свой совет директоров в преддверии потенциального IPO. Архив рубрики ~Лента новостей~ Около 90 тысяч серверов в России могут быть уязвимы из-за критической ошибки в Windows RDS

Оставить комментарий