Свежая исследовательская работа Виктории Граф и коллег ставит неудобный…
🔥 Свежая исследовательская работа Виктории Граф и коллег ставит неудобный вопрос: что, если атаковать будущие языковые модели можно ещё до того, как их вообще начали обучать — просто массово оставляя вредоносный текст в комментариях на обычных сайтах? Раньше эксперименты по «отравлению» обучающих данных в основном строились на подконтрольных источниках вроде Wikipedia, что плохо отражает реальный масштаб и разнородность настоящих датасетов для претрейна.
Эта работа впервые честно смотрит на весь путь атакующего контента — от публикации до реального попадания в обучающую выборку модели.
Для этого авторы предложили метод HalfLife — он оценивает вероятность того, что вредоносный текст не просто появится на странице, а действительно пройдёт весь конвейер: попадёт в краулинг, сохранится в виде читаемого текста, а затем переживёт автоматические фильтры качества, которые компании и так применяют к своим корпусам. Итоговая цифра выживаемости для отравления через комментарии оказалась скромной — около 0,13%. Звучит как ничтожная величина, но важно учитывать масштаб: авторы напоминают, что по прошлым исследованиям всего 250 отравленных документов достаточно, чтобы встроить в модель бэкдор, а значит атакующему хватило бы «испортить» от 100 тысяч до миллиона веб-страниц — вполне посильная задача при наличии автоматизированной публикации комментариев и учитывая, насколько массово открытые формы для комментариев встречаются в вебе.
⚠️ Отдельно любопытный вывод — замена естественных комментариев на курируемый вредоносный контент почти не влияет на то, проходит ли текст через фильтры качества: подделка выглядит для системы фильтрации так же «нормально», как обычный человеческий комментарий.
По сути, работа переводит атаку на данные из области абстрактной теории в область измеримого практического риска — с конкретной методологией, кодом в открытом доступе и числами, а не просто «в принципе это возможно».
❓ Насколько вас как читателя канала беспокоит эта уязвимость — или она кажется скорее теоретической угрозой, чем реальным риском для моделей, которыми вы пользуетесь?
Похожие записи
Оцените материал:
Похожие записи
Make no mistakes — скилл для Claude Code, который заставляет…
23.02.2026
Китае протестировали сеть 6G Технология передаёт 50-гигабайтный файл за 1.4…
26.07.2025
🎬 Higgsfield Cinema Studio: кинематограф по промпту Команда Higgsfield запустила…
11.01.2026Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
