Архив рубрики ~Коротко из Telegram~

Свежая исследовательская работа Виктории Граф и коллег ставит неудобный…

Свежая исследовательская работа Виктории Граф и коллег ставит неудобный…
File 553

🔥 Свежая исследовательская работа Виктории Граф и коллег ставит неудобный вопрос: что, если атаковать будущие языковые модели можно ещё до того, как их вообще начали обучать — просто массово оставляя вредоносный текст в комментариях на обычных сайтах? Раньше эксперименты по «отравлению» обучающих данных в основном строились на подконтрольных источниках вроде Wikipedia, что плохо отражает реальный масштаб и разнородность настоящих датасетов для претрейна.

Эта работа впервые честно смотрит на весь путь атакующего контента — от публикации до реального попадания в обучающую выборку модели.
Для этого авторы предложили метод HalfLife — он оценивает вероятность того, что вредоносный текст не просто появится на странице, а действительно пройдёт весь конвейер: попадёт в краулинг, сохранится в виде читаемого текста, а затем переживёт автоматические фильтры качества, которые компании и так применяют к своим корпусам. Итоговая цифра выживаемости для отравления через комментарии оказалась скромной — около 0,13%. Звучит как ничтожная величина, но важно учитывать масштаб: авторы напоминают, что по прошлым исследованиям всего 250 отравленных документов достаточно, чтобы встроить в модель бэкдор, а значит атакующему хватило бы «испортить» от 100 тысяч до миллиона веб-страниц — вполне посильная задача при наличии автоматизированной публикации комментариев и учитывая, насколько массово открытые формы для комментариев встречаются в вебе.

⚠️ Отдельно любопытный вывод — замена естественных комментариев на курируемый вредоносный контент почти не влияет на то, проходит ли текст через фильтры качества: подделка выглядит для системы фильтрации так же «нормально», как обычный человеческий комментарий.
По сути, работа переводит атаку на данные из области абстрактной теории в область измеримого практического риска — с конкретной методологией, кодом в открытом доступе и числами, а не просто «в принципе это возможно».

Насколько вас как читателя канала беспокоит эта уязвимость — или она кажется скорее теоретической угрозой, чем реальным риском для моделей, которыми вы пользуетесь?

Оцените материал:

Поделиться
Понравилась статья? Расскажите другим
ВКонтакте
Читайте также
Архив рубрики ~Лента новостей~ Компания Cursor предпринимает самую масштабную попытку выхода на индийский рынок в преддверии приобретения компанией SpaceX, предлагая локализованные цены. Архив рубрики ~Полезное~ Perplexity выпустили SPACE — и это революция в AI-агентах Perplexity… Архив рубрики ~Лента новостей~ Инженерия вокруг агента: 10 идей AI Engineer Новости робототехники Вижу, следовательно, осязаю Робототехника в буквальном смысле упёрлась в кончики… Архив рубрики ~Лента новостей~ Что в тренде по нейросетям за неделю: 5 ИИ-скиллов, 4 вайбкодинг-проекта и еще 7 ИИ-полезностей Архив рубрики ~Полезное~ Генерация изображений: Midjourney, GPT Image, Nano Banana, Stable Diffusion/Flux — в… Архив рубрики ~Лента новостей~ Инференс LLM: от KV-кэша до продакшен-деплоя Архив рубрики ~Полезное~ Находим бесплатную замену почти любому платному сервису — нашли библиотеку с… Архив рубрики ~Лента новостей~ Физики создали первый квантовый материал, работающий при комнатной температуре Архив рубрики ~Лента новостей~ Дарио Амодей из Anthropic отвечает: он не против моделей с открытыми весами, но опасается китайского ИИ. Архив рубрики ~Лента новостей~ 502 на ingress, 302 в приложении: как я учил инфраструктурного LLM-агента не врать Архив рубрики ~Лента новостей~ Инструмент для экономии на Claude Code — до 90% дешевле Архив рубрики ~Лента новостей~ [Перевод] Новые правила контекстной инженерии для Claude 5 Новости робототехники Kraken Technology обеспечивает финансирование серии B для автономных судов Архив рубрики ~Лента новостей~ Компания Cursor предпринимает самую масштабную попытку выхода на индийский рынок в преддверии приобретения компанией SpaceX, предлагая локализованные цены. Архив рубрики ~Полезное~ Perplexity выпустили SPACE — и это революция в AI-агентах Perplexity… Архив рубрики ~Лента новостей~ Инженерия вокруг агента: 10 идей AI Engineer Новости робототехники Вижу, следовательно, осязаю Робототехника в буквальном смысле упёрлась в кончики… Архив рубрики ~Лента новостей~ Что в тренде по нейросетям за неделю: 5 ИИ-скиллов, 4 вайбкодинг-проекта и еще 7 ИИ-полезностей Архив рубрики ~Полезное~ Генерация изображений: Midjourney, GPT Image, Nano Banana, Stable Diffusion/Flux — в… Архив рубрики ~Лента новостей~ Инференс LLM: от KV-кэша до продакшен-деплоя Архив рубрики ~Полезное~ Находим бесплатную замену почти любому платному сервису — нашли библиотеку с… Архив рубрики ~Лента новостей~ Физики создали первый квантовый материал, работающий при комнатной температуре Архив рубрики ~Лента новостей~ Дарио Амодей из Anthropic отвечает: он не против моделей с открытыми весами, но опасается китайского ИИ. Архив рубрики ~Лента новостей~ 502 на ingress, 302 в приложении: как я учил инфраструктурного LLM-агента не врать Архив рубрики ~Лента новостей~ Инструмент для экономии на Claude Code — до 90% дешевле Архив рубрики ~Лента новостей~ [Перевод] Новые правила контекстной инженерии для Claude 5 Новости робототехники Kraken Technology обеспечивает финансирование серии B для автономных судов

Оставить комментарий