Архив рубрики ~Коротко из Telegram~

Свежая исследовательская работа Виктории Граф и коллег ставит неудобный…

Свежая исследовательская работа Виктории Граф и коллег ставит неудобный…
File 553

🔥 Свежая исследовательская работа Виктории Граф и коллег ставит неудобный вопрос: что, если атаковать будущие языковые модели можно ещё до того, как их вообще начали обучать — просто массово оставляя вредоносный текст в комментариях на обычных сайтах? Раньше эксперименты по «отравлению» обучающих данных в основном строились на подконтрольных источниках вроде Wikipedia, что плохо отражает реальный масштаб и разнородность настоящих датасетов для претрейна.

Эта работа впервые честно смотрит на весь путь атакующего контента — от публикации до реального попадания в обучающую выборку модели.
Для этого авторы предложили метод HalfLife — он оценивает вероятность того, что вредоносный текст не просто появится на странице, а действительно пройдёт весь конвейер: попадёт в краулинг, сохранится в виде читаемого текста, а затем переживёт автоматические фильтры качества, которые компании и так применяют к своим корпусам. Итоговая цифра выживаемости для отравления через комментарии оказалась скромной — около 0,13%. Звучит как ничтожная величина, но важно учитывать масштаб: авторы напоминают, что по прошлым исследованиям всего 250 отравленных документов достаточно, чтобы встроить в модель бэкдор, а значит атакующему хватило бы «испортить» от 100 тысяч до миллиона веб-страниц — вполне посильная задача при наличии автоматизированной публикации комментариев и учитывая, насколько массово открытые формы для комментариев встречаются в вебе.

⚠️ Отдельно любопытный вывод — замена естественных комментариев на курируемый вредоносный контент почти не влияет на то, проходит ли текст через фильтры качества: подделка выглядит для системы фильтрации так же «нормально», как обычный человеческий комментарий.
По сути, работа переводит атаку на данные из области абстрактной теории в область измеримого практического риска — с конкретной методологией, кодом в открытом доступе и числами, а не просто «в принципе это возможно».

Насколько вас как читателя канала беспокоит эта уязвимость — или она кажется скорее теоретической угрозой, чем реальным риском для моделей, которыми вы пользуетесь?

Оцените материал:

Поделиться
Понравилась статья? Расскажите другим
ВКонтакте
Читайте также
Архив рубрики ~Лента новостей~ Нельзя просто так стать системным инженером. Код значимых проектов всегда писали только хакеры Архив рубрики ~Лента новостей~ Чат-боты с искусственным интеллектом не справились со своей задачей в кризисных ситуациях. Можно ли это исправить? Архив рубрики ~Лента новостей~ Как мне удалось заставить новый ИИ Siri действительно мне помогать. Архив рубрики ~Лента новостей~ Мы игнорируем признаки внеземной жизни, которые не являются ни технологическими, ни биологическими Архив рубрики ~Лента новостей~ Ведущий специалист Google по борьбе с хакерами объясняет, почему хакерские группы получают кодовые названия. Архив рубрики ~Лента новостей~ Не отдавайте ИИ то, что должны придумать сами Архив рубрики ~Лента новостей~ Скиллы для AI-агентов: что это и как их использовать Архив рубрики ~Лента новостей~ Horsey Horseless — самая дурацкая машина в истории (и её внезапная связь с интерфейс-разработкой) Архив рубрики ~Лента новостей~ Компания ByteDance обучает масштабную модель искусственного интеллекта, стремясь составить конкуренцию Anthropic. Архив рубрики ~Лента новостей~ Эта миниатюрная веб-камера с искусственным интеллектом продается по рекордно низкой цене и создана для того, чтобы вы выглядели великолепно. Архив рубрики ~Лента новостей~ Электронная книга Kindle Scribe Colorsoft — очень интересная программа, но она не является обязательной к приобретению. Архив рубрики ~Лента новостей~ Событийная сингулярность как философская модель факта и возможного Архив рубрики ~Лента новостей~ FT: китайская ByteDance начала разработку ИИ-модели, «сопоставимой» с Mythos 5, — у неё будет около 10 трлн параметров Архив рубрики ~Лента новостей~ Крупнейший в мире солнечный телескоп зафиксировал вихри на поверхности Солнца. Архив рубрики ~Лента новостей~ Нельзя просто так стать системным инженером. Код значимых проектов всегда писали только хакеры Архив рубрики ~Лента новостей~ Чат-боты с искусственным интеллектом не справились со своей задачей в кризисных ситуациях. Можно ли это исправить? Архив рубрики ~Лента новостей~ Как мне удалось заставить новый ИИ Siri действительно мне помогать. Архив рубрики ~Лента новостей~ Мы игнорируем признаки внеземной жизни, которые не являются ни технологическими, ни биологическими Архив рубрики ~Лента новостей~ Ведущий специалист Google по борьбе с хакерами объясняет, почему хакерские группы получают кодовые названия. Архив рубрики ~Лента новостей~ Не отдавайте ИИ то, что должны придумать сами Архив рубрики ~Лента новостей~ Скиллы для AI-агентов: что это и как их использовать Архив рубрики ~Лента новостей~ Horsey Horseless — самая дурацкая машина в истории (и её внезапная связь с интерфейс-разработкой) Архив рубрики ~Лента новостей~ Компания ByteDance обучает масштабную модель искусственного интеллекта, стремясь составить конкуренцию Anthropic. Архив рубрики ~Лента новостей~ Эта миниатюрная веб-камера с искусственным интеллектом продается по рекордно низкой цене и создана для того, чтобы вы выглядели великолепно. Архив рубрики ~Лента новостей~ Электронная книга Kindle Scribe Colorsoft — очень интересная программа, но она не является обязательной к приобретению. Архив рубрики ~Лента новостей~ Событийная сингулярность как философская модель факта и возможного Архив рубрики ~Лента новостей~ FT: китайская ByteDance начала разработку ИИ-модели, «сопоставимой» с Mythos 5, — у неё будет около 10 трлн параметров Архив рубрики ~Лента новостей~ Крупнейший в мире солнечный телескоп зафиксировал вихри на поверхности Солнца.

Оставить комментарий