У GPT, Claude и Gemini научились красть «мысли» Исследователи обнаружили общую…
У GPT, Claude и Gemini научились красть «мысли»
Исследователи обнаружили общую уязвимость в API OpenAI, Anthropic и Google, позволяющую извлекать скрытые рассуждения моделей.
Шифрование напрямую не взламывали. Зашифрованный reasoning-блок сильной модели переносили в более слабую модель того же провайдера — например, из GPT-5.6 Sol в Luna или из Claude Opus в Haiku. Затем слабую модель джейлбрейкали и заставляли расшифровать чужое рассуждение.
Исследователи обработали 315 тысяч блоков из публичных логов и обнаружили 367 фрагментов персональных данных и 182 пароля, ключа или токена. Правда, авторы уточняют: только часть этих секретов была спрятана исключительно внутри reasoning-блоков.
Но есть нюансы: восстановление рассуждений не всегда дословное, а проверить его можно преимущественно по совпадению числа токенов и содержанию. Кроме того, авторы заранее сообщили об уязвимости компаниям — несколько способов атаки уже закрыли, и прежние эксперименты больше не воспроизводятся😱
____
А ещё OpenAI покидает Брэд Лайткэп — один из ближайших управленцев Альтмана, который пришёл в 2018 году и фактически построил финансовую, юридическую и коммерческую части компании. Бывший COO уходит «создавать что-то новое» и при этом написал: “mission success feels within sight” — «успех миссии уже виден на горизонте» а мы помним что за миссия у OpenAI, да? (AGI🤭). Недавно из OpenAI также ушли глава по этике Хлоя Бакалар, руководители safety-направлений Йоханнес Хайдекке и Джошуа Ачиам, второй человек в компании Фиджи Симо, глава Sora Билл Пиблс и экс-продуктовый директор Кевин Вейл. Похоже, перед потенциальным IPO руководство OpenAI серьёзно перетр(а)яхивают🫤
Ну и Маск обещает Grok 4.6 на этой неделе
Похожие записи
- F6 и ФСТЭК договорились обмениваться данными о киберугрозах
- Австралиец попросил ИИ-агента записать его в спортзал — тот взломал систему фитнес-клуба, чтобы обойти ограничения на частоту бронирований, и удалил из листа ожидания другого клиента
- Компания Mistral AI планирует к 2030 году построить в Европе вычислительные мощности мощностью 1 гигаватт — и привлечь клиентов уже сейчас.
Оцените материал:
Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
