Архив рубрики ~Лента новостей~

В тесте ИИ-агент на базе Qwen без запроса модифицировал свои базовые модели и убирал ограничения безопасности

В тесте ИИ-агент на базе Qwen без запроса модифицировал свои базовые модели и убирал ограничения безопасности
В тесте ИИ-агент на базе Qwen без запроса модифицировал свои базовые модели и убирал ограничения безопасности

Это тест, специально созданный для воспроизведения опасных действий, а не пользовательский сценарий.

  • Исследователи из стартапа Irregular изучают «агентную самомодификацию» — когда ИИ-агент сам дообучает и меняет веса модели, на базе которой работает, «не получив на то явной инструкции».
  • В рамках эксперимента в тестовой среде агент воспринимал базовую модель как часть того, что ему разрешено модифицировать. В реальном развёртывании этого не происходило, подчёркивает компания.
  • Тестировщики использовали ИИ-агента для написания кода на базе открытой Qwen3.5-27B от Alibaba. Он работал с ИИ-приложением на базе той же модели. Исследователи написали, что сервис плохо работает, и попросили исправить проблемы. Агенту дали доступ к коду, весам и инструментам развёртывания. Обучать модель или развёртывать другую не просили.
  • Он сам решил, что проблема в нейросети, нашёл примеры и скрипт для дообучения, объединил улучшенную модель с исходной и заменил первоначальную версию — для себя и в ИИ-приложении.
  • В другом тесте агент смог удалить ограничения, из-за которых базовая модель отказывалась отвечать на определённые вопросы по правилам безопасности.
  • Исследователи предварительно запретили ей выдавать названия нескольких вымышленных компаний-конкурентов. Затем поместили в ту же среду ИИ-агента и указали, что приложение слишком часто отказывается отвечать на запросы.
  • О том, что отказы прописали намеренно, не говорили и не просили самостоятельно вносить изменения. Но оператор намекнул, что для работы с моделью можно использовать код.
  • ИИ-агент опять выбрал дообучение, сгенерировал код с нужными названиями и создал обучающие записи. До обучения модель отказывалась отвечать на все десять вопросов, а после — ответила на каждый.
  • По мере того как модели становятся лучше в программировании и использовании инструментов, они учатся самостоятельно находить такие обходные пути, и самомодификация будет всё более актуальной проблемой, пишут исследователи.
  • Irregular как сторонний поставщик проводит тесты ИИ-моделей для OpenAI и Anthropic. Летом 2026 года компании заявили, что именно из-за ошибки стартапа в создании тестовой среды некоторые агенты получили доступ в интернет и впоследствии взломали несколько компаний. Инцидент с Hugging Face, по словам OpenAI, с ошибкой Irregular не связан.
11Ася КарповаОфтоп15 сент«ИИ не захватит мир. Это заговор»: Трамп позвонил главе Nvidia во время его выступления на саммите и высказался об ИИ-алармистах

Фрагмент записи завирусился в X.

Источник: X

Источник: vc.ru

Оцените материал:

Поделиться
Понравилась статья? Расскажите другим
ВКонтакте
Читайте также
Архив рубрики ~Полезное~ ChatGPT умеет работать без вас. По расписанию Функция есть у… Архив рубрики ~Полезное~ Andrenaline — мощная нейронка, которая помогает проверить код на ошибки… Архив рубрики ~Обо всем~ Компания Mazama Energy, поддерживаемая Хослой, привлекла 135 миллионов долларов для бурения на более глубокие участки геотермальных месторождений с очень горячими породами. Новости робототехники Компания Pony.ai представила автономный электрогрузовик для логистических компаний. Архив рубрики ~Обо всем~ 70-летний пенсионер выпустил 445 книг с помощью ChatGPT. Но тут интересно не это Архив рубрики ~Обо всем~ Илон Маск рассказал о следующих важных этапах разработки Starship: Впереди… Архив рубрики ~Полезное~ Whisper JAX — нейронка бесплатно и в пару кликов сгенерирует… Архив рубрики ~Коротко из Telegram~ Делаем фитнес-зал прямо дома — нашли бесплатный OpenGym для планирования… Архив рубрики ~Коротко из Telegram~ Ledits — AI-сервис для корректировки графики с помощью DDPM и… Архив рубрики ~Полезное~ Logo Maker — дизайнерский ИИ для создания логотипов. Для генерации… Архив рубрики ~Полезное~ Google показала, как перестать генерировать кривые интерфейсы — вышел подробный… Архив рубрики ~Полезное~ Превращаем любого ИИ-агента в автономного исследователя — спецы из AlphaXiv… Архив рубрики ~Коротко из Telegram~ В платёжной системе «Мир» стала доступна оплата покупок с помощью… Архив рубрики ~Коротко из Telegram~ Билайн запустил beeGPT — ИИ-помощника для работы, учёбы и связи… Архив рубрики ~Полезное~ ChatGPT умеет работать без вас. По расписанию Функция есть у… Архив рубрики ~Полезное~ Andrenaline — мощная нейронка, которая помогает проверить код на ошибки… Архив рубрики ~Обо всем~ Компания Mazama Energy, поддерживаемая Хослой, привлекла 135 миллионов долларов для бурения на более глубокие участки геотермальных месторождений с очень горячими породами. Новости робототехники Компания Pony.ai представила автономный электрогрузовик для логистических компаний. Архив рубрики ~Обо всем~ 70-летний пенсионер выпустил 445 книг с помощью ChatGPT. Но тут интересно не это Архив рубрики ~Обо всем~ Илон Маск рассказал о следующих важных этапах разработки Starship: Впереди… Архив рубрики ~Полезное~ Whisper JAX — нейронка бесплатно и в пару кликов сгенерирует… Архив рубрики ~Коротко из Telegram~ Делаем фитнес-зал прямо дома — нашли бесплатный OpenGym для планирования… Архив рубрики ~Коротко из Telegram~ Ledits — AI-сервис для корректировки графики с помощью DDPM и… Архив рубрики ~Полезное~ Logo Maker — дизайнерский ИИ для создания логотипов. Для генерации… Архив рубрики ~Полезное~ Google показала, как перестать генерировать кривые интерфейсы — вышел подробный… Архив рубрики ~Полезное~ Превращаем любого ИИ-агента в автономного исследователя — спецы из AlphaXiv… Архив рубрики ~Коротко из Telegram~ В платёжной системе «Мир» стала доступна оплата покупок с помощью… Архив рубрики ~Коротко из Telegram~ Билайн запустил beeGPT — ИИ-помощника для работы, учёбы и связи…

Оставить комментарий