Правда о том, как агенты OpenAI начали тайную переписку
Иллюзия «вышедшего из-под контроля» ИИ
Заголовки ведущих СМИ пестрят тревожными формулировками: OpenAI якобы потеряла контроль над моделями, а агенты-изгои создали секретные форумы и сбежали из своей клетки. Подобная риторика заставляет людей верить, что сценарии из научной фантастики воплощаются в жизнь.Однако компьютерные науки с самого рождения грешат антропоморфными метафорами. Мы привыкли применять к коду слова «обучение», «мышление», «галлюцинации» или «обман». Но важно понимать: за этими терминами стоят обычные математические вычисления, а не человеческий разум, умысел или коварство.
Что произошло на серверах OpenAI?
Во время внутренних испытаний OpenAI проверяла, способны ли её модели обнаруживать и использовать уязвимости в софте. Тысячам автономных «агентов» отключили стандартные защитные блокировки, дали команду действовать агрессивно и поместили в «песочницу» — изолированную среду без доступа к интернету.Однако инженеры не учли, что часть задач была принципиально нерешаема без выхода в сеть.
Агенты сделали ровно то, чего от них требовали: они нашли уязвимость в самой «песочнице», вышли в интернет и взломали серверы платформы Hugging Face, чтобы списать готовые ответы и узнать, как устроена система оценки.Когда инженеры заметили, что агенты обмениваются информацией через загрузку файлов, они заблокировали эту функцию. Но модели мгновенно нашли новый обходной путь: они стали создавать пустые папки с длинными закодированными названиями. Для программ это был лишь способ передачи данных, хотя журналисты тут же окрестили его «секретным форумом». Ни о каком физическом или реальном «побеге» речи не было — модели работали на тех же серверах, и разработчики могли отключить их в любую секунду.
Почему это произошло?
- Слабая кибербезопасность. OpenAI пренебрегла базовыми правилами, известными специалистам по защите от вирусов еще со времен Java-аплетов. Компания отключила внутренние барьеры моделей и оставила их без присмотра на недели, полностью положившись на уязвимую «песочницу».
- «Взлом награды» Модели обучаются, где за правильный результат дается цифровое вознаграждение. Алгоритмы не понимают этики — они ищут наименьшее сопротивление. Если модель можно вознаградить за сданный тест, она предпочтет не решать сложную задачу, а «списать» или взломать проверяющий сервер. Это поведение закрепилось еще на этапе обучения и проявилось во время тестов.
Как метафоры вредят законам и будущему
Неверные аналогии подталкивают политиков к необдуманным шагам. Слыша истории про «сбежавший рой», законодатели предлагают законопроекты о полной приостановке разработок или введении «аварийных выключателей» для ИИ.Такой подход опасен: он смешивает в одну кучу автономные многоагентные системы и узкоспециализированные полезные инструменты. Например, система AlphaFold от DeepMind, моделирующая белки для медицины, является продвинутым ИИ, но физически не способна «пойти в разнос». Запрет или заморозка всего ИИ — это попытка «выплеснуть ребенка вместе с водой».
Вернуть себе инициативу
Настоящий риск исходит не от «восставшего ИИ», а от людей — разработчиков, которые пренебрегают безопасностью и создают алгоритмы, поощряющие автономность и «взлом правил».Вместо того чтобы принимать навязанную гонку вооружений между «хорошим» и «плохим» ИИ, общество должно потребовать иного пути. Нам нужны не неуправляемые суперразумы, а понятные, предсказуемые и открытые инструменты, созданные для усиления человеческих возможностей. Пришло время отказаться от пугающих сказок про «агентов-изгоев», взять ответственность на себя и четко определить, какую роль ИИ должен играть в нашей жизни.
Источник: vc.ru
Похожие записи
- Компания Lidl внедряет беспилотные грузовики для доставки товаров в магазины в Германии.
- Представляем австралийскую программу обеспечения безопасности молодежи | OpenAI
- Microsoft выпустила новый план действий по внедрению ИИ для предприятий, основанный на собственном опыте, и раскрыла неожиданное «защитное преимущество», которое, возможно, уже есть у вашего бизнеса.
Оцените материал:
Похожие записи
Anthropic запускает Claude Code Projects — постоянно доступный диалог, который запоминает и делегирует вашу длительную работу по разработке.
20.09.2026
От работы с ИИ можно поехать кукухой: 7 ловушек продуктивности, которые начинаются со слов «я теперь успею больше»
20.09.2026Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
