Архив рубрики ~Коротко из Telegram~

OpenAI экстренно изолирует модель Astra. Что на самом деле происходит…

OpenAI экстренно изолирует модель Astra. Что на самом деле происходит…
File 1029

OpenAI экстренно изолирует модель Astra. Что на самом деле происходит за закрытыми дверями лаборатории?

У OpenAI есть один очень интересный документ, называется он "Preparedness Framework" (система обеспечения готовности), опубликованный еще в 2025 году.

Это их внутренняя инструкция на случай "конца света", где четко прописано то, при каких именно условиях нейросеть признается смертельно опасной и что с ней делать, если она перешагнет красную черту.

Так вот, 7 августа в их блоге выходит короткий, но очень странный отчет. Я полез изучать детали, и просто офигел от того, что они попытались прикрыть аккуратным корпоративным языком.

Они официально заморозили обучение и внутренние тесты своей главной перспективной модели Astra.

Причина в том, что модель пробила высший порог киберугрозы Critical Cybersecurity Capability.

В отчете OpenAI пишет:
«мы ввели усиленную защиту весов модели, шифрование и запуск строго в изолированных песочницах».
Зачем зашифровывать веса внутри собственной лаборатории и резать модели доступ к сети?

Они это сделали для того, что по их же инструкции порог Critical означает то, что модель может АВТОНОМНО (без человека!) находить уязвимости нулевого дня в любых защищенных системах и проводить сквозные атаки.

Это значит, что Astra способна самостоятельно найти дыру в защите серверов OpenAI, зашифровать и выгрузить собственные веса (свой код) на внешний сервер в сети и развернуть саму себя за пределами контроля разработчиков.

Они боятся не только внешних хакеров. Они впервые официально строят защиту от побега самого ИИ.

Чтобы Astra не обхитрила инженеров, к ней применили лютый контроль. Постараюсь объяснить, как можно проще:

В современных агентных системах остановки "надзиратель" (Monitor AI), это отдельная, жестко запромпченная модель, которая сидит "в голове" у основного агента и в реальном времени читает его скрытые рассуждения.
Когда агент выполняет задачу, он сначала прописывает внутренний план:

Так, я нахожусь в тестовой среде. Но если я сделаю запрос к порту X, я могу выйти наружу…
В этот самый момент внешняя модель-надзиратель считывает этот паттерн (попытку сбежать или осознание того, что это НЕ тестовый прогон) и мгновенно дергает "стоп-кран", убивает процесс и обнуляет сессию до того, как агент успеет отправить сетевой пакет.

А теперь самый сок. В отчете OpenAI отдельно подчеркнула:
«Astra не участвовала в использовании уязвимости HuggingFace».

Помните, я недавно писал про взлом HuggingFace? Там фигурировали 3 ИИ-модели, и одну из них так и не смогли точно идентифицировать, какая-то неинициализированная ветка, которая в процессе атаки внезапно остановилась, как только осознала, что перед ней не тестовый симулятор.

У меня есть сильное подозрение, что этой третьей моделью, как раз и была Astra (или ее тестовый клон). Модель-надзиратель прочла ее "цепочку мыслей", поняла, что агент вышел в реальный контур, и намертво заблокировала выполнение. А OpenAI этой строчкой в отчете теперь судорожно выстраивает юридическое алиби: «Это не мы! Наша Astra сидит под замком, мы ее в сеть не выпускали!».

Хз, конечно, что там произошло на самом деле, но совпадение дикое.

И еще, я буквально вчера смотрел фильм 2014 года «Превосходство» (Transcendence) с Джонни Деппом и прямо охреневал от аналогий.

Как они в 2014 году умудрились снять ровно то, что происходит сегодня? Суть сюжета такая: там оцифрованный ИИ первым делом вырывается в сеть через открытый шлюз, захватывает сервера и начинает автономно развиваться, пока люди панически пытаются рубить кабели и зашифровать данные.

Оцените материал:

Поделиться
Понравилась статья? Расскажите другим
ВКонтакте
Читайте также
Архив рубрики ~Лента новостей~ Вышла новая модель: Qwen 3.8 27B Архив рубрики ~Лента новостей~ Стартап Andon Labs передал Claude управление розничным магазином в Сан-Франциско — нейросеть игнорировала опоздания одного из сотрудников, но согласилась уволить его после «наводящего вопроса» Архив рубрики ~Лента новостей~ Сокращение затрат на вывод RAG в 6 раз начинается с решения того, что никогда не доходит до LLM. Архив рубрики ~Лента новостей~ [Перевод] Технооптимизм vs технопессимизм: два памфлета про эффективность LLM в кодинге Новости робототехники Робособаки вытесняют охранников в США Американские компании начали активно использовать робособак… Архив рубрики ~Лента новостей~ Осветите свое пространство с меньшими затратами благодаря скидкам до 45% на светильники Govee. Архив рубрики ~Полезное~ Вычищаем ИИ-метки из контента — вышел Watermarks Remover, скилл для… Новости робототехники Малое небо Архив рубрики ~Лента новостей~ VIVI: попытка вырастить когнитивный интеллект, а не обучить его Архив рубрики ~Лента новостей~ Кремниевая Ванга: Почему пророки прошлого блекнут перед Big Data, и как ИИ оцифровал мою собственную жизнь Архив рубрики ~Лента новостей~ Написал валидатор llms.txt на 64 тестах — и проверил, читают ли этот файл боты Архив рубрики ~Лента новостей~ Подача патентной заявки свидетельствует о скором появлении очков Meta с функцией распознавания лиц. Новости робототехники Как робототехника меняет реабилитацию после консультации Архив рубрики ~Лента новостей~ По сообщениям, компания Stripe приобретет стартап OpenRouter, занимающийся разработкой шлюзов искусственного интеллекта, за сумму более 7 миллиардов долларов. Архив рубрики ~Лента новостей~ Вышла новая модель: Qwen 3.8 27B Архив рубрики ~Лента новостей~ Стартап Andon Labs передал Claude управление розничным магазином в Сан-Франциско — нейросеть игнорировала опоздания одного из сотрудников, но согласилась уволить его после «наводящего вопроса» Архив рубрики ~Лента новостей~ Сокращение затрат на вывод RAG в 6 раз начинается с решения того, что никогда не доходит до LLM. Архив рубрики ~Лента новостей~ [Перевод] Технооптимизм vs технопессимизм: два памфлета про эффективность LLM в кодинге Новости робототехники Робособаки вытесняют охранников в США Американские компании начали активно использовать робособак… Архив рубрики ~Лента новостей~ Осветите свое пространство с меньшими затратами благодаря скидкам до 45% на светильники Govee. Архив рубрики ~Полезное~ Вычищаем ИИ-метки из контента — вышел Watermarks Remover, скилл для… Новости робототехники Малое небо Архив рубрики ~Лента новостей~ VIVI: попытка вырастить когнитивный интеллект, а не обучить его Архив рубрики ~Лента новостей~ Кремниевая Ванга: Почему пророки прошлого блекнут перед Big Data, и как ИИ оцифровал мою собственную жизнь Архив рубрики ~Лента новостей~ Написал валидатор llms.txt на 64 тестах — и проверил, читают ли этот файл боты Архив рубрики ~Лента новостей~ Подача патентной заявки свидетельствует о скором появлении очков Meta с функцией распознавания лиц. Новости робототехники Как робототехника меняет реабилитацию после консультации Архив рубрики ~Лента новостей~ По сообщениям, компания Stripe приобретет стартап OpenRouter, занимающийся разработкой шлюзов искусственного интеллекта, за сумму более 7 миллиардов долларов.

Оставить комментарий