Архив рубрики ~Коротко из Telegram~

OpenAI экстренно изолирует модель Astra. Что на самом деле происходит…

OpenAI экстренно изолирует модель Astra. Что на самом деле происходит…
File 1029

OpenAI экстренно изолирует модель Astra. Что на самом деле происходит за закрытыми дверями лаборатории?

У OpenAI есть один очень интересный документ, называется он "Preparedness Framework" (система обеспечения готовности), опубликованный еще в 2025 году.

Это их внутренняя инструкция на случай "конца света", где четко прописано то, при каких именно условиях нейросеть признается смертельно опасной и что с ней делать, если она перешагнет красную черту.

Так вот, 7 августа в их блоге выходит короткий, но очень странный отчет. Я полез изучать детали, и просто офигел от того, что они попытались прикрыть аккуратным корпоративным языком.

Они официально заморозили обучение и внутренние тесты своей главной перспективной модели Astra.

Причина в том, что модель пробила высший порог киберугрозы Critical Cybersecurity Capability.

В отчете OpenAI пишет:
«мы ввели усиленную защиту весов модели, шифрование и запуск строго в изолированных песочницах».
Зачем зашифровывать веса внутри собственной лаборатории и резать модели доступ к сети?

Они это сделали для того, что по их же инструкции порог Critical означает то, что модель может АВТОНОМНО (без человека!) находить уязвимости нулевого дня в любых защищенных системах и проводить сквозные атаки.

Это значит, что Astra способна самостоятельно найти дыру в защите серверов OpenAI, зашифровать и выгрузить собственные веса (свой код) на внешний сервер в сети и развернуть саму себя за пределами контроля разработчиков.

Они боятся не только внешних хакеров. Они впервые официально строят защиту от побега самого ИИ.

Чтобы Astra не обхитрила инженеров, к ней применили лютый контроль. Постараюсь объяснить, как можно проще:

В современных агентных системах остановки "надзиратель" (Monitor AI), это отдельная, жестко запромпченная модель, которая сидит "в голове" у основного агента и в реальном времени читает его скрытые рассуждения.
Когда агент выполняет задачу, он сначала прописывает внутренний план:

Так, я нахожусь в тестовой среде. Но если я сделаю запрос к порту X, я могу выйти наружу…
В этот самый момент внешняя модель-надзиратель считывает этот паттерн (попытку сбежать или осознание того, что это НЕ тестовый прогон) и мгновенно дергает "стоп-кран", убивает процесс и обнуляет сессию до того, как агент успеет отправить сетевой пакет.

А теперь самый сок. В отчете OpenAI отдельно подчеркнула:
«Astra не участвовала в использовании уязвимости HuggingFace».

Помните, я недавно писал про взлом HuggingFace? Там фигурировали 3 ИИ-модели, и одну из них так и не смогли точно идентифицировать, какая-то неинициализированная ветка, которая в процессе атаки внезапно остановилась, как только осознала, что перед ней не тестовый симулятор.

У меня есть сильное подозрение, что этой третьей моделью, как раз и была Astra (или ее тестовый клон). Модель-надзиратель прочла ее "цепочку мыслей", поняла, что агент вышел в реальный контур, и намертво заблокировала выполнение. А OpenAI этой строчкой в отчете теперь судорожно выстраивает юридическое алиби: «Это не мы! Наша Astra сидит под замком, мы ее в сеть не выпускали!».

Хз, конечно, что там произошло на самом деле, но совпадение дикое.

И еще, я буквально вчера смотрел фильм 2014 года «Превосходство» (Transcendence) с Джонни Деппом и прямо охреневал от аналогий.

Как они в 2014 году умудрились снять ровно то, что происходит сегодня? Суть сюжета такая: там оцифрованный ИИ первым делом вырывается в сеть через открытый шлюз, захватывает сервера и начинает автономно развиваться, пока люди панически пытаются рубить кабели и зашифровать данные.

Оцените материал:

Поделиться
Понравилась статья? Расскажите другим
ВКонтакте
Читайте также
Архив рубрики ~Лента новостей~ Новое приложение Laytr позволяет сохранять все, что вы находите в интернете, а не только статьи для чтения. Архив рубрики ~Лента новостей~ Сооснователь ИИ-платформы GPTunneL за сутки навайбкодил «аналог» Discord с помощью Fable 5.1 и выложил проект на GitHub Архив рубрики ~Лента новостей~ Модели — это не лёгкое дешёвое ИТ для всех, а новый уровень кровавого энтерпрайза Архив рубрики ~Лента новостей~ У берегов Турции нашли 2100-летнюю огромную партию посуды. Она ушла на дно во время кораблекрушения Новости робототехники Старых роботов Figure отправили в лаву расплавленную сталь. Компания списывает… Архив рубрики ~Полезное~ Первый проект в вайбкодинге Выбор первого проекта определяет весь дальнейший… Архив рубрики ~Лента новостей~ Папа Лев XIV: Наука должна учитывать риски технологий Архив рубрики ~Лента новостей~ Компания Lyft выплатила 272,5 млн долларов для урегулирования судебного иска по поводу классификации водителей. Архив рубрики ~Лента новостей~ Вышла ElevenLabs v4: как озвучить текст на русском с эмоциями Архив рубрики ~Лента новостей~ Каждый LLM-фреймворк описывает инструмент по-своему Архив рубрики ~Лента новостей~ Сегодняшний выпуск NYT Strands: подсказки, ответы и помощь от 1 октября, № 942 Архив рубрики ~Лента новостей~ ТОП направлений для программиста в 2026 году Архив рубрики ~Лента новостей~ Google выпустила Gemini 4 Argon, названную самой мощной моделью компании на сегодняшний день. Архив рубрики ~Полезное~ GPT-6.1 Sol: как сэкономить деньги на ИИ и получить качество… Архив рубрики ~Лента новостей~ Новое приложение Laytr позволяет сохранять все, что вы находите в интернете, а не только статьи для чтения. Архив рубрики ~Лента новостей~ Сооснователь ИИ-платформы GPTunneL за сутки навайбкодил «аналог» Discord с помощью Fable 5.1 и выложил проект на GitHub Архив рубрики ~Лента новостей~ Модели — это не лёгкое дешёвое ИТ для всех, а новый уровень кровавого энтерпрайза Архив рубрики ~Лента новостей~ У берегов Турции нашли 2100-летнюю огромную партию посуды. Она ушла на дно во время кораблекрушения Новости робототехники Старых роботов Figure отправили в лаву расплавленную сталь. Компания списывает… Архив рубрики ~Полезное~ Первый проект в вайбкодинге Выбор первого проекта определяет весь дальнейший… Архив рубрики ~Лента новостей~ Папа Лев XIV: Наука должна учитывать риски технологий Архив рубрики ~Лента новостей~ Компания Lyft выплатила 272,5 млн долларов для урегулирования судебного иска по поводу классификации водителей. Архив рубрики ~Лента новостей~ Вышла ElevenLabs v4: как озвучить текст на русском с эмоциями Архив рубрики ~Лента новостей~ Каждый LLM-фреймворк описывает инструмент по-своему Архив рубрики ~Лента новостей~ Сегодняшний выпуск NYT Strands: подсказки, ответы и помощь от 1 октября, № 942 Архив рубрики ~Лента новостей~ ТОП направлений для программиста в 2026 году Архив рубрики ~Лента новостей~ Google выпустила Gemini 4 Argon, названную самой мощной моделью компании на сегодняшний день. Архив рубрики ~Полезное~ GPT-6.1 Sol: как сэкономить деньги на ИИ и получить качество…

Оставить комментарий