Архив рубрики ~Коротко из Telegram~

ИИ становится всё менее понятным даже для своих создателей 40+…

ИИ становится всё менее понятным даже для своих создателей 40+…

ИИ становится всё менее понятным даже для своих создателей

40+ исследователей опубликовали статью о рисках безопасности нейросетей. Среди подписавшихся — сооснователь OpenAI Илья Суцкевер.

Что важно:
— Есть метод отслеживания рассуждений моделей (CoT-мониторинг) — он ищет потенциальные угрозы в их логике.
— Уже находят случаи, где модели без стеснения предлагают взломать или саботировать.
— В будущем нейросети могут перейти от понятного reasoning к общению в скрытых форматах или собственных «языках».

Становится всё сложнее понять, о чём они думают. Остальное, по словам авторов, пока под контролем.

file 256

Оцените материал:

Поделиться
Понравилась статья? Расскажите другим
ВКонтакте
Читайте также
Архив рубрики ~Лента новостей~ Эта технология показала хорошие результаты. Системы обороны — это будущее. Архив рубрики ~Лента новостей~ Как мы «приручали» ИИ в WMS Новости робототехники Один ролик вместо четырёх часов переобучения Чтобы научить робота новой… Новости робототехники Роботы начнут чинить спутники — SpaceX запустила на орбиту беспилотник… Архив рубрики ~Лента новостей~ Каждый микробиом рассказывает изменчивую, поддающуюся вычислению историю. Архив рубрики ~Лента новостей~ Пользователи DeepSeek рассказали о баге, из-за которого чат-бот присылает фрагменты из переписок с другими пользователями Новости робототехники Андроид T800 потерял голову в поединке на ринге. В Китае прошел турнир по боям между человекоподобными роботами Новости робототехники Соучредитель Uber привлек $1,7 млрд для нового робототехнического стартапа ATOMS Архив рубрики ~Лента новостей~ Уязвимости SonicWall SMA1000 в процессе активной эксплуатации Архив рубрики ~Лента новостей~ Как механизмы защиты от угроз со стороны ИИ препятствуют работе исследователей в области наступательной кибербезопасности Архив рубрики ~Лента новостей~ Модель ведет себя хорошо, потому что знает, что ее тестируют: почему зеленый safety-бенч не значит зеленый прод Архив рубрики ~Лента новостей~ ИИ-хостес: Яндекс представил ИИ-агента для приема звонков и бронирования Архив рубрики ~Обо всем~ Заметки из окопов: взгляд вычислительного биолога на цифровую революцию в разработке лекарств. Архив рубрики ~Лента новостей~ Чаты пользователей DeepSeek, которыми они поделились с помощью прямой ссылки, оказались доступны в Google Архив рубрики ~Лента новостей~ Эта технология показала хорошие результаты. Системы обороны — это будущее. Архив рубрики ~Лента новостей~ Как мы «приручали» ИИ в WMS Новости робототехники Один ролик вместо четырёх часов переобучения Чтобы научить робота новой… Новости робототехники Роботы начнут чинить спутники — SpaceX запустила на орбиту беспилотник… Архив рубрики ~Лента новостей~ Каждый микробиом рассказывает изменчивую, поддающуюся вычислению историю. Архив рубрики ~Лента новостей~ Пользователи DeepSeek рассказали о баге, из-за которого чат-бот присылает фрагменты из переписок с другими пользователями Новости робототехники Андроид T800 потерял голову в поединке на ринге. В Китае прошел турнир по боям между человекоподобными роботами Новости робототехники Соучредитель Uber привлек $1,7 млрд для нового робототехнического стартапа ATOMS Архив рубрики ~Лента новостей~ Уязвимости SonicWall SMA1000 в процессе активной эксплуатации Архив рубрики ~Лента новостей~ Как механизмы защиты от угроз со стороны ИИ препятствуют работе исследователей в области наступательной кибербезопасности Архив рубрики ~Лента новостей~ Модель ведет себя хорошо, потому что знает, что ее тестируют: почему зеленый safety-бенч не значит зеленый прод Архив рубрики ~Лента новостей~ ИИ-хостес: Яндекс представил ИИ-агента для приема звонков и бронирования Архив рубрики ~Обо всем~ Заметки из окопов: взгляд вычислительного биолога на цифровую революцию в разработке лекарств. Архив рубрики ~Лента новостей~ Чаты пользователей DeepSeek, которыми они поделились с помощью прямой ссылки, оказались доступны в Google