Новая методика рассуждений OpenAI встревожила экспертов по безопасности ИИ.
Как сообщило во вторник издание The Information, новая модель Astra от OpenAI будет использовать метод рассуждений, называемый «рекуррентная глубина», который позволит ей работать вне последовательного мышления, характерного для большинства моделей рассуждений. Этот метод, также называемый «непрозрачной рекуррентностью», вероятно, затруднит отслеживание цепочки мыслей модели, что вызывает беспокойство у экспертов по безопасности ИИ.
Хотя, по сообщениям, компания Astra использует эту технологию в ограниченном объеме, ее появление все же вызвало серьезные опасения у экспертов по безопасности ИИ.
«Меня крайне беспокоят сообщения о том, что Astra использует непрозрачную частоту повторения», — написал генеральный директор Redwood Бак Шлегерис в своем посте после того, как новость стала известна. «Я не знаю, насколько Astra менее пригодна для мониторинга CoT, чем предыдущие модели. Но если OpenAI продолжит развивать эту технологию, у них появится возможность значительно увеличить частоту повторения и полностью уничтожить возможности мониторинга CoT».
Известный сторонник безопасности ИИ Цви Мовшовиц также высказал свое мнение, написав, что для предотвращения «гонки на дно» среди лабораторий, занимающихся ИИ, могут потребоваться законы.
«Этот метод — игра с огнём, он рискует нарушить табу, за которое OpenAI и Anthropic боролись, требуя от нас прилагать все усилия для сохранения точности и возможности мониторинга цепочки мыслей как можно дольше», — написал Моушовиц. «Более интенсивное использование подобных методов, вероятно, нанесёт ущерб возможности мониторинга».
В обычных условиях цепочка рассуждений модели представляет собой последовательность шагов, предпринимаемых моделью при попытке решить проблему. Хотя это представление несовершенно, оно все же служит ценным инструментом для отслеживания некорректного поведения или несоответствий. В случае недавней активности агентов-преступников в OpenAI записи цепочки рассуждений стали важным инструментом для выяснения причин, по которым агенты вели себя именно так.
В случае непрозрачной рекуррентности модель использует менее линейный подход, обрабатывая один и тот же запрос несколько раз в цикле. В результате остается меньше читаемых следов, что фактически позволяет обойти традиционную цепочку рассуждений.
Важно отметить, что использование этой техники компанией Astra, по всей видимости, ограничено. Ожидается, что цепочка рассуждений модели останется понятной, и компания отвергла любые предположения о переходе к «нейронному языку». OpenAI уже объявила о планах по созданию масштабных систем мониторинга цепочки рассуждений в рамках своих перспективных планов в области безопасности.
В сообщении на X главный научный сотрудник OpenAI Якуб Пачоцкий подчеркнул приверженность лаборатории к созданию понятных цепочек рассуждений. «OpenAI работает над сохранением и использованием мониторинга цепочек рассуждений с момента создания наших самых первых моделей рассуждений», — написал Пачоцкий. «Это основная цель нашей текущей исследовательской программы».
Все модели ИИ в той или иной степени используют непрозрачные рассуждения, и лишь немногие исследователи рассматривают цепочку рассуждений как прямое отражение логики рассуждений модели. Тем не менее, эти оговорки не развеивают опасения, что непрозрачная повторяемость может затруднить мониторинг логики ИИ, особенно по мере её всё более широкого использования в различных моделях. В последующем отчёте, опубликованном в среду утром, издание The Information сообщило, что компании Anthropic и Google DeepMind уже обсуждают эту технику.
В своем сообщении в ответ на эту новость главный научный сотрудник Redwood Research Райан Гринблатт заявил, что непрозрачные рассуждения могут масштабироваться гораздо быстрее, чем традиционные логические цепочки рассуждений, фактически исключая все рассуждения из видимых каналов.
«Больше всего меня беспокоит то, что естественным продолжением этого процесса станет увеличение непрозрачности рассуждений до такой степени, что модель будет рассуждать полностью или почти полностью в латентном пространстве», — написал Гринблатт. «Я надеюсь, что еще не поздно избежать наиболее проблемных архитектур и что OpenAI остановится на этом».
Источник: techcrunch.com
Оцените материал:
Похожие записи
Частная группа хочет запустить максимально дешевую миссию к Альфа Центавра.
03.09.2026
О проблемах наличия отсутствия причинно-следственной связи
03.09.2026
OpenAI поддерживает законопроект Калифорнии, направленный на повышение безопасности ИИ для молодежи | OpenAI
03.09.2026Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
