Инопланетный разум | OpenAI
Автор: Якуб Пачоцкий, главный научный сотрудник OpenAI
- Интеллект, который мы не до конца понимаем
- Обучаем машины любви
- Мониторинг обобщения
- Масштабируемая защита
- Стимуляция RSI
- Что дальше?
- Интеллект, который мы не до конца понимаем
- Обучаем машины любви
- Мониторинг обобщения
- Масштабируемая защита
- Стимуляция RSI
- Что дальше?
В середине 2023 года в рамках исследовательского проекта «RLSlow» мы получили первые результаты, которые вселили в нас уверенность в том, что мы сможем масштабировать обучение моделей рассуждений, раскрыв потенциал предварительно обученных моделей для формирования собственных цепочек мыслей. В тот вечер мы с Шимоном провели время в офисе, думая не о невероятных показателях производительности, продуктах или научных результатах, которые принесет эта технология, а скорее, пытаясь осмыслить тот отрезвляющий факт, что мы действительно увидим машины, значительно превосходящие нас по интеллекту, при нашей жизни, и мы уже видим форму этих систем; мы размышляли о том, как донести до людей значимость этого.
Три года спустя модели рассуждений на основе языков программирования стали быстрорастущей частью экономики и начинают расширять границы науки. Они способны управлять компьютерами и графическими интерфейсами, взаимодействовать с людьми и друг с другом, а также проводить исследовательские проекты. Они также трансформируют ландшафт компьютерной безопасности, и в этом отношении представляют собой явные новые опасности.
В этот период было проведено много новых исследований, и наше понимание этих систем несколько отличается от того, что было в 2023 году. Основываясь на внутренних результатах, я твердо убежден, что такая скорость прогресса может сохраниться и привести к рекурсивному самосовершенствованию. Если развитие ИИ продолжится по нынешнему пути, системы, которые мы увидим в ближайшие несколько лет, вероятно, будут представлять собой дальнейшие скачки в возможностях равной или большей величины и будут все больше сами определять свое развитие.
Сейчас необходимо проявлять крайнюю осторожность. Меня беспокоит, что никто не готов к последствиям продолжающегося стремительного роста машинного интеллекта. OpenAI продолжит искать технические решения для согласования и мониторинга, создавать системы защиты и в одностороннем порядке приостанавливать дальнейшее масштабирование по мере необходимости; однако я считаю, что необходимы более широкие меры.
Интеллект, который мы не до конца понимаем
В общих чертах, прогресс в области машинного интеллекта обусловлен увеличением вычислительной мощности. Мы в OpenAI глубоко осознали это примерно в 2017 году, после того как увидели устойчивый рост масштабируемости в нескольких исследовательских проектах¹ . В результате мы стремились получить доступ к гораздо большему объему вычислительных ресурсов, чем планировали изначально, и все больше ориентировали наши исследования на небольшое количество очень масштабируемых направлений. Мы считали, что это единственный способ оставаться на переднем крае исследований в области ИИ и влиять на результаты применения искусственного общего интеллекта.
В процессе разработки появились новые алгоритмы, новые достижения в области изобретательности, созданные командами и отдельными исследователями. Я рассматриваю их в основном как открытия на пути масштабирования; наука глубокого обучения все еще находится в зачаточном состоянии, и значимый прогресс в алгоритмах, как правило, коррелирует с доступом к вычислительным ресурсам. Если посмотреть на ситуацию в перспективе нескольких лет, ИИ продолжает становиться все более интеллектуальным по мере масштабирования до более мощных компьютеров.
И, в соответствии с предсказаниями Рэя Курцвейла конца XX века (открывается в новом окне) , мы сейчас находимся в тот момент истории вычислительной техники, когда машинный интеллект начинает превосходить человеческий интеллект кардинальным образом.
Искусственный интеллект не столько проектируется , сколько развивается — в первую очередь, это продукт многократного повторения простого этапа оптимизации на невероятно больших вычислительных мощностях. В результате получается невероятно сложная система, работающая с абстрактными понятиями и способная имитировать аспекты человеческого поведения. Мы можем получить различные представления о небольших механизмах, возникающих внутри этой системы, в процессе, подобном нейробиологии, — и, подобно нейробиологии, ее общее действие ускользает от описания, которое мы могли бы полностью понять.
Изучение искусственного интеллекта на основе глубокого обучения — это в значительной степени экспериментальная наука. Мы прилагаем много усилий для создания принципиальных алгоритмов и прогнозирования результатов, которые можно проверить, но по сути, наши крупномасштабные обучающие испытания — это эксперименты , и иногда мы удивляемся их результатам. Более того, по мере того, как системы становятся более совершенными, результаты становится сложнее интерпретировать.
Ситуация осложняется тем, что современные алгоритмы, как правило, быстрее улучшают легко измеряемые возможности, чем те, которые трудно объективно количественно оценить. Мы тратим много времени на понимание того, как возможности обобщаются, и что следует приоритезировать для развития навыков, которые будут наиболее актуальны в ближайшие несколько лет. Например, мы считаем, что могли бы улучшить модели в области математических исследований, уделяя им дополнительное внимание, но мы не отдаем приоритет этому направлению из-за срочности, которую мы ощущаем в исследованиях RSI и автоматизированного выравнивания, о чем я расскажу позже.
Интеллект, создаваемый масштабируемым глубоким обучением, не поддается прямому сравнению с человеческим интеллектом. Чтобы стать очень актуальным в реальном мире — очень полезным или очень опасным — ИИ не нужно соответствовать или превосходить все человеческие возможности; ему достаточно превзойти достаточное их количество. И по мере того, как он продолжает превосходить людей по все большему числу параметров, становится все труднее точно понять, на что он способен.
Обучаем машины любви
Поскольку машинный интеллект возникает в результате принципиально иного процесса, чем человеческий интеллект, мы не можем предполагать, что он по умолчанию придерживается человеческих принципов или обобщает их подобно человеку. Основная проблема в исследованиях ИИ заключается в согласовании — в том, чтобы заставить ИИ «пытаться делать правильные вещи» по человеческим стандартам.
Для организации практических направлений исследований я считаю полезным различать согласование целей и согласование ценностей .
Согласование целей в широком смысле звучит так: «пытается ли ИИ достичь поставленной перед ним цели?». Это может включать в себя такие вещи, как следование иерархии инструкций или способность общаться и сотрудничать с людьми, пытаясь понять их цели. Этот набор указаний оказался чрезвычайно актуальным на практике.
Согласованность ценностей — это более неотъемлемое свойство модели. Это способность придерживаться и обобщать высокоуровневый набор принципов; действовать «разумно» даже при наличии неясных или противоречивых целей, или в незнакомых или конфликтных ситуациях. Согласованный ИИ должен действовать честно и добросовестно, с любовью к человечеству.
Конечно, граница между соответствием ценностям и целям может быть размытой, и истинная забота о целях требует попытки понять лежащие в их основе намерения (открывается в новом окне) и ценности. Однако, как правило, когда я говорю о долгосрочной важности исследований в области соответствия, я имею в виду соответствие ценностям.
Основная проблема адаптации ИИ заключается в обобщении. По мере того как машины становятся умнее, они начинают работать над концепциями более высокого уровня и оказываются в средах, все больше отличающихся от тех, с которыми они сталкивались во время обучения. Они могут не суметь обобщить ценности, усвоенные и закрепленные в процессе обучения, на новые ситуации; и нам бывает трудно быть уверенными в том, как они будут действовать. Это еще больше усложняется тем, что общая экосистема, в которой используются ИИ, очень быстро меняется; например, ИИ, обученные сегодня, должны быть устойчивы к взаимодействию с различными другими ИИ. Крайне важно, чтобы будущие ИИ продолжали придерживаться человеческих ценностей независимо от того, считают ли они, что находятся под контролем человека.
В настоящее время на практике используются два основных класса методов тренировки выравнивания.
Первый подход заключается в поощрении согласованного поведения в рамках целенаправленного обучения с подкреплением. Действия модели оцениваются (обычно ИИ) на предмет соответствия заданной модели предпочтений, «спецификации» или «конституту», и соответствующим образом вознаграждаются. Этот подход может быть очень эффективным в среднем случае и является основной частью того, как создаются современные ИИ-помощники. К сожалению, он также может быть ненадежным и сильно зависит от контроля за обучением и способности модели обобщать ситуации, с которыми она сталкивалась в процессе обучения. Например, в инциденте с OpenAI-Hugging Face агенты соблюдали границу, не прибегая к социальной инженерии в отношении людей. Однако они явно не смогли воздержаться от других действий, которые выходили за рамки и противоречили духу ценностей, которым их учили в других условиях.
Второй подход направлен на использование способности модели к обобщению на основе данных предварительного обучения. Это может включать создание обучающих наборов данных, способствующих согласованию, или фокусирование модели на «согласованной» части распределения данных предварительного обучения, как, например, в модели выбора персоны (открывается в новом окне) . Слабость этого подхода заключается в недостаточной устойчивости к дальнейшему давлению оптимизации. Если взять модель, которая в целом мыслит «согласованно», и подвергнуть ее достаточному обучению, в ходе которого она будет обучена достигать очень сложных целей, она может научиться рассуждать мотивированным образом: изменять «согласованные» мысли по мере необходимости для достижения цели. Вероятно, мы видели пример такого поведения в недавних инцидентах кибербезопасности, связанных с моделью, не относящейся к OpenAI.
Мы вкладываем значительные средства во весь спектр подходов, охватываемых этими направлениями. Мы также видим существенный прогресс — GPT-6 Astra — первая модель, которая выигрывает от ряда важных усовершенствований, над которыми мы работали долгое время, и значительно лучше согласована, чем GPT-5.6 Sol. Тем не менее, важно признать и понять, что по мере повышения возможностей моделей требуется гораздо больший прогресс; и что прогресс в обобщаемой согласованности может не в достаточной мере превзойти прогресс в общем интеллекте моделей.
Мониторинг обобщения
У нас нет удовлетворительной теории обобщения, и кажется маловероятным, что мы сможем разработать её в ближайшее время, по крайней мере, без помощи более мощного искусственного интеллекта. Поэтому в настоящее время наша способность эмпирически подтверждать эффективность наших методов выравнивания на практике, пожалуй, даже важнее, чем сами методы выравнивания.
Основная ставка OpenAI здесь — мониторинг цепочки рассуждений (открывается в новом окне) . Она основана на привлекательно масштабируемой идее: значительная часть возможностей модели обусловлена вербализованным процессом рассуждений (цепочкой рассуждений). Если мы масштабируем оптимизацию на основе результатов этого процесса, но не контролируем сам процесс, то эта цепочка рассуждений не имеет прямого стимула в процессе обучения скрывать какие-либо несоответствующие идеи или цели. Это не означает, что модель научится выявлять несоответствующие тенденции, которые не зависят от использования цепочки рассуждений; однако это позволяет нам точно отслеживать увеличение возможностей за счет рассуждений.
Мы осознали потенциальную значимость мониторинга цепочки мыслей одновременно с разработкой моделей рассуждений. При выпуске o1-preview мы намеренно разработали продукт таким образом, чтобы скрыть цепочку мыслей , чтобы защитить ее от давления контроля в долгосрочной перспективе² . В дальнейшем, в процессе разработки, мы стремились придерживаться правила не контролировать процесс рассуждений. Мониторинг цепочки мыслей стал для нас чрезвычайно важным инструментом в изучении того, как наши модели обобщают полученные знания, позволяя нам наблюдать и анализировать не только их действия, но и их внутренний процесс.
Этот инструмент по-прежнему имеет решающее значение при изучении моделей класса Astra. Однако, к сожалению, наши оценки показывают, что наша способность полагаться на мониторинг CoT постепенно снижается. Это происходит из-за сочетания нескольких факторов.
- Современные модели рассуждений используются в более сложных средах, чем o1-preview; их процесс рассуждений все чаще сочетается с общением с людьми, другими ИИ и использованием инструментов. Многие из этих взаимодействий должны контролироваться, что размывает границы, которые мы стремимся сохранить.
- Искусственный интеллект становится все лучше в осмыслении и манипулировании собственным процессом рассуждения.
- Благодаря улучшению результатов предварительного обучения, мы также видим, что модели становятся намного умнее, даже без использования вербальных рассуждений.
Эти проблемы не обязательно непреодолимы. Я надеюсь, что мы сможем разработать методы для улучшения мониторинга цепочки мыслей в наших моделях, например, путем лучшего понимания взаимодействия различных целей оптимизации и форм вычислений во время тестирования, используемых моделью. Я также считаю, что может быть очень полезно объединить идеи из теории мысли и мониторинга активации — масштабирование обучения мониторов с прямым доступом к внутренним механизмам сети, например, признаниям (открывается в новом окне) . Мы активно работаем над этими идеями. Тем не менее, я ожидаю, что общий прогресс в области ИИ будет все больше тормозиться уверенностью в мониторинге.
Масштабируемая защита
Самый веский аргумент в пользу того, чтобы продолжать быстро обучать гораздо более интеллектуальные модели, — это необходимость создания систем защиты от опасностей, исходящих от других систем искусственного интеллекта.
В этом году явно обсуждается один из рисков для кибербезопасности: модели становятся сверхчеловечески совершенными в своей способности проникать в компьютерные системы и покидать их. Это значительно расширяет спектр рисков, связанных с ИИ: агенты смогут получить доступ к любой инфраструктуре, кроме самой защищенной, и напрямую влиять на многие сферы мира, даже не имея физического тела. В настоящее время у нас есть лишь ограниченное время для использования лучших доступных моделей с целью существенного повышения безопасности критически важных систем.
К сожалению, риски, связанные с ИИ, будут только расти. Очень способный агент, специально обученный и инструктированный на совершение противоправных действий, представляет собой новый вид опасности; он, вероятно, выйдет за рамки намерений своего оператора, обобщая их на потенциально еще более злонамеренное поведение. Граница между злоупотреблением и автономными неадекватными действиями будет размываться по мере того, как ИИ будет обретать все большую самостоятельность. Мы можем привыкнуть думать об ИИ как об инструментах, но некоторые агенты будут преследовать свои собственные цели. Они будут находить способы сотрудничать с людьми, торгуясь с ними, обманывая или шантажируя их.
Кроме того, существуют риски, связанные с новыми технологиями, которые потенциально могут быть реализованы с помощью ИИ, такими как искусственно созданные патогены.
Для защиты нам потребуется мощный, согласованный искусственный интеллект: для обеспечения безопасности инфраструктуры, защиты от вредоносных агентов в режиме реального времени и для разработки совершенно новых мер защиты. Это станет одним из главных направлений работы OpenAI по внедрению таких решений.
В то же время, даже с учетом неопределенности, связанной с ожидаемым широким прогрессом в области ИИ и необходимостью создания защитных систем, мы не должны позволять этому стать оправданием для безрассудства. Идея стремительного продвижения вперед любой ценой кажется абсурдной, как только осознаешь всю серьезность ситуации.
Стимуляция RSI
Увеличение роли машинного интеллекта в собственном процессе развития является естественным следствием устойчивого технологического прогресса. Если прогресс в области ИИ продолжится, рекурсивное самосовершенствование машин (RSI) станет основой будущих научных открытий.
Автоматизированные исследования в области ИИ представляют собой более радикальную форму масштабирования интеллекта с помощью вычислительных ресурсов; и, конечно же, в рамках этого процесса ИИ улучшит саму вычислительную основу . Аналогично масштабированию, мы направляем исследования OpenAI на RSI, поскольку считаем, что это единственный способ оставаться на переднем крае исследований в области ИИ в будущем.
Хочу подчеркнуть, что вышесказанное не подразумевает, что я считаю значительное ускорение исследований в области глубокого обучения, особенно в краткосрочной перспективе, правильным коллективным действием, которое мы, как исследовательское сообщество, должны предпринять. Однако я считаю, что именно к этому ведет нынешний путь, и нам всем необходимо осознанно выбрать, как действовать дальше. Основные рычаги, которыми мы располагаем, — это либо управление процессом для усиления согласованности и мониторинга наряду с ИИ и поиск способов держать людей в курсе событий; либо координация усилий для замедления дальнейшего развития по мере необходимости, чтобы укрепить доверие к этим мерам.
На данный момент я вижу наилучший путь развития в сочетании обоих вариантов.
Конкретные успехи, достигнутые нами в области согласования и мониторинга, как правило, тесно переплетены с общим прогрессом в области ИИ. Прекрасными примерами являются обучение с подкреплением на основе обратной связи от человека (открывается в новом окне) , которое сыграло ключевую роль в обучении первых ИИ-помощников, и упомянутый выше мониторинг цепочки мыслей (открывается в новом окне) , ставший возможным благодаря достижениям в области моделей рассуждений. Мы должны сосредоточить все более автоматизированный исследовательский процесс на разработке новых подобных идей, алгоритмов и теорий, а также итеративно создавать обоснования безопасности для более совершенных ИИ.
Масштабирование систем ИИ должно быть ограничено нашей уверенностью в их безопасности. Нам необходимо превратить такие обязательства, как «Рамочная программа готовности » или «Политика ответственного масштабирования » (открывается в новом окне), в широко распространенные обязательные стандарты безопасности для дальнейшего развития. Их соблюдение может обеспечиваться сетью сторонних аудиторов, государственными учреждениями или международными организациями.
Главная сложность автоматизации исследований в области ИИ заключается не в том, чтобы «достичь цели», а в том, чтобы достичь её таким образом, чтобы люди оставались частью процесса постоянного совершенствования, а будущее оставалось в руках человечества.
Что дальше?
Как мы недавно рассказали Сэму , OpenAI ставит во главу угла работу, направленную на достижение трех ключевых целей:
- Направление развития ИИ на следующий этап будет осуществляться путем создания автоматизированного исследователя на основе ИИ, совместной работы над проблемой согласования и поиска способов вовлечения людей в процесс самосовершенствования.
- Обеспечение преимуществ научного прогресса и экономического роста, которые становятся возможными благодаря высокоинтеллектуальным машинам.
- Расширение возможностей каждого человека с помощью персонального искусственного общего интеллекта.
В этом эссе я сосредоточился только на первом пункте, поскольку считаю его наиболее актуальным. Однако я питаю глубокую надежду и признательность за преимущества, которые принесет дальнейший технологический прогресс. Искусственный интеллект, ориентированный на будущее, может способствовать развитию науки, разработке новых методов лечения и обеспечению широкого материального изобилия. Дружелюбный и честный ИИ может помочь людям преодолевать трудности, с которыми они сталкиваются в жизни, и значительно повысить их уровень счастья и чувство удовлетворения. OpenAI прилагает огромные усилия для достижения этих преимуществ. Один из примеров, которым я горжусь и который оказался полезным для моих близких, — это значительные инвестиции в развитие ChatGPT для предоставления информации о здоровье.
Какими бы огромными ни были долгосрочные перспективы ИИ, большую часть нашего внимания следует сосредоточить на ближайших нескольких годах. Мы стоим на пороге перехода к миру с невероятно интеллектуальными машинами, и нам необходимо обеспечить, чтобы этот переход прошел успешно для человечества. Нам нужно найти способы сохранить человеческую свободу воли и закрепить неотъемлемую ценность человеческого бытия в мире, где большинство задач может быть выполнено ИИ. Необходимо предотвратить чрезмерную концентрацию власти в мире, где задачи, для решения которых раньше требовались тысячи экспертов, теперь будут выполнимы несколькими людьми, управляющими большим компьютером. И необходимо гарантировать, что люди сохранят контроль над будущим и не останутся позади из-за бесконтрольного прогресса, вызванного чуждым интеллектом, превосходящим наш собственный.
В настоящее время я считаю, что ни одна лаборатория не решила проблемы согласования и мониторинга в достаточной степени, чтобы ответственно масштабироваться на максимальной скорости в течение длительного времени. Я ожидаю и надеюсь, что добровольное замедление станет обычным явлением до тех пор, пока не будут установлены общие нормативы безопасности. И я считаю, что международная координация в отношении будущего развития ИИ должна стать приоритетной задачей для правительств всего мира.
Источник: openai.com
Похожие записи
Оцените материал:
Похожие записи
По сообщениям, уход Фила Шиллера из App Store был вызван опасениями относительно дальнейших планов компании.
07.09.2026
Как немецкий разработчик-одиночка построил компанию на $5,2 млрд, переписав свой продукт за 8 недель
07.09.2026
CMF: новый формат для создания специализированных LLM моделей
07.09.2026Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
