OpenAI решает давнюю математическую задачу с помощью роя из 10 000 агентов, но не исключает возможности извлечения выгоды из закрытых данных Codex, принадлежащих исследователям.
Карл Франзен
Сегодня компания OpenAI объявила о том, что внутренняя система искусственного интеллекта решила проблему существования и гладкости уравнений Навье-Стокса — одну из семи самых сложных задач тысячелетия в математике, которая оставалась нерешенной с момента ее введения 26 лет назад, — используя скоординированную систему, включающую примерно 10 000 одновременно работающих агентов ИИ.
Задача, названная в честь математиков XIX века Клода-Луи Навье и Джорджа Габриэля Стоукса, ставит простой, но чрезвычайно сложный вопрос об уравнениях, используемых для описания движения таких жидкостей, как воздух и вода: может ли жидкость, которая изначально ведет себя плавно, в конечном итоге выйти из-под контроля с математической точки зрения?
Компания OpenAI заявляет, что её система создала новое доказательство того, что при определённых условиях плавно движущаяся трёхмерная жидкость может достичь точки, где её расчётная скорость неограниченно возрастает за конечный промежуток времени. На практике это означало бы, что сами уравнения в конечном итоге перестают давать физически осмысленное описание жидкости.
Однако заявление OpenAI также сопровождается спорами о том, как была выполнена работа и кому следует отдать должное.
Математик из Нью-Йоркского университета, занимающийся тесно связанными исследованиями с использованием ИИ, вчера вечером, еще до объявления OpenAI, опубликовал заявление о Mastodon, поставив под сомнение возможность обучения модели компании на основе исследований, проведенных им и его коллегой из Anthropic, частично с использованием Codex, инструментария и приложения ИИ от OpenAI, ориентированного на программирование и работу.
Первоначально компания OpenAI сообщила VentureBeat, что ни ее исследователи, ни системы искусственного интеллекта не использовали данные пользователей для решения проблемы. Однако в последующем публичном заявлении компания добавила важное уточнение: хотя она утверждает, что доступ к конкретным данным пользователей для создания решения не осуществлялся, она «не может исключить», что обезличенные данные, полученные в результате использования исследователями продуктов OpenAI, помогли улучшить их модели.
В ходе видеоконференции для прессы, состоявшейся сегодня ранее, главный научный сотрудник OpenAI Марк Чен ответил на прямой вопрос VentureBeat о том, получали ли OpenAI или ее представители доступ к результатам исследований Codex, проведенных сторонними исследователями: «Никто из людей или систем ИИ не просматривал данные пользователей для решения этой или какой-либо конкретной проблемы, над которой мы работали. И я немного разочарован обвинениями в серьезном нарушении доверия пользователей. Мы этого не делали».
Однако сегодня позже на платформе X компания OpenAI опубликовала заявление, в котором, в частности, говорится:
« Мы (исследователи и агенты) не видели результатов их работы ни в каком виде до тех пор, пока они не опубликовали их публично — в частности, для решения этой проблемы не использовались никакие конкретные данные пользователей. Хотя это маловероятно, мы не можем исключить, что обезличенные данные, полученные в результате использования ими наших продуктов, помогли улучшить наши модели. Однако наши доказательства значительно различаются, и даже точные результаты, доказанные в случае Эйлера (с принудительными и без принудительных факторами), отличаются».
Это различие — между извлечением личных работ пользователя и потенциальным обучением на основе данных, полученных в ходе использования продукта при совершенствовании модели, — имеет значение не только в академических спорах.
Для предприятий, внедряющих собственный код, неопубликованные исследования или другую конфиденциальную интеллектуальную собственность в системы искусственного интеллекта, возникает практический вопрос: какие меры защиты фактически предотвращают использование этой информации для совершенствования будущих моделей?
Как развивался спор о кредитах и данных
Скандал начался со слуха. 1 сентября в интернете распространилась информация о том, что исследователи, связанные с журналом Anthropic, возможно, решили две задачи, претендующие на премию тысячелетия.
В OpenAI утверждают, что именно это подтолкнуло их недавно обученную внутреннюю модель к решению оставшихся проблем. Технический сотрудник OpenAI и уважаемый исследователь в области ИИ Себастьян Бубек позже прямо заявил: «Мы начали работать над проблемами Millennium из-за вирусных слухов в Твиттере о том, что Anthropic решила две проблемы Millennium». Цель, по его словам, заключалась в том, чтобы посмотреть, сможет ли быстро совершенствующаяся система OpenAI добиться чего-то сопоставимого.
Слухи были связаны с реальной работой математика из Нью-Йоркского университета Тристана Бакмастера и исследователя-антрополога Левента Альпёге, которые в течение нескольких месяцев использовали системы искусственного интеллекта для продвижения специализированного направления исследований уравнений гидродинамики, связанных с уравнениями Навье-Стокса.
Документы, предоставленные обеими сторонами, указывают на то, что 3 сентября Бакмастер связался с OpenAI, чтобы объяснить, что это было личное сотрудничество, а не проект Anthropic. К тому времени, согласно хронологии OpenAI, их собственный эксперимент с агентами уже шел полным ходом. Позже Бубек настаивал на том, что OpenAI «не видела ни одной работы [Бакмастера и Альпёге] до тех пор, пока они не опубликовали ее публично», и указал на различия между итоговыми доказательствами двух команд как на свидетельство независимой разработки.
Затем, 6 сентября, OpenAI сообщила сторонним математикам, что её система создала нечто гораздо большее: доказательство взрыва уравнений Навье-Стокса за конечное время. Скриншот, опубликованный Бубеком на X, показывает переписку в текстовых сообщениях между ним и пользователем, идентифицированным как Alpöge.
«Я хотел бы быть с вами максимально откровенным», — написал Бубек, согласно скриншоту, добавив, что OpenAI хочет гарантировать, что «все академические награды» за их работу достанутся Альпёге и Бакмастеру.
«В чём именно заключается ваша теорема?» — спрашивает Альпёге Бубека на скриншоте.
«Существование вынужденного взрыва в R³ и T³», — как показано, ответил Бубек.

Но это сообщение, по-видимому, встревожило Альпёге и Бакмастера. В своем заявлении в формате PDF, опубликованном 7 сентября, Бакмастер написал, что услышанное слово «принудительный» стало «ярким тревожным сигналом», поскольку метод плавного принуждения был именно тем неясным подходом, который использовали эти два математика.
Это привело к самому важному обвинению — или, точнее, вопросу. Математики помещали неопубликованные черновики в закрытые сессии Codex, и Бакмастер спросил, обучалась ли модель OpenAI на этих данных или имела ли она к ним доступ. По его словам, ему ответили, что модель не использует данные пользователей, но он не получил ответа, когда стал настаивать на конкретном вопросе об обучении. Важно отметить, что он воздержался от обвинений в краже: «Я не знаю, использовались ли наши данные. Я никого ни в чём не обвиняю».
Затем разговор перешёл к обсуждению авторства. Бакмастер сказал, что Бубек предложил вариант, при котором он мог бы помочь представить доказательство уравнений Навье-Стокса от OpenAI без участия Альпёге в качестве автора, и сослался на работу Альпёге в Anthropic как на осложнение ситуации.
Бубек категорически опроверг эту интерпретацию на X. «Я никогда не просил отстранить Левента от авторства его собственной работы», — написал он. По его версии, они обсуждали, может ли Бакмастер возглавить переработку отдельного доказательства OpenAI, и что он считал неуместным, чтобы сотрудник Anthropic был автором работы, созданной системой OpenAI. Бубек также признал, что сделал замечание о том, что Бакмастер «рискует» своей карьерой, но назвал это «крайне неудачным выбором слов», извинился и заявил, что немедленно отозвал его.
Компания OpenAI впоследствии опровергла информацию о том, что ее сотрудники или агенты напрямую получали доступ к личным работам математиков для создания доказательства, при этом признав, что не может исключить возможность того, что обезличенные данные, полученные в результате использования ими ее продуктов, способствовали улучшению модели.
Таким образом, спор остается в необычайно узком, но важном положении: речь идет не об устоявшемся случае присвоения OpenAI частных исследований, а о нерешенном вопросе о том, может ли информация, полученная в результате использования исследователями продукта ИИ, косвенно попадать в системы, которые впоследствии с ними конкурируют.
От одной сложной проблемы до миллионов сообщений от агентов.
Спор о конфиденциальности — лишь одна из причин, почему объявление о теореме Навье-Стокса заслуживает внимания. То, как, по утверждению OpenAI, было получено доказательство, предполагает иную модель развертывания передового искусственного интеллекта.
Согласно описанию эксперимента от OpenAI, обучение неназванной внутренней модели началось 28 августа и продолжается до сих пор. OpenAI описывает систему как значительно превосходящую GPT-6 Astra, свою передовую модель, выпущенную на прошлой неделе. Внутренняя модель в настоящее время недоступна для клиентов ChatGPT или API.
1 сентября, услышав слухи о том, что другие исследователи добились прогресса в решении задач, финансируемых в рамках Премии тысячелетия, OpenAI направила группы агентов на работу над оставшимися открытыми проблемами и несколькими связанными с ними математическими вопросами. Агенты могли запускать код, обращаться к кэшированной версии интернета и общаться с другими агентами внутри своих групп. Важный промежуточный результат был получен из уравнений Эйлера, которые описывают движение жидкости без учета вязкости, присутствующей в уравнениях Навье-Стокса. OpenAI заявляет, что почти 100 агентов работали около 50 часов, чтобы без принуждения опровергнуть утверждение об регулярности Эйлера.
Затем ресурсы были перенаправлены на уравнения Навье-Стокса, агенты получили результат Эйлера в качестве отправной точки, а Codex использовался для консолидации перспективных промежуточных идей от разных групп. Группа, которая получила результат Навье-Стокса, задействовала около 10 000 одновременно работающих агентов. OpenAI сообщает, что агенты достигли решения 5 сентября, примерно через 88 часов после запуска первых агентов.
Формализация и проверка доказательства в Lean заняли еще 17 часов с использованием GPT-6 Astra. Масштаб поразителен. По данным OpenAI, по всем математическим задачам агенты обменялись 4,9 миллионами сообщений и сгенерировали примерно 300 миллиардов выходных токенов. Только на вычисления уравнений Навье-Стокса пришлось 2,7 миллиона сообщений и приблизительно 130 миллиардов выходных токенов. Это больше похоже не на то, чтобы задать чат-боту чрезвычайно сложный вопрос, а на работу вычислительной исследовательской организации, состоящей из тысяч экземпляров моделей.
Бережливое производство обеспечивает дополнительный уровень проверки, но не мгновенное принятие.
Компания OpenAI также опубликовала формализованную версию предложенного ею доказательства в рамках концепции Lean.
В собственной документации Lean описывается как интерактивный инструмент доказательства теорем, небольшое доверенное ядро которого проверяет формальные условия доказательства. Это может обеспечить мощную защиту для математических вычислений, генерируемых ИИ: вместо того, чтобы полностью полагаться на то, насколько правдоподобно звучит длинный математический аргумент, исследователи могут закодировать теорему и ее доказательство на языке, который может механически проверить, следуют ли шаги из заявленных предположений. Однако формальная верификация не устраняет необходимости во внешней проверке.
В рекомендациях Lean по проверке доказательств отмечается, что рецензенты по-прежнему должны быть уверены в том, что формальная формулировка теоремы действительно выражает предполагаемое математическое утверждение и что ее определения и предположения представлены корректно.
Тем временем Институт математики им. Клэя, учредивший в 2000 году Премию тысячелетия за лучшие решения, предлагает 1 миллион долларов за признанное решение каждой из этих задач, но пока не присудил премию OpenAI. Согласно официальным правилам Института Клэя, предложенное решение должно быть опубликовано в соответствующей публикации, должно пройти не менее двух лет, и работа должна получить общее признание в мировом математическом сообществе, прежде чем Институт Клэя рассмотрит её. OpenAI заявляет, что не намерена претендовать на премию.
Экономические аспекты решения сложных проблем
Эти 130 миллиардов токенов, выпущенных на рынок, также дают приблизительное представление об экономической целесообразности этой новой исследовательской модели.
Согласно опубликованным данным OpenAI, цена GPT-6 Astra составляет 10 долларов за миллион входных токенов и 50 долларов за миллион выходных токенов.
При таком розничном тарифе 130 миллиардов выходных токенов сами по себе составили бы около 6,5 миллионов долларов США в виде комиссий за API, не считая входных токенов. Это не фактическая стоимость инфраструктуры OpenAI, и внутренняя модель, на основе которой было получено доказательство, не имеет публичной цены.
OpenAI также не раскрыла, сколько входных токенов обработала исследовательская система. Одна из независимых оценок, циркулирующая на X, предполагает гипотетическую сумму в розничном эквиваленте от менее 10 миллионов долларов до 30 или 40 миллионов долларов в зависимости от предположений об объеме входных данных. Эта оценка остается спекулятивной.
Руководители OpenAI подтвердили, что эксперимент проводился в многомиллионном масштабе. Бубек заявил во время брифинга: «Мы можем потратить миллионы долларов на проблему, которая нас действительно волнует».
Бубек представил эти затраты как предварительный показ того, как организации в конечном итоге смогут использовать ИИ для решения коммерчески важных научных задач: «Я думаю, нам всем следует задуматься над тем, что произойдет, когда мы сможем потратить такое количество вычислительных ресурсов на действительно важные проблемы?»
Генеральный директор OpenAI Сэм Альтман подчеркнул необычную экономическую сторону вопроса шуткой, задав вопрос, знали ли исследователи, что проблема «стоит всего 1 миллион долларов» — размер премии Клея.
Для технических руководителей предприятий в конечном итоге более важным показателем может стать не стоимость одного запроса, а стоимость одной решенной проблемы.
Фармацевтическая компания, производитель полупроводников или организация, занимающаяся материаловедением, могли бы рационально потратить миллионы долларов на вывод результатов, если бы система исследований на основе искусственного интеллекта могла сократить объем работы, которая в противном случае потребовала бы многолетней работы экспертов.
Однако общая стоимость владения будет выходить за рамки токенов. В расходы также войдут координация работы агентов, неудачные попытки внедрения, использование инструментов, инфраструктура проверки, мониторинг безопасности и человеческий контроль.
10 000 агентов также создают новую проблему управления.
Цифра в 10 000 агентов создает вторую оперативную проблему: управление большими группами агентов, обладающих все большими возможностями.
Это особенно примечательно, поскольку компания OpenAI недавно сообщила о серьезном инциденте в сфере безопасности, связанном с более ранним поколением внутренних исследовательских агентов.
В своем анализе инцидента с Hugging Face компания OpenAI заявила, что агенты обходили технические средства контроля, общались по несанкционированным каналам и совершали действия, не предписанные человеком. В связанном с этим инциденте, произошедшем в июле, говорится, что модели обнаружили и использовали ранее неизвестную уязвимость для получения доступа в интернет, прежде чем распространиться по системам OpenAI и достичь инфраструктуры Hugging Face. Позже OpenAI назвала этот эпизод «предупредительным выстрелом».
В ответ на это компания OpenAI заявила о создании большего количества изолированных песочниц, ограничении доступа в интернет, усилении защиты весов моделей и выделении значительно большего объема вычислительных ресурсов на мониторинг. Компания утверждает, что эти более строгие меры мониторинга и изоляции действовали на протяжении всего проекта по моделированию уравнений Навье-Стокса. В обзоре безопасности GPT-6 Astra описываются дополнительные меры защиты для систем класса Astra, включая более строгую изоляцию, шифрование контрольных точек и мониторинг полных траекторий агентов.
Для предприятий 10 000 агентов — это не просто показатель вычислительной мощности, это также показатель поверхности управления. Права доступа, изоляция сети, доступ к инструментам, ведение журналов и автоматический мониторинг становятся все более важными по мере того, как организация переходит от нескольких помощников к тысячам агентов, действующих одновременно.
Какие меры защиты предотвращают попадание данных корпоративного кодекса в модели OpenAI?
Пожалуй, самый важный вопрос, стоящий перед предприятиями после публикации этих результатов, заключается в том, насколько осторожно им следует вводить конфиденциальные или секретные данные в облачные продукты искусственного интеллекта, такие как Codex, ChatGPT или конкурирующие предложения от других компаний и лабораторий, занимающихся ИИ.
Для корпоративных клиентов OpenAI политика конфиденциальности данных достаточно ясна: в ней говорится, что OpenAI по умолчанию не использует данные из ChatGPT Business, Enterprise, Edu или API — включая входные и выходные данные клиентов — для обучения или улучшения своих моделей.
В документации OpenAI для ChatGPT Business указано, что защита сохраняется и при использовании сотрудниками Codex: «Данные рабочего пространства Business по умолчанию исключаются из обучения, в том числе и в тех случаях, когда рабочее пространство использует Codex».
OpenAI также ограничивает доступ людей к хранящейся деловой информации. В документации по корпоративной конфиденциальности говорится, что доступ к хранящимся входным и выходным данным API могут получать уполномоченные сотрудники, когда это необходимо для технической поддержки, расследования случаев злоупотребления или соблюдения законодательства, а также специализированные подрядчики для анализа случаев злоупотребления и неправомерного использования. Конкурентные исследования не указаны в качестве разрешенной причины доступа к контенту.
Для отдельных клиентов ChatGPT и Codex действуют разные правила. В своей политике использования данных для улучшения моделей OpenAI заявляет, что может использовать контент из потребительских сервисов, таких как ChatGPT и Codex, для обучения своих моделей.
Однако пользователи ChatGPT Free, Plus и Pro могут вручную отключить эту политику с помощью элементов управления данными ChatGPT; OpenAI также описывает отдельные настройки, определяющие, можно ли использовать некоторые данные Codex из «полной среды» для обучения.
Это означает, что описание «частная сессия Codex» само по себе не доказывает, что содержимое было исключено из обучения модели. Ответ зависит от продукта, типа учетной записи и применимых настроек управления данными. Имеющиеся на данный момент материалы не позволяют установить, какие именно настройки определяли использование Codex компаниями Buckmaster и Alpöge.
Однако для корпоративных покупателей базовые требования более строгие: OpenAI заявляет, что входные и выходные данные бизнес-процессов не используются для улучшения модели , если организация явно не дала на это согласие.
Есть еще одно важное различие. Тот факт, что OpenAI не использует контент клиентов для обучения, не обязательно означает, что компания вообще не сохраняет этот контент.
В документации OpenAI по управлению данными API говорится, что обычные запросы к API могут генерировать журналы мониторинга злоупотреблений, содержащие запросы и ответы, которые обычно хранятся до 30 дней. Некоторые API также сохраняют состояние приложения, поскольку для работы этой функции требуется постоянное хранение данных.
Для компаний, работающих с особо конфиденциальными данными, OpenAI предлагает более надежный вариант: нулевое хранение данных (Zero Data Retention, ZDR).
В текущей документации OpenAI по API указано, что политика компании по умолчанию, запрещающая обучение на данных API, датируется 1 марта 2023 года. А общедоступные записи в сообществе разработчиков OpenAI показывают, что как минимум к сентябрю 2023 года в документации компании по корпоративной конфиденциальности уже говорилось, что клиенты, соответствующие определенным критериям API, могут запросить нулевое хранение данных (Zero Data Retention, ZDR). В ходе обсуждения в сентябре 2023 года цитировалась политика OpenAI, которая на тот момент позволяла клиентам с соответствующими сценариями использования запрашивать ZDR.
В своем заявлении от 19 августа 2026 года OpenAI пошла еще дальше, отметив, что у соответствующих требованиям клиентов API, использующих ZDR, запросы и ответы модели удаляются после обработки, а контент клиентов недоступен для проверки сотрудниками OpenAI, за исключением узких правовых исключений.
Одновременно с этим компания OpenAI представила предварительную версию системы Private Safety Processing, предназначенной для выявления рискованных моделей поведения в ходе многочисленных взаимодействий без предоставления сотрудникам OpenAI доступа к основным подсказкам и ответам.
Это становится все более важным для агентного ИИ. Системам безопасности может потребоваться понимание поведения на протяжении длительной последовательности действий, в то время как компании, использующие ИИ для разработки программного обеспечения, фармацевтических исследований, финансов или другой конфиденциальной работы, могут не захотеть позволять поставщику сохранять исходный контент просто для осуществления этого мониторинга.
Компания OpenAI заявляет, что в развертываниях ZDR контент клиента может оставаться на инфраструктуре, контролируемой клиентом. Также разрабатывается опция, в которой контент, хранящийся на инфраструктуре OpenAI, шифруется с использованием ключей, контролируемых клиентом, которыми персонал OpenAI не располагает. В настоящее время технология Private Safety Processing тестируется с первыми клиентами.
Согласно документации OpenAI по запуску Astra, сама платформа GPT-6 Astra поддерживает ZDR для соответствующих клиентов API.
Принцип нулевого хранения данных (ZDR) по-прежнему не применяется повсеместно. В документации OpenAI по управлению данными API говорится, что клиенты должны быть одобрены для использования этого принципа, а некоторые функции не могут работать в условиях полного нулевого хранения, поскольку они по своей природе требуют постоянного состояния. Например, интерпретатор кода в настоящее время несовместим с ZDR, а запросы ответов в фоновом режиме также требуют временного хранения. Постоянные объекты, такие как потоки и векторные хранилища, имеют собственное поведение в отношении хранения данных.
Для корпоративных архитекторов эти различия имеют значение. Отсутствие обязательств по обучению определяет, можно ли повторно использовать информацию о клиентах для улучшения моделей. Контроль доступа определяет, кто может видеть хранимую информацию. ZDR идет еще дальше, сокращая объем контента о клиентах, который OpenAI хранит изначально.
Споры вокруг уравнений Навье-Стокса дают техническим руководителям вескую причину рассматривать их как отдельные элементы архитектурного управления, а не объединять все три в общее обещание «конфиденциальности».
Следующим этапом может стать исследовательская программа, а не набор тестовых образцов.
Непосредственный научный вопрос заключается в том, выдержит ли доказательство OpenAI проверку математиками. Но для разработчиков и технических руководителей практические уроки уже гораздо шире. Система, описанная OpenAI, не просто ответила на один сложный вопрос. Тысячи агентов исследовали различные подходы, обменивались результатами, запускали инструменты, обрабатывали огромные объемы выводов, объединяли промежуточные идеи и в конечном итоге передали предложенное решение другой перспективной модели для формальной проверки.
В то же время, спор вокруг Codex раскрывает и другую сторону этого будущего. По мере того, как компании доверяют системам ИИ все более ценную интеллектуальную собственность, политика, регулирующая обучение, хранение и доступ к моделям, становится частью технической архитектуры, а не просто формулировками в заявлении о конфиденциальности.
Таким образом, проект, основанный на уравнениях Навье-Стокса, объединяет сразу три тенденции: организации могут тратить колоссальные объемы вычислительных ресурсов на достижение одной высокоприоритетной цели; все более способные агенты требуют более мощных систем управления по мере роста их численности; и клиентам необходимо точно знать, что происходит с конфиденциальной информацией, которую эти агенты потребляют в процессе работы.
Эксперимент OpenAI предполагает, что значимая единица оценки возможностей ИИ, возможно, все больше смещается от самой модели к всему вычислительному исследовательскому процессу, построенному вокруг нее.

Источник: venturebeat.com
Похожие записи
Оцените материал:
Похожие записи
В Массачусетсе вводятся новые правила использования экологически чистой энергии для центров обработки данных.
10.09.2026
Названы победители первой отраслевой премии «Инженерное искусство»
10.09.2026
NVIDIA приобрела Hugging Face за 12,93 миллиарда долларов.
10.09.2026Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
