Архив рубрики ~Лента новостей~

Как GPT-5.6 объединяет передовые интеллектуальные возможности с передовой эффективностью | OpenAI

Как GPT-5.6 объединяет передовые интеллектуальные возможности с передовой эффективностью | OpenAI
Как GPT-5.6 объединяет передовые интеллектуальные возможности с передовой эффективностью | OpenAI

Мы разработали семейство моделей GPT-5.6, чтобы сбалансировать возможности и стоимость в широком спектре задач, для которых люди используют наши модели. Наша флагманская модель, GPT-5.6 Sol, с максимальным уровнем логического мышления, превосходит Claude Fable 5 в индексе агентов искусственного анализа при стоимости менее половины. Terra показывает такие же результаты, как GPT-5.5, в тестах интеллекта при вдвое меньшей цене, а Luna — наша самая быстрая и доступная модель, цена которой на 80% ниже, чем у Sol. Для достижения такой эффективности наши исследовательские и технические группы провели значительную оптимизацию на каждом основном уровне нашего стека. Эти улучшения охватывают наши модели, вывод (способ запуска моделей для генерации результатов) и нашу агентную платформу, которая используется как Codex, так и ChatGPT Work.

За последние четыре года, масштабировав наши модели до 1 миллиарда активных пользователей и более чем 2 миллионов предприятий, мы сделали эффективность ключевым фактором в распределении преимуществ искусственного интеллекта среди всех. Наша миссия — обеспечить, чтобы искусственный общий интеллект приносил пользу всему человечеству. За эти годы мы постоянно работали над оптимизацией всего нашего стека, чтобы предлагать наиболее производительные модели на каждом этапе кривой «затраты-интеллект». Наибольшей эффективности по показателю «интеллект на токен» мы достигли благодаря GPT-5.6, которая обучена выполнять больше работы на токен . В процессе обучения мы оптимизируем как успешность выполнения задач, так и эффективность, формируя модель таким образом, чтобы она следовала более прямому пути выполнения задачи.

В этой статье мы не ограничиваемся описанием наших моделей, а расскажем о том, как мы повысили эффективность за счет усовершенствований в двух других важных компонентах стека, включая: 1) вывод результатов , оптимизировав такие процессы, как балансировка нагрузки, спекулятивное декодирование, кэширование и оптимизация ядра, чтобы получить больше выходных данных от того же оборудования, и 2) нашу систему агентного управления , включая улучшенное управление раздуванием контекста, использованием инструментов и повторяющейся работой. Мы также расскажем о роли GPT-5.6 Sol в автономном выполнении ряда из этих задач. Хотя любое отдельное улучшение может показаться ограниченным, эти достижения в совокупности позволяют нам достигать передовых результатов как в области интеллекта, так и в области эффективности.

Диаграмма, демонстрирующая эффективность GPT-5.6 в контексте работы с агентами, оркестрации API и вывода модели, показывающая уменьшение объема сетевых данных, снижение нагрузки на ЦП и увеличение производительности графического процессора.

Ускорение вывода данных с помощью GPT-5.6 Sol

В условиях ограниченности вычислительных мощностей, когда спрос на модели растет быстрее, чем их возможности, эффективность является ключевым фактором при проектировании любой системы. Это особенно актуально для нашего стека для выполнения инференции, который запускает обученные модели для генерации ответов. Наша главная цель — обслуживать больше токенов на том же оборудовании, сохраняя при этом интеллектуальность, задержку, доступность и надежность, которые ожидают пользователи.

Для достижения этой цели требуется оптимизация всей системы. Модель может быть очень эффективной сама по себе, но при этом обходиться дорого, если запросы распределяются неравномерно, оборудование простаивает или перемещение данных замедляет вычисления. Улучшения на каждом уровне накапливаются, при этом выгода достигается за счет оптимизации маршрутизации (куда отправляются запросы), планирования (когда отправляются запросы), ядер (программного обеспечения, работающего на графических процессорах), кэширования (сохраненная и повторно используемая работа) и реализации модели (порядок выполнения кода на графическом процессоре). Решение GPT-5.6 из Codex сыграло важную роль во всех этих оптимизациях.

Первый важный пример — балансировка нагрузки. В глобальном масштабе мы маршрутизируем запросы на основе таких факторов, как географическое положение, доступная мощность и тип ускорителя (тип графического процессора или специализированного чипа, на котором работает модель). Внутри кластера мы распределяем работу между экземплярами модели на основе нагрузки, длины контекста, доступности кэша и других свойств запроса. В каждом экземпляре работа должна быть эффективно распределена между ускорителями, подсетями модели и вычислительными ядрами. GPT-5.6 Sol в Codex помогает нам анализировать производственный трафик, выявлять ранее упущенные из виду источники дисбаланса, тестировать новые стратегии маршрутизации и постоянно настраивать эти эвристики. Только эти улучшения балансировки нагрузки значительно снизили стоимость обслуживания наших моделей.

Мы также использовали GPT-5.6 Sol для оптимизации прямого прохода модели: вычисления, преобразующего входные данные в предсказания следующего токена. Даже когда отдельные операции выполняются быстро, избыточное перемещение памяти, синхронизация и неэффективное размещение данных могут привести к простою графических процессоров. Чтобы избежать этого, GPT-5.6 Sol нашел задачи, которые можно было предварительно вычислить, избежать или распараллелить. С помощью Codex GPT-5.6 Sol автономно переписал и оптимизировал наши производственные ядра — основной код, выполняющий математические операции, составляющие модель. Это сработало отчасти потому, что мы обучили GPT-5.6 эффективно писать и улучшать ядра в Triton .(откроется в новом окне)и Глюон(откроется в новом окне)Это два языка программирования с открытым исходным кодом для графических процессоров, поддерживаемые OpenAI. Эти усилия в сочетании с более широкими улучшениями ядра, начиная с GPT-5.6 Sol, позволили снизить сквозные затраты на обслуживание на 20%. Мы также вложили значительные средства в инструменты верификации, такие как инструмент с открытым исходным кодом FpSan .(откроется в новом окне)(Антикодировщик чисел с плавающей запятой), помогающий проверить корректность ядер, написанных с помощью GPT-5.6 Sol.

Спекулятивное декодирование — ещё один способ повышения скорости и эффективности. Этот метод предполагает запуск уменьшенной черновой модели (или «спекулятивной») параллельно с основной моделью, предлагая несколько токенов для параллельной проверки основной моделью. Когда эти предложения принимаются, система может генерировать несколько выходных токенов за один проход основной модели, сокращая объём дорогостоящих последовательных вычислений. GPT-5.6 Sol улучшила свою собственную черновую модель, разработав и проведя сотни экспериментов на своей архитектуре, протестировав изменения размера, структуры и характеристик. Кроме того, GPT-5.6 Sol запустила и контролировала процесс обучения спекулятивной модели, автономно вмешиваясь при возникновении проблем, включая аппаратные сбои и нестабильность обучения. В результате улучшений эффективность генерации токенов увеличилась более чем на 15%.

При обработке некэшированных входных токенов модель создает кэш ключ-значение (KV) за один ресурсоемкий проход; при генерации выходных данных она многократно считывает данные из этого кэша и расширяет его. Оптимальная конфигурация для обслуживания, такая как пакетная обработка, сегментирование и управление KV, в значительной степени зависит от рабочей нагрузки — длины запроса и выходных данных, размера пакета, коэффициента попадания в кэш, характеристик запроса и многого другого. Однако ранее пространство конфигураций было слишком большим для систематической настройки, что вынуждало инженеров полагаться на общие эвристики. С помощью GPT-5.6 Sol в Codex мы смогли анализировать производственные рабочие нагрузки, генерировать и оценивать потенциальные конфигурации, а также гипероптимизировать конфигурацию движка и модели для каждого сценария. Это делает практически осуществимым новый уровень оптимизации, специфичной для рабочей нагрузки, позволяя извлекать более полезные результаты из того же оборудования.

Оптимизация вывода — это непрерывный цикл обратной связи. Мы измеряем поведение системы в производственной среде, выявляем наиболее существенные недостатки, внедряем изменения и проверяем, что они улучшают всю систему в целом, а не только отдельный бенчмарк. GPT-5.6 Sol и Codex ускоряют каждый этап этого цикла. Это означает, что наша команда может исследовать больше идей, быстрее реагировать на меняющиеся рабочие нагрузки и создавать стек для вывода с меньшей задержкой, большей производительностью и меньшими затратами для пользователей.

Как наша система управления рабочим процессом оптимизирует повторяющуюся работу

ChatGPT Work и Codex выполняют сложные задачи посредством серии запросов к моделям и вызовов инструментов. За один цикл — от запроса пользователя до окончательного ответа — Codex может проверить исходный код, просмотреть историю развертывания, прочитать отчеты об инцидентах, отредактировать файл и запустить тесты. Каждый шаг может потребовать отдельного запроса.

Подготовка контекста, передача данных, выполнение вывода, вызов инструментов и запуск процессов — всё это требует времени и вычислительных ресурсов. Если задача требует 30 запросов к модели, то каждая дополнительная секунда на запрос добавляется к общему времени. Повышение общей производительности означает сокращение повторяющихся операций в системе, а не просто ускорение работы модели.

В модель поступает задача от пользователя, которая может вызывать инструмент, получать результат и многократно принимать решения, аналогичные решениям модели, прежде чем задача будет выполнена.

Эти множители повлияли на разработку нашей агентской системы, представляющей собой слой оркестровки на Rust, соединяющий наши модели, инструменты и среду пользователя. Далее мы рассмотрим, как предотвращение избыточности контекста, загрузка инструментов и повторное использование работы повышают эффективность каждого запроса.

Избегайте излишнего контекстного перегруза.

По мере того, как агенты получают доступ к большему количеству инструментов, навыков, плагинов и истории разговоров, контекстные окна могут легко расширяться. Это увеличивает затраты, отвлекает модель и приводит к ненужным рассуждениям. Система может уменьшить эти накладные расходы за счет отложенного обнаружения, благодаря чему интеграции, пользовательские инструменты MCP, навыки и плагины становятся доступными только тогда, когда это необходимо. Система также предотвращает неожиданное использование контекстного окна отдельными инструментами и интеграциями MCP. Вывод инструментов по умолчанию ограничен 10 000 токенами, если модель не запросит другой лимит.

Сохраняйте точные префиксы для оперативного кэширования.

Как уже упоминалось, цикл работы агента может отправлять одни и те же инструкции, историю разговоров, определения инструментов и предыдущие результаты на графические процессоры несколько раз за один ход. Обработка этих повторяющихся входных данных обходится дорого, поэтому кэширование подсказок повторно использует вычисления, связанные с ранее обработанным префиксом подсказки. Для сохранения этого префикса система обрабатывает всю видимую для модели историю как историю только для добавления: новые сообщения, результаты работы инструментов и обновления среды добавляются в конце, а не вставляются в предыдущий контекст. Инструменты также отображаются в детерминированном порядке, в то время как настройки времени выполнения, такие как политики утверждения, применяются во время выполнения, а не встраиваются в определения инструментов. Это проектное решение способствует высоким общим показателям попадания в кэш подсказок в Codex и ChatGPT Work.

Три запроса сравнивают байты, отправленные по постоянному соединению, с растущим контекстом, видимым для модели, и префиксом, пригодным для повторного использования кэша.

Эффективность на протяжении всей кривой интеллекта

Повышение эффективности, достигнутое с помощью GPT-5.6, является результатом многолетней работы по совершенствованию всей системы, охватывающей исследования, вывод результатов и нашу агентную архитектуру. Роль GPT-5.6 в обеспечении многих из этих улучшений вселяет в нас оптимизм относительно того, как ускорится темп оптимизации. Мы продолжим проводить более масштабную оптимизацию в таких областях, как оптимизация ядра, наряду с фундаментальными улучшениями нашей системы. Мы с нетерпением ждем возможности передать эти постоянно совершенствующиеся, скрытые улучшения нашим пользователям и клиентам в виде более доступной и экономически эффективной интеллектуальной системы.

Особая благодарность Мэтью Феррари, Филиппу Тилле, Ахмеду Ибрагиму, Джо Гершенсону и Стиву Коффи, членам технического персонала, за их вклад в эту публикацию.

Оцените материал:

Поделиться
Понравилась статья? Расскажите другим
ВКонтакте
Читайте также
Новости робототехники Nvidia делает ставку на то, что физический искусственный интеллект сможет решить проблему нехватки данных в медицинской робототехнике. Новости робототехники Эксперты реагируют на ограничения FCC на импорт в США новых гуманоидов и мобильных роботов Архив рубрики ~Обо всем~ Компания Beacon Biosignals проводит картирование головного мозга во время сна. Архив рубрики ~Обо всем~ Компания Fast Metals перерабатывает отходы в большем количестве для извлечения важнейших минералов. Архив рубрики ~Обо всем~ Материаловеды получили трехслойный перовскитный солнечный элемент с рекордным напряжением. Органическая соль помогла стабилизировать самый проблемный верхний слой Новости робототехники Примерно так будут развиваться системы БПЛА в ближайшее время Бионика с робототехникой, в сочетании с ИИ и квантовыми технологиями Архив рубрики ~Коротко из Telegram~ Нынешний и будущий руководители Apple также дали короткое интервью о… Новости робототехники «Фантом МК-1»: Настоящий гуманоид для войны или кликбейт из TikTok?… Новости робототехники ENvue Medical разрабатывает роботизированную систему установки зонда для кормления Архив рубрики ~Коротко из Telegram~ В Мексике прошла война панков и ЭМО — это не шутка,… Новости робототехники Терминатор на стройке получил копыта и бензопилы  — умельцы из… Архив рубрики ~Коротко из Telegram~ В России начинают регулировать ИИ Владимир Путин подписал закон про категоризацию… Архив рубрики ~Коротко из Telegram~ Госдума приняла закон, который позволяет региональным властям участвовать в финансировании… Архив рубрики ~Коротко из Telegram~ Своя LoFi-тян прямо на рабочем столе — нашли LoFi Engine для… Новости робототехники Nvidia делает ставку на то, что физический искусственный интеллект сможет решить проблему нехватки данных в медицинской робототехнике. Новости робототехники Эксперты реагируют на ограничения FCC на импорт в США новых гуманоидов и мобильных роботов Архив рубрики ~Обо всем~ Компания Beacon Biosignals проводит картирование головного мозга во время сна. Архив рубрики ~Обо всем~ Компания Fast Metals перерабатывает отходы в большем количестве для извлечения важнейших минералов. Архив рубрики ~Обо всем~ Материаловеды получили трехслойный перовскитный солнечный элемент с рекордным напряжением. Органическая соль помогла стабилизировать самый проблемный верхний слой Новости робототехники Примерно так будут развиваться системы БПЛА в ближайшее время Бионика с робототехникой, в сочетании с ИИ и квантовыми технологиями Архив рубрики ~Коротко из Telegram~ Нынешний и будущий руководители Apple также дали короткое интервью о… Новости робототехники «Фантом МК-1»: Настоящий гуманоид для войны или кликбейт из TikTok?… Новости робототехники ENvue Medical разрабатывает роботизированную систему установки зонда для кормления Архив рубрики ~Коротко из Telegram~ В Мексике прошла война панков и ЭМО — это не шутка,… Новости робототехники Терминатор на стройке получил копыта и бензопилы  — умельцы из… Архив рубрики ~Коротко из Telegram~ В России начинают регулировать ИИ Владимир Путин подписал закон про категоризацию… Архив рубрики ~Коротко из Telegram~ Госдума приняла закон, который позволяет региональным властям участвовать в финансировании… Архив рубрики ~Коротко из Telegram~ Своя LoFi-тян прямо на рабочем столе — нашли LoFi Engine для…

Оставить комментарий