Представляем GPT-6 Sol и Luna | OpenAI
Ещё больше способов интегрировать передовые методы разведки в вашу повседневную работу.
- Цены на API GPT-6
- Улучшение характеристик всей линейки моделей.
- Профессиональная работа
- Фактичность
- Программирование
- Использование компьютера
- Стиль сотрудничества
- Улучшение кэширования для агентов и длительных диалогов.
- Продолжаем улучшать выравнивание
- Доступность
- Цены на API GPT-6
- Улучшение характеристик всей линейки моделей.
- Профессиональная работа
- Фактичность
- Программирование
- Использование компьютера
- Стиль сотрудничества
- Улучшение кэширования для агентов и длительных диалогов.
- Продолжаем улучшать выравнивание
- Доступность
В начале этого месяца мы представили GPT-6 Astra — самую интеллектуальную и оптимизированную модель в мире. Хотя самые сложные и важные проекты по-прежнему требуют всех возможностей Astra, работа ведется в разных масштабах, в разном темпе и с разными бюджетами.
Именно поэтому мы расширяем вселенную GPT-6 с помощью GPT-6 Sol и GPT-6 Luna. GPT-6 Astra представила новое поколение интеллекта — эти модели помогают распределять преимущества этого интеллекта, продвигаясь вперед в области экономической эффективности. Мы обучили GPT-6 Sol и Luna с использованием методов, аналогичных GPT-6 Astra, перенеся достижения, лежащие в основе передовых результатов Astra в профессиональной работе, достоверности, программировании, использовании компьютеров и согласовании, на более быстрые и доступные модели.
Модели GPT-6 лидируют по соотношению цены и качества, сочетая исключительные возможности на каждом уровне с инфраструктурой, которая эффективно обеспечивает их масштабируемое использование. Улучшения в кэшировании и выводе позволяют нам предоставлять эти модели по более низкой цене, и мы напрямую передаем эту экономию пользователям и клиентам, снижая цены на API для Sol и Luna на 50% по сравнению с акционными ценами GPT-5.6. В совокупности эти улучшения делают передовой ИИ практичным для решения более распространенных повседневных задач и приложений в масштабе.
Цены на API GPT-6
|
Модель |
Вход |
Выход |
Снижение цены |
|
GPT‑5.6 Sol → GPT‑6 Sol |
4 доллара → 2 доллара |
20 долларов → 10 долларов |
На 50% дешевле |
|
GPT‑5.6 Луна → GPT‑6 Луна |
0,20 долл. → 0,10 долл. |
1,20 долл. → 0,50 долл. |
На 50% дешевле |
Цены указаны за 1 миллион токенов.
GPT-6 Astra по-прежнему остается нашей лучшей моделью во всех отношениях. Выбирайте ее, если хотите получить наилучшие результаты и бескомпромиссный опыт использования.
Улучшение характеристик всей линейки моделей.
GPT-6 Sol и Luna обеспечивают повышение интеллектуальных возможностей и экономической эффективности уже известных вам моделей, используемых в наиболее полезных для выполнения сложных задач.
Профессиональная работа
GPT-6 Sol способен справляться со сложными рабочими задачами, предоставляя при этом больше возможностей для итераций благодаря более высоким лимитам использования и более низкой стоимости, предлагая более интеллектуальные функции и лучшие результаты по сравнению с аналогичными по цене моделями конкурентов.
В тесте AutomationBench, оценивающем бизнес-процессы в различных приложениях, GPT-6 Sol при высоких усилиях превосходит Claude Opus 5 при максимальных усилиях, потребляя всего 9% от стоимости задачи в Opus 5. При высоких усилиях GPT-6 Luna превосходит своего предшественника на 5,4 процентных пункта, при этом стоимость задачи на 58% ниже.
GPT-6 Sol также превосходит Claude Fable 5.1 при значительно меньших затратах и даже опережает GPT-6 Astra, требующую минимальных усилий.
|
Модель (и усилия) |
Счет |
Стоимость за задачу |
|---|---|---|
|
GPT-6 Sol (xhigh) |
33,2% |
0,27 доллара |
|
GPT-6 Astra (низкий) |
30,3% |
3,9x GPT‑6 Sol |
|
Клод Опус 5 (макс.) |
26,9% |
11.1x GPT‑6 Sol |
|
Claude Fable 5.1 с Opus 5 Fallback (макс.) |
31,4% |
>8,9x GPT‑6 Sol (стоимость резервного варианта не указана) |
В тесте Agents' Last Exam , оценивающем навыки агентов в сложных профессиональных рабочих процессах, GPT-6 Sol с максимальными усилиями набирает 56,4%, что выше наивысшего результата Claude Opus 5 в этом тесте, при этом стоимость выполнения задачи на 60% ниже.
Фактичность
Полезность ответа зависит от точности фактов, и мы продолжаем совершенствоваться в плане достоверности фактов. По результатам нашей внутренней оценки достоверности, основанной на обезличенных реальных разговорах пользователей, в которых они указывали на ошибки, выявленные нашими моделями, GPT-6 Sol допускает примерно вдвое меньше ошибок, чем его предшественник, приближаясь к уровню надежности Astra при значительно меньших затратах. GPT-6 Luna также существенно улучшает свои показатели; при более высоких уровнях сложности он соответствует GPT-5.6 Sol, но обходится примерно в сто раз дешевле.
Программирование
В этом году агенты-программисты начали решать задачи большей сложности, масштаба и продолжительности, чем когда-либо прежде. В OpenAI наше внутреннее использование выросло в геометрической прогрессии. В пересчете на цены API ежедневное использование токенов превысило 600 долларов для среднего исследователя и 7000 долларов для исследователей, входящих в 90-й процентиль ( Ускорение исследований: взгляд изнутри OpenAI ). Поскольку агенты-программисты берутся за более длительные и сложные задачи, стоимость их постоянного использования становится все более важной. GPT-6 Sol и Luna сочетают высокую производительность программирования с более низкими ценами API, предоставляя разработчикам больше возможностей для итераций, а командам — уверенность в том, что они могут амбициознее подходить к задачам, которые они ставят перед Codex.
На платформе FrontierCode , которая оценивает, создают ли агенты программирования изменения, готовые к слиянию с реальными кодовыми базами, GPT-6 Sol значительно превосходит GPT-5.6 Sol и способен сравняться с Claude Fable 5.1 xhigh при гораздо меньших затратах.
В DeepSWE v1.1, тестирующем производительность при решении сложных задач разработки программного обеспечения в реальных кодовых базах, GPT-6 Sol с максимальными усилиями показывает результат 68,8%, что всего на 1,1 процентных пункта меньше, чем наивысший результат Claude Fable 5 в этом тесте — 69,9% при очень высоких усилиях — при примерно на 80% меньшей стоимости выполнения задачи.
В игре GPT-6 Luna при максимальных усилиях результат составляет 66,6%, что сопоставимо с результатами Claude Opus 5 и Fable 5 при средних усилиях. В этих сравнениях Luna обходится на 93% дешевле за выполнение задачи, чем Opus 5, и на 96% дешевле, чем Fable 5.
Использование компьютера
Хотя GPT-6 Astra остается лучшей в мире моделью для работы за компьютером, GPT-6 Sol и Luna предлагают более экономичную производительность, чем их предшественники. В OSWorld 2.0 в автономном режиме GPT-6 Sol с высокой интенсивностью работы показывает результат, аналогичный Claude Opus 5 со средней интенсивностью работы — 60,5% против 60,3% — при примерно на 80% меньшей стоимости выполнения задачи. GPT-6 Luna (максимальная интенсивность работы) превосходит GPT-5.6 Sol (средняя интенсивность работы) при одной десятой стоимости.
Стиль сотрудничества
Мы также перенесли улучшенный стиль общения GPT-6 Astra в Sol и Luna, что, как мы думаем, будет особенно заметно в технических и программистских обсуждениях. Ожидайте большей ясности, меньшего количества профессионального жаргона, меньшего количества странных оборотов речи, меньшего количества малозначимых деталей и немного более коротких ответов в целом без потери содержательности.
Безусловно. Я могу добиться эффекта «бенто» и переключателя страниц в правом верхнем углу без использования React — взаимодействие достаточно незначительное, чтобы сайт оставался быстрым и плавным. Сейчас я перестраиваю все четыре страницы под эту систему.
Готово — откройте работающий сайт.
Теперь на всех четырех страницах используется красочный дизайн в стиле бенто-бокса, а в правом верхнем углу расположен анимированный слайдер «Главная / Играть / Место / Вкусить». React не понадобился; нативные переходы между страницами обеспечивают легкость и плавность работы.
Встроенный инструмент для работы с изображениями создал иллюстрацию на тему еды. Задание: «Энергичная редакционная иллюстрация, выполненная гуашью и чернилами, воспевающая пельмени и острую лапшу, с яркими цветами, паром, специями и без текста или логотипов».
GPT-6 Sol
Я переделаю страницы в сетку Bento и превращу ссылки в правом верхнем углу в скользящий переключатель страниц. Я сохраню существующий сайт и проверю, требуется ли React для этого взаимодействия, прежде чем менять его конфигурацию.
Обновленный сайт запущен. Теперь каждая страница имеет забавный дизайн в стиле Bento, а переключатель страниц в правом верхнем углу плавно переключает разделы. Я проверил его на настольных компьютерах и узких экранах мобильных устройств, включая навигацию «Назад» в браузере. Существующему сайту для этого не требовался React.
Улучшение кэширования для агентов и длительных диалогов.
Наряду со снижением цен на токены, мы помогаем разработчикам, создающим приложения на основе GPT-6, экономить на контексте, который они используют повторно. Мы улучшили кэширование подсказок для GPT-6, чтобы обеспечить более высокие показатели попадания в кэш по умолчанию, что помогает агентам повторно использовать больше контекста, быстрее реагировать и получать скидки в размере 90% на чтение кэшированных входных токенов.
У разработчиков также появилось больше способов измерения и оптимизации производительности кэширования:
- Мониторинг и диагностика. Панель мониторинга кэширования запросов (открывается в новом окне) показывает, какой объем входных данных кэшируется и как это меняется со временем. Инструмент диагностики (открывается в новом окне) помогает выявить упущенные возможности для кэширования и определить, что нужно исправить.
- Настройте параметры логического мышления и доступность инструментов, не нарушая работу кэша. Увеличьте… усилие, затрачиваемое на рассуждение (открывается в новом окне), для более сложных задач или его снижение для более простых последующих действий, и Включайте или отключайте инструменты (открывается в новом окне) в зависимости от потребностей вашего агента. Оба элемента управления теперь сохраняют предыдущий контекст для повторного использования кэша.
- Оптимизируйте, какие префиксы будут кэшироваться. Явные точки останова позволяют разработчикам выбирать, где заканчиваются кэшированные префиксы подсказок. Это дает разработчикам больше контроля над повторным использованием кэша и может повысить производительность.
По данным GitHub, за последние несколько месяцев эти улучшения позволили сократить долю токенов-подсказок, требующих повторной обработки, более чем на 50% в миллиардах запросов к моделям OpenAI, что помогло Copilot реагировать быстрее.
Продолжаем улучшать выравнивание
Модели GPT-6 Sol и Luna развивают идеи, заложенные в модели Astra, нашей наиболее точно выверенной модели на сегодняшний день. В наших оценках точности выверения как Sol, так и Luna демонстрируют улучшения по сравнению со своими аналогами GPT-5.6, включая более низкий уровень вводящих в заблуждение утверждений об их работе по кодированию.
Приведенные ниже оценки намеренно проверяют сложные ситуации и не измеряют частоту отказов при типичном использовании. Полные результаты см. в карточке системы (откроется в новом окне) .
Доступность
Модели GPT-6 Sol и GPT-6 Luna доступны в ChatGPT Work и Codex с сегодняшнего дня для всех пользователей Plus, Pro, Business, Enterprise и Edu. Пользователи Free и Go могут получить доступ к GPT-6 Luna в настольном приложении. Эти модели пока недоступны в Chat. В API OpenAI они доступны как gpt-6-sol и gpt-6-luna .
Для обеспечения стабильной работы сервиса для всех пользователей мы планируем постепенно внедрять эти модели в ChatGPT в течение дня. Если вы не видите новые модели в ChatGPT Work или Codex, пожалуйста, попробуйте позже.
Оценка GPT проводилась в нашей исследовательской среде или через наш API, что может привести к несколько иным результатам по сравнению с ChatGPT в производственной среде из-за различий в системных подсказках, доступных инструментах и т. д. Оценка моделей конкурентов была взята из общедоступных отчетов. В случаях, когда оценки для Claude Fable 5.1 были недоступны, указывались баллы для Claude Fable 5.1.
Источник: openai.com
Похожие записи
Оцените материал:
Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
