Архив рубрики ~Лента новостей~

Представляем GPT-6 Sol и Luna | OpenAI

Представляем GPT-6 Sol и Luna | OpenAI
Представляем GPT-6 Sol и Luna | OpenAI

Ещё больше способов интегрировать передовые методы разведки в вашу повседневную работу.

  • Цены на API GPT-6
  • Улучшение характеристик всей линейки моделей.
    • Профессиональная работа
    • Фактичность
    • Программирование
    • Использование компьютера
    • Стиль сотрудничества
  • Улучшение кэширования для агентов и длительных диалогов.
  • Продолжаем улучшать выравнивание
  • Доступность
  • Цены на API GPT-6
  • Улучшение характеристик всей линейки моделей.
    • Профессиональная работа
    • Фактичность
    • Программирование
    • Использование компьютера
    • Стиль сотрудничества
  • Улучшение кэширования для агентов и длительных диалогов.
  • Продолжаем улучшать выравнивание
  • Доступность

В начале этого месяца мы представили GPT-6 Astra — самую интеллектуальную и оптимизированную модель в мире. Хотя самые сложные и важные проекты по-прежнему требуют всех возможностей Astra, работа ведется в разных масштабах, в разном темпе и с разными бюджетами.

Именно поэтому мы расширяем вселенную GPT-6 с помощью GPT-6 Sol и GPT-6 Luna. GPT-6 Astra представила новое поколение интеллекта — эти модели помогают распределять преимущества этого интеллекта, продвигаясь вперед в области экономической эффективности. Мы обучили GPT-6 Sol и Luna с использованием методов, аналогичных GPT-6 Astra, перенеся достижения, лежащие в основе передовых результатов Astra в профессиональной работе, достоверности, программировании, использовании компьютеров и согласовании, на более быстрые и доступные модели.

Модели GPT-6 лидируют по соотношению цены и качества, сочетая исключительные возможности на каждом уровне с инфраструктурой, которая эффективно обеспечивает их масштабируемое использование. Улучшения в кэшировании и выводе позволяют нам предоставлять эти модели по более низкой цене, и мы напрямую передаем эту экономию пользователям и клиентам, снижая цены на API для Sol и Luna на 50% по сравнению с акционными ценами GPT-5.6. В совокупности эти улучшения делают передовой ИИ практичным для решения более распространенных повседневных задач и приложений в масштабе.

Цены на API GPT-6

Модель

Вход

Выход

Снижение цены

GPT‑5.6 Sol → GPT‑6 Sol

4 доллара → 2 доллара

20 долларов → 10 долларов

На 50% дешевле

GPT‑5.6 Луна → GPT‑6 Луна

0,20 долл. → 0,10 долл.

1,20 долл. → 0,50 долл.

На 50% дешевле

Цены указаны за 1 миллион токенов.

GPT-6 Astra по-прежнему остается нашей лучшей моделью во всех отношениях. Выбирайте ее, если хотите получить наилучшие результаты и бескомпромиссный опыт использования.

Улучшение характеристик всей линейки моделей.

GPT-6 Sol и Luna обеспечивают повышение интеллектуальных возможностей и экономической эффективности уже известных вам моделей, используемых в наиболее полезных для выполнения сложных задач.

Профессиональная работа

GPT-6 Sol способен справляться со сложными рабочими задачами, предоставляя при этом больше возможностей для итераций благодаря более высоким лимитам использования и более низкой стоимости, предлагая более интеллектуальные функции и лучшие результаты по сравнению с аналогичными по цене моделями конкурентов.

В тесте AutomationBench, оценивающем бизнес-процессы в различных приложениях, GPT-6 Sol при высоких усилиях превосходит Claude Opus 5 при максимальных усилиях, потребляя всего 9% от стоимости задачи в Opus 5. При высоких усилиях GPT-6 Luna превосходит своего предшественника на 5,4 процентных пункта, при этом стоимость задачи на 58% ниже.

GPT-6 Sol также превосходит Claude Fable 5.1 при значительно меньших затратах и даже опережает GPT-6 Astra, требующую минимальных усилий.

Модель (и усилия)

Счет

Стоимость за задачу

GPT-6 Sol (xhigh)

33,2%

0,27 доллара

GPT-6 Astra (низкий)

30,3%

3,9x GPT‑6 Sol

Клод Опус 5 (макс.)

26,9%

11.1x GPT‑6 Sol

Claude Fable 5.1 с Opus 5 Fallback (макс.)

31,4%

>8,9x GPT‑6 Sol

(стоимость резервного варианта не указана)

В тесте Agents' Last Exam , оценивающем навыки агентов в сложных профессиональных рабочих процессах, GPT-6 Sol с максимальными усилиями набирает 56,4%, что выше наивысшего результата Claude Opus 5 в этом тесте, при этом стоимость выполнения задачи на 60% ниже.

Фактичность

Полезность ответа зависит от точности фактов, и мы продолжаем совершенствоваться в плане достоверности фактов. По результатам нашей внутренней оценки достоверности, основанной на обезличенных реальных разговорах пользователей, в которых они указывали на ошибки, выявленные нашими моделями, GPT-6 Sol допускает примерно вдвое меньше ошибок, чем его предшественник, приближаясь к уровню надежности Astra при значительно меньших затратах. GPT-6 Luna также существенно улучшает свои показатели; при более высоких уровнях сложности он соответствует GPT-5.6 Sol, но обходится примерно в сто раз дешевле.

Программирование

В этом году агенты-программисты начали решать задачи большей сложности, масштаба и продолжительности, чем когда-либо прежде. В OpenAI наше внутреннее использование выросло в геометрической прогрессии. В пересчете на цены API ежедневное использование токенов превысило 600 долларов для среднего исследователя и 7000 долларов для исследователей, входящих в 90-й процентиль ( Ускорение исследований: взгляд изнутри OpenAI ). Поскольку агенты-программисты берутся за более длительные и сложные задачи, стоимость их постоянного использования становится все более важной. GPT-6 Sol и Luna сочетают высокую производительность программирования с более низкими ценами API, предоставляя разработчикам больше возможностей для итераций, а командам — уверенность в том, что они могут амбициознее подходить к задачам, которые они ставят перед Codex.

На платформе FrontierCode , которая оценивает, создают ли агенты программирования изменения, готовые к слиянию с реальными кодовыми базами, GPT-6 Sol значительно превосходит GPT-5.6 Sol и способен сравняться с Claude Fable 5.1 xhigh при гораздо меньших затратах.

В DeepSWE v1.1, тестирующем производительность при решении сложных задач разработки программного обеспечения в реальных кодовых базах, GPT-6 Sol с максимальными усилиями показывает результат 68,8%, что всего на 1,1 процентных пункта меньше, чем наивысший результат Claude Fable 5 в этом тесте — 69,9% при очень высоких усилиях — при примерно на 80% меньшей стоимости выполнения задачи.

В игре GPT-6 Luna при максимальных усилиях результат составляет 66,6%, что сопоставимо с результатами Claude Opus 5 и Fable 5 при средних усилиях. В этих сравнениях Luna обходится на 93% дешевле за выполнение задачи, чем Opus 5, и на 96% дешевле, чем Fable 5.

Использование компьютера

Хотя GPT-6 Astra остается лучшей в мире моделью для работы за компьютером, GPT-6 Sol и Luna предлагают более экономичную производительность, чем их предшественники. В OSWorld 2.0 в автономном режиме GPT-6 Sol с высокой интенсивностью работы показывает результат, аналогичный Claude Opus 5 со средней интенсивностью работы — 60,5% против 60,3% — при примерно на 80% меньшей стоимости выполнения задачи. GPT-6 Luna (максимальная интенсивность работы) превосходит GPT-5.6 Sol (средняя интенсивность работы) при одной десятой стоимости.

Стиль сотрудничества

Мы также перенесли улучшенный стиль общения GPT-6 Astra в Sol и Luna, что, как мы думаем, будет особенно заметно в технических и программистских обсуждениях. Ожидайте большей ясности, меньшего количества профессионального жаргона, меньшего количества странных оборотов речи, меньшего количества малозначимых деталей и немного более коротких ответов в целом без потери содержательности.

Сайт выглядит аккуратно! Можем ли мы использовать дизайн в стиле Bento Box и добавить слайдер между страницами в правом верхнем углу? Возможно, вам потребуется изучить React… Решение GPT-5.6

Безусловно. Я могу добиться эффекта «бенто» и переключателя страниц в правом верхнем углу без использования React — взаимодействие достаточно незначительное, чтобы сайт оставался быстрым и плавным. Сейчас я перестраиваю все четыре страницы под эту систему.

Готово — откройте работающий сайт.

Теперь на всех четырех страницах используется красочный дизайн в стиле бенто-бокса, а в правом верхнем углу расположен анимированный слайдер «Главная / Играть / Место / Вкусить». React не понадобился; нативные переходы между страницами обеспечивают легкость и плавность работы.

Встроенный инструмент для работы с изображениями создал иллюстрацию на тему еды. Задание: «Энергичная редакционная иллюстрация, выполненная гуашью и чернилами, воспевающая пельмени и острую лапшу, с яркими цветами, паром, специями и без текста или логотипов».

GPT-6 Sol

Я переделаю страницы в сетку Bento и превращу ссылки в правом верхнем углу в скользящий переключатель страниц. Я сохраню существующий сайт и проверю, требуется ли React для этого взаимодействия, прежде чем менять его конфигурацию.

Обновленный сайт запущен. Теперь каждая страница имеет забавный дизайн в стиле Bento, а переключатель страниц в правом верхнем углу плавно переключает разделы. Я проверил его на настольных компьютерах и узких экранах мобильных устройств, включая навигацию «Назад» в браузере. Существующему сайту для этого не требовался React.

Улучшение кэширования для агентов и длительных диалогов.

Наряду со снижением цен на токены, мы помогаем разработчикам, создающим приложения на основе GPT-6, экономить на контексте, который они используют повторно. Мы улучшили кэширование подсказок для GPT-6, чтобы обеспечить более высокие показатели попадания в кэш по умолчанию, что помогает агентам повторно использовать больше контекста, быстрее реагировать и получать скидки в размере 90% на чтение кэшированных входных токенов.

У разработчиков также появилось больше способов измерения и оптимизации производительности кэширования:

  • Мониторинг и диагностика. Панель мониторинга кэширования запросов (открывается в новом окне) показывает, какой объем входных данных кэшируется и как это меняется со временем. Инструмент диагностики (открывается в новом окне) помогает выявить упущенные возможности для кэширования и определить, что нужно исправить.
  • Настройте параметры логического мышления и доступность инструментов, не нарушая работу кэша. Увеличьте… усилие, затрачиваемое на рассуждение (открывается в новом окне), для более сложных задач или его снижение для более простых последующих действий, и Включайте или отключайте инструменты (открывается в новом окне) в зависимости от потребностей вашего агента. Оба элемента управления теперь сохраняют предыдущий контекст для повторного использования кэша.
  • Оптимизируйте, какие префиксы будут кэшироваться. Явные точки останова позволяют разработчикам выбирать, где заканчиваются кэшированные префиксы подсказок. Это дает разработчикам больше контроля над повторным использованием кэша и может повысить производительность.

По данным GitHub, за последние несколько месяцев эти улучшения позволили сократить долю токенов-подсказок, требующих повторной обработки, более чем на 50% в миллиардах запросов к моделям OpenAI, что помогло Copilot реагировать быстрее.

Продолжаем улучшать выравнивание

Модели GPT-6 Sol и Luna развивают идеи, заложенные в модели Astra, нашей наиболее точно выверенной модели на сегодняшний день. В наших оценках точности выверения как Sol, так и Luna демонстрируют улучшения по сравнению со своими аналогами GPT-5.6, включая более низкий уровень вводящих в заблуждение утверждений об их работе по кодированию.

Приведенные ниже оценки намеренно проверяют сложные ситуации и не измеряют частоту отказов при типичном использовании. Полные результаты см. в карточке системы (откроется в новом окне) .

Доступность

Модели GPT-6 Sol и GPT-6 Luna доступны в ChatGPT Work и Codex с сегодняшнего дня для всех пользователей Plus, Pro, Business, Enterprise и Edu. Пользователи Free и Go могут получить доступ к GPT-6 Luna в настольном приложении. Эти модели пока недоступны в Chat. В API OpenAI они доступны как gpt-6-sol и gpt-6-luna .

Для обеспечения стабильной работы сервиса для всех пользователей мы планируем постепенно внедрять эти модели в ChatGPT в течение дня. Если вы не видите новые модели в ChatGPT Work или Codex, пожалуйста, попробуйте позже.

Оценка GPT проводилась в нашей исследовательской среде или через наш API, что может привести к несколько иным результатам по сравнению с ChatGPT в производственной среде из-за различий в системных подсказках, доступных инструментах и т. д. Оценка моделей конкурентов была взята из общедоступных отчетов. В случаях, когда оценки для Claude Fable 5.1 были недоступны, указывались баллы для Claude Fable 5.1.

Источник: openai.com

Оцените материал:

Поделиться
Понравилась статья? Расскажите другим
ВКонтакте
Читайте также
Архив рубрики ~Коротко из Telegram~ 74% россиянок готовы содержать мужчину — Согласны отказаться от цветов,… Архив рубрики ~Коротко из Telegram~ Еще про вышедший GPT-6 — И на этот раз OpenAI… Архив рубрики ~Коротко из Telegram~ Bing тоже показывает цитирование в ИИ. А это ChatGPT от… Архив рубрики ~Полезное~ СКАЧИВАНИЕ ВИДЕО И АУДИО С РАЗНЫХ ПЛАТФОРМ noTube — простой… Архив рубрики ~Полезное~ StoryGraph — нейронка для трекинга книг. StoryGraph — бесплатный инструмент… Архив рубрики ~Коротко из Telegram~ SellerPic AI — ИИ-платформа для создания качественных изображений и видео… Архив рубрики ~Коротко из Telegram~ HeyGen — позволяет делать анимацию своего фото или настроить клонирование… Архив рубрики ~Коротко из Telegram~ SummateIt — может резюмировать и коротко донести суть любого текста… Архив рубрики ~Коротко из Telegram~ Люди придумали странный способ меньше сидеть в телефоне — носят… Архив рубрики ~Коротко из Telegram~ ElevenLabs собрала весь видеопродакшн в одном редакторе В ElevenCreative вышел… Архив рубрики ~Полезное~ Для GPT-6 Sol и Opus 5.5 уже выкатили официальные гайды… Архив рубрики ~Коротко из Telegram~ AI-рынок за одни сутки уронил цены и выкатил сразу три… Архив рубрики ~Полезное~ «Без вежливости и предисловий» — промпт, который экономит время Просишь… Архив рубрики ~Коротко из Telegram~ Еще от Google Они выложили гайд, как сделать дизайн вайбкод-приложения… Архив рубрики ~Коротко из Telegram~ 74% россиянок готовы содержать мужчину — Согласны отказаться от цветов,… Архив рубрики ~Коротко из Telegram~ Еще про вышедший GPT-6 — И на этот раз OpenAI… Архив рубрики ~Коротко из Telegram~ Bing тоже показывает цитирование в ИИ. А это ChatGPT от… Архив рубрики ~Полезное~ СКАЧИВАНИЕ ВИДЕО И АУДИО С РАЗНЫХ ПЛАТФОРМ noTube — простой… Архив рубрики ~Полезное~ StoryGraph — нейронка для трекинга книг. StoryGraph — бесплатный инструмент… Архив рубрики ~Коротко из Telegram~ SellerPic AI — ИИ-платформа для создания качественных изображений и видео… Архив рубрики ~Коротко из Telegram~ HeyGen — позволяет делать анимацию своего фото или настроить клонирование… Архив рубрики ~Коротко из Telegram~ SummateIt — может резюмировать и коротко донести суть любого текста… Архив рубрики ~Коротко из Telegram~ Люди придумали странный способ меньше сидеть в телефоне — носят… Архив рубрики ~Коротко из Telegram~ ElevenLabs собрала весь видеопродакшн в одном редакторе В ElevenCreative вышел… Архив рубрики ~Полезное~ Для GPT-6 Sol и Opus 5.5 уже выкатили официальные гайды… Архив рубрики ~Коротко из Telegram~ AI-рынок за одни сутки уронил цены и выкатил сразу три… Архив рубрики ~Полезное~ «Без вежливости и предисловий» — промпт, который экономит время Просишь… Архив рубрики ~Коротко из Telegram~ Еще от Google Они выложили гайд, как сделать дизайн вайбкод-приложения…

Оставить комментарий