Архив рубрики ~Лента новостей~

Руководство для разработчиков по GPT-5.6 | OpenAI

Руководство для разработчиков по GPT-5.6 | OpenAI

Технические уроки от стартапов, применяемые в производстве.

  • GPT-5.6 устанавливает новый стандарт соотношения цены и производительности.
  • Улучшенное взаимодействие с устройством «сразу после установки»
  • Выбор модели
  • Развитие API ответов для создания более эффективных агентов.
  • Программный вызов инструментов
  • Многоагентный
  • Кэширование подсказок
  • Заключение
  • GPT-5.6 устанавливает новый стандарт соотношения цены и производительности.
  • Улучшенное взаимодействие с устройством «сразу после установки»
  • Выбор модели
  • Развитие API ответов для создания более эффективных агентов.
  • Программный вызов инструментов
  • Многоагентный
  • Кэширование подсказок
  • Заключение

GPT-5.6 устанавливает новый стандарт соотношения цены и качества.

Семейство моделей GPT-5.6 делает достижение производительности агентов на переднем крае технологий значительно более доступным по цене, одновременно расширяя границы возможного.

В этом руководстве мы покажем, как стартапы используют более интеллектуальный выбор моделей и новые элементы управления API, которые помогают обеспечить непрерывность рассуждений, оркестровку нескольких агентов и программный вызов инструментов для создания более быстрых и функциональных агентов с минимальными затратами.

Улучшенное взаимодействие с устройством «сразу после установки»

Начиная с GPT-5, каждое поколение моделей стремилось решать задачи с более длительным горизонтом планирования с меньшим количеством токенов. GPT-5.6 продолжает эту тенденцию: более высокая производительность агентов, снижение затрат при минимальных изменениях в базовой архитектуре.

Улучшение показателей экономической эффективности в целом подкрепляется повышением точности при меньших затратах на логическое мышление. Например, на последнем экзамене Agents' Last Exam GPT-5.6 Sol с «низким» уровнем логического мышления превзошёл GPT-5.5 с «высоким» уровнем логического мышления при неизменном уровне сложности. Мы наблюдали аналогичные истории успеха в ходе производственного тестирования, где стартапы сообщают о значительном снижении затрат в различных рабочих процессах за счёт уменьшения затрат на логическое мышление по сравнению с предыдущими настройками по умолчанию.

« Мы внедрили GPT-5.6 в нашу систему, и низкие затраты времени на рассуждения дали нам наилучшие результаты. Система понимала, когда данных недостаточно, не гонялась за ложными следами и находила правильный ответ с меньшим количеством токенов».

— Иззи Миллер, руководитель отдела исследований в области ИИ, Hex (открывается в новом окне)

Выбор модели

Исторически сложилось так, что переход на флагманскую модель с максимальным уровнем производительности был лучшим вариантом для сценариев использования в долгосрочной перспективе. Это во многом объяснялось тем, что эти модели были значительно более производительными, чем модели с оптимизированной стоимостью, в обработке более длительных контекстов и вызовов инструментов. Ситуация изменилась с появлением семейства 5.6: благодаря большему объему вычислительных ресурсов во время тестирования Luna и Terra часто демонстрируют производительность, аналогичную GPT-5.4 и 5.5, при этом будучи значительно дешевле.

1 из 3

« Luna сохраняет 98% точности извлечения данных GPT-5.5 при одной восемнадцатой стоимости. Это обеспечивает нашим агентам высококачественное понимание документов по цене, которая делает его практичным для гораздо большего числа рабочих процессов».

— Сергей Щохолиев, руководитель разработки агентов, Hypha (открывается в новом окне)

Рассмотрим задачи из BrowseComp: это бенчмарк, основанный на поиске, который проверяет способность модели искать малоизвестные факты. Три месяца назад GPT-5.5 (Extra High) показал результат 84,36% в этом бенчмарке при общей стоимости 33,27 доллара. На момент запуска GPT-5.6 Luna (Extra High) демонстрирует практически ту же производительность, набрав 84,04% при стоимости 1,33 доллара. С тех пор мы еще больше снизили цены. Подробнее о наших последних снижениях цен читайте здесь.

Меньшие по размеру модели семейства 5.6 отлично подходят для обработки больших объемов данных, взаимодействий, чувствительных к задержкам, и повторяющихся шагов в рамках агентных рабочих процессов. Например, если вы управляете стартапом в сфере юридических технологий, который анализирует рукописные служебные записки перед агентным анализом, вместо использования модели для всего сценария использования вы теперь можете использовать Terra или Luna для извлечения данных и получить значительную экономию средств.

Развитие API ответов для создания более эффективных агентов.

Помимо повышения производительности GPT-5.6 «из коробки», мы также добавили новые примитивы в API ответов для дальнейшего повышения эффективности. Мы обучили GPT-5.6 от начала до конца с помощью трех взаимодополняющих архитектурных решений, которые позволяют агентам работать более эффективно:

  1. Повторное использование уже проделанной работы: благодаря возможности сохранения рассуждений (открывается в новом окне) между этапами работы модели и использованию встроенной функции сжатия (открывается в новом окне) для сжатия длительных диалогов, модель может поддерживать согласованность своей работы на протяжении более длительных горизонтов задач, не путаясь и не нуждаясь в восстановлении предыдущего контекста.
  2. Параллельное разложение там, где это уместно: использование встроенной многоагентной оркестровки (открывается в новом окне) позволяет координировать работу нескольких агентов в параллельных рабочих потоках для более быстрого выполнения сложных задач.
  3. Перенесите детерминированную работу в код: используйте программный вызов инструментов (открывается в новом окне) для фильтрации, агрегирования и координации выходных данных инструментов вне контекстного окна модели, резервируя токены модели для принятия решений и снижая затраты, задержку и устаревание контекста.

При совместном использовании разница может быть существенной. Например, на ARC-AGI-3 GPT-5.6 Sol показал результат 13,3% со стандартной версией. Однако после включения сохранения логики и сжатия данных результат подскочил до 38,3% — при этом использовалось примерно в 6 раз меньше выходных токенов. Модель осталась без изменений, но производительность увеличилась почти в три раза. Подробнее об исследовании ARC-AGI-3 можно прочитать здесь.

Программный вызов инструментов

В рабочих процессах агентов часто задействованы два вида работы:

  1. Задачи, требующие принятия решений
  2. Работа, в основном требующая перемещения, фильтрации и объединения данных.

Когда агент получает 100 документов, фильтрует их по дате и определяет релевантные транзакции, модели не нужно анализировать каждый промежуточный результат в своем контекстном окне. Функция программного вызова инструментов позволяет GPT-5.6 писать код на JavaScript для координации работы инструментов, выполнения независимых вызовов параллельно и обработки их результатов вне контекстного окна. Модель может сосредоточиться на том, что требует интеллекта: применении суждений.

« В сфере финансовых исследований самая сложная часть — это надежный поиск документов, координация инструментов и анализ данных. В ходе наших оценок GPT-5.6 с использованием функции вызова программного инструмента соответствовал качеству, указанному в нашей критериях, при этом используя на 21% меньше входных токенов. В этом разница между агентом, который может обсуждать финансовые исследования, и тем, кто может их реально проводить».

— Алекс Ванг, Applied AI, Rogo (открывается в новом окне)

Многоагентный

В сложных, параллельно выполняемых задачах распределение действий и рассуждений между несколькими рабочими потоками агентов позволяет быстрее завершать задачи, а также повышает интеллектуальные возможности. В таких конфигурациях основной агент отвечает за координацию работы субагентов и делегирование им задач. Субагенты параллельно преследуют свои цели и, наконец, передают результаты основному агенту для окончательного анализа. Команды могут начать использовать многоагентную архитектуру изначально, включив многоагентную архитектуру (открывается в новом окне) в API ответов. Так же работает и настройка сверхвысоких возможностей в ChatGPT.

« Qualia использует команды агентов для решения открытых исследовательских задач, и GPT-5.6 Sol идеально подошёл. Он продемонстрировал заметное улучшение по сравнению с GPT-5.5, завершил работу быстрее, чем почти все другие протестированные нами модели, и быстро стал нашей основной моделью OpenAI».

— Э Чи, основатель Quadrillion (открывается в новом окне)

« GPT-5.6 — лучший оркестратор, который мы видели от OpenAI. Мы одновременно задали ему шесть спецификаций (писали, создавали и обсуждали их), и он отслеживал всё без потери качества».

— Джон Белл, соучредитель и директор по продуктам компании Obvious (открывается в новом окне)

1 из 2

Хотя GPT-5.6 хорошо понимает оптимальное количество субагентов и когда их следует создавать, поведение многоагентной системы вполне управляемо. Указание модели на момент вызова субагентов может повысить вероятность создания агентов только в тех ситуациях, когда дополнительные затраты токенов приведут к улучшению производительности.

Кэширование подсказок

Для всего семейства моделей время жизни кэша подсказок (TTL) было увеличено до минимума в 30 минут, а точки останова кэша теперь могут устанавливаться детерминированно в рамках контекстного окна модели. Это позволило стартапам значительно повысить коэффициент попаданий в кэш.

« Мы добавили точки останова кэширования и ключи, специфичные для рабочей области, в общий запрос с 29 000 токенов и сократили объем некэшированного ввода на 28%. 30-минутное окно кэширования также стало большим преимуществом: наши агенты могли повторно использовать один и тот же контекст в разных запусках, вместо того чтобы начинать с нуля».

— Лоренцо Джентиле, инженер по искусственному интеллекту, Ploy (открывается в новом окне)

Помимо установки точек останова кэширования, дальнейшее использование соответствующего параметра prompt_cache_key (открывается в новом окне) повышает вероятность того, что запросы будут попадать на тот же механизм вывода, который ранее обслуживал тот же префикс, тем самым уменьшая задержку.

Заключение

В этих примерах особенно бросается в глаза, насколько сильно изменилась экономика деятельности строительных агентств.

В сценариях использования, которые ранее требовали построения модели граничных условий на каждом этапе, теперь можно достичь сопоставимых или лучших результатов при значительно меньших затратах за счет использования моделей меньшего размера, оптимизации вычислительных процессов и принятия эффективных архитектурных решений.

Нам не терпится увидеть, что вы все создадите!

Источник: openai.com

Оцените материал:

Поделиться
Понравилась статья? Расскажите другим
ВКонтакте
Читайте также
Новости робототехники Вопреки всем ожиданиям, SpaceX наконец-то отбуксировала Starship в порт после 24 дней в море. Архив рубрики ~Коротко из Telegram~ «Тантор Лабс» купила российскую СУБД «Персей» вместе с командой разработки… Архив рубрики ~Коротко из Telegram~ Prompt injection вошла в топ угроз корпоративной безопасности Исследователи подвели… Архив рубрики ~Коротко из Telegram~ AirPods с камерами откладываются до 2027 года Планы Apple по… Архив рубрики ~Коротко из Telegram~ Firecrawl Monitor следит за сайтами конкурентов и присылает только то,… Архив рубрики ~Коротко из Telegram~ Higgsfield превратил генерацию видео в работу настоящего режиссёра Higgsfield выкатил… Архив рубрики ~Коротко из Telegram~ ElevenLabs выпустила Eleven v3 Conversational — голос, который умеет смеяться… Архив рубрики ~Коротко из Telegram~ Goldman Sachs посчитал: ИИ убирает около 16 тысяч рабочих мест… Архив рубрики ~Коротко из Telegram~ Мощные языковые модели поехали в смартфоны: семейство Ornith-1.5 запускается на… Архив рубрики ~Коротко из Telegram~ Meta тихо стала одним из крупнейших клиентов Microsoft по искусственному… Архив рубрики ~Коротко из Telegram~ 🌟 Spark-to-Paper автоматизирует весь путь от исследовательской идеи до готовой… Архив рубрики ~Коротко из Telegram~ 🪟 Apple обучила отдельную большую языковую модель именно для китайского… Архив рубрики ~Коротко из Telegram~ ⁉️ Microsoft резко наращивает производство чипов следующего поколения Maia 300… Архив рубрики ~Коротко из Telegram~ 🪟 Свежий эпизод Latent Space — разговор с инженерами Baseten… Новости робототехники Вопреки всем ожиданиям, SpaceX наконец-то отбуксировала Starship в порт после 24 дней в море. Архив рубрики ~Коротко из Telegram~ «Тантор Лабс» купила российскую СУБД «Персей» вместе с командой разработки… Архив рубрики ~Коротко из Telegram~ Prompt injection вошла в топ угроз корпоративной безопасности Исследователи подвели… Архив рубрики ~Коротко из Telegram~ AirPods с камерами откладываются до 2027 года Планы Apple по… Архив рубрики ~Коротко из Telegram~ Firecrawl Monitor следит за сайтами конкурентов и присылает только то,… Архив рубрики ~Коротко из Telegram~ Higgsfield превратил генерацию видео в работу настоящего режиссёра Higgsfield выкатил… Архив рубрики ~Коротко из Telegram~ ElevenLabs выпустила Eleven v3 Conversational — голос, который умеет смеяться… Архив рубрики ~Коротко из Telegram~ Goldman Sachs посчитал: ИИ убирает около 16 тысяч рабочих мест… Архив рубрики ~Коротко из Telegram~ Мощные языковые модели поехали в смартфоны: семейство Ornith-1.5 запускается на… Архив рубрики ~Коротко из Telegram~ Meta тихо стала одним из крупнейших клиентов Microsoft по искусственному… Архив рубрики ~Коротко из Telegram~ 🌟 Spark-to-Paper автоматизирует весь путь от исследовательской идеи до готовой… Архив рубрики ~Коротко из Telegram~ 🪟 Apple обучила отдельную большую языковую модель именно для китайского… Архив рубрики ~Коротко из Telegram~ ⁉️ Microsoft резко наращивает производство чипов следующего поколения Maia 300… Архив рубрики ~Коротко из Telegram~ 🪟 Свежий эпизод Latent Space — разговор с инженерами Baseten…

Оставить комментарий