Руководство для разработчиков по GPT-5.6 | OpenAI
Технические уроки от стартапов, применяемые в производстве.
- GPT-5.6 устанавливает новый стандарт соотношения цены и производительности.
- Улучшенное взаимодействие с устройством «сразу после установки»
- Выбор модели
- Развитие API ответов для создания более эффективных агентов.
- Программный вызов инструментов
- Многоагентный
- Кэширование подсказок
- Заключение
- GPT-5.6 устанавливает новый стандарт соотношения цены и производительности.
- Улучшенное взаимодействие с устройством «сразу после установки»
- Выбор модели
- Развитие API ответов для создания более эффективных агентов.
- Программный вызов инструментов
- Многоагентный
- Кэширование подсказок
- Заключение
GPT-5.6 устанавливает новый стандарт соотношения цены и качества.
Семейство моделей GPT-5.6 делает достижение производительности агентов на переднем крае технологий значительно более доступным по цене, одновременно расширяя границы возможного.
В этом руководстве мы покажем, как стартапы используют более интеллектуальный выбор моделей и новые элементы управления API, которые помогают обеспечить непрерывность рассуждений, оркестровку нескольких агентов и программный вызов инструментов для создания более быстрых и функциональных агентов с минимальными затратами.
Улучшенное взаимодействие с устройством «сразу после установки»
Начиная с GPT-5, каждое поколение моделей стремилось решать задачи с более длительным горизонтом планирования с меньшим количеством токенов. GPT-5.6 продолжает эту тенденцию: более высокая производительность агентов, снижение затрат при минимальных изменениях в базовой архитектуре.
Улучшение показателей экономической эффективности в целом подкрепляется повышением точности при меньших затратах на логическое мышление. Например, на последнем экзамене Agents' Last Exam GPT-5.6 Sol с «низким» уровнем логического мышления превзошёл GPT-5.5 с «высоким» уровнем логического мышления при неизменном уровне сложности. Мы наблюдали аналогичные истории успеха в ходе производственного тестирования, где стартапы сообщают о значительном снижении затрат в различных рабочих процессах за счёт уменьшения затрат на логическое мышление по сравнению с предыдущими настройками по умолчанию.
« Мы внедрили GPT-5.6 в нашу систему, и низкие затраты времени на рассуждения дали нам наилучшие результаты. Система понимала, когда данных недостаточно, не гонялась за ложными следами и находила правильный ответ с меньшим количеством токенов».
Выбор модели
Исторически сложилось так, что переход на флагманскую модель с максимальным уровнем производительности был лучшим вариантом для сценариев использования в долгосрочной перспективе. Это во многом объяснялось тем, что эти модели были значительно более производительными, чем модели с оптимизированной стоимостью, в обработке более длительных контекстов и вызовов инструментов. Ситуация изменилась с появлением семейства 5.6: благодаря большему объему вычислительных ресурсов во время тестирования Luna и Terra часто демонстрируют производительность, аналогичную GPT-5.4 и 5.5, при этом будучи значительно дешевле.
1 из 3
« Luna сохраняет 98% точности извлечения данных GPT-5.5 при одной восемнадцатой стоимости. Это обеспечивает нашим агентам высококачественное понимание документов по цене, которая делает его практичным для гораздо большего числа рабочих процессов».
« Мы запустили Luna для решения 106 самых сложных задач в браузере, и она выполнила 78% из них примерно за 14 долларов. Текущая лучшая модель достигла 80% за примерно 235 долларов. Такое сочетание возможностей и стоимости является замечательным для браузерных агентов».
« Luna теперь является нашей моделью по умолчанию для ряда задач высокопроизводительного поиска кода и моделирования принятия решений. Для ключевой задачи исследования кода в нашей многоагентной инженерной системе она снизила затраты на вывод на 64%, сократила время отклика на 90% и улучшила показатель F1 на пять пунктов».
Рассмотрим задачи из BrowseComp: это бенчмарк, основанный на поиске, который проверяет способность модели искать малоизвестные факты. Три месяца назад GPT-5.5 (Extra High) показал результат 84,36% в этом бенчмарке при общей стоимости 33,27 доллара. На момент запуска GPT-5.6 Luna (Extra High) демонстрирует практически ту же производительность, набрав 84,04% при стоимости 1,33 доллара. С тех пор мы еще больше снизили цены. Подробнее о наших последних снижениях цен читайте здесь.
Меньшие по размеру модели семейства 5.6 отлично подходят для обработки больших объемов данных, взаимодействий, чувствительных к задержкам, и повторяющихся шагов в рамках агентных рабочих процессов. Например, если вы управляете стартапом в сфере юридических технологий, который анализирует рукописные служебные записки перед агентным анализом, вместо использования модели для всего сценария использования вы теперь можете использовать Terra или Luna для извлечения данных и получить значительную экономию средств.
Развитие API ответов для создания более эффективных агентов.
Помимо повышения производительности GPT-5.6 «из коробки», мы также добавили новые примитивы в API ответов для дальнейшего повышения эффективности. Мы обучили GPT-5.6 от начала до конца с помощью трех взаимодополняющих архитектурных решений, которые позволяют агентам работать более эффективно:
- Повторное использование уже проделанной работы: благодаря возможности сохранения рассуждений (открывается в новом окне) между этапами работы модели и использованию встроенной функции сжатия (открывается в новом окне) для сжатия длительных диалогов, модель может поддерживать согласованность своей работы на протяжении более длительных горизонтов задач, не путаясь и не нуждаясь в восстановлении предыдущего контекста.
- Параллельное разложение там, где это уместно: использование встроенной многоагентной оркестровки (открывается в новом окне) позволяет координировать работу нескольких агентов в параллельных рабочих потоках для более быстрого выполнения сложных задач.
- Перенесите детерминированную работу в код: используйте программный вызов инструментов (открывается в новом окне) для фильтрации, агрегирования и координации выходных данных инструментов вне контекстного окна модели, резервируя токены модели для принятия решений и снижая затраты, задержку и устаревание контекста.
При совместном использовании разница может быть существенной. Например, на ARC-AGI-3 GPT-5.6 Sol показал результат 13,3% со стандартной версией. Однако после включения сохранения логики и сжатия данных результат подскочил до 38,3% — при этом использовалось примерно в 6 раз меньше выходных токенов. Модель осталась без изменений, но производительность увеличилась почти в три раза. Подробнее об исследовании ARC-AGI-3 можно прочитать здесь.
Программный вызов инструментов
В рабочих процессах агентов часто задействованы два вида работы:
- Задачи, требующие принятия решений
- Работа, в основном требующая перемещения, фильтрации и объединения данных.
Когда агент получает 100 документов, фильтрует их по дате и определяет релевантные транзакции, модели не нужно анализировать каждый промежуточный результат в своем контекстном окне. Функция программного вызова инструментов позволяет GPT-5.6 писать код на JavaScript для координации работы инструментов, выполнения независимых вызовов параллельно и обработки их результатов вне контекстного окна. Модель может сосредоточиться на том, что требует интеллекта: применении суждений.
« В сфере финансовых исследований самая сложная часть — это надежный поиск документов, координация инструментов и анализ данных. В ходе наших оценок GPT-5.6 с использованием функции вызова программного инструмента соответствовал качеству, указанному в нашей критериях, при этом используя на 21% меньше входных токенов. В этом разница между агентом, который может обсуждать финансовые исследования, и тем, кто может их реально проводить».
Многоагентный
В сложных, параллельно выполняемых задачах распределение действий и рассуждений между несколькими рабочими потоками агентов позволяет быстрее завершать задачи, а также повышает интеллектуальные возможности. В таких конфигурациях основной агент отвечает за координацию работы субагентов и делегирование им задач. Субагенты параллельно преследуют свои цели и, наконец, передают результаты основному агенту для окончательного анализа. Команды могут начать использовать многоагентную архитектуру изначально, включив многоагентную архитектуру (открывается в новом окне) в API ответов. Так же работает и настройка сверхвысоких возможностей в ChatGPT.
« Qualia использует команды агентов для решения открытых исследовательских задач, и GPT-5.6 Sol идеально подошёл. Он продемонстрировал заметное улучшение по сравнению с GPT-5.5, завершил работу быстрее, чем почти все другие протестированные нами модели, и быстро стал нашей основной моделью OpenAI».
« GPT-5.6 — лучший оркестратор, который мы видели от OpenAI. Мы одновременно задали ему шесть спецификаций (писали, создавали и обсуждали их), и он отслеживал всё без потери качества».
1 из 2
Хотя GPT-5.6 хорошо понимает оптимальное количество субагентов и когда их следует создавать, поведение многоагентной системы вполне управляемо. Указание модели на момент вызова субагентов может повысить вероятность создания агентов только в тех ситуациях, когда дополнительные затраты токенов приведут к улучшению производительности.
Кэширование подсказок
Для всего семейства моделей время жизни кэша подсказок (TTL) было увеличено до минимума в 30 минут, а точки останова кэша теперь могут устанавливаться детерминированно в рамках контекстного окна модели. Это позволило стартапам значительно повысить коэффициент попаданий в кэш.
« Мы добавили точки останова кэширования и ключи, специфичные для рабочей области, в общий запрос с 29 000 токенов и сократили объем некэшированного ввода на 28%. 30-минутное окно кэширования также стало большим преимуществом: наши агенты могли повторно использовать один и тот же контекст в разных запусках, вместо того чтобы начинать с нуля».
Помимо установки точек останова кэширования, дальнейшее использование соответствующего параметра prompt_cache_key (открывается в новом окне) повышает вероятность того, что запросы будут попадать на тот же механизм вывода, который ранее обслуживал тот же префикс, тем самым уменьшая задержку.
Заключение
В этих примерах особенно бросается в глаза, насколько сильно изменилась экономика деятельности строительных агентств.
В сценариях использования, которые ранее требовали построения модели граничных условий на каждом этапе, теперь можно достичь сопоставимых или лучших результатов при значительно меньших затратах за счет использования моделей меньшего размера, оптимизации вычислительных процессов и принятия эффективных архитектурных решений.
Нам не терпится увидеть, что вы все создадите!
Источник: openai.com
Похожие записи
Оцените материал:
Похожие записи
«Узкое место» в пространственной биологии: почему модели ИИ терпят неудачу при работе со сложными тканями и что на самом деле помогает это исправить.
24.07.2026
Ученые: осознанные сновидения — это еще одно состояние сознания, отправляющее вас в потрясающее путешествие
03.01.2026
Разработка цикла иерархического поиска: чтение длинного документа по его содержанию.
15.07.2026Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
