Создавайте более естественные голосовые интерфейсы с помощью GPT-Live-1 в API | OpenAI
GPT-Live-1 переносит естественные полнодуплексные диалоги ChatGPT в API, предоставляя больший контроль над тем, как голосовые агенты говорят и действуют.
- Упростите архитектуру вашего голосового агента и уменьшите задержку передачи голоса.
- Измерение преимущества полнодуплексной связи
- Что говорят клиенты
- Новые варианты голосового сопровождения
- Цены и наличие
- Упростите архитектуру вашего голосового агента и уменьшите задержку передачи голоса.
- Измерение преимущества полнодуплексной связи
- Что говорят клиенты
- Новые варианты голосового сопровождения
- Цены и наличие
Мы запускаем GPT-Live-1 в API, предоставляя разработчикам мощную, естественную голосовую модель для создания приложений с поддержкой голосового управления и бизнес-процессов. Впервые представленный в ChatGPT , GPT-Live-1 способен одновременно слушать и говорить, и, как показано в Codex и ChatGPT Work (открывается в новом окне) , может делегировать более глубокие рассуждения и действия моделям и инструментам, с которыми он сопряжен.
В рамках выпуска API GPT-Live-1 мы сосредоточились на новых возможностях, позволяющих разработчикам настраивать голосовое взаимодействие в соответствии с потребностями пользователей, рабочими процессами и целями. Одно из ключевых преимуществ GPT-Live-1 — плавная обработка прерываний — уже приносит ощутимые результаты для бизнеса: в ходе первых оценок компания Speak обнаружила, что GPT-Live-1 дает учащимся больше времени на обдумывание ответа преподавателя, сокращая количество прерываний почти на 80% по сравнению с предыдущими системами пошагового обучения.
Основные преимущества GPT-Live-1 в API:
- Обработка прерываний: Улучшает обработку прерываний за счет единой модели, которая совместно обрабатывает входящий и исходящий аудиосигнал, избегая задержек и нестабильных переходов, характерных для цепочек архитектур STT–LLM–TTS.
- Делегирование задач по логическому мышлению и вызову инструментов: GPT-Live-1 может делегировать обработку логических рассуждений и вызовы инструментов серверной текстовой модели, такой как GPT-6 Astra, или модели стороннего разработчика.
- Тон, темп и стиль: позволяет разработчикам формировать тон, темп и стиль разговора агента с помощью системных подсказок.
- Управление контекстом и фоновым шумом: улучшена обработка фонового шума и тишины без прерывания разговора или озвучивания каждого шага.
- Надежность при длительном взаимодействии: улучшает запоминание контекста и качество разговора в течение продолжительных сеансов.
- Поддержка телефонии: Обеспечивает развертывание полнодуплексных голосовых агентов для телефонных звонков, от бронирования столиков в ресторанах до поддержки клиентов.
Попробуйте GPT-Live-1 Начните сессию и говорите естественно. Перебивайте, смейтесь, меняйте свое мнение — попробуйте дома или в шумном месте, например, в кафе или на городской улице. Посмотрите, на что это способно.
- Обсудите это — естественно. Попросите о помощи, а затем прервите ответ на полуслове, чтобы изменить вопрос или добавить подробности.
- Возьмите это с собой. Попробуйте поговорить во время прогулки на свежем воздухе или в условиях обычного фонового шума, и посмотрите, как это отразится на вас.
- Сделайте разговор игривым. Смейтесь, немного помедлите, используйте короткие приветствия или коротко поговорите с кем-нибудь рядом, а затем продолжите беседу.
Данная демоверсия доступна ограниченное время. Используя её, вы соглашаетесь с Условиями использования OpenAI и подтверждаете своё согласие с нашей Политикой конфиденциальности.
Упростите архитектуру вашего голосового агента и уменьшите задержку передачи голоса.
Традиционные голосовые агенты объединяют преобразование речи в текст, модель рассуждений и преобразование текста в речь. Каждый этап добавляет задержку и создает больше возможностей для потери синхронизации, контекста или естественного ритма разговора. Зачастую именно разработчикам приходится координировать эти этапы, включая то, что происходит, когда кто-то прерывает, делает паузу или меняет направление.
GPT-Live-1 обрабатывает прослушивание и речь в единой модели, упрощая голосовой слой. Он может реагировать на прерывания и подтверждения по мере их возникновения, делегируя более глубокий анализ бэкэнду. Это позволяет продолжать разговор, пока работа ведется в фоновом режиме.
« По сравнению с нашей каскадной сборкой, GPT-Live-1 упростил нашу кодовую базу на 80% и удалил 23 000 строк кода. Это позволило вести естественный диалог с пациентами в режиме реального времени и освободило нашу команду от рутинной работы по улучшению всего процесса — от записи на прием до получения медицинской помощи».
Разработчики выбирают модели, инструменты и инфраструктуру агентов для ведения диалога. Например, они могут использовать GPT-Live-1 в паре с моделью, подобной Luna, для задач с большим объемом данных, таких как планирование или обновление заказов, и модель, подобную Astra, для сложных вопросов клиентов, требующих логического вывода. Такая гибкость позволяет разработчикам подбирать глубину логического вывода, скорость и стоимость в зависимости от задачи.
GPT-Live-1 изначально предоставляет расшифровки ASR и текст ответов. Он также обеспечивает хорошее понимание буквенно-цифровых символов и поддерживает предвзятое использование ключевых слов. Хотя GPT-Live-1 не является моделью, основанной на пошаговом режиме, он изначально поддерживает определение ходов, поэтому разработчики могут продолжать создавать приложения, ориентируясь на явные границы ходов.
Измерение преимущества полнодуплексной связи
По результатам наших оценок, GPT-Live-1 улучшает производительность в Full Duplex Bench на 30 процентных пунктов по сравнению с GPT-Realtime-2.1, демонстрируя значительное сокращение задержки при пошаговом выполнении команд и улучшение интерактивного поведения. В паре с GPT-6 Astra при средней сложности рассуждений он также занимает первое место в тесте Tau3, который измеряет интеллектуальные возможности голосовых агентов в сквозных задачах.
Оценивает навыки устного общения в сфере обслуживания клиентов в авиационной, розничной и телекоммуникационной отраслях. Показатель «Pass@1» измеряет успешность выполнения задания; заголовок присваивает каждой отрасли одинаковый вес.
* Бэкенд GPT Live: Astra (средний).
Оценивается качество голосовой поддержки банковских операций с использованием инструментов поиска информации и управления счетами. Показатель Pass@1 — это доля успешно выполненных задач из 97 заданий по банковским знаниям.
Тест проверяет использование инструментов на основе устных запросов, содержащих естественные паузы, колебания и самокоррекции. Показатель Pass@1 оценивает последовательность вызова инструмента.
* GPT Live backend: Terra (low).
Оценивает устный ответ на запросы, связанные с использованием инструментов, содержащий паузы, колебания и самокоррекции. Выставляет баллы за то, насколько хорошо ответ соответствует исходному намерению.
Что говорят клиенты
1 из 4
« Внедрение GPT-Live-1 в Yelp Host и Hatch улучшило согласованность реплик и точность по сравнению с нашей традиционной голосовой архитектурой. Когда Yelp Host использует GPT-Live-1 для ответа на звонки, например, при бронировании столиков и заказе еды, мы видим существенное улучшение показателей обработки звонков. Абоненты также говорят более полными и естественными фразами, что говорит о том, что общение на другом конце провода действительно отличается».
« Хороший преподаватель языка знает, когда нужно дать ученикам пространство, а когда следует вмешаться, и GPT-Live-1 привносит эту естественность в уроки с живым преподавателем Speak — по результатам наших первых оценок, количество перерывов во время размышлений сократилось почти на 80% по сравнению с предыдущими системами, основанными на пошаговом обучении».
« GPT-Live-1 демонстрирует возможности полнодуплексной модели: она переводит голосовую поддержку на основе ИИ из прерывистого ритма в естественный ход телефонного разговора. Клиенты могут делать паузы, прерывать разговор и менять направление естественным образом; голосовая поддержка — это явный шаг вперед; а Fin может объединить этот естественный разговор со своей собственной системой поддержки для выполнения более глубокой работы, необходимой для решения проблемы. Для нас это самый ясный сигнал о том, куда движется голосовая поддержка».
« С Девином и GPT-Live-1 работа с инженером по искусственному интеллекту начинает больше походить на сотрудничество с коллегой. Вы можете обсудить идею, проверить подход в экстремальных условиях или просто передать работу, пока вы не за компьютером».
Новые варианты голосового сопровождения
Разработчикам нужны голоса, которые подходят к их продукту и звучат естественно для пользователей. С GPT-Live-1 мы расширяем набор голосов, доступных в режиме реального времени, до более широкого выбора акцентов, диалектов и языков, предоставляя разработчикам больше возможностей для настройки звучания своих голосовых помощников.
Прислушайтесь к новым голосам
В ближайшие месяцы мы продолжим расширять возможности голосового управления и выбор доступных языков.
Цены и наличие
GPT-Live-1 доступен в API уже сегодня (открывается в новом окне) по цене 0,05 доллара США в минуту за голосовой интерфейс. Соедините его с бэкэнд-моделью и агентским оборудованием, подходящими для вашего продукта, и создайте голосовой интерфейс, масштабируемый в соответствии с объемом выполняемой работы.
Подключение GPT-Live-1 к Codex
1 import { Codex } from «@openai/codex-sdk» ; 2
3 const thread = new Codex (). startThread ({ 4 workingDirectory : «./repo» , 5 sandboxMode : «read-only» , 6 approvalPolicy : «never» , 7 }); 8
9 асинхронная функция answer ( live, DelegationId, context ) { 10 const { finalResponse } = await thread. run ( 11 `Ответьте на последний вопрос, используя этот репозиторий. 12 Ответьте двумя короткими устными предложениями.n ${context} ` 13 ); 14
15 live.send ({ 16 type : «session.commentary.append» , 17 Delegation_id : DelegationId, 18 content : finalResponse, 19 }); 20 }
Подключение GPT-Live-1 к Codex. В этом фрагменте показано, как приложение передает контекст разговора в Codex и возвращает ответ GPT-Live-1. Настройка соединения и обработка делегирования опущены.
Для получения персонализированного голосового доступа свяжитесь с отделом продаж , чтобы узнать больше о критериях соответствия и процедуре запроса.
Еще один способ построения голосовых рабочих процессов на основе GPT-Live-1 — это использование OpenAI Presence , которая применяет эту модель для обеспечения голосового взаимодействия в режиме реального времени. Presence помогает предприятиям развертывать доверенных агентов ИИ, которые могут отвечать на вопросы, решать проблемы, использовать корпоративные системы, выполнять утвержденные действия и при необходимости передавать запросы специалистам. Для получения дополнительной информации обратитесь к своему менеджеру по работе с клиентами OpenAI.
Источник: openai.com
Похожие записи
Оцените материал:
Похожие записи
Компания Proxima Fusion вкладывает 140 миллионов евро в важнейший ингредиент для термоядерной энергетики, рынок которого в основном представлен поставщиками из Азии.
10.09.2026
Ultima, NVIDIA и Google объединили усилия для разработки полногеномного секвенирования с учетом пангенома.
10.09.2026
В цепочках поставок быстро выявляют проблемы, но медленно реагируют: как агенты искусственного интеллекта это решают.
10.09.2026Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
