Архив рубрики ~Лента новостей~

Как мы за шесть месяцев создали систему реального времени для адаптивного голосового ИИ | OpenAI

Как мы за шесть месяцев создали систему реального времени для адаптивного голосового ИИ | OpenAI

Джастин Уберти и Захан Малкани, сотрудники технического отдела.

  • Переход от пошагового общения к стримингу
  • Обеспечение непрерывного вывода
    • Обеспечение быстрого потока информации в СМИ
    • Поддержание (состоятельного) диалога
  • Делегирование полномочий без блокирования разговора
  • Сделать процесс делегирования достаточно быстрым, чтобы он ощущался естественно.
    • Выведение отдельных реплик из непрерывной речи
  • Начало сеансов по ускоренному протоколу.
  • Безопасное тестирование GPT-Live в производственной среде с использованием реальных данных.
  • Адаптивный дизайн, от клиента до модели.
  • Переход от пошагового общения к стримингу
  • Обеспечение непрерывного вывода
    • Обеспечение быстрого потока информации в СМИ
    • Поддержание (состоятельного) диалога
  • Делегирование полномочий без блокирования разговора
  • Сделать процесс делегирования достаточно быстрым, чтобы он ощущался естественно.
    • Выведение отдельных реплик из непрерывной речи
  • Начало сеансов по ускоренному протоколу.
  • Безопасное тестирование GPT-Live в производственной среде с использованием реальных данных.
  • Адаптивный дизайн, от клиента до модели.

Для голосового ИИ понять, когда нужно говорить, сложнее, чем кажется. Люди без труда передают реплики друг другу за доли секунды, но предыдущие системы голосового ИИ не могли угнаться за этим ритмом. Их архитектура, основанная на репликации, опиралась на крошечные модели, известные как детекторы репликации, перед которыми стояла непростая задача: если угадать слишком рано, пользователь прерывается; если угадать слишком поздно, ответ кажется вялым. Только после того, как детектор принял решение, гораздо более крупная модель LLM приступала к работе.

GPT-Live , наша система голосового управления третьего поколения, исключает детектор поворота из аудиотракта. Ее голосовая модель является полнодуплексной, что означает, что она может одновременно слушать и говорить. Это устраняет необходимость в отдельном детекторе и делает разговор более непосредственным и естественным. Когда требуется более глубокое осмысление или использование инструментов, GPT-Live также может обращаться к нашим передовым моделям, таким как GPT-5.5, не прерывая ход разговора. В совокупности эти возможности обеспечивают GPT-Live беспрецедентное сочетание отзывчивости в разговоре и интеллекта.

Для обеспечения такой масштабируемости потребовалась новая системная архитектура, оптимизированная для низкой задержки. В отличие от типичного подхода «запрос-ответ», наша система передает входящий аудиопоток в голосовую модель и исходящую речь обратно пользователю, при этом делегирование осуществляется по отдельному асинхронному каналу. За последние шесть месяцев мы переработали вывод модели, управление контекстом и передачу мультимедиа, чтобы обеспечить бесперебойную передачу речи от начала до конца.

Архитектура также создает четкую границу между основным голосовым каналом и логикой приложения. Это упрощает настройку поведения приложения без ущерба для быстродействия. Эта основа обеспечивает работу все большего количества функций в ChatGPT Voice, включая недавно появившуюся возможность управлять своим компьютером и координировать действия операторов в настольном приложении ChatGPT.

В этом посте мы объясним, почему более ранние пошаговые системы не могли удовлетворить наши потребности и как мы разработали новую систему для обеспечения быстродействия на каждом уровне. Мы рассмотрим вывод состояния, динамическое управление контекстом, асинхронное делегирование и оптимизацию на уровне протокола — все это работает вместе, чтобы GPT-Live ощущался по-настоящему живым .

Переход от пошагового общения к стримингу

Более ранние архитектуры голосового управления унаследовали пошаговую структуру текстовых LLM, но каждый ход представлялся отдельным аудиофрагментом, а не текстом. В каскадных системах преобразование речи в текст, LLM и преобразование текста в речь выполнялись последовательно. Такая последовательность добавляла задержку и игнорировала такие сигналы, как тон и темп речи.

Модели преобразования речи в речь усовершенствовали этот подход, обрабатывая аудио напрямую. Обучение модели естественному пониманию и генерации речи позволило ей сохранить детали, потерянные при транскрипции, и реагировать быстрее. Но система по-прежнему полагалась на детектор реплик для определения момента начала вывода. Модель обрабатывала большую часть взаимодействия, но взаимодействие оставалось основанным на репликах.

GPT-Live передает управление разговором голосовой модели: аудиопоток поступает в модель и выходит из нее, в то время как более глубокий анализ и использование инструментов происходят асинхронно. Основная задача системы — поддерживать непрерывный поток мультимедиа. Другая работа, такая как вызов моделей-предшественников и поддержание разговора, выполняется вне основного потока.

Диаграмма, демонстрирующая модель обработки голоса в реальном времени на стороне клиента в GPT-Live, асинхронное делегирование задач модели логического вывода на стороне бэкэнда, использование инструментов и двустороннюю передачу звука пользователю.

Обеспечение непрерывного вывода

Поддержание непрерывного потока мультимедиа не всегда является простой задачей. Любая задержка в передаче, обработке или выводе может привести к слышимой паузе или артефакту. В прежних системах с пошаговым воспроизведением можно было допускать некоторые колебания во времени поступления аудиофрагмента. Однако в системе воспроизведения мультимедиа в реальном времени необходимо доставлять каждый аудиокадр точно по расписанию.

Предыдущая работа над ChatGPT Voice и Realtime API заложила важную основу. Мы уже перестроили нашу голосовую инфраструктуру для прямой потоковой передачи аудио и видео в наши системы и из них с меньшей и более предсказуемой задержкой. GPT-Live развил эту концепцию дальше, передавая медиаконтент непосредственно в модель через новую систему вывода с сохранением состояния, разработанную для непрерывного разговора.

Однако потоковая обработка данных была лишь частью решения. Для обеспечения ее эффективной работы в производственной среде нам также необходимо было гарантировать надежную передачу звука от клиента к стеку обработки данных и решить проблемы, связанные с сохранением состояния.

Обеспечение быстрого потока информации в СМИ

Одним из первых принятых нами решений было четкое разделение потока мультимедиа от прикладной и бизнес-логики. Аудиопоток между клиентом и голосовой моделью передается по выделенному быстрому каналу. Делегирование, использование инструментов и другие операции приложения происходят за асинхронной границей RPC. Медленный вызов инструмента или бэкэнд-сервиса может задержать свой результат, но не может остановить поток мультимедиа.

Такое разделение также обеспечивает системе четкую границу для настройки. Приложения могут изменять свои инструменты, политики и поведение бэкэнда, не затрагивая медиа-интерфейс, отвечающий за передачу звука. Путь передачи в реальном времени остается небольшим, предсказуемым и сосредоточенным на работе, которая должна выполняться в режиме реального времени.

Мы написали интерфейс для работы с медиафайлами и логику обработки данных на Go, заменив предыдущую реализацию asyncio на Python . Это значительно улучшило плавность доставки кадров: показатель p95 в новой системе соответствует показателю p50 в предыдущей системе.

WebRTC обеспечивает основу для передачи данных. Он разработан для передачи медиаконтента с низкой задержкой и может продолжать работать при потере пакетов, смещении тактовой частоты и изменениях в подключении клиента. Если пакеты приходят с задержкой, WebRTC может незаметно растягивать звук, чтобы предотвратить разрывы, а затем кратковременно ускорять воспроизведение, чтобы вернуться к реальному времени.

Сводя к минимуму буферизацию и блокировки во всей системе, мы можем обеспечить скорость отклика, составляющую доли секунды, которую люди ожидают от общения.

Поддержание (состоятельного) диалога

Вывод состояния имеет свои собственные компромиссы в работе. Голосовая сессия может оставаться активной в течение длительного времени, но ее контекст постоянно расширяется, а экземпляры модели запускаются и отключаются в зависимости от спроса.

Для решения этих проблем мы разработали механизм бесшовной передачи данных между экземплярами моделей. Когда требуется переход, мы можем предварительно запустить заменяющий экземпляр модели параллельно с существующим, заполнить его контекстом текущей сессии, выполнить вывод данных для обоих экземпляров параллельно и переключиться, когда новый экземпляр будет полностью готов.

Тот же базовый механизм поддерживает и динамическое сжатие контекста. По мере развития разговора накопленный контекст может в конечном итоге превысить лимит контекста модели. Сжатие может уменьшить размер контекста, чтобы он соответствовал лимиту, но эта операция занимает время. И поскольку она изменяет прошлый контекст, она также аннулирует кэш ключ-значение (KV) модели, который хранит ключи внимания и значения из ранее обработанных токенов. Восстановление этого состояния требует нового предварительного заполнения, что приводит к дополнительной задержке.

Вместо этого мы рассматриваем компактизацию как еще один управляемый переход. Пока исходный экземпляр модели продолжает общаться, система компактирует контекст и подготавливает заменяющий экземпляр модели с новым контекстом. Как только этот экземпляр будет готов, мы можем переключиться без каких-либо прерываний передачи медиаконтента. Это позволяет системе поддерживать длительные вызовы, выполняя компактизацию по мере необходимости.

Основная работа выполняется вне канала прямого эфира, поэтому даже во время передачи управления разговор не прерывается.

Делегирование полномочий без блокировки разговора

Способность GPT-Live использовать существующие передовые модели наделяет его огромным потенциалом, эффективно отделяя «разговор» от более глубокого «мышления». Но для того, чтобы эта двухмодельная архитектура воспринималась как единая система, потребовалось решить две взаимосвязанные инженерные задачи.

Делегирование полномочий для более глубокой работы

GPT-Live обеспечивает быстрые и естественные отклики, а GPT-5.5 выполняет поиск в фоновом режиме.

Пользователь GPT-Live-1 ГПТ-5.5 Поиск + причина Пример расшифровки разговора с GPT-Live-1, с использованием GPT-5.5 Instant.

Источник: openai.com

Оцените материал:

Поделиться
Понравилась статья? Расскажите другим
ВКонтакте
Читайте также
Новости робототехники igus запускает энергетическую цепь с вращением на 600 градусов для промышленных роботов Новости робототехники HEBI Robotics получает грант НАСА СБИР на ускорение создания миниатюрных приводов Новости робототехники Как компании по автоматизации внедряют ИИ, не привязываясь к отдельному поставщику Новости робототехники Внутри роскошного роботакси Uber, которое тестируют компании Lucid и Nuro. Архив рубрики ~Коротко из Telegram~ Alibaba вывела Qwen3.8-Max из preview: это MoE-флагман на 2,4 трлн… Архив рубрики ~Коротко из Telegram~ OpenAI показали, чем занималась её следующая модель Astra: она выдала… Новости робототехники У берегов Новороссийска морские дроны ВСУ потопили контейнеровоз FESCO «Янина» Новости робототехники Google DeepMind утверждает, что Gemini Robotics 2 позволяет полностью контролировать тело Новости робототехники Хлеб будущего: от руля комбайна к управлению роботизированным флотом Архив рубрики ~Коротко из Telegram~ 🎬 Dreamina Seedance 2.5 — теперь видео до 30 секунд без… Архив рубрики ~Коротко из Telegram~ Что ИИ-агенты делают, когда у них есть доступ к деньгам… Архив рубрики ~Коротко из Telegram~ Лучшие генераторы видео на ИИ Прошлись по свежим рейтингам с… Архив рубрики ~Коротко из Telegram~ Perplexity превратила Spaces в Projects Теперь в одном проекте можно… Архив рубрики ~Коротко из Telegram~ Мозговой имплант впервые помог вернуть движения парализованным рукам Если раньше… Новости робототехники igus запускает энергетическую цепь с вращением на 600 градусов для промышленных роботов Новости робототехники HEBI Robotics получает грант НАСА СБИР на ускорение создания миниатюрных приводов Новости робототехники Как компании по автоматизации внедряют ИИ, не привязываясь к отдельному поставщику Новости робототехники Внутри роскошного роботакси Uber, которое тестируют компании Lucid и Nuro. Архив рубрики ~Коротко из Telegram~ Alibaba вывела Qwen3.8-Max из preview: это MoE-флагман на 2,4 трлн… Архив рубрики ~Коротко из Telegram~ OpenAI показали, чем занималась её следующая модель Astra: она выдала… Новости робототехники У берегов Новороссийска морские дроны ВСУ потопили контейнеровоз FESCO «Янина» Новости робототехники Google DeepMind утверждает, что Gemini Robotics 2 позволяет полностью контролировать тело Новости робототехники Хлеб будущего: от руля комбайна к управлению роботизированным флотом Архив рубрики ~Коротко из Telegram~ 🎬 Dreamina Seedance 2.5 — теперь видео до 30 секунд без… Архив рубрики ~Коротко из Telegram~ Что ИИ-агенты делают, когда у них есть доступ к деньгам… Архив рубрики ~Коротко из Telegram~ Лучшие генераторы видео на ИИ Прошлись по свежим рейтингам с… Архив рубрики ~Коротко из Telegram~ Perplexity превратила Spaces в Projects Теперь в одном проекте можно… Архив рубрики ~Коротко из Telegram~ Мозговой имплант впервые помог вернуть движения парализованным рукам Если раньше…

Оставить комментарий