Как мы за шесть месяцев создали систему реального времени для адаптивного голосового ИИ | OpenAI
Для голосового ИИ понять, когда нужно говорить, сложнее, чем кажется. Люди без труда передают реплики друг другу за доли секунды, но предыдущие системы голосового ИИ не могли угнаться за этим ритмом. Их архитектура, основанная на репликации, опиралась на крошечные модели, известные как детекторы репликации, перед которыми стояла непростая задача: если угадать слишком рано, пользователь прерывается; если угадать слишком поздно, ответ кажется вялым. Только после того, как детектор принял решение, гораздо более крупная модель LLM приступала к работе.
GPT-Live , наша система голосового управления третьего поколения, исключает детектор поворота из аудиотракта. Ее голосовая модель является полнодуплексной, что означает, что она может одновременно слушать и говорить. Это устраняет необходимость в отдельном детекторе и делает разговор более непосредственным и естественным. Когда требуется более глубокое осмысление или использование инструментов, GPT-Live также может обращаться к нашим передовым моделям, таким как GPT-5.5, не прерывая ход разговора. В совокупности эти возможности обеспечивают GPT-Live беспрецедентное сочетание отзывчивости в разговоре и интеллекта.
Для обеспечения такой масштабируемости потребовалась новая системная архитектура, оптимизированная для низкой задержки. В отличие от типичного подхода «запрос-ответ», наша система передает входящий аудиопоток в голосовую модель и исходящую речь обратно пользователю, при этом делегирование осуществляется по отдельному асинхронному каналу. За последние шесть месяцев мы переработали вывод модели, управление контекстом и передачу мультимедиа, чтобы обеспечить бесперебойную передачу речи от начала до конца.
Архитектура также создает четкую границу между основным голосовым каналом и логикой приложения. Это упрощает настройку поведения приложения без ущерба для быстродействия. Эта основа обеспечивает работу все большего количества функций в ChatGPT Voice, включая недавно появившуюся возможность управлять своим компьютером и координировать действия операторов в настольном приложении ChatGPT.
В этом посте мы объясним, почему более ранние пошаговые системы не могли удовлетворить наши потребности и как мы разработали новую систему для обеспечения быстродействия на каждом уровне. Мы рассмотрим вывод состояния, динамическое управление контекстом, асинхронное делегирование и оптимизацию на уровне протокола — все это работает вместе, чтобы GPT-Live ощущался по-настоящему живым .
Переход от пошагового общения к стримингу
Более ранние архитектуры голосового управления унаследовали пошаговую структуру текстовых LLM, но каждый ход представлялся отдельным аудиофрагментом, а не текстом. В каскадных системах преобразование речи в текст, LLM и преобразование текста в речь выполнялись последовательно. Такая последовательность добавляла задержку и игнорировала такие сигналы, как тон и темп речи.
Модели преобразования речи в речь усовершенствовали этот подход, обрабатывая аудио напрямую. Обучение модели естественному пониманию и генерации речи позволило ей сохранить детали, потерянные при транскрипции, и реагировать быстрее. Но система по-прежнему полагалась на детектор реплик для определения момента начала вывода. Модель обрабатывала большую часть взаимодействия, но взаимодействие оставалось основанным на репликах.
GPT-Live передает управление разговором голосовой модели: аудиопоток поступает в модель и выходит из нее, в то время как более глубокий анализ и использование инструментов происходят асинхронно. Основная задача системы — поддерживать непрерывный поток мультимедиа. Другая работа, такая как вызов моделей-предшественников и поддержание разговора, выполняется вне основного потока.
Обеспечение непрерывного вывода
Поддержание непрерывного потока мультимедиа не всегда является простой задачей. Любая задержка в передаче, обработке или выводе может привести к слышимой паузе или артефакту. В прежних системах с пошаговым воспроизведением можно было допускать некоторые колебания во времени поступления аудиофрагмента. Однако в системе воспроизведения мультимедиа в реальном времени необходимо доставлять каждый аудиокадр точно по расписанию.
Предыдущая работа над ChatGPT Voice и Realtime API заложила важную основу. Мы уже перестроили нашу голосовую инфраструктуру для прямой потоковой передачи аудио и видео в наши системы и из них с меньшей и более предсказуемой задержкой. GPT-Live развил эту концепцию дальше, передавая медиаконтент непосредственно в модель через новую систему вывода с сохранением состояния, разработанную для непрерывного разговора.
Однако потоковая обработка данных была лишь частью решения. Для обеспечения ее эффективной работы в производственной среде нам также необходимо было гарантировать надежную передачу звука от клиента к стеку обработки данных и решить проблемы, связанные с сохранением состояния.
Обеспечение быстрого потока информации в СМИ
Одним из первых принятых нами решений было четкое разделение потока мультимедиа от прикладной и бизнес-логики. Аудиопоток между клиентом и голосовой моделью передается по выделенному быстрому каналу. Делегирование, использование инструментов и другие операции приложения происходят за асинхронной границей RPC. Медленный вызов инструмента или бэкэнд-сервиса может задержать свой результат, но не может остановить поток мультимедиа.
Такое разделение также обеспечивает системе четкую границу для настройки. Приложения могут изменять свои инструменты, политики и поведение бэкэнда, не затрагивая медиа-интерфейс, отвечающий за передачу звука. Путь передачи в реальном времени остается небольшим, предсказуемым и сосредоточенным на работе, которая должна выполняться в режиме реального времени.
Мы написали интерфейс для работы с медиаконтентом и логику обработки данных на языке Go, заменив предыдущую реализацию на Python. Это значительно улучшило плавность доставки кадров: показатель p95 в новой системе соответствует показателю p50 в предыдущей системе.asyncio
Читать дальше в источнике
Похожие записи
Оцените материал:
Похожие записи
Искусственный интеллект в кибербезопасности: баланс угроз и защитных технологий
09.10.2025
Как эти два брата стали экспертами по «таинственному вторжению дронов» в Америку
27.09.2025
Как и многим другим людям, мне тоже не чужд благоговейный трепет перед великой силой эволюции, постигающей совершенство через беспощадное перемалывание менее приспособленных звеньев
22.11.2025Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
