Архив рубрики ~Лента новостей~

Как мы за шесть месяцев создали систему реального времени для адаптивного голосового ИИ | OpenAI

Как мы за шесть месяцев создали систему реального времени для адаптивного голосового ИИ | OpenAI
Как мы за шесть месяцев создали систему реального времени для адаптивного голосового ИИ | OpenAI

Для голосового ИИ понять, когда нужно говорить, сложнее, чем кажется. Люди без труда передают реплики друг другу за доли секунды, но предыдущие системы голосового ИИ не могли угнаться за этим ритмом. Их архитектура, основанная на репликации, опиралась на крошечные модели, известные как детекторы репликации, перед которыми стояла непростая задача: если угадать слишком рано, пользователь прерывается; если угадать слишком поздно, ответ кажется вялым. Только после того, как детектор принял решение, гораздо более крупная модель LLM приступала к работе.

GPT-Live , наша система голосового управления третьего поколения, исключает детектор поворота из аудиотракта. Ее голосовая модель является полнодуплексной, что означает, что она может одновременно слушать и говорить. Это устраняет необходимость в отдельном детекторе и делает разговор более непосредственным и естественным. Когда требуется более глубокое осмысление или использование инструментов, GPT-Live также может обращаться к нашим передовым моделям, таким как GPT-5.5, не прерывая ход разговора. В совокупности эти возможности обеспечивают GPT-Live беспрецедентное сочетание отзывчивости в разговоре и интеллекта.

Для обеспечения такой масштабируемости потребовалась новая системная архитектура, оптимизированная для низкой задержки. В отличие от типичного подхода «запрос-ответ», наша система передает входящий аудиопоток в голосовую модель и исходящую речь обратно пользователю, при этом делегирование осуществляется по отдельному асинхронному каналу. За последние шесть месяцев мы переработали вывод модели, управление контекстом и передачу мультимедиа, чтобы обеспечить бесперебойную передачу речи от начала до конца.

Архитектура также создает четкую границу между основным голосовым каналом и логикой приложения. Это упрощает настройку поведения приложения без ущерба для быстродействия. Эта основа обеспечивает работу все большего количества функций в ChatGPT Voice, включая недавно появившуюся возможность управлять своим компьютером и координировать действия операторов в настольном приложении ChatGPT.

В этом посте мы объясним, почему более ранние пошаговые системы не могли удовлетворить наши потребности и как мы разработали новую систему для обеспечения быстродействия на каждом уровне. Мы рассмотрим вывод состояния, динамическое управление контекстом, асинхронное делегирование и оптимизацию на уровне протокола — все это работает вместе, чтобы GPT-Live ощущался по-настоящему живым .

Переход от пошагового общения к стримингу

Более ранние архитектуры голосового управления унаследовали пошаговую структуру текстовых LLM, но каждый ход представлялся отдельным аудиофрагментом, а не текстом. В каскадных системах преобразование речи в текст, LLM и преобразование текста в речь выполнялись последовательно. Такая последовательность добавляла задержку и игнорировала такие сигналы, как тон и темп речи.

Модели преобразования речи в речь усовершенствовали этот подход, обрабатывая аудио напрямую. Обучение модели естественному пониманию и генерации речи позволило ей сохранить детали, потерянные при транскрипции, и реагировать быстрее. Но система по-прежнему полагалась на детектор реплик для определения момента начала вывода. Модель обрабатывала большую часть взаимодействия, но взаимодействие оставалось основанным на репликах.

GPT-Live передает управление разговором голосовой модели: аудиопоток поступает в модель и выходит из нее, в то время как более глубокий анализ и использование инструментов происходят асинхронно. Основная задача системы — поддерживать непрерывный поток мультимедиа. Другая работа, такая как вызов моделей-предшественников и поддержание разговора, выполняется вне основного потока.

Диаграмма, демонстрирующая модель обработки голоса в реальном времени на стороне клиента в GPT-Live, асинхронное делегирование задач модели логического вывода на стороне бэкэнда, использование инструментов и двустороннюю передачу звука пользователю.

Обеспечение непрерывного вывода

Поддержание непрерывного потока мультимедиа не всегда является простой задачей. Любая задержка в передаче, обработке или выводе может привести к слышимой паузе или артефакту. В прежних системах с пошаговым воспроизведением можно было допускать некоторые колебания во времени поступления аудиофрагмента. Однако в системе воспроизведения мультимедиа в реальном времени необходимо доставлять каждый аудиокадр точно по расписанию.

Предыдущая работа над ChatGPT Voice и Realtime API заложила важную основу. Мы уже перестроили нашу голосовую инфраструктуру для прямой потоковой передачи аудио и видео в наши системы и из них с меньшей и более предсказуемой задержкой. GPT-Live развил эту концепцию дальше, передавая медиаконтент непосредственно в модель через новую систему вывода с сохранением состояния, разработанную для непрерывного разговора.

Однако потоковая обработка данных была лишь частью решения. Для обеспечения ее эффективной работы в производственной среде нам также необходимо было гарантировать надежную передачу звука от клиента к стеку обработки данных и решить проблемы, связанные с сохранением состояния.

Обеспечение быстрого потока информации в СМИ

Одним из первых принятых нами решений было четкое разделение потока мультимедиа от прикладной и бизнес-логики. Аудиопоток между клиентом и голосовой моделью передается по выделенному быстрому каналу. Делегирование, использование инструментов и другие операции приложения происходят за асинхронной границей RPC. Медленный вызов инструмента или бэкэнд-сервиса может задержать свой результат, но не может остановить поток мультимедиа.

Такое разделение также обеспечивает системе четкую границу для настройки. Приложения могут изменять свои инструменты, политики и поведение бэкэнда, не затрагивая медиа-интерфейс, отвечающий за передачу звука. Путь передачи в реальном времени остается небольшим, предсказуемым и сосредоточенным на работе, которая должна выполняться в режиме реального времени.

Мы написали интерфейс для работы с медиаконтентом и логику обработки данных на языке Go, заменив предыдущую реализацию на Python. Это значительно улучшило плавность доставки кадров: показатель p95 в новой системе соответствует показателю p50 в предыдущей системе.asyncio

Оцените материал:

Поделиться
Понравилась статья? Расскажите другим
ВКонтакте
Читайте также
Архив рубрики ~Коротко из Telegram~ Продолжение новости про роботов уборщиков Если быть точнее, то это… Архив рубрики ~Коротко из Telegram~ Российские банки столкнулись с проблемами у пользователей зарубежных браузеров —… Архив рубрики ~Коротко из Telegram~ Креатин — ИМБА для мозга, при депресии По данным клинических работ,… Архив рубрики ~Коротко из Telegram~ Бесплатные UI-скиллы для ИИ-агентов Набор навыков для Claude Code, Codex… Архив рубрики ~Коротко из Telegram~ Даже самые продвинутые языковые модели не умеют читать мысли. Когда… Архив рубрики ~Коротко из Telegram~ OpenAI показали, чем занималась её следующая модель Astra — она… Архив рубрики ~Коротко из Telegram~ а ещё сегодня DeepSeek выпустили (их первый пост с апреля)… Новости робототехники Роботы начали убираться в домах за $30 в час. В… Архив рубрики ~Коротко из Telegram~ Сгенерированные нейросетью изображения не считаются творчеством — решение московского суда. Автор «Моны… Архив рубрики ~Коротко из Telegram~ Google Earth превратился в генератор катастроф. В сервис встроили генератор изображений… Архив рубрики ~Коротко из Telegram~ SenseNova выкатила лёгкую модель для быстрой генерации картинок SenseTime выпустила… Архив рубрики ~Коротко из Telegram~ Google показала Gemini Robotics 2 — мозг для роботов-помощников Google… Архив рубрики ~Коротко из Telegram~ ИИ-агента прокачали до реверс-инженера Нашли Reverse Skill — набор инструкций,… Архив рубрики ~Коротко из Telegram~ Gurufy собирает полноценный курс по любой теме за пару минут… Архив рубрики ~Коротко из Telegram~ Продолжение новости про роботов уборщиков Если быть точнее, то это… Архив рубрики ~Коротко из Telegram~ Российские банки столкнулись с проблемами у пользователей зарубежных браузеров —… Архив рубрики ~Коротко из Telegram~ Креатин — ИМБА для мозга, при депресии По данным клинических работ,… Архив рубрики ~Коротко из Telegram~ Бесплатные UI-скиллы для ИИ-агентов Набор навыков для Claude Code, Codex… Архив рубрики ~Коротко из Telegram~ Даже самые продвинутые языковые модели не умеют читать мысли. Когда… Архив рубрики ~Коротко из Telegram~ OpenAI показали, чем занималась её следующая модель Astra — она… Архив рубрики ~Коротко из Telegram~ а ещё сегодня DeepSeek выпустили (их первый пост с апреля)… Новости робототехники Роботы начали убираться в домах за $30 в час. В… Архив рубрики ~Коротко из Telegram~ Сгенерированные нейросетью изображения не считаются творчеством — решение московского суда. Автор «Моны… Архив рубрики ~Коротко из Telegram~ Google Earth превратился в генератор катастроф. В сервис встроили генератор изображений… Архив рубрики ~Коротко из Telegram~ SenseNova выкатила лёгкую модель для быстрой генерации картинок SenseTime выпустила… Архив рубрики ~Коротко из Telegram~ Google показала Gemini Robotics 2 — мозг для роботов-помощников Google… Архив рубрики ~Коротко из Telegram~ ИИ-агента прокачали до реверс-инженера Нашли Reverse Skill — набор инструкций,… Архив рубрики ~Коротко из Telegram~ Gurufy собирает полноценный курс по любой теме за пару минут…

Оставить комментарий