VibeVoice — семейство AI-моделей для генерации и распознавания речи.

🤔 VibeVoice — это семейство AI-моделей для генерации и распознавания речи.
Что умеет:
— ASR-модель расшифровывает до 60 минут аудио за один проход;
— понимает, кто говорит, когда говорит и что говорит;
— TTS-модель генерирует диалоги до 90 минут с несколькими голосами;
— realtime-версия выдает речь почти без задержки (~300 мс).
💯 Самое интересное — Microsoft делает ставку на long-context voice AI.
То есть индустрия идет не просто к “озвучке текста”, а к полноценным голосовым AI-системам:
— AI-операторы;
— AI-ассистенты;
— автономные звонки;
— realtime-перевод;
— voice agents.
🪐 И все это постепенно становится open-source.
Похожие записи
- X направил уведомление о прекращении противоправных действий проекту с открытым исходным кодом Nitter из-за предполагаемого сбора данных.
- Первые результаты Jalapeño демонстрируют лидирующую в отрасли скорость и эффективность выполнения задач искусственного интеллекта | OpenAI
- AgentHands: Генерация интерактивных жестов рук для пространственно-ориентированных диалогов между агентами в XR.
Оцените материал:
Похожие записи
Новый шаг в создании видео Компания Luma представила модель Ray3,…
24.09.2025
Банк «Санкт-Петербург» завершил миграцию с зарубежной OmniTracker на отечественную ITSM-платформу…
22.07.2026
Авито Подработка помогает бизнесу стабильнее закрывать смены — платформа запустила инструмент…
30.07.2026Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
