Xiaomi открыла модель, которая генерирует сложные звуковые сцены целиком Команда…
Xiaomi открыла модель, которая генерирует сложные звуковые сцены целиком
Команда MiLM Plus из Xiaomi выложила в открытый доступ MiDashengLM-Gen — генератор аудио по текстовому описанию. Он собирает не отдельный голос или трек, а полноценную звуковую сцену: речь, музыку, шумовые эффекты и фоновую акустику вместе.
Внутри — аудиотокенизатор MiDashengLM-0.6B, дообученная языковая модель Qwen3-1.7B и генеративная часть Flow Matching на базе DiT. Управление идёт через теги промпта: caption, asr, speech, sfx, music, env, а ненужные поля помечаются как unknown. На выходе — WAV 16 кГц длительностью до 20 секунд.
Обучали модель на приватном датасете ACAVCaps объёмом 77 тысяч часов плюс открытых наборах Emilia, LibriTTS, LJSpeech, AISHELL-3 и WenetSpeech4TTS. Русского в речевой части ACAVCaps всего 4,66% против 54% английского и 24,5% китайского — это сразу видно по качеству: доля ошибок на русском 13,19% против 2,42% на английском.
По метрикам на Seed-TTS ошибки снизились с 12,15% до 2,79%, на CV3-Eval эмоции распознаются уверенно: радость 0,98, грусть 0,96, злость 0,92. А вот на AudioCaps результат скромнее — FAD 5,01 против 2,26 у TangoFlux, то есть в чистой генерации звуковых эффектов конкуренты пока сильнее.
Похожие записи
Оцените материал:
Похожие записи
⚡️ Ваш телефон придется поставить на ГОСУЧЕТ — Путин подписал…
27.06.2026
Google Translate прокачали ИИ — теперь он понимает сленг, идиомы…
14.12.2025
Apple исправила около 30 различных уязвимостей в iOS/iPadOS 26.6.1…
19.08.2026Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
