Архив рубрики ~Лента новостей~

MiniMax H3: нейросеть для видео со звуком — разбор 9 демок

MiniMax H3: нейросеть для видео со звуком — разбор 9 демок
MiniMax H3: нейросеть для видео со звуком — разбор 9 демок
MiniMax H3: разбор девяти официальных демок

31 июля 2026 года китайская MiniMax показала H3 — модель, которая по одному текстовому описанию собирает ролик до пятнадцати секунд в разрешении 2K и сразу со стереозвуком. Через три дня компания открыла веса, и рейтинг Artificial Analysis впервые возглавила открытая модель: первое место в видеомонтаже, второе в генерации по тексту, третье в генерации по картинке.

MiniMax H3 уже подключена в нашем боте Cyber AI: TG | MAX

Что такое H3 простыми словами

Обычно под каждую задачу нужна своя нейросеть. Одна делает видео из текста, вторая оживляет фотографию, третья умеет держать лицо персонажа по референсу, четвёртая накладывает звук. Пользователь бегает между вкладками и склеивает результат руками.

MiniMax H3 устроена иначе. Это одна модель на 33 миллиарда параметров, которая читает текст, картинки, видео и аудио как единый контекст. В один запрос помещается до девяти изображений, трёх видеофрагментов и трёх аудиодорожек. На выходе — клип от четырёх до пятнадцати секунд с готовой стереодорожкой внутри. Звук не приклеивается отдельным шагом, модель пишет его вместе с картинкой.

Именно это MiniMax называет omni-моделью и ставит в центр своей подачи. Компания прямо говорит: разделение на отдельные задачи мешало не только пользователю, но и обучению — модель хуже обобщала. Поэтому первым принципом при разработке H3 стало объединение задач.

Главный тезис MiniMax: язык как мост между задачами

Ключевая мысль их блога звучит так. Раньше каждый тип генерации был отдельным продуктом со своими правилами: текст в картинку, редактирование, референс объекта, референс движения, референс стиля — и всё это ещё отдельно для видео и отдельно для звука. Границы между задачами были жёсткими.

H3 вместо фиксированного набора задач использует обычный язык. Отношение между тем, что вы приложили, и тем, что хотите получить, описывается словами. Не «режим image-to-video», а фраза «возьми движение камеры отсюда, героя отсюда, голос отсюда».

MiniMax: язык выступает обобщающим мостом и переводчиком, который сводит отдельные задачи в открытую описательную форму. Именно отсюда растёт способность H3 следовать инструкциям.

Отсюда же их прогноз про то, куда идут видеомодели. Авторы пишут, что создатели контента всё чаще описывают замысел естественной речью, а не вводят короткий визуальный запрос. И что видеомодели постепенно перестают быть генератором отдельного клипа и переходят к участию во всём производственном процессе.

Пример 1. Три источника в одном запросе

Это единственный пример из блога, где MiniMax публикует сам запрос. Дальше промптов компания не даёт — только результаты. Вот перевод на русский:

Сошлись на движение камеры в духе Хичкока из Видео 1, пусть персонаж с Картинки 2 поёт, а вокал совпадает с Аудио 3.

Разберём, что реально приложено на вход.

Источник 1: видеофрагмент с движением камеры. 1920×1080, HEVC, 30 кадров в секунду, 2,09 секунды

Первый источник — видеофрагмент 1920 на 1080, кодек HEVC, тридцать кадров в секунду, длительность всего 2,09 секунды. На кадрах пляж, мужчина в очках на переднем плане, за ним женщина в шляпе. По композиции и характеру движения это классический контрзум: камера едет вперёд, а объектив одновременно отъезжает, из-за чего фон схлопывается, а герой остаётся того же размера. Приём назван по фильму Хичкока «Головокружение», и кадр на входе очень похож на хрестоматийный пляжный дубль из «Челюстей». Утверждать это как факт не будем — MiniMax источник не подписала.

Источник 2: фотография героини. Именно её лицо должно попасть в результатИсточник 2: фотография героини. Именно её лицо должно попасть в результат

Второй источник — фотография девушки с кудрявыми волосами за столиком уличного кафе, в руке чашка эспрессо, на заднем плане вывеска и посетители.

Третий источник — аудиофайл на 4,02 секунды, стерео, частота дискретизации 44,1 килогерца. Он выше по тексту, его можно послушать прямо здесь.

МЕСТО ПОД РОЛИК СО ЗВУКОМ: результат первого примера — героиня поёт под приложенный вокал. Файл лежит в папке — прикрепи вручную.

Результат H3: 2560×1440, 24 кадра в секунду, 6,58 секунды, стерео 32 кГц

Результат: ролик 2560 на 1440 точек, двадцать четыре кадра в секунду, 6,58 секунды, стереодорожка на 32 килогерца, средняя громкость минус 14,4 децибела. Это живая дорожка, а не тишина для галочки.

По кадрам видно ровно то, что просили. Героиня со второй фотографии сидит в том же кафе, поёт, а перспектива улицы за её спиной сжимается и разжимается — контрзум с первого источника отработал. Ни одну из трёх задач не пришлось запускать отдельно.

Пример 2. Что даёт 2K на практике

Демонстрация 2K: макросъёмка геккона. Самый тяжёлый ролик подборки — 12,65 Мбит/с

Второй ролик MiniMax подписывает просто: производительность в 2K. В кадре макросъёмка головы геккона — оранжево-розовая кожа, крупный глаз с вертикальным зрачком, на середине ролика ящерица облизывает глаз языком.

Параметры файла: 2560 на 1440, двадцать четыре кадра в секунду, 6,58 секунды, битрейт 12,65 мегабита в секунду. Это самый тяжёлый ролик всей подборки — десять мегабайт на шесть с половиной секунд.

Сюжет выбран не случайно. Чешуйки, шипы над глазом, влажный блеск языка — именно та фактура, на которой видно разницу между честным разрешением и растянутой картинкой. Средняя громкость дорожки минус 38,9 децибела, то есть звука тут почти нет. Ролик про изображение, и подан он честно.

Как MiniMax делает 2K — отдельная история. Обычно поверх модели вешают модуль увеличения разрешения, который дорисовывает детали по догадке. В H3 базовая модель сама перегенерирует собственный результат низкого разрешения, снова заглядывая в исходный контекст. Компания объясняет выгоду так: апскейлер угадывает мелкие детали и часто не может восстановить, например, мелкий текст, а перегенерация в контексте берёт их из исходных данных.

Пример 3. Нативное стерео

МЕСТО ПОД РОЛИК СО ЗВУКОМ: демонстрация стереозвука — тот самый ролик, ради которого написан этот раздел. Файл лежит в папке — прикрепи вручную.

Демонстрация стерео: сверхширокий кадр 2944×1248, ровно 15,08 секунды

Третий ролик — демонстрация стереозвука. Формат необычный: 2944 на 1248 точек, то есть сверхширокий кадр примерно 21 к 9. Длительность ровно 15,08 секунды — потолок модели.

В кадре зеркально-симметричная шахта промышленного вида, по ней движется кабина с подсвеченным окном, по обеим сторонам крупная надпись MINIMAX. Композиция подобрана под задачу: когда объект едет по центру симметричной сцены, разница между левым и правым каналом слышна сразу.

Средняя громкость минус 35,4 децибела при пиках до минус 13,7 — дорожка тихая, атмосферная, с акцентами. Для гула механики это нормально.

Кейсы применения: четыре сценария

Дальше MiniMax показывает четыре области, куда H3 метит в первую очередь. Промптов к ним компания не публикует, поэтому разбираем по кадрам и по файлам.

Титры к фильму

Нуарная заставка Midnight Line: текст на латинице и японской кане, всё читаемо

Ролик 2560 на 1440, пятнадцать секунд. Нуарная заставка вымышленного детектива Midnight Line: коллажные панели, силуэт под дождём, неоновые синие и красные пятна, наручные часы крупным планом, мост, папка с делом. Текста в кадре много и он разноязычный — латиница вроде STARRING MAYA CROSS и WITH REN KATO соседствует с японской каной. Все надписи читаемые, без каши из символов, а это то место, где видеомодели ломаются чаще всего. Детектор смены планов нашёл три перехода в узком промежутке около 12,6 секунды, то есть финальная сборка кадра идёт быстрой серией.

Страница продукта

Работающий макет интерфейса: подписи, кнопка, полоса загрузки, курсор

Тоже 2560 на 1440 и пятнадцать секунд. Показан интерфейс: панель настройки снаряжения с надписью ARMAMENT CUSTOMIZATION, кнопка CONFIRM CONFIG, полоса загрузки с процентами, курсор мыши. Персонаж в фиолетовой гамме, финальный кадр уводит в неоновый переулок. Модель нарисовала не абстрактную красоту, а работающий макет интерфейса с подписями и элементами управления.

Анимированный постер

Вертикаль 1440×2560: элементы вёрстки выезжают по очереди

Вертикальный формат 1440 на 2560, 10,13 секунды — единственный ролик подборки короче пятнадцати секунд. Постер игрушечной серии POPUP! в розово-салатовой гамме: персонаж в костюме динозавра, крупный заголовок MAKE SOMETHING FUN!, номер серии, копирайт студии. По кадрам видно, как элементы выезжают постепенно: сначала верхний блок, потом подпись серии, потом нижняя строка с иконками. Это не статичная картинка с лёгким движением, а собранная анимация вёрстки.

Реклама и электронная торговля

Лукбук: восемь планов внутри одной генерации, семь склеек за пятнадцать секунд

Вертикаль 1440 на 2560, пятнадцать секунд, средняя громкость минус 11,5 децибела — самая громкая дорожка подборки. Модный лукбук: две модели в чёрном и белом, студийный белый фон, очки-маски, обувь крупным планом.

Самое интересное здесь не картинка, а монтаж. Детектор насчитал семь смен плана: на отметках 2,17, 3,75, 5,92, 7,46, 10,04, 11,58 и 14 секунд. То есть восемь планов внутри одной генерации, со сменой ракурса и крупности. MiniMax отдельно упоминает нативное многоплановое моделирование в списке того, чему модель училась, и вот как оно выглядит на деле.

Технологии под капотом на человеческом языке

Четыре опоры H3 по версии самой MiniMaxЧетыре опоры H3 по версии самой MiniMax

Контекстное omni-представление. Модель должна описать словами не только целевой ролик, но и связь между приложенными материалами и результатом, и даже связи внутри самих материалов. Плюс отдельно описать, как соотносятся картинка и звук, что усложняется при нескольких планах. MiniMax собрала под это отдельный конвейер понимания: исходный материал требует примерно ста тысяч токенов рассуждения, которые сжимаются в среднем до четырёх тысяч.

H3-VAE. Полностью переписанный токенизатор. Он даёт четырёхкратный выигрыш по эффективной длине последовательности, снижает стоимость обучения и вывода, и именно он делает возможным нативные 2K.

H3-Omni Transformer. Ради обобщения задач MiniMax отказалась от архитектуры предыдущего поколения Hailuo 02, хотя та давала преимущество. Аргумент прямой: архитектурные трюки должны уступать тому, как определена сама модель. Понимание и генерацию развели по разным нагрузкам, и сквозная пропускная способность обучения выросла почти на треть.

Перегенерация в контексте. Механизм получения 2K, описанный выше в разборе ролика с гекконом.

Чего в блоге MiniMax нет

Блог — это подача компании, и несколько неудобных деталей в него не попали. Их стоит знать.

Открыли не то, что заняло первое место. В публичный доступ ушла базовая версия, которая выдаёт 768p и стерео. Модуль перегенерации в 2K и блок, превращающий сложные референсы в инструкции, остались на серверах MiniMax. Локально в ComfyUI потолок — 768p. То есть ролики выше по тексту сняты в конфигурации, которой у скачавшего веса человека нет.

Лицензия с ограничениями. Коммерческое использование разрешено компаниям с выручкой ниже определённого порога, а из локального развёртывания исключён ряд стран.

Официальных замеров нет. Технический отчёт компания обещает, но пока не выпустила. Все цифры про первое место — это один прогон стороннего рейтинга с нераскрытой методикой. Относиться к ним стоит как к ориентиру, а не как к приговору.

Ещё одна деталь: экономику генерации MiniMax выносит в подачу отдельным пунктом и считает её своим козырем. Эти расчёты мы не пересказываем — это маркетинг компании, а не независимый замер.

Что показали в блоге и что лежит в файлах

Параметры сняты ffprobe с оригинальных файлов с сервера MiniMaxПараметры сняты ffprobe с оригинальных файлов с сервера MiniMax

Из таблицы видно несколько вещей, о которых в тексте блога не сказано.

• Все результаты H3 идут на двадцати четырёх кадрах в секунду — кинематографическая частота, не тридцать и не шестьдесят.

• Стереодорожка присутствует в каждом ролике без исключения, даже там, где она почти не слышна.

• Частота дискретизации звука везде 32 килогерца — ниже студийного стандарта, но для встроенной дорожки нормально.

• Длительность у большинства демок ровно пятнадцать секунд, то есть компания показывает работу на пределе возможностей модели.

Как попробовать H3 самому

Модель уже подключена в нашем боте. Порядок такой.

• Откройте бота и нажмите кнопку запуска приложения.

• Перейдите в раздел видео и выберите карточку MiniMax H3.

• Заполните поля и вставьте описание.

• Нажмите сохранение — это и есть запуск генерации, отдельной кнопки нет.

Режимов у модели три, и набор полей в каждом свой. Генерация по тексту — без вложений, доступны шесть форматов кадра. Генерация по кадрам — одна или две картинки на первый и последний кадр, поле пропорций при этом скрывается, формат берётся от исходника. Генерация по референсам — до девяти изображений, трёх видео и трёх аудио, семь вариантов пропорций, включая подстройку под материал.

Промпт у H3 длинный: помещается до семи тысяч символов. Это не случайность — модель рассчитана на то, что вы описываете замысел развёрнуто, а не бросаете три слова.

Частые вопросы

Чем H3 отличается от предыдущих моделей Hailuo? Hailuo 01 и Hailuo 02 были обычными видеомоделями с разделением на задачи. H3 — первое поколение, где текст, картинка, видео и звук обрабатываются одним контекстом, а звук пишется вместе с изображением.

Какая нейросеть для видео со звуком сейчас лучшая? Однозначного ответа нет: официальных сравнений MiniMax не публиковала, а сторонний рейтинг измерял хостинговую версию. По видеомонтажу со звуком H3 в этом рейтинге на первом месте, по генерации из текста и из картинки — ниже конкурентов.

Сколько длится ролик? От четырёх до пятнадцати секунд. Восемь из девяти демок в блоге сделаны на максимуме, один анимированный постер — на десяти секундах.

Правда ли, что H3 понимает несколько картинок сразу? Да. Ограничение — девять изображений, три видеофрагмента и три аудиодорожки на один запрос.

Можно ли получить нейросеть для видео из фото на H3? Да, для этого предусмотрен режим генерации по кадрам: вы задаёте первый и, если нужно, последний кадр, а модель достраивает движение между ними.

Работает ли модель с русским языком? Описание сцены можно писать по-русски. С репликами персонажей сложнее: качество произношения зависит от языка, и надёжнее задавать речь латиницей.

Что за история с открытыми весами? Веса выложены на Hugging Face, но это базовая версия на 768p. Модули 2K и разбора сложных референсов остались закрытыми, плюс действуют лицензионные ограничения по выручке и по странам.

Итог

MiniMax подаёт H3 как поворот от специализированных моделей к универсальной, и девять роликов из блога этот тезис поддерживают: один запрос с тремя разными источниками, читаемые титры на двух алфавитах, рабочий макет интерфейса, восемь планов внутри одной генерации. Файлы подтверждают заявленное — 2560 на 1440, двадцать четыре кадра в секунду, стерео в каждом ролике.

При этом главное расхождение никуда не делось: открытые веса и та конфигурация, что сняла эти демки, — разные вещи. Если вы планируете локальное развёртывание, рассчитывайте на 768p. Если нужен результат как в блоге, нужна хостинговая версия.

Какой из девяти примеров показался вам самым убедительным? Напишите в комментариях. И если разбор оказался полезным, поставьте лайк — так его увидит больше людей.

Больше разборов моделей и промптов 👉 TG | MAX

Источник: vc.ru

Оцените материал:

Поделиться
Понравилась статья? Расскажите другим
ВКонтакте
Читайте также
Архив рубрики ~Коротко из Telegram~ 🤖Grok Imagine Video 1.5 — разбираем полностью Мы уже упоминали… Архив рубрики ~Коротко из Telegram~ OpenAI совместно с Джони Айвом разрабатывают умную колонку без дисплея, размером… Архив рубрики ~Коротко из Telegram~ Grok Imagine Image 2.0: обошёл Nano Banana и Midjourney xAI… Архив рубрики ~Коротко из Telegram~ Black Forest Labs выпустили FLUX 3 — универсальная модель для… Архив рубрики ~Коротко из Telegram~ Основатель Coursera выкатил OpenWorker Эндрю Ын, основатель Coursera выпустил OpenWorker — open-source… Архив рубрики ~Коротко из Telegram~ Минцифры не планирует превращать «Госуслуги» в мессенджер. По словам главы… Архив рубрики ~Коротко из Telegram~ Оборот ИТ-компаний Москвы в первом полугодии 2026 года достиг 3,5… Архив рубрики ~Коротко из Telegram~ Huawei придумал кнопку КОНФИДЕНЦИАЛЬНОСТИ — в новый ноутбук встроили физический переключатель… Архив рубрики ~Коротко из Telegram~ Один стандарт плагинов для ИИ Agent Plugins OpenAI, AWS, Cursor,… Архив рубрики ~Обо всем~ По сообщениям СМИ, Volkswagen планирует вернуть себе позиции на американском рынке с помощью пикапа. Новости робототехники TechCrunch Mobility: Zoox готовится к запуску и империя беспилотных автомобилей Uber Архив рубрики ~Обо всем~ Сообщение: Белый дом разрабатывает указ, связывающий вакцинацию и аутизм. Архив рубрики ~Обо всем~ Обзор Galaxy Z Fold 8: миниатюрный смартфон, способный менять форму в любой момент. Архив рубрики ~Обо всем~ Физическое удаление от планеты разрушает эволюционно привычные сенсорные, пространственные и временные рамки, вынуждая сознание строить новую модель реальности Архив рубрики ~Коротко из Telegram~ 🤖Grok Imagine Video 1.5 — разбираем полностью Мы уже упоминали… Архив рубрики ~Коротко из Telegram~ OpenAI совместно с Джони Айвом разрабатывают умную колонку без дисплея, размером… Архив рубрики ~Коротко из Telegram~ Grok Imagine Image 2.0: обошёл Nano Banana и Midjourney xAI… Архив рубрики ~Коротко из Telegram~ Black Forest Labs выпустили FLUX 3 — универсальная модель для… Архив рубрики ~Коротко из Telegram~ Основатель Coursera выкатил OpenWorker Эндрю Ын, основатель Coursera выпустил OpenWorker — open-source… Архив рубрики ~Коротко из Telegram~ Минцифры не планирует превращать «Госуслуги» в мессенджер. По словам главы… Архив рубрики ~Коротко из Telegram~ Оборот ИТ-компаний Москвы в первом полугодии 2026 года достиг 3,5… Архив рубрики ~Коротко из Telegram~ Huawei придумал кнопку КОНФИДЕНЦИАЛЬНОСТИ — в новый ноутбук встроили физический переключатель… Архив рубрики ~Коротко из Telegram~ Один стандарт плагинов для ИИ Agent Plugins OpenAI, AWS, Cursor,… Архив рубрики ~Обо всем~ По сообщениям СМИ, Volkswagen планирует вернуть себе позиции на американском рынке с помощью пикапа. Новости робототехники TechCrunch Mobility: Zoox готовится к запуску и империя беспилотных автомобилей Uber Архив рубрики ~Обо всем~ Сообщение: Белый дом разрабатывает указ, связывающий вакцинацию и аутизм. Архив рубрики ~Обо всем~ Обзор Galaxy Z Fold 8: миниатюрный смартфон, способный менять форму в любой момент. Архив рубрики ~Обо всем~ Физическое удаление от планеты разрушает эволюционно привычные сенсорные, пространственные и временные рамки, вынуждая сознание строить новую модель реальности

Оставить комментарий