Архив рубрики ~Лента новостей~

Компания Black Forest Labs выпустила FLUX 3, способный генерировать изображения и 20-секундные видеоролики со звуком, но на начальном этапе — в ограниченном количестве.

Компания Black Forest Labs выпустила FLUX 3, способный генерировать изображения и 20-секундные видеоролики со звуком, но на начальном этапе — в ограниченном количестве.
Компания Black Forest Labs выпустила FLUX 3, способный генерировать изображения и 20-секундные видеоролики со звуком, но на начальном этапе — в ограниченном количестве.

Карл Франзен

Лаборатории Черного Леса

Компания Black Forest Labs (BFL) расширяет семейство своих решений FLUX, выходя за рамки генерации изображений, и сегодня представляет FLUX 3 — многомодальную модель, обученную понимать и генерировать изображения или комбинированные аудио/видеоролики продолжительностью до 20 секунд на основе одного запроса, а также распространять ту же базовую архитектуру на роботизированное зрение и действия.

В расположенной во Фрайбурге, Германия, лаборатории искусственного интеллекта утверждают, что FLUX 3 обучается совместно для всех этих модальностей, а не путем объединения отдельных моделей изображений, видео и аудио за общим интерфейсом.

Это различие является ключевым моментом в стратегии компании: BFL хочет, чтобы предприятия рассматривали создание креативов, моделирование, использование компьютеров и робототехнику как взаимосвязанные приложения единой возможности, которую она называет визуальным интеллектом — моделями, по словам компании, «которые могут воспринимать, прогнозировать и действовать в физической и цифровой среде». Этот релиз знаменует собой первую публичную модель генерации видео от BFL.

FLUX 3 будет предлагаться в рамках четырех продуктовых линеек: FLUX 3 Video, FLUX 3 Image, FLUX 3 Action и готовящегося к выпуску открытого программного обеспечения FLUX 3 Dev. FLUX 3 Video, с возможностью генерации собственного звука, и FLUX 3 Action сейчас участвуют в программе «Раннего доступа» с ограниченным доступом, на которую может подать заявку любой желающий, но одобрение должно быть получено от BFL.

В настоящее время публичный доступ через программный интерфейс приложений (API) BFL или партнеров пока отсутствует, но компания заявляет, что FLUX 3 Image будет выпущен в ближайшие недели, после чего станет доступен для всех. Ограниченное первоначальное распространение повторяет стратегии выпуска новых моделей от других передовых лабораторий в США в последнее время, включая Anthropic и OpenAI, хотя это было сделано, по-видимому, из соображений безопасности и по запросу правительства.

Компания пока не объявила о ценах, обязательствах по уровню обслуживания, методологии оценки, размерах выборки, количестве оценщиков или каких-либо эталонных показателях моделей изображений. Поэтому корпоративные покупатели пока не могут рассчитать общую стоимость владения или самостоятельно воспроизвести сравнение видео.

Ещё одно существенное упущение: FLUX 3 в настоящее время не выпускается с возможностью загрузки весов и не имеет лицензии с открытым исходным кодом. BFL заявляет, что более быстрые и открытые версии весов появятся позже в этом году, а в техническом блоге FLUX 3 Dev позиционируется как «доступ к многомодальной основе с открытыми весами для создания контента (видео, аудио и изображения) и прогнозирования действий» — значительно более широкое обязательство, чем любой предыдущий релиз FLUX Dev, все из которых касались только изображений.

Но она появляется последней в последовательности. Разработчикам, привыкшим получать локально развертываемый вариант FLUX одновременно с — или вскоре после — анонса крупной модели, придется подождать. Эта задержка не отменяет приверженности компании, но она разочаровывает, учитывая роль открытых весов в распространении FLUX до настоящего времени.

Flux 3 имеет более высокий рейтинг, чем конкуренты, но отсутствие информации о ценах и результатах сравнительного анализа может препятствовать быстрому внедрению в корпоративной среде.

Компания BFL опубликовала несколько сравнительных тестов, но они носят предварительный характер — полные результаты и методология будут опубликованы позже, в ходе более широкого распространения.

В ходе предварительного сравнительного тестирования 10-секундных видеороликов в формате 720p с аудио, компания сообщила, что FLUX 3 был предпочтительнее Luma Ray 3.2 в 93% случаев, Runway Gen-4.5 — в 77%, Grok Imagine Video — в 69%, Kling v3 Pro — в 60%, Happy Horse v1 — в 59%, Happy Horse 1.1 — в 57%, а также Seedance 2.0 и Google Gemini Omni Flash — в 52%.

Внутреннее тестирование Flux 3, проведенное на основе анализа 10-секундных видеороликов в разрешении 720p, созданных с помощью различных моделей, показало, что пользователи оценивают результаты тестирования.

К каждой из этих цифр прилагается одно предостережение, и оно исходит от самой компании BFL. Диаграмма с результатами помечена как «предварительная оценка ранней версии FLUX 3» — это означает, что цифры описывают предрелизную версию, а не модель, которая сейчас находится в раннем доступе. Это работает в обе стороны: серийная модель может показать лучшие результаты, но ничто из опубликованного сегодня не отражает того, что на самом деле будут запрашивать клиенты.

Luma Ray 3.2 и Runway Gen-4.5, где FLUX 3 показал 93% и 77% соответственно, являются наименее привлекательными аналогами в этом списке — это уже зарекомендовавшие себя продукты, но не те модели, которые в настоящее время лидируют в независимых рейтингах видео. Это реальные лидеры, и именно они вряд ли изменят корпоративный список претендентов.

Доля Seedance 2.0 в 52% — это статистический бросок монеты против модели, которую большинство западных предприятий в настоящее время не могут себе позволить. Компания ByteDance отложила международный запуск Seedance 2.0 на неопределенный срок после того, как Netflix, Warner Bros, Disney, Paramount и Sony пригрозили судебными исками по поводу предполагаемого систематического нарушения авторских прав, и эта приостановка остается в силе. Привязка замороженного продукта не является ни сильным, ни наносящим ущерб утверждением.

Gemini Omni Flash, также с показателем 52%, имеет гораздо большее значение. Omni — это ближайший аналог FLUX 3 на больших платформах — многомодальный ввод, создание контента с учетом видео и аудио, редактирование диалогов — и, по собственным измерениям BFL, по качеству преобразования текста в видео за 10 секунд эти два продукта практически неотличимы.

Преимущество Google в этом сравнении заключается в том, что Omni обычно доступен через API Gemini от Google по цене 0,10 доллара за секунду сгенерированного видео в разрешении 720p, или примерно за 10-секундный ролик.

Для немецкой компании на внутреннем рынке существует один региональный нюанс. Редактирование загруженного видео недоступно пользователям Omni Flash в Европейской экономической зоне, Швейцарии и Великобритании, хотя редактирование видео, сгенерированного самой моделью, разрешено. Европейская компания, желающая обработать имеющиеся видеоматериалы с помощью генеративного редактирования, в настоящее время не может этого сделать в Omni Flash.

Вот примерное руководство для предприятий, рассматривающих, на какие модели видеосистемы следует полагаться:

Модель

Максимальная продолжительность одного поколения

Максимальное разрешение

Ключевые ограничения

Цена за 10-секундный ролик (720p)

Цена за 10-секундный ролик (1080p)

Цена за 10-секундный ролик (4K)

Видео FLUX 3

20 секунд

Информация не указана; оценка проводится в разрешении 720p.

Ранний доступ; соглашение об уровне обслуживания и цены не опубликованы.

Не объявлено

Не объявлено

Не объявлено

HappyHorse 1.1

15 секунд

1080p

Нет 4K; закрытые веса

Не опубликовано (стоимость для реселлеров версии 1.0 составляет примерно 1,82 доллара США)

Не опубликовано (стоимость для реселлеров версии 1.0 составляет примерно 3,12 доллара США)

н/д

Veo 3.1

посекундная тарификация

4K

Поддерживает расширение клипа; предварительный просмотр.

4,00 доллара

4,00 доллара

6,00 долларов

Veo 3.1 Fast

посекундная тарификация

4K

Предварительный просмотр

1,00 долл.

1,20 доллара

3,00 доллара

Veo 3.1 Lite

посекундная тарификация

1080p

Нет 4K, нет расширения для клипа; предварительный просмотр.

0,50 доллара

0,80 доллара

н/д

Gemini Omni Flash

10 секунд (минимум 3 секунды)

720p при 24 кадрах в секунду

Предварительный просмотр и отсутствие доступа для ЕС.

1,00 долл.

н/д

н/д

Единая архитектура для создания медиаконтента и физического действия

FLUX 3 основан на Self-Flow, методе BFL для согласования многомодального понимания и генерации в рамках единой архитектуры, опубликованном еще в марте 2026 года.

Компания заявляет, что значительно увеличила вычислительные мощности и объем данных для одновременного обучения на видео, изображениях и аудио, и что тестирование показало, что генерация видео и прогнозирование действий не требуют отдельных основ — ту же архитектуру можно расширить для прогнозирования действий, не жертвуя тем, чему она научилась на видео.

«Мы ставим зрение в центр нашего подхода, потому что это наиболее насыщенная сигналами среда физического мира. Изображения передают структуру, изображения и видео обучают пространственным отношениям, видео обучает динамике, а действия выявляют причинно-следственные связи. Но одного зрения недостаточно, чтобы получить полную картину», — заявил Робин Ромбах, соучредитель и генеральный директор BFL, в предварительном заявлении, предоставленном VentureBeat. «Истинный интеллект означает восприятие мира: прогнозирование его изменений, принятие мер и извлечение уроков из результатов. Совместное обучение в рамках единой архитектуры — вот что приведет нас к этому, потому что каждый метод обучения усиливает другие. Аудио передает время, просодию и физические события, которые ускользают от зрения. Язык передает цели, абстракции и инструкции, которые пиксели не могут легко выразить».

В другом месте своего заявления он выразился более прямолинейно: «Нельзя обмануть реальность. Модель, которая обучается только на изображениях, может только генерировать изображения. Но мир состоит не из неподвижных кадров. Он движется, звучит, меняется и реагирует».

Компания BFL заявляет, что FLUX 3 ориентирован на креативные инструменты, медиа, дизайн, электронную коммерцию и физический ИИ, поддерживая создание видео с синхронизированным звуком, точное редактирование изображений, согласованность продукта и материалов в движении, многоязычную генерацию и прогнозирование действий роботов. Он уже тестируется компаниями Canva, Burda, Magnific (ранее Freepik), Krea и Picsart.

Для компаний, занимающихся разработкой креативного программного обеспечения, привлекательность заключается в консолидации. Единая платформа потенциально может поддерживать раскадровку, редактирование изображений, рендеринг продуктов, создание вариаций видео и локализацию без необходимости многократного перевода ресурсов и инструкций между разрозненными моделями.

Для команд, занимающихся робототехникой, потенциальная ценность заключается в повышении эффективности использования данных. Модели, которые уже кодируют движение, поведение объектов и физические изменения, могут нуждаться в менее специализированном обучении роботов, чем системы, начинающиеся с простых демонстрационных примеров.

На что действительно способен FLUX 3 Video

Наиболее конкретно описанной частью запуска является видеофункция, которая отвечает на вопрос, циркулировавший в виде слухов: FLUX 3 генерирует видеоклипы продолжительностью до 20 секунд со звуком за один раз.

Каждый видеовыход поставляется с собственным звуком. Для сравнения, HappyHorse 1.0 достигает максимальной продолжительности в 15 секунд в разрешении 1080p с синхронизированным звуком — хотя BFL не указала, в каком разрешении воспроизводятся её 20-секундные клипы, а опубликованные ею оценки проводились в разрешении 720p. Тем не менее, 20-секундный клип, созданный на основе одного запроса, является одним из самых длинных, достигнутых на сегодняшний день, и соответствует снятой с производства модели Sora от OpenAI.

В опубликованном компанией BFL списке возможностей отражены следующие возможности:

  • Генерация текста в видео.

  • Создание видеоконтента на основе изображений, либо путем анимации с использованием исходного кадра, либо с использованием изображений в качестве визуальных ориентиров.

  • Создание видеороликов из исходного клипа, перенос таких элементов, как конкретный персонаж, в новую сцену или контекст.

  • Генерация видео-аудио продолжения на основе существующих видео- и аудиовходов.

  • Генерация ключевых кадров для видео, позволяющая осуществлять контролируемые переходы между заданными моментами.

  • Многоязычный диалог.

  • Широкий спектр визуальных стилей и соотношений сторон, от съемок с помощью скрытой видеокамеры до анимации и кинематографических роликов.

  • Создание типографики и анимационный дизайн.

  • Объединение отдельных видеороликов в более длинные последовательности, состоящие из нескольких кадров.

Последний пункт – это то, на что командам, занимающимся корпоративным видеопроизводством, следует обратить особое внимание. BFL утверждает, что объединенные возможности позволяют создавать последовательности длительностью в несколько минут, при этом визуальные ориентиры обеспечивают согласованность персонажей в разных сценах. Если это подтвердится в производственных условиях, то будет решена проблема, которая препятствовала внедрению генеративного видео в большинство коммерческих производственных процессов: не качество клипа, а непрерывность между кадрами.

Это также та область, где конкуренция наиболее прямая. Главное обновление HappyHorse 1.1 — это R2V, или «ссылка на видео», которая принимает несколько эталонных изображений персонажей для обеспечения стабильности идентичности во всем сгенерированном видеоматериале — та же проблема, решаемая на входном уровне, а не посредством цепочки клипов. Alibaba также заявляет о синхронизации губ без смещения и специально нацелена на артефакты, которые указывают на то, что коммерческое видео, созданное с помощью ИИ, является синтетическим, включая жирность лица и чрезмерное повышение резкости. В этой категории разворачивается ожесточенная конкуренция за согласованность персонажей, и обе компании это понимают.

Компания BFL заявляет, что FLUX 3 Video уже демонстрирует особенно высокие показатели в обработке мимики человека, сопоставлении звуков с физическими событиями и многоязычном выводе. Что касается обработки изображений, компания утверждает, что предварительные оценки, проведенные в середине обучения, показывают значительное улучшение по сравнению с более ранними версиями FLUX в обработке сложных подсказок и генерации текста, включая высокоточный текст на нескольких языках. Данные по производительности обработки изображений и проценту успешных результатов не были опубликованы.

FLUX-mimic проверяет, могут ли видеомодели превратиться в модели роботов.

Компания BFL применяет свою концепцию унифицированной архитектуры через FLUX-mimic, видео-экшн-модель, созданную на основе FLUX 3 и разработанную совместно со швейцарской компанией Mimic Robotics, одним из первых партнеров, получивших ранний доступ.

В техническом блоге описываются два различных пути к прогнозированию действий: интеграция встроенной функции прогнозирования действий непосредственно в FLUX 3, масштабирование первоначальной работы по самообучению; и использование предварительно обученной видеобазы данных в качестве динамической основы, на которой можно дорабатывать специализированные модели действий с использованием ограниченного объема данных, специфичных для конкретной задачи. FLUX-mimic — это второй путь: база данных FLUX 3 в сочетании с опытом mimic в области обучения роботов и внедрения в производство решений для точного манипулирования объектами.

FLUX-mimic разработан для универсального управления роботами: он помогает роботам понимать визуальную сцену, предсказывать последствия действий и адаптироваться к новым задачам, используя гораздо меньше данных, специфичных для конкретной задачи.

Компании BFL и Mimic Robotics утверждают, что в зависимости от сложности задачи модель можно точно настроить для конкретной задачи манипулирования, используя всего 30 минут данных от робота, тогда как предыдущие подходы требовали 30 и более часов.

«Самая сложная часть робототехники — это данные, — заявил Элвис Нава, технический директор Mimic Robotics, в заявлении, предоставленном VentureBeat. — Каждая новая задача обычно означает часы, в течение которых робот повторяет одно и то же действие. Поскольку FLUX-mimic построен на основе передовых видеомоделей, которые уже понимают, как ведет себя физический мир, он осваивает новую задачу за минуты, а не за дни. Таким образом, мы можем совершить скачок вперед по сравнению с нынешним уровнем развития робототехники».

BFL утверждает, что модель, обученная только на изображениях, не может понять мир, который «движется, звучит, меняется и реагирует», и что именно физическое понимание позволяет создавать убедительные сгенерированные видеоматериалы. Google делает практически идентичное заявление в отношении Gemini Omni.

В документации для разработчиков упоминается «знание мира», сочетающее «понимание физики» с пониманием Gemini истории, науки и культурного контекста. Маркетинговая стратегия ещё более прямолинейна: «Большинство моделей ИИ просто предсказывают следующий пиксель для построения повествования или изображения. Gemini Omni отличается», — заявила компания в июне, отметив, что модель обладает «интуитивным пониманием таких сил, как гравитация, кинетическая энергия и гидродинамика, что обеспечивает более реалистичные движения, соответствующие логике реального мира».

Для корпоративных покупателей практическим следствием является то, что язык моделей мира не является конкурентным преимуществом. Две из трех ведущих систем видеонаблюдения сейчас позиционируют понимание физических параметров как свое главное преимущество, и ни одна из них не опубликовала бенчмарк, измеряющий это преимущество.

Не существует стандартного теста, позволяющего определить, ведет ли себя созданная вода как вода, падает ли упавший предмет с приемлемой скоростью или издает ли звук при ударе. Оценки человеческих предпочтений косвенно отражают некоторые из этих явлений. Ничто другое из предлагаемого не отражает их вовсе.

Использование открытых весов помогло сделать FLUX отраслевым стандартом.

Компания BFL официально запустилась летом 2024 года и за прошедшие два года завоевала известность в индустрии ИИ благодаря своей приверженности открытому исходному коду высококачественных моделей изображений, созданных с помощью ИИ, которые пользуются популярностью у разработчиков, творческих людей и предприятий.

Основатели компании, включая Ромбаха, Андреаса Блаттмана и Патрика Эссера, ранее участвовали в создании VQGAN, латентной диффузии и Stable Diffusion, последняя из которых является технологией с открытым исходным кодом, положившей начало широким возможностям генерации изображений с помощью ИИ и в настоящее время используемой многими компаниями и разработчиками генераторов изображений на основе ИИ.

Этот охват привел к коммерческому распространению. Модели FLUX теперь используются в функциях генерации контента в Adobe Photoshop, Picsart и Hermes Agent от Nous Research, а также на других платформах, и компания называет кинорежиссера Мартина Скорсезе в числе профессиональных пользователей.

Журнал Wired описал Black Forest Labs как относительно небольшую компанию, которая, тем не менее, стала ведущим конкурентом крупнейшим лабораториям искусственного интеллекта в Кремниевой долине. Модели FLUX занимают лидирующие позиции в тестах производительности обработки изображений и стали одними из самых скачиваемых моделей преобразования текста в изображения на платформе Hugging Face, где делятся кодом в области ИИ. Компания заявляет, что сейчас в ней работает команда из 100 человек во Фрайбурге и Сан-Франциско.

FLUX.1 Dev, FLUX.1 Kontext Dev, FLUX.1 Fill Dev и связанные с ними модели управления, выпущенные вскоре после основания компании, предоставили исследователям и разработчикам инструментов для творчества доступ к загружаемым контрольным точкам, локальному выводу данных и интеграции с такими фреймворками, как Hugging Face Diffusers и ComfyUI. Например, FLUX.1 Kontext Dev был выпущен как модель с открытыми весами для исследовательского и некоммерческого использования, а сгенерированные выходные данные разрешены для коммерческого использования в соответствии с применимой лицензией.

Компания продолжила эту тенденцию с выпуском FLUX.2 Dev в конце 2025 года — модели с открытыми весами, насчитывающей 32 миллиарда параметров и объединяющей генерацию и многоэтапное редактирование изображений. Black Forest Labs назвала её самой мощной моделью генерации и редактирования изображений с открытыми весами, доступной на момент запуска, и выпустила веса, эталонный код для вывода результатов и оптимизированные реализации для потребительских графических процессоров Nvidia.

FLUX 3 Dev повышает ставки в этой оценке. Предыдущие версии Dev были моделями для обработки изображений. Эта же описывается как многомодальная основа, охватывающая видео, аудио, изображения и прогнозирование действий — это означает, что единая лицензия будет определять, может ли компания локально развернуть модель, которая затрагивает как производство контента, так и физическое оборудование. BFL пока не предоставила информацию о своей лицензии, количестве параметров, квантизации или требованиях к оборудованию.

Компания позиционирует открытые веса как корпоративную функцию, а не как инициативу сообщества, утверждая, что они обеспечивают безопасное локальное развертывание с низкой задержкой для таких приложений, как системы управления роботами, и позволяют командам адаптировать FLUX 3 к своим собственным данным, продуктам и рабочим процессам.

Наряду с техническими характеристиками, стоит отметить и финансовую поддержку FLUX 3. Компания Black Forest Labs оценивается в 3,25 миллиарда долларов и привлекла более 450 миллионов долларов от инвесторов, включая a16z, AMP, Salesforce Ventures, Nvidia, General Catalyst, Adobe Ventures, Figma Ventures, Canva и T.Capital (подразделение Deutsche Telekom).

Источник: venturebeat.com

Оцените материал:

Поделиться
Понравилась статья? Расскажите другим
ВКонтакте
Читайте также
Новости робототехники Как интегрированные приводы улучшают производительность соединений гуманоидных роботов и системную интеграцию Архив рубрики ~Коротко из Telegram~ 🐼 ПАНДА НЕ ЖРЕТ ОПЕРАТИВКУ Релизнулся Lightpanda — ультралегкий браузер,… Архив рубрики ~Коротко из Telegram~ Разработчик запустил полностью локальное ИИ-радио: модель подбирает треки из библиотеки… Архив рубрики ~Коротко из Telegram~ Kimi-K3 теперь можно запустить даже на картошке — китайского убийцу… Архив рубрики ~Коротко из Telegram~ Мгновенное распознавание аудио и видео без подключения к интернету Vibe… Архив рубрики ~Коротко из Telegram~ Превращаем свой ПК в приватный ИИ-сервер — вышел ODS: он сам… Архив рубрики ~Коротко из Telegram~ Забираем имбовейший скилл — сделает из унылых README проектов на… Архив рубрики ~Коротко из Telegram~ Минцифры рекомендовало пользователям установить российские SSL-сертификаты безопасности из-за риска отзыва… Архив рубрики ~Коротко из Telegram~ Свежее видео разбирает то, о чём многие разработчики слышали,… Архив рубрики ~Коротко из Telegram~ Anthropic обновила бесплатный курс по Claude Code Теперь в нём 9… Архив рубрики ~Коротко из Telegram~ Делаем из старого Android нормальную вебку — вышла тулза, которая стримит… Архив рубрики ~Коротко из Telegram~ Apple официально представила Upgrade – новую программу лизинга своих устройств… Архив рубрики ~Коротко из Telegram~ В ИТМО собрали мультиагентную платформу для медицинских документов В ИТМО… Архив рубрики ~Коротко из Telegram~ Vals-Smith позволит тестировать ИИ-модели на вашей кодовой базе Бенчмарк-платформа Vals… Новости робототехники Как интегрированные приводы улучшают производительность соединений гуманоидных роботов и системную интеграцию Архив рубрики ~Коротко из Telegram~ 🐼 ПАНДА НЕ ЖРЕТ ОПЕРАТИВКУ Релизнулся Lightpanda — ультралегкий браузер,… Архив рубрики ~Коротко из Telegram~ Разработчик запустил полностью локальное ИИ-радио: модель подбирает треки из библиотеки… Архив рубрики ~Коротко из Telegram~ Kimi-K3 теперь можно запустить даже на картошке — китайского убийцу… Архив рубрики ~Коротко из Telegram~ Мгновенное распознавание аудио и видео без подключения к интернету Vibe… Архив рубрики ~Коротко из Telegram~ Превращаем свой ПК в приватный ИИ-сервер — вышел ODS: он сам… Архив рубрики ~Коротко из Telegram~ Забираем имбовейший скилл — сделает из унылых README проектов на… Архив рубрики ~Коротко из Telegram~ Минцифры рекомендовало пользователям установить российские SSL-сертификаты безопасности из-за риска отзыва… Архив рубрики ~Коротко из Telegram~ Свежее видео разбирает то, о чём многие разработчики слышали,… Архив рубрики ~Коротко из Telegram~ Anthropic обновила бесплатный курс по Claude Code Теперь в нём 9… Архив рубрики ~Коротко из Telegram~ Делаем из старого Android нормальную вебку — вышла тулза, которая стримит… Архив рубрики ~Коротко из Telegram~ Apple официально представила Upgrade – новую программу лизинга своих устройств… Архив рубрики ~Коротко из Telegram~ В ИТМО собрали мультиагентную платформу для медицинских документов В ИТМО… Архив рубрики ~Коротко из Telegram~ Vals-Smith позволит тестировать ИИ-модели на вашей кодовой базе Бенчмарк-платформа Vals…

Оставить комментарий