LTX-2.5 способен сгенерировать 10-секундное видео с использованием ИИ из изображения всего за 6,8 секунды на суперчипах Nvidia — и это при том, что его весовые коэффициенты открыты.
Карл Франзен
Компания LTX, специализирующаяся на моделях открытого мира и отделившаяся от Lightricks, сегодня выпустила LTX-2.5, новейшую версию своей модели видео и «мира» с открытыми весами. Она интегрирована в ComfyUI, инструмент для организации рабочих процессов на основе узлов, ставший де-факто средой прототипирования для открытых генеративных медиа, благодаря стратегическому партнерству между двумя компаниями, заключенному в день запуска.
Модель уже доступна в виде открытых весов на Hugging Face, внутри ComfyUI и через API LTX для команд, которым требуется управляемая генерация. Для организаций с годовым доходом менее 10 миллионов долларов использование бесплатно; более крупные компании заключают лицензионное соглашение. LTX заявляет, что количество загрузок её моделей превысило 33 миллиона, что делает семейство LTX самой используемой линейкой моделей «открытого мира» на рынке.
В преддверии запуска VentureBeat эксклюзивно побеседовал с соучредителем и генеральным директором LTX Зеевом Фарбманом и соучредителем и генеральным директором ComfyUI Йоландом Яном о релизе, партнерстве и о том, почему обе компании делают ставку на то, что открытые веса, а не закрытые API, завоюют рынок видео и моделей мира.
«Мы стараемся поддерживать ту же эффективность и скорость вывода, которыми мы известны, но при этом постоянно повышаем качество», — сказал Фарбман. «В этом релизе мы внедряем множество интересных нововведений: поддержку многокадрового обучения, диффузионный декодер для повышения качества, новые режимы обусловливания, улучшенную поддержку авторегрессионных моделей, которые имеют решающее значение для сценариев использования в реальном времени и робототехники».
Что нового в LTX-2.5?
Согласно заявлению компании, LTX-2.5 перестраивает практически каждый этап конвейера генерации, а не просто добавляет новые возможности к старому ядру. Изменения в заголовке:
-
Новый декодер диффузионного видео , который уменьшает визуальные артефакты в видеоматериалах с высокой скоростью движения и восстанавливает мелкие детали, такие как текст и лица, сохраняя при этом высокий коэффициент сжатия LTX.
-
Встроенная функция генерации многокадровых изображений , которая преобразует всю последовательность в единый выходной файл, сохраняя согласованность персонажей, сцен и голоса во всех монтажных склейках, вместо того чтобы сшивать воедино отдельные сгенерированные кадры.
-
Специально разработанная языковая платформа Gemma 4 и выделенный инструмент для улучшения обработки сложных многотематических запросов.
-
Предварительно обученная контрольная точка, настроенная для физического ИИ и робототехники, предоставляет командам основу для тонкой настройки на данных предметной области, которые совершенно не похожи на кинематографическое видео.
-
Значительно улучшенная упрощенная модель , обеспечивающая качество, близкое к качеству полной модели, при меньших затратах и более быстрой обработке результатов, а благодаря оптимизации, проведенной совместно с NVIDIA, работает локально на графических процессорах NVIDIA RTX с уменьшенными требованиями к памяти.
Компания утверждает, что стоимость составляет примерно одну восьмую, а время рендеринга — одну седьмую по сравнению с аналогичными моделями, при этом результаты работы доступны на оборудовании от графических процессоров центров обработки данных до компьютеров Mac.
Насколько быстро и качественно, по словам LTX, это работает.
Наиболее впечатляющая цифра в рекламных материалах LTX — это скорость: компания заявляет, что LTX-2.5 генерирует 10-секундный видеоролик в формате 720p за 6,8 секунды быстрее, чем в реальном времени.
Однако следует учитывать особенности оборудования. Эти данные были получены в режиме автономной работы на двух топовых процессорах NVIDIA GB200 в стабильном режиме, что значительно превосходит возможности большинства команд; та же задача, выполненная через собственный управляемый API LTX, заняла 23,7 секунды, хотя и с более высоким разрешением 1080p (API не поддерживает разрешение 720p).

По результатам комплексных измерений конкурирующих API в рамках одной и той же задачи, проведенных компанией, Google Gemini Omni Flash показал время 52 секунды, xAI Grok 1.5 — 63 секунды, Google Veo 3.1 — 70 секунд (для 8-секундного ролика), MiniMax H3 — 180 секунд, ByteDance Seedance 2.5 — 317 секунд, а Kuaishou Kling 3.0 Pro — 398 секунд.
Что касается качества, LTX представила результаты слепых сравнительных тестов, в которых эксперты голосовали за видеоролики, созданные на основе одного и того же запроса, не зная, какая модель создала какой ролик.
LTX-2.5 показала 67% побед, немного опередив Seedance 2.5 с 65%, Gemini Omni Flash с 55%, MiniMax H3 с 50%, Seedance 2.0 с 44%, Wan 2.6 с 42% и FLUX 3 с 28%.
Все эти данные предоставлены поставщиком, измерены или заказаны самой компанией LTX, не проверены независимыми экспертами, и компания называет результаты предварительными, отмечая, что ожидает их «изменения по мере расширения оценки». Это ориентировочные утверждения, которые покупатель должен проверить на своих собственных рабочих нагрузках, а не устоявшиеся рейтинги.
В рекламных материалах также акцент делается на условиях развертывания, а не на чистой производительности: LTX-2.5 работает на любом графическом процессоре с минимальным объемом видеопамяти 16 ГБ, развертывается локально, на периферии сети или через API, не требует обязательной маркировки на выходных данных и может быть точно настроен на основе собственных данных и интеллектуальной собственности клиента. Эта гибкость отличает компанию от конкурентов, работающих только через закрытый API, и от конкурентов с открытыми лицензиями, чьи возможности недоступны в США и Европе или чьи лицензии ограничивают возможность точной настройки.
Ставка против бизнес-модели API
Для Фарбмана этот релиз — еще один этап стратегии, которая началась как реакция на консолидацию отрасли вокруг закрытых моделей.
«Мы начали с собственных моделей из необходимости, потому что примерно в то время, когда появилась Sora, мы поняли, что все крупные игроки пытаются закрыть свои модели, а работа через API просто не подходит для многих предприятий, включая те, которые мы хотели создать», — сказал он.
Он пояснил, что технический аргумент заключается в том, что видео- и мировые модели имеют принципиально более широкую область применения, чем языковые модели.
«В случае с LLM-моделями область применения API довольно узкая, мы обычно задаем какой-то вопрос, передаем слова и получаем слова в ответ», — сказал Фарбман. «В случае с видеомоделями, моделями мира существует множество различных вариантов использования, которые требуют от людей доступа к весам и создания потоков, которые действительно работают для них».
Он прямо заявил, что эта открытость не является благотворительностью. «Мы определенно не занимаемся этим из филантропии», — сказал он. «Наше решение — это открытые весы с лицензиями, которые позволяют частным лицам и компаниям с доходом ниже определенного уровня использовать эту модель бесплатно, а после достижения успеха — заключать с нами какое-либо лицензионное соглашение».
«Мы пытаемся создать модель, на основе которой строители могли бы уверенно строить», — добавил он. «Мы говорим: ребята, открытые весовые категории — это не какая-то разовая благотворительная авантюра. Это наша стратегия. Мы считаем, что это правильный способ поддержки этих моделей, и мы будем продолжать в том же духе».
От Facetune до моделей мира и графа узлов, ставшего стандартом.
LTX выросла из Lightricks, компании со штаб-квартирой в Иерусалиме, наиболее известной своими приложениями для творчества, такими как Facetune и Videoleap. Lightricks, развиваясь без внешнего финансирования и став прибыльной компанией, в 2022 году перешла к разработке базовых моделей, запустила свою платформу для создания фильмов LTX Studio в начале 2024 года и выпустила свою первую модель LTX Video с открытыми весами (LTXV) в ноябре 2024 года, а затем и версию с 13 миллиардами параметров в мае 2025 года. Фарбман стал соучредителем компании вместе с техническим директором Яроном Ингером и директором по маркетингу Ниром Похтером, и теперь бренд LTX возглавляет глобальный бизнес по разработке моделей, имея офисы в Нью-Йорке, Лондоне и Чикаго.
ComfyUI зародился в январе 2023 года как побочный проект с открытым исходным кодом, созданный анонимным разработчиком под ником «comfyanonymous», который разработал графический интерфейс на основе узлов для Stable Diffusion, позволяющий пользователям объединять модели и этапы обработки в повторяющиеся визуальные рабочие процессы. С тех пор он стал одним из самых быстрорастущих проектов с открытым исходным кодом в области генеративных медиа — стандартной среды, где новые модели изображений и видео тестируются, комбинируются и внедряются в производство. Сейчас его поддерживает компания Comfy Org, которая привлекла 17 миллионов долларов для продолжения разработки инструмента. Ян, один из соучредителей, является его генеральным директором.
Почему ComfyUI — это лучший способ внедрения в корпоративной среде
Для читателей, задающихся вопросом, почему модельная компания и компания, разрабатывающая инструменты, запускаются одновременно, ответ Фарбмана был необычайно откровенным: платные клиенты LTX приходят в ComfyUI.
«Многие наши клиенты начинают свой путь с Comfy», — сказал он. «Это уже чрезвычайно популярная в отрасли система прототипирования, и многие потенциальные клиенты обращаются к нам, уже разобравшись с рабочим процессом внутри Comfy. Она уже работает, поэтому для нас очевидно, что мы должны обеспечить поддержку интеграции Comfy с нуля, поскольку это, по сути, наш канал привлечения клиентов».
Ян описал роль ComfyUI как связующего звена открытой экосистемы. «Comfy по своей сути является надстройкой, предоставляющей людям доступ к открытым моделям весов, которые можно использовать для вывода результатов на локальном компьютере, или же к закрытым моделям через нашу партнерскую систему узлов», — сказал он. «В конечном итоге, [они] объединяют все вместе в рабочий процесс, который расширяет возможности для различных задач, от творческой стороны до обработки данных и сценариев робототехники».
Ян утверждал, что именно этот «маховик» поддерживает коммерческую жизнеспособность открытых моделей: «Мы помогаем продвигать и распространять эти модели по всему миру… люди создают на их основе всевозможные рабочие процессы и инновации в области моделей, и это способствует дальнейшему распространению этих моделей в студиях или лабораториях робототехники. В конечном итоге эти компании приобретают лицензии, а затем вносят часть полученной прибыли обратно в LTX и остальную экосистему».
Что должны знать предприятия
Оба руководителя опровергли предположение, что видеомодель предназначена только для создания видеороликов. Фарбман перечислил ряд корпоративных внедрений, которые имеют мало общего с кинематографическими клипами.
«У нас есть клиенты, которые пытаются понять, как, например, создавать вычислительную фотографию с использованием моделей диффузии, обрабатывая поток необработанных пикселей, поступающих с датчиков, который обычно очень зашумлен, и пытаясь уменьшить этот шум», — сказал он. «Или представьте себе производственные студии, которые пытаются понять, как создавать визуальные эффекты, как моделировать воду, как превращать день в ночь. Или представьте себе анимационные студии: они пытаются оптимизировать свой рабочий процесс, где аниматоры создают ключевые кадры, а затем система использует их для интерполяции».
Для предприятий, раздумывающих, с чего начать, рекомендуемый путь — тот, который, вероятно, уже прошли их собственные сотрудники. «Многие предприятия уже внедрили Comfy, и я думаю, что многие другие последуют их примеру», — сказал Фарбман. «Он обеспечивает необходимый уровень структуры, позволяющий вносить множество корректировок, но при этом значительно упрощает многие вещи… Как правило, предприятия обращаются к нам после того, как сотрудники внутри компании уже поработали с этой моделью, поработали с Comfy».
Ян описал устойчивую двухэтапную схему среди студий и компаний, уже использующих LTX и другие открытые модели в производстве. «У них есть свои исследования, или НИОКР, творческий процесс, всё что угодно», — сказал он. «Время от времени некоторые из этих процессов становятся достаточно хорошими, чтобы перейти к какой-либо производственной среде. И где-то по пути начинается обсуждение корпоративного уровня. С нашей стороны это больше касается инструментов, а со стороны LTX — лицензирования».
Поскольку параметры являются открытыми, весь этап экспериментирования может проходить на собственном оборудовании компании, без оплаты за каждое поколение и без вывода данных или интеллектуальной собственности за пределы ее систем, что является важным отличием для предприятий, работающих с конфиденциальными видеоматериалами, авторскими правами или регулируемыми данными. Коммерческий эффект достигается только при масштабировании: организациям с годовым доходом более 10 миллионов долларов требуется лицензия.
Ян сформулировал ставки для компаний, которые развиваются медленнее, в более резких терминах. «Эта тенденция коренным образом изменит всю креативную индустрию», — сказал он. «Студии изо всех сил пытаются понять, как нам двигаться вперед и как нам не отставать, а иногда и вовсе не отставать от волны внедрения ИИ».
Разработчики, приложения реального времени и периферийные вычисления
Для разработчиков программного обеспечения этот релиз подчеркивает растущую популярность технологии реального времени. Наряду с ComfyUI, LTX назвала еще двух партнеров по запуску: Asteria, киностудию, занимающуюся разработкой фильмов и видеороликов на основе искусственного интеллекта и создающую оригинальные проекты на платформе LTX, и Reactor, платформу для разработчиков, которая запускает LTX-2.5 на инфраструктуре с низкой задержкой для создания интерактивных аватаров, живых миров и рабочих нагрузок робототехники в реальном времени, позволяя разработчикам создавать готовые к производству приложения в реальном времени без необходимости самостоятельной настройки этой инфраструктуры.
Ян привёл вирусный пример того, что становится возможным благодаря открытым весам и низкой задержке: Flipbook, интерактивный проект, распространившийся на Reddit, в котором целый мир, по которому можно кликать, генерируется на лету. «Всё, что люди видят в этом интерфейсе, генерируется с помощью модели LTX, транслируемой в реальном времени», — сказал он. «Это среда или мир, где в любом месте, куда вы кликаете, генерируется совершенно новое взаимодействие… Такой опыт и эксперименты не существовали бы без модели с открытыми весами, без производительности LTX».
Фарбман заявил, что эффективность на периферии — это целенаправленная задача проектирования, а не побочный эффект. «Для нас очень важно создать чрезвычайно эффективную модель, которую люди смогут запускать на периферийных устройствах, как на потребительском оборудовании, так и вблизи периферии с использованием физического ИИ», — сказал он, признавая при этом неустанный темп развития этой области: «В наши дни практически невозможно взять отпуск. Все развивается так быстро, что пока вы выпускаете одну модель, вы уже глубоко погружены в обучение другой, и новые статьи появляются ежедневно».
Кинопроизводители: виртуальное производство сейчас, более лёгкие склоны потом.
Ян считает, что для профессиональных кинематографистов и студий модели реального мира меняют сам процесс производства, сокращая разрыв между съемкой и постпродакшеном. «В наши дни модели реального времени, или модели мира, внедряются в студиях как часть так называемого виртуального производства, что означает, что вы можете снять фильм, а затем сразу же получить результат, близкий к тому, что будет на этапе постпродакшена», — сказал он. «Это дает продюсеру или режиссеру гораздо больше возможностей сказать: „Хорошо, вот что я хочу“, или „Это не то, что я хочу, позвольте мне уточнить“. В то время как раньше весь голливудский конвейер, на мой взгляд, представлял собой огромный беспорядок, где все постоянно приходится передавать между множеством отделов».
Он также предостерег от слишком буквального толкования сравнений моделей «лицом к лицу», учитывая, насколько по-разному модели специализируются в анимации, фотореализме, играх, 3D и робототехнике. «Разные модели просто обладают разными характеристиками», — сказал он. «Это как сравнивать Майкла Фелпса, например, с Майклом Джорданом. Это не сравнение того, кто лучше как спортсмен, здесь просто разные специализации».
Что касается начинающих и независимых разработчиков, которых пугает печально известная сложность освоения ComfyUI, Ян прямо заявил, что инструмент частично им поможет, но лишь частично.
«Это чем-то похоже на катание на лыжах, — сказал он. — Есть пологие склоны, по которым можно спускаться с помощью Comfy, и мы надеемся, что сможем создать все больше и больше таких пологих склонов в целом. Но мы никогда не пожертвуем существованием трасс двойной сложности, потому что настоящим техническим специалистам, профессиональным креативщикам действительно нужна такая мощная платформа, без которой они не смогли бы обойтись. В этом и заключается наше главное отличие от инструментов для творчества, подобных мобильным приложениям».
LTX-2.5 доступен уже сегодня в Hugging Face, в ComfyUI и через API LTX.
Источник: venturebeat.com
Похожие записи
Оцените материал:
Похожие записи
Lucid Motors устанавливает рекорд: продажи Gravity растут, а налоговый вычет истекает
07.10.2025
Этот робот, напечатанный на 3D-принтере, работает на воздухе, а не на электричестве
22.06.2025
4 слабых места, которые есть у любого конкурента — и как найти их за час
24.05.2026Присоединяйтесь и подпишитесь на рассылку самых свежих новостей по Email
Получайте свежие новости и идеи на почту. Без спама — только самое интересное.
Нажимая «Подписаться», вы соглашаетесь с политикой конфиденциальности.
