LTX-2.5: открытая world-модель NVIDIA генерирует 10-секундное видео за 6,8 секунды на RTX

Видеопроизводство смещается с облачных GPU на локальные: LTX выпустила LTX-2.5, открытую world-модель для генерации видео, real-time приложений и physical AI. Модель оптимизирована для локального инференса на NVIDIA RTX и DGX Spark, что снижает требования к VRAM. Релиз стал частью месячной серии NVIDIA по локальному ИИ и вышел в один день с открытой агентной моделью Nemotron 3.5 Lightning.

Что локальная генерация меняет для создателей

LTX-2.5 дает то, что раньше было доступно только студиям: настоящую согласованность. Встроенная multishot-генерация создает целую последовательность как единый результат, сохраняя внешность персонажа от кадра к кадру. Более мощная языковая основа Gemma 4 и новый декодер уменьшают артефакты в сценах с высокой динамикой. Все это работает на потребительской NVIDIA RTX прямо внутри ComfyUI. Один человек может закрепить фирменного персонажа или стиль с помощью быстрой LoRA-настройки — без студии, облака и передачи IP за пределы машины.

Весь производственный стек теперь помещается на одном рабочем столе: то, что требовало команды, съемочного дня, рендер-фермы и счета за облако, происходит на уже установленной RTX-карте. Дополнительные клипы не требуют платы за генерацию или метрированных кредитов. Это меняет подход: можно экспериментировать широко, пробовать десяток направлений вместо одной безопасной идеи и за ночь сгенерировать неделю контента.

Для авторов коротких видео и рекламных команд это особенно важно. Усталость от рекламы наступает обычно через 7–10 дней, поэтому узким местом были не идеи, а стоимость и время производства. Локальная генерация снимает это ограничение: варианты по одному брифу, тест десяти хуков, локализация для пяти рынков — все это доступно с одной RTX GPU на столе.

Скорость: цифры и сравнение

По опубликованному LTX бенчмарку image-to-video, 10-секундный клип создается за 6,8 секунды локально на 2x NVIDIA GB200 и за 23,7 секунды через LTX API. Самые быстрые закрытые альтернативы — Omni Flash, Grok 1.5 и Veo 3.1 — занимают от 52 до 70 секунд. Более медленные системы растягиваются еще сильнее: Seedance 2.0 — 196 секунд, FLUX 3 — 259, Seedance 2.5 — 317, Kling 3.0 Pro — 398. Локально LTX-2.5 генерирует быстрее длительности самого ролика, в 7,6 раза быстрее ближайшей закрытой альтернативы и примерно в 58 раз быстрее самой медленной.

Импульс NVIDIA в локальном ИИ

В течение августа NVIDIA акцентирует внимание на моделях и инструментах локальной ИИ-экосистемы. Nemotron 3.5 Lightning — открытая 30B-модель смеси экспертов для постоянно работающих агентов, а NeMo Switchyard — библиотека с открытым исходным кодом для маршрутизации шагов агента к подходящей модели. Открытые модели экосистемы NVIDIA масштабируются от RTX ПК до рабочих станций, дата-центров и облака. LTX-2.5 вписывается в эту историю как ускоренная world-модель для создателей, разработчиков и робототехнических команд.

Что такое LTX-2.5

Если LLM предсказывают следующее слово, world-модели предсказывают следующий момент. Они генерируют среды, моделируют их поведение и позволяют действовать внутри. Это основа для кино, рекламы, игр, симуляций и роботов. LTX называет семейство LTX самой используемой открытой world-моделью с более чем 33 миллионами загрузок и позиционирует LTX-2.5 как самую мощную версию. Открытые веса дают командам полный контроль над оборудованием, кастомизацией и IP.

Новое в архитектуре

LTX переработала почти все этапы пайплайна генерации, а не добавила функции к старому ядру:

  • Новый диффузионный видеодекодер — уменьшает визуальные артефакты в сценах с высокой динамикой, сохраняя высокую степень сжатия и соответствие исходному материалу.
  • Нативная multishot-генерация — выводит полную последовательность одним результатом, сохраняя персонажа, сцену и голос. Кастомная языковая основа Gemma 4 и промпт-усилитель улучшают понимание сложных многосубъектных запросов.
  • Diffusion Fidelity Rendering — строит движение и структуру в 8x сжатом по времени латентном пространстве, затем генерирует ключевые кадры высокой точности. Их количество адаптируется к сложности сцены и вычислительному бюджету.
  • Чекпоинт physical AI — предобученный чекпоинт для робототехники, основа для тонкой настройки на доменных данных.
  • Более сильная дистиллированная модель — то же качество при меньших затратах и более быстром инференсе для производственных объемов.

Кому подходит LTX-2.5

Кино- и видеостудии: multishot-согласованность и чистый декодер делают последовательности пригодными для реального производства. Студия Asteria уже создает оригинальные фильмы на LTX.

Авторы коротких видео и рекламные команды: локальная генерация без оплаты за клип превращает A/B-тестирование в стратегию — пакетные варианты за ночь, еженедельное обновление креативов, локализация без производственного бюджета.

Разработчики real-time приложений: Reactor запускает LTX-2.5 на своей низколатентной инфраструктуре для интерактивных аватаров, живых миров и робототехники.

Робототехника и physical AI: чекпоинт physical AI дает основу для тонкой настройки на данных, отличных от кинематографичных. Markov Robotics использует LTX для развития восприятия и движения физических систем.

Доступность и лицензирование

LTX-2.5 доступна с открытыми весами на Hugging Face, нативно в ComfyUI и через LTX API. Модель работает на чем угодно — от GPU дата-центра до Mac — и бесплатна для организаций с годовой выручкой ниже 10 миллионов долларов. Код опубликован на GitHub, документация прилагается.

Совсем недавно Meta выпустила Muse Glimmer — 30B-модель с открытыми весами, помещающуюся в 24 ГБ VRAM, а NVIDIA представила VoiceChat 11B с задержкой 448 мс. Эти релизы вместе с LTX-2.5 показывают общий тренд: открытые модели, ускоренные локально, становятся стандартной производственной инфраструктурой.

Частые вопросы

Что такое world-модель и чем она отличается от LLM?

World-модель предсказывает следующий момент сцены, а не следующее слово. Она генерирует среды, моделирует их поведение и позволяет действовать внутри них — это основа для видео, игр, симуляций и робототехники.

На каком оборудовании можно запустить LTX-2.5?

Модель оптимизирована для NVIDIA RTX GPU и DGX Spark, но работает на любом оборудовании — от GPU дата-центра до Mac.

Сколько стоит использование LTX-2.5?

Для организаций с годовой выручкой до 10 миллионов долларов модель бесплатна. Веса открыты на Hugging Face, код — на GitHub.

Насколько LTX-2.5 быстрее закрытых конкурентов?

10-секундный клип на 2x GB200 создается за 6,8 секунды. Ближайшая закрытая альтернатива занимает 52 секунды — в 7,6 раза дольше.

Что такое multishot-генерация?

Это генерация целой последовательности кадров одним результатом: персонаж, сцена и голос остаются согласованными от кадра к кадру, что критично для рекламных кампаний.

Нужен ли облачный аккаунт или API-ключ?

Нет. Модель работает локально через ComfyUI, без облака и без передачи IP за пределы машины.

Есть ли чекпоинт для робототехники?

Да, предобученный чекпоинт physical AI дает основу для тонкой настройки на доменных данных, отличных от кинематографичных.

Источник: marktechpost.com