Видеопроизводство смещается с облачных GPU на локальные: LTX выпустила LTX-2.5, открытую world-модель для генерации видео, real-time приложений и physical AI. Модель оптимизирована для локального инференса на NVIDIA RTX и DGX Spark, что снижает требования к VRAM. Релиз стал частью месячной серии NVIDIA по локальному ИИ и вышел в один день с открытой агентной моделью Nemotron 3.5 Lightning.
Что локальная генерация меняет для создателей
LTX-2.5 дает то, что раньше было доступно только студиям: настоящую согласованность. Встроенная multishot-генерация создает целую последовательность как единый результат, сохраняя внешность персонажа от кадра к кадру. Более мощная языковая основа Gemma 4 и новый декодер уменьшают артефакты в сценах с высокой динамикой. Все это работает на потребительской NVIDIA RTX прямо внутри ComfyUI. Один человек может закрепить фирменного персонажа или стиль с помощью быстрой LoRA-настройки — без студии, облака и передачи IP за пределы машины.
Весь производственный стек теперь помещается на одном рабочем столе: то, что требовало команды, съемочного дня, рендер-фермы и счета за облако, происходит на уже установленной RTX-карте. Дополнительные клипы не требуют платы за генерацию или метрированных кредитов. Это меняет подход: можно экспериментировать широко, пробовать десяток направлений вместо одной безопасной идеи и за ночь сгенерировать неделю контента.
Для авторов коротких видео и рекламных команд это особенно важно. Усталость от рекламы наступает обычно через 7–10 дней, поэтому узким местом были не идеи, а стоимость и время производства. Локальная генерация снимает это ограничение: варианты по одному брифу, тест десяти хуков, локализация для пяти рынков — все это доступно с одной RTX GPU на столе.
Скорость: цифры и сравнение
По опубликованному LTX бенчмарку image-to-video, 10-секундный клип создается за 6,8 секунды локально на 2x NVIDIA GB200 и за 23,7 секунды через LTX API. Самые быстрые закрытые альтернативы — Omni Flash, Grok 1.5 и Veo 3.1 — занимают от 52 до 70 секунд. Более медленные системы растягиваются еще сильнее: Seedance 2.0 — 196 секунд, FLUX 3 — 259, Seedance 2.5 — 317, Kling 3.0 Pro — 398. Локально LTX-2.5 генерирует быстрее длительности самого ролика, в 7,6 раза быстрее ближайшей закрытой альтернативы и примерно в 58 раз быстрее самой медленной.
Импульс NVIDIA в локальном ИИ
В течение августа NVIDIA акцентирует внимание на моделях и инструментах локальной ИИ-экосистемы. Nemotron 3.5 Lightning — открытая 30B-модель смеси экспертов для постоянно работающих агентов, а NeMo Switchyard — библиотека с открытым исходным кодом для маршрутизации шагов агента к подходящей модели. Открытые модели экосистемы NVIDIA масштабируются от RTX ПК до рабочих станций, дата-центров и облака. LTX-2.5 вписывается в эту историю как ускоренная world-модель для создателей, разработчиков и робототехнических команд.
Что такое LTX-2.5
Если LLM предсказывают следующее слово, world-модели предсказывают следующий момент. Они генерируют среды, моделируют их поведение и позволяют действовать внутри. Это основа для кино, рекламы, игр, симуляций и роботов. LTX называет семейство LTX самой используемой открытой world-моделью с более чем 33 миллионами загрузок и позиционирует LTX-2.5 как самую мощную версию. Открытые веса дают командам полный контроль над оборудованием, кастомизацией и IP.
Новое в архитектуре
LTX переработала почти все этапы пайплайна генерации, а не добавила функции к старому ядру:
- Новый диффузионный видеодекодер — уменьшает визуальные артефакты в сценах с высокой динамикой, сохраняя высокую степень сжатия и соответствие исходному материалу.
- Нативная multishot-генерация — выводит полную последовательность одним результатом, сохраняя персонажа, сцену и голос. Кастомная языковая основа Gemma 4 и промпт-усилитель улучшают понимание сложных многосубъектных запросов.
- Diffusion Fidelity Rendering — строит движение и структуру в 8x сжатом по времени латентном пространстве, затем генерирует ключевые кадры высокой точности. Их количество адаптируется к сложности сцены и вычислительному бюджету.
- Чекпоинт physical AI — предобученный чекпоинт для робототехники, основа для тонкой настройки на доменных данных.
- Более сильная дистиллированная модель — то же качество при меньших затратах и более быстром инференсе для производственных объемов.
Кому подходит LTX-2.5
Кино- и видеостудии: multishot-согласованность и чистый декодер делают последовательности пригодными для реального производства. Студия Asteria уже создает оригинальные фильмы на LTX.
Авторы коротких видео и рекламные команды: локальная генерация без оплаты за клип превращает A/B-тестирование в стратегию — пакетные варианты за ночь, еженедельное обновление креативов, локализация без производственного бюджета.
Разработчики real-time приложений: Reactor запускает LTX-2.5 на своей низколатентной инфраструктуре для интерактивных аватаров, живых миров и робототехники.
Робототехника и physical AI: чекпоинт physical AI дает основу для тонкой настройки на данных, отличных от кинематографичных. Markov Robotics использует LTX для развития восприятия и движения физических систем.
Доступность и лицензирование
LTX-2.5 доступна с открытыми весами на Hugging Face, нативно в ComfyUI и через LTX API. Модель работает на чем угодно — от GPU дата-центра до Mac — и бесплатна для организаций с годовой выручкой ниже 10 миллионов долларов. Код опубликован на GitHub, документация прилагается.
Совсем недавно Meta выпустила Muse Glimmer — 30B-модель с открытыми весами, помещающуюся в 24 ГБ VRAM, а NVIDIA представила VoiceChat 11B с задержкой 448 мс. Эти релизы вместе с LTX-2.5 показывают общий тренд: открытые модели, ускоренные локально, становятся стандартной производственной инфраструктурой.
Частые вопросы
Что такое world-модель и чем она отличается от LLM?
World-модель предсказывает следующий момент сцены, а не следующее слово. Она генерирует среды, моделирует их поведение и позволяет действовать внутри них — это основа для видео, игр, симуляций и робототехники.
На каком оборудовании можно запустить LTX-2.5?
Модель оптимизирована для NVIDIA RTX GPU и DGX Spark, но работает на любом оборудовании — от GPU дата-центра до Mac.
Сколько стоит использование LTX-2.5?
Для организаций с годовой выручкой до 10 миллионов долларов модель бесплатна. Веса открыты на Hugging Face, код — на GitHub.
Насколько LTX-2.5 быстрее закрытых конкурентов?
10-секундный клип на 2x GB200 создается за 6,8 секунды. Ближайшая закрытая альтернатива занимает 52 секунды — в 7,6 раза дольше.
Что такое multishot-генерация?
Это генерация целой последовательности кадров одним результатом: персонаж, сцена и голос остаются согласованными от кадра к кадру, что критично для рекламных кампаний.
Нужен ли облачный аккаунт или API-ключ?
Нет. Модель работает локально через ComfyUI, без облака и без передачи IP за пределы машины.
Есть ли чекпоинт для робототехники?
Да, предобученный чекпоинт physical AI дает основу для тонкой настройки на доменных данных, отличных от кинематографичных.
Источник: marktechpost.com