Google выпустила производственное обновление своей мультимодальной модели генерации и редактирования видео — Gemini Omni 1.1 Flash (gemini-omni-1.1-flash). Главное изменение: модель стала не просто генератором, а управляемым инструментом. Расширение сцены теперь учитывает до 10 секунд предыдущего контекста вместо одного финального кадра, можно зафиксировать первый и последний кадры для контроля движения камеры, черновики рендерятся в 360p за треть стоимости 720p, а финальные версии масштабируются до 4K. Видеоклипы можно передавать как референсы для сохранения внешности персонажа.
Архитектура и ключевые возможности
Gemini Omni Flash построена на трёх свойствах, которые Google отличает от предыдущих видеомоделей: нативная мультимодальность (текст, изображение, аудио и видео обрабатываются вместе), разговорное редактирование через Interactions API и мировые знания, унаследованные от Gemini. Редактирование является stateful: вы передаёте previous_interaction_id, и модель применяет ваше изменение, сохраняя то, что вы не упоминали, без повторной загрузки предыдущего видео.
Расширение сцены — главное изменение
Omni 1.1 анализирует до 10 секунд предыдущего контекста при продолжении клипа. Google утверждает, что предыдущие модели учитывали только последнюю секунду. Расширения выполняются шагами по 10 секунд до суммарных 40 секунд, а модель генерирует продолжение на 3–10 секунд за один вызов. Некоторые финальные кадры входного видео редактируются, чтобы шов был непрерывным.
Ограничения конкретны: расширение добавляется только в конец клипа — без вставки в середину или в начало. Загружаемые входные видео должны быть не длиннее 10 секунд, если только вы не расширяете сгенерированное моделью видео в многоходовом диалоге. Нельзя добавить новый диалог при расширении загруженного видео, где кто-то говорит; разговорная речь поддерживается в многоходовом расширении через previous_interaction_id.
Ключевые кадры и видеореференсы
Теперь можно указать первый и последний кадр, и модель сгенерирует непрерывное видео между ними — это механизм, стоящий за орбитальными движениями камеры, наездами (dolly-zoom) и бесшовными циклами. Промпты связывают медиа с ролями через теги: , , и .
Видеореференсы принимают максимум три клипа длиной до трёх секунд каждый и лучше всего работают для сохранения внешности. Аудио внутри видеореференса игнорируется. Рассуждение по нескольким видео не поддерживается и может ухудшить результат.
Контроль стоимости: черновик в 360p, финал в 4K
Параметр resolution в response_format принимает значения 360p, 720p (по умолчанию), 1080p и 4k, причём два верхних значения — это апскейл. Google сообщает, что превью в 360p генерируются до 60% быстрее и стоят треть от стоимости 720p, основываясь на пропускной способности системы для 360p против 720p. Это делает цикл «черновик — затем апскейл» предполагаемым производственным паттерном: дешёвые итерации, один финальный рендер.
Цены, происхождение и ограничения
Вход стоит $1,50 за 1 млн токенов (текст, изображение, видео, аудио). Выход — $9,00 за 1 млн текстовых токенов и $17,50 за 1 млн видеотокенов. Видео тарифицируется из расчёта 5 792 токена за секунду видео в 720p, что даёт примерно $0,10 за секунду по стандартным ценам.
Каждое сгенерированное видео несёт водяной знак SynthID — невидимый для зрителей, но программно обнаруживаемый для подтверждения происхождения. Заметные пробелы: нет системных инструкций, temperature, top_p, стоп-последовательностей и негативных промптов (негативы задаются в тексте промпта); редактирование голоса не поддерживается; аудиореференсы не поддерживаются; URL YouTube нельзя использовать как источник. Английский полностью поддерживается; другие языки не оценивались. Для выходных данных объёмом более 4 МБ используйте delivery="uri" и опрашивайте Files API, пока файл не станет ACTIVE.
Google называет Adobe (Firefly), Figma Weave, GMI Cloud и Runway клиентами, уже использующими Omni Flash в производстве. Модель также доступна в Google Flow для подписчиков AI Plus, Pro и Ultra, с расширением сцены в приложении Gemini.
Ключевые выводы
- Расширение сцены теперь читает 10 секунд предыдущего контекста вместо одной последней секунды и накапливается до 40 секунд суммарно.
- Интерполяция первого/последнего кадра плюс теги дают покадровый контроль камеры и персонажа.
- Черновики в 360p генерируются до 60% быстрее и стоят треть от стоимости 720p; 1080p и 4K — это апскейл.
- Только платный тариф — около $0,10 за секунду видео в 720p, без бесплатного уровня и без выделенной пропускной способности.
Частые вопросы
Кому нужна эта модель?
Видеопродакшн-студиям, маркетинговым отделам и разработчикам, создающим инструменты генеративного видео. Возможность дёшево итерировать черновики в 360p и получать финал в 4K делает её пригодной для реальных рабочих процессов, а не только для экспериментов.
Чем Omni 1.1 Flash отличается от предыдущей версии?
Главное — расширение сцены: теперь учитывается до 10 секунд контекста вместо одной секунды. Добавлены контроль первого и последнего кадра, видеореференсы для сохранения внешности персонажа и апскейл до 4K. Стоимость черновиков в 360p снижена до трети от 720p.
Как работает расширение сцены до 40 секунд?
Расширение выполняется шагами по 10 секунд, каждый вызов генерирует продолжение на 3–10 секунд. Модель анализирует до 10 секунд предыдущего контекста. Суммарно можно нарастить клип до 40 секунд. Расширять можно только конец клипа, не начало и не середину.
Что такое контроль первого и последнего кадра?
Вы задаёте первый и последний кадр через теги и , а модель генерирует непрерывное видео между ними. Это позволяет создавать орбитальные движения камеры, наезды и бесшовные циклы.
Как сохранить внешность персонажа между сценами?
Используйте теги и передайте до трёх видеоклипов длиной до трёх секунд каждый. Аудио в референсах игнорируется. Рассуждение по нескольким видео не поддерживается и может ухудшить результат.
Сколько стоит генерация видео?
Вход — $1,50 за 1 млн токенов, выход — $9,00 за 1 млн текстовых токенов и $17,50 за 1 млн видеотокенов. Секунда видео в 720p стоит примерно $0,10. Черновики в 360p — треть стоимости 720p.
Какие ограничения у модели?
Не поддерживаются: системные инструкции, temperature, top_p, стоп-последовательности, негативные промпты, редактирование голоса, аудиореференсы, URL YouTube как источник. Английский полностью поддерживается, другие языки не оценивались. Для файлов больше 4 МБ нужен delivery="uri" и опрос Files API.
Есть ли бесплатный тариф?
Нет. Модель доступна только на платной основе через Gemini API, Google AI Studio и Gemini Enterprise Agent Platform. Также она есть в Google Flow для подписчиков AI Plus, Pro и Ultra.
Как проверить происхождение сгенерированного видео?
Каждое видео несёт водяной знак SynthID — он невидим для зрителей, но программно обнаруживаем. Это позволяет подтвердить, что видео создано моделью Google, а не человеком или другой системой.
Где уже используется модель?
Google называет Adobe (Firefly), Figma Weave, GMI Cloud и Runway как производственных пользователей. Модель также доступна в Google Flow для подписчиков AI Plus, Pro и Ultra, с расширением сцены в приложении Gemini. Похожие возможности для работы с видео есть и у других моделей — например, Gemini 3.5 Transcribe показывает, как Google развивает мультимодальные API, а Grok 4.6 демонстрирует рост контекстных окон у конкурентов.
Источник: marktechpost.com