Black Forest Labs (BFL) выпустила FLUX 3 — мультимодальную базовую модель, которая обучается на изображениях, видео и аудио одновременно в единой архитектуре. Это первая модель семейства FLUX, способная генерировать видео, звук и предсказывать действия из одного набора весов.
Принцип работы
Команда BFL исходит из того, что ни одна модальность не даёт полного описания мира. Изображения фиксируют пространственную структуру в один момент времени. Видео добавляет время и раскрывает физическую динамику. Аудио показывает причинно-следственные связи между механическими событиями и звуком. Каждая модальность рассматривается как проекция одной реальности с потерями.
Совместное обучение на всех модальностях заставляет их взаимно ограничивать друг друга: звук должен соответствовать удару, движение — массе объекта.
Архитектура: Self-Flow
FLUX 3 построен на методе Self-Flow, который BFL представила в марте 2026 года. Self-Flow сочетает цель flow matching с self-supervised-восстановлением признаков. Эталонная реализация на GitHub опубликована под лицензией Apache-2.0 и использует SiT-XL/2 с поканальным conditioning'ом по времени. По словам BFL, для обучения FLUX 3 вычислительные мощности и объём данных были «существенно увеличены» по сравнению с исследовательским прототипом.
Возможности генерации видео
FLUX 3 Video генерирует клипы длиной до 20 секунд за один проход с нативным аудио. Поддерживаемые режимы:
- текст-в-видео
- изображение-в-видео
- видео-в-видео по референсному клипу
- keyframe-в-видео для контролируемых переходов
- генеративное продолжение видео и аудио из входных данных
BFL также заявляет о поддержке многоязычного диалога, связывания клипов в многосценные последовательности и генерации качественной типографики с анимацией. Отдельно отмечена точность в передаче человеческой мимики и ассоциации звуков с физическими событиями.
Сравнение с конкурентами
BFL опубликовала предварительные результаты предпочтений пользователей. Для 10-секундных клипов text-to-video в 720p с аудио модель получила преимущество:
- над Luma Ray 3.2 — в 93% сравнений
- над Runway Gen-4.5 — в 77%
- над Grok Imagine Video — до 69%
- над Kling v3 Pro — 60%
- над Seedance 2.0 и Gemini Omni Flash — 52% (практически равный результат)
Распространение и доступ
Команда BFL отмечает, что более 95% вычислительных ресурсов при обучении ушло на видео, тогда как аудио занимает менее 0,5% токенов. Та же базовая архитектура используется в FLUX-mimic — роботизированной политике, работающей менее чем за 80 мс на одном RTX 5090.
Доступ к FLUX 3 разделён на этапы: видео и режим Action — в раннем доступе, изображения — позднее, открытые веса — в последнюю очередь.
Источник: marktechpost.com