Black Forest Labs представила FLUX 3 — мультимодальную модель для видео, изображений и звука

Black Forest Labs (BFL) выпустила FLUX 3 — мультимодальную базовую модель, которая обучается на изображениях, видео и аудио одновременно в единой архитектуре. Это первая модель семейства FLUX, способная генерировать видео, звук и предсказывать действия из одного набора весов.

Принцип работы

Команда BFL исходит из того, что ни одна модальность не даёт полного описания мира. Изображения фиксируют пространственную структуру в один момент времени. Видео добавляет время и раскрывает физическую динамику. Аудио показывает причинно-следственные связи между механическими событиями и звуком. Каждая модальность рассматривается как проекция одной реальности с потерями.

Совместное обучение на всех модальностях заставляет их взаимно ограничивать друг друга: звук должен соответствовать удару, движение — массе объекта.

Архитектура: Self-Flow

FLUX 3 построен на методе Self-Flow, который BFL представила в марте 2026 года. Self-Flow сочетает цель flow matching с self-supervised-восстановлением признаков. Эталонная реализация на GitHub опубликована под лицензией Apache-2.0 и использует SiT-XL/2 с поканальным conditioning'ом по времени. По словам BFL, для обучения FLUX 3 вычислительные мощности и объём данных были «существенно увеличены» по сравнению с исследовательским прототипом.

Возможности генерации видео

FLUX 3 Video генерирует клипы длиной до 20 секунд за один проход с нативным аудио. Поддерживаемые режимы:

  • текст-в-видео
  • изображение-в-видео
  • видео-в-видео по референсному клипу
  • keyframe-в-видео для контролируемых переходов
  • генеративное продолжение видео и аудио из входных данных

BFL также заявляет о поддержке многоязычного диалога, связывания клипов в многосценные последовательности и генерации качественной типографики с анимацией. Отдельно отмечена точность в передаче человеческой мимики и ассоциации звуков с физическими событиями.

Сравнение с конкурентами

BFL опубликовала предварительные результаты предпочтений пользователей. Для 10-секундных клипов text-to-video в 720p с аудио модель получила преимущество:

  • над Luma Ray 3.2 — в 93% сравнений
  • над Runway Gen-4.5 — в 77%
  • над Grok Imagine Video — до 69%
  • над Kling v3 Pro — 60%
  • над Seedance 2.0 и Gemini Omni Flash — 52% (практически равный результат)

Распространение и доступ

Команда BFL отмечает, что более 95% вычислительных ресурсов при обучении ушло на видео, тогда как аудио занимает менее 0,5% токенов. Та же базовая архитектура используется в FLUX-mimic — роботизированной политике, работающей менее чем за 80 мс на одном RTX 5090.

Доступ к FLUX 3 разделён на этапы: видео и режим Action — в раннем доступе, изображения — позднее, открытые веса — в последнюю очередь.

Источник: marktechpost.com