Skip to content
Новость TechTimes июль 2026 г.

Black Forest Labs: FLUX 3 объединяет генерацию изображений, видео и аудио

Black Forest Labs выпустила FLUX 3 23 июля 2026 года, сделав значительный архитектурный шаг по сравнению с предыдущими работами. Если более ранние релизы FLUX были сосредоточены на генерации изображений, то FLUX 3 — это единая мультимодальная foundation-модель, совместно обученная на изображениях, видео и аудио с самого начала. Унифицированная архитектура означает, что каждая модальность усиливает остальные в процессе обучения, а не сшивается вместе после.

Первоначальный ранний доступ охватывает видео и prediction действий. Выпуск функций генерации изображений последует через несколько недель; open-weight версия для разработчиков запланирована на конец 2026 года. Видеогенерация производит клипы длиной до 20 секунд с нативным аудио — звук генерируется вместе с видеорядом, а не добавляется отдельно. Ранние оценки указывают на высокое качество захвата мимики, связи звука с физическими событиями и многоязычного контента.

Для дизайнеров наиболее непосредственная ценность заключается в экосистеме инструментов. Adobe Photoshop и Picsart уже интегрировали более ранние модели FLUX, а расширенные возможности FLUX 3 в видео и аудио делают его более полноценной основой для AI-assisted творческого производства. Возможность prediction действий — позволяющая модели предсказывать движения роботов — находится за пределами дизайн-работы, но сигнализирует о глубине обобщения, которого способна достичь архитектура.

Применение в робототехнике является операционным, а не экспериментальным. Через партнёрство с Mimic Robotics, FLUX 3 управляет роботами на производственных линиях Audi со временем реакции 101 миллисекунда. Компания позиционирует это как часть долгосрочной стратегии в области physical AI, где одна модель генерирует изображения и видео, а также управляет машинами в физическом мире.

Генеральный директор Робин Ромбах описал унифицированную архитектуру как ключевое решение: «Совместное обучение в рамках единой архитектуры — это путь к цели, потому что каждая тренировочная модальность усиливает другие». Этот принцип отличает FLUX 3 от мультимодальных систем, объединяющих раздельно обученные компоненты.