Black Forest Labs đã ra mắt FLUX 3 vào Thứ Năm, đánh dấu lần đầu tiên mô hình chủ lực của công ty tạo video thay vì ảnh tĩnh. Phòng thí nghiệm AI của Đức, nổi tiếng với dòng bộ tạo ảnh FLUX, đã huấn luyện hệ thống mới bằng hình ảnh, video và âm thanh đồng thời trong cùng một hệ thống chia sẻ. Cách tiếp cận đa phương thức này giúp FLUX 3 tạo các đoạn clip dài đến 20 giây, với âm thanh được tạo cùng lúc với hình ảnh và đồng bộ theo hành động trên màn hình, bao gồm thoại, hiệu ứng âm thanh và tiếng ồn xung quanh. Việc phát hành này thể hiện sự chuyển hướng chiến lược từ tạo ảnh thuần túy sang năng lực video, đồng thời mô hình cũng cung cấp nền tảng cho FLUX-mimic, một ứng dụng robotics hiện đã được Audi thử nghiệm trên dây chuyền sản xuất của hãng cho các tác vụ như lắp gioăng cửa linh hoạt.
FLUX 3 tạo các clip video 20 giây kèm âm thanh đồng bộ
FLUX 3 tạo các clip video dài đến 20 giây, với âm thanh được tạo cùng lúc với hình ảnh và đồng bộ với những gì đang diễn ra trên màn hình. Trong các đánh giá ban đầu, người đánh giá con người ưu tiên đầu ra của FLUX 3 hơn Runway Gen-4.5 ở 77% các so sánh đối đầu và hơn Luma Ray 3.2 ở 93% các so sánh. Mô hình cũng vượt Gemini Omni và Seedance ở 52% số lần đánh giá. Các bài kiểm tra sở thích này gồm việc người đánh giá xem hai clip và chọn clip trông và nghe thuyết phục hơn, trong đó Black Forest Labs ghi nhận tần suất FLUX 3 giành chiến thắng.
Mô hình cũng thể hiện năng lực tạo ảnh tĩnh, bám theo tiền lệ từ mảng tạo ảnh trước đó. Black Forest Labs đã chia sẻ các hình ảnh cho thấy FLUX 3 có độ linh hoạt trong việc tạo ra nhiều phong cách đa dạng ngoài tính chân thực ảnh chụp. Đồng sáng lập kiêm CEO Robin Rombach cho biết: “Một mô hình chỉ học ảnh thì chỉ có thể tạo ảnh.” Lập luận của công ty là việc học dự đoán video cũng đồng nghĩa học các quy luật vật lý bên dưới nó—trọng lượng, tiếp xúc, thời điểm—điều mà một cỗ máy cần để di chuyển qua thế giới vật chất.
Audi thử nghiệm hệ thống robotics FLUX-mimic trên dây chuyền sản xuất
FLUX-mimic, được xây dựng với mimic robotics đặt tại Zurich, lấy động cơ dự đoán video của FLUX 3 và bổ sung một bộ giải mã nhẹ—một phần cài thêm nhỏ—để chuyển đổi “cảm nhận” bên trong của mô hình về cách mọi thứ chuyển động thành các chuyển động robot thực tế. Audi đang thử nghiệm nó cho các tác vụ như lắp gioăng cửa linh hoạt, công việc mà tự động hóa truyền thống từng gặp khó khăn. Đồng sáng lập mimic Stephan-Daniel Gravert nói: “Audi là kiểu đối tác sản xuất mà chúng tôi xây dựng FLUX-mimic hướng tới.” Christoph Schneider của Audi cho biết các robot giờ đây “giải quyết được công việc thao tác vật thể dạng mềm phức tạp” mà các máy móc đời cũ không thể chạm tới. Black Forest Labs cho biết toàn bộ hệ thống phản hồi trong khoảng 101 mili giây, tương đương vùng phản xạ thị giác của con người.
Black Forest Labs xây FLUX 3 sau nguồn gốc Stable Diffusion
Black Forest Labs được thành lập vào Tháng 8 2024 bởi các nhà nghiên cứu kỳ cựu, từng góp phần xây dựng các mô hình Stable Diffusion gốc tại Stability AI. Công ty ra mắt các mô hình Flux đã đánh bại MidJourney và vượt trội Stable Diffusion 3 của Stability. Các mô hình Flux Dev và Schnell mã nguồn mở đã giành danh hiệu “bộ tạo ảnh mã nguồn mở tốt nhất” mà các nghệ sĩ AI kỳ vọng Stable Diffusion 3.5 sẽ giành lại. FLUX 1.1 Pro đứng đầu đấu trường hình ảnh của Artificial Analysis vào Tháng 10, dù phiên bản này không phải mã nguồn mở.
Black Forest Labs phát hành FLUX.2 vào Tháng 11 2025 nhưng mức độ phổ biến không cao bằng. Vương miện mã nguồn mở do Flux gốc nắm giữ tồn tại cho đến khi Z-Image Turbo của Alibaba lật đổ vào cuối 2025, đạt chất lượng tương đương trên các card đồ họa phổ thông cấp thấp. Một người dùng CivitAI khi đó viết: “Đây là điều mà SD3 lẽ ra đã phải như thế.”
Phiên bản Dev dự kiến vào cuối năm 2026
Video và Action hiện đang ở giai đoạn truy cập sớm thông qua API và một số đối tác chọn lọc, trong đó có mimic robotics. Việc tạo ảnh đang “trong vài tuần tới”, theo Black Forest Labs. Phiên bản Dev bản mã mở (open-weight), là cấp độ duy nhất mà Black Forest Labs dự định phát hành để dùng cục bộ, chưa đến hạn cho đến cuối năm 2026.
Câu hỏi thường gặp
FLUX 3 có những năng lực video nào?
FLUX 3 tạo các clip video dài đến 20 giây, với âm thanh được tạo cùng lúc với hình ảnh và đồng bộ theo hành động trên màn hình, bao gồm thoại, hiệu ứng âm thanh và tiếng ồn xung quanh. Trong các đánh giá ban đầu, người đánh giá con người ưu tiên đầu ra của FLUX 3 hơn Runway Gen-4.5 ở 77% các so sánh và hơn Luma Ray 3.2 ở 93% các so sánh.
Audi đang dùng FLUX-mimic trên dây chuyền sản xuất như thế nào?
Audi đang thử nghiệm FLUX-mimic cho các tác vụ như lắp gioăng cửa linh hoạt, công việc mà tự động hóa truyền thống từng gặp khó khăn. Hệ thống, được xây dựng cùng mimic robotics, chuyển động cơ dự đoán video của FLUX 3 thành các chuyển động robot thực tế, với thời gian phản hồi khoảng 101 mili giây. Christoph Schneider của Audi cho biết các robot giờ đây giải quyết được công việc thao tác vật thể dạng mềm phức tạp mà các máy móc đời cũ không thể chạm tới.
Khi nào phiên bản Dev bản mã mở của FLUX 3 sẽ có?
Phiên bản Dev bản mã mở, là cấp độ duy nhất mà Black Forest Labs dự định phát hành để dùng cục bộ, chưa đến hạn cho đến cuối năm 2026. Video và Action hiện đang ở giai đoạn truy cập sớm thông qua API và một số đối tác chọn lọc, còn việc tạo ảnh sẽ theo sau trong vài tuần tới.