FLUX 3: Hình ảnh, Video, Âm thanh và mọi thứ chúng ta biết
Tìm hiểu FLUX 3 là gì, làm thế nào hình ảnh, video, âm thanh bản địa và khả năng hành động của nó hoạt động, và làm thế nào để truy cập năm dòng video sản xuất trên PoYo.


Black Forest Labs công bố FLUX 3 Ngày tháng 7 23, 2026. Đây là sự thay đổi lớn nhất cho gia đình mô hình FLUX cho đến nay: thay vì chỉ tập trung vào việc tạo và chỉnh sửa hình ảnh, FLUX 3 là một mô hình nền tảng đa phương thức được đào tạo qua hình ảnh, video, âm thanh và hành động.
FLUX 3 hiện có trên PoYo thông qua năm dòng video sản xuất: văn bản-video, hình ảnh-video, lần tạo khung hình đầu tiên và cuối cùng, mở rộng video và khung phím định vị. FLUX 3 API trang trên PoYo bao gồm máy phát điện trực tiếp, ID mô hình, điều khiển được hỗ trợ và giá cả.
Hướng dẫn này tách những gì Black Forest Labs đã chính thức công bố khỏi các chi tiết vẫn chưa được biết.
FLUX 3 tại một cái nhìn
| Tính năng | Thông tin chính thức được công bố |
|---|---|
| Nhà phát triển | Các phòng thí nghiệm rừng đen |
| Ngày thông báo | Tháng 7 23, 2026 |
| Tình trạng hiện tại | Năm video video dòng công việc sản xuất có sẵn trên PoYo |
| Các phương pháp | Hình ảnh, video, âm thanh và dự đoán hành động |
| Các đầu vào | Các văn bản, hình ảnh và video tham chiếu |
| Khả năng hình ảnh | Tạo và chỉnh sửa |
| Khả năng video | Văn bản thành video, image-to-video, video-to-video, tiếp tục và keyframes |
| Âm thanh bản địa | Vâng. |
| Thời gian video được thông báo tối đa | Tối đa 20 giây trong một lần tạo |
| Đối thoại đa ngôn ngữ | Được thông báo |
| Tổng quyền truy cập PoYo API | Có sẵn ngay bây giờ |
| Các chỉ số và giá của mô hình API | Được xuất bản trên trang tài liệu và mô hình PoYo |
FLUX 3 là gì?
FLUX 3 là một mô hình đa phương tiện thống nhất. Black Forest Labs nói nó được đào tạo trên hình ảnh, video và âm thanh cùng một lúc để các phương pháp hạn chế và thông báo cho nhau.
Một hình ảnh mô tả cấu trúc không gian. Video thêm thời gian và chuyển động. Âm thanh cung cấp bằng chứng về các sự kiện và tương tác vật lý. Ngôn ngữ kết nối các tín hiệu đó với các hướng dẫn và mục tiêu trừu tượng. FLUX 3 được thiết kế để học một đại diện chung thay vì xử lý mỗi phương tiện như một nhiệm vụ tạo ra riêng biệt.
Đây là một hướng sản phẩm khác với FLUX 2, chủ yếu là một lần tạo hình ảnh và chỉnh sửa gia đình. FLUX 3 vẫn tạo và chỉnh sửa hình ảnh, nhưng nó cũng sản xuất video với âm thanh bản địa và cung cấp nền tảng cho dự đoán hành động.

Gia đình mô hình FLUX 3
Black Forest Labs đã công bố bốn ứng dụng chính của nền tảng FLUX 3.
FLUX 3 Hình ảnh
FLUX 3 Image bao gồm tổng hợp hình ảnh và chỉnh sửa thông qua API và truy cập trọng lượng riêng. BFL cho biết mô hình xử lý nhiều phong cách, tỷ lệ khía cạnh và độ phân giải khác nhau, theo dõi các prompt phức tạp chính xác hơn và cải thiện việc hiển thị văn bản đa ngôn ngữ.
FLUX 3 Video
FLUX 3 Video tạo và chỉnh sửa video với âm thanh bản địa. Nó chấp nhận văn bản, hình ảnh và video tham chiếu và hỗ trợ một số dòng công việc, bao gồm tiếp tục và phát điện được điều khiển bằng khung khóa.
FLUX 3 Dev
FLUX 3 Dev là xương sống đa phương thức có trọng lượng mở được công bố. BFL mô tả nó là một nền tảng cho việc tạo nội dung và dự đoán hành động. Công ty vẫn chưa công bố trọng lượng, giấy phép, yêu cầu phần cứng hoặc ngày phát hành.
FLUX 3 Action và FLUX-mimic
FLUX 3 cũng hỗ trợ dự đoán hành động thông qua các đối tác nghiên cứu và thương mại được lựa chọn. FLUX-mimic, được phát triển với robot mimic, áp dụng mô hình đại diện thế giới trực quan của mô hình cho hành động robot. Đây là một nghiên cứu chuyên ngành và hướng công nghiệp, không phải là một máy tạo hình ảnh hoặc video tiêu dùng.
FLUX 3 Khả năng hình ảnh
FLUX 3 vẫn là một mô hình hình ảnh lớn mặc dù phạm vi của nó rộng hơn so với các phiên bản trước của FLUX.
Black Forest Labs đã công bố:
- Tạo văn bản sang hình ảnh
- Chỉnh sửa hình ảnh
- Nhiều phong cách hình ảnh và tỷ lệ hình ảnh
- Các độ phân giải đầu ra nhiều lần
- Khả năng xử lý các prompt phức tạp tốt hơn
- Tạo văn bản đa ngôn ngữ chính xác hơn
- API và truy cập trọng lượng riêng
Các ví dụ chính thức từ chụp gần thực tế và hình ảnh studio giống như sản phẩm đến tranh vẽ và minh họa phẳng. Chúng cho thấy sự đa dạng phong cách, nhưng chúng được chọn là mẫu phóng thay vì là một thước đo độc lập về sự nhất quán.

Các chi tiết sản xuất quan trọng vẫn còn thiếu. BFL đã không công bố các tham số FLUX 3 hình ảnh API, độ phân giải tối đa, độ trễ, giới hạn tỷ lệ hoặc giá.
FLUX 3 Khả năng video
FLUX 3 có thể tạo ra video với âm thanh lên đến 20 giây Các dòng công việc được công bố bao gồm:
- Văn bản thành video: tạo một đoạn clip đầy đủ từ mô tả bằng văn bản.
- Hình ảnh qua video: tạo hình ảnh hoặc sử dụng hình ảnh như tham chiếu trực quan.
- Video-to-video: mang các nhân vật, đối tượng hoặc yếu tố hình ảnh từ một clip nguồn vào một cảnh khác.
- Video và âm thanh tiếp tục: mở rộng một chuỗi âm thanh thị giác hiện có.
- Keyframe-to-video: tạo ra các chuyển đổi được kiểm soát giữa các khoảnh khắc được xác định.
- Đối thoại đa ngôn ngữ: tạo nội dung nói bằng nhiều ngôn ngữ.
- Các dây chuyền nhiều mũi: kết nối clip thành chuỗi dài hơn bằng cách sử dụng một dòng công việc của đại lý.
- Phép họa hoạt hình: tạo ra thiết kế chuyển động và văn bản hoạt hình.
Âm thanh của mô hình là bản địa thay vì được thêm vào như một bước tiếp theo xử lý riêng biệt. Điều này quan trọng đối với các sự kiện mà âm thanh, chuyển động và thời gian cần phải đồng thuận.
Làm thế nào tự chảy phù hợp với FLUX 3
FLUX 3 xây dựng trên Tự chảy, một phương pháp được phát triển bởi Black Forest Labs để sắp xếp lần tạo đa phương thức và hiểu biết trong một kiến trúc.
Nghiên cứu sơ bộ của BFL so sánh Self-Flow với dòng chảy thông thường phù hợp trong việc tạo hình ảnh, video và âm thanh. Công ty báo cáo lỗi sản xuất bình thường thấp hơn và học nhanh hơn về các nhiệm vụ thao tác dòng chảy.
Những kết quả này giúp giải thích kiến trúc, nhưng chúng không nên được giải thích như là một tiêu chuẩn công khai hoàn chỉnh của các sản phẩm cuối cùng FLUX 3. Mô hình và vòng đánh giá vẫn đang được phát triển.
Đời gian đầu FLUX 3 Video đánh giá
Black Forest Labs đã công bố kết quả ưu tiên con người sơ bộ cho các đoạn video văn bản-video 10-II, 720p với âm thanh. Trong các thử nghiệm của mình, FLUX 3 được ưu tiên hơn:
- Grok Hãy tưởng tượng Video trong đến 69% của so sánh
- Kling v3 Pro trong 60%
- Happy Horse v1 trong 59%
- Happy Horse 1.1 trong 57%
- Seedance 2.0 và Gemini Omni Flash trong 52%
- Runway Gen-4.5 trong 77%
- Luma Ray 3.2 trong 93%
Đây là Các đánh giá sớm được nhà cung cấp xuất bản, không phải là một bảng xếp hạng độc lập. BFL nói rõ ràng rằng mô hình và thiết lập đánh giá vẫn đang phát triển. Việc lựa chọn prompt, cài đặt lấy mô hình, các nhà đánh giá và các phiên bản mô hình cạnh tranh đều có thể ảnh hưởng đến kết quả ưu tiên.
FLUX 3 Khả năng truy cập trên PoYo
PoYo hiện đang tiết lộ năm ID mô hình video sản xuất:
flux-3/text-to-videoflux-3/image-to-videoflux-3/first-last-frame-to-videoflux-3/extend-videoflux-3/keyframes-to-video
Các dòng công việc này tạo ra các clip giây 5–20 tại 720p hoặc 1080p, hỗ trợ tám tỷ lệ khía cạnh, và có thể tạo âm thanh bản địa đồng bộ. Các dòng công việc tiêu chuẩn có chi phí 34 tín dụng mỗi giây tại 720p hoặc 58 tín dụng mỗi giây tại 1080p. Việc mở rộng video chi phí 82 hoặc 106 tín dụng mỗi giây tương ứng.
Việc ra mắt này áp dụng cho các dòng video FLUX 3 của PoYo. FLUX 3 Hình ảnh, hành động và xương sống phơi phơi phơi FLUX 3 Dev vẫn là những phần riêng biệt của lộ trình BFL rộng hơn; PoYo không trình bày chúng như được đưa vào bản phát hành API hiện tại. Xem các Tài liệu FLUX 3 API cho các trường yêu cầu và giới hạn hiện tại.
FLUX 3 Các trường hợp sử dụng
Tạo hình ảnh và chỉnh sửa
FLUX 3 Image có thể hỗ trợ hình ảnh sản phẩm, minh họa biên tập, quảng cáo, thiết kế đa ngôn ngữ và chỉnh sửa được kiểm soát bằng tham chiếu.
Video ngắn với âm thanh đồng bộ
Sản xuất trực tuyến bản địa hữu ích cho các cảnh đối thoại, trình bày sản phẩm, clip xã hội, thiết kế hoạt hình và khái niệm câu chuyện nơi âm thanh phải phù hợp với hành động.
Tính chất và phong cách liên tục
Các tài liệu tham chiếu hình ảnh và video có thể mang một chủ đề trung tâm hoặc ngôn ngữ hình ảnh vào các cảnh mới. Các chuỗi nhiều lần có thể mở rộng ra các chuỗi dài hơn.
Pre-visualization
Các khung chìa khóa, các đoạn video tham chiếu và đầu vào hình ảnh có thể giúp các nhóm sáng tạo khám phá chuyển đổi, chuyển động máy ảnh và cấu trúc cảnh trước khi sản xuất thông thường.
Nghiên cứu AI vật lý
Phương pháp đại diện thế giới chia sẻ của FLUX 3 cũng có thể được điều chỉnh để dự đoán hành động, như được chứng minh bởi sự hợp tác mô phỏng của FLUX.
Những câu hỏi thường được hỏi
FLUX 3 được phát hành không?
Black Forest Labs công bố FLUX 3 vào tháng 7 23, 2026. PoYo hiện cung cấp năm điểm cuối video sản xuất bao gồm văn bản, hình ảnh, khung hình đầu tiên và cuối cùng, mở rộng nguồn video và khung hình phím định vị.
FLUX 3 là mô hình hình ảnh hay mô hình video?
Đó là một mô hình nền tảng đa phương thức. Các biến thể được công bố bao gồm việc tạo và chỉnh sửa hình ảnh, video với âm thanh bản địa và dự đoán hành động.
FLUX 3 tạo âm thanh?
Có. FLUX 3 Video tạo âm thanh bản địa cùng với video và hỗ trợ đối thoại đa ngôn ngữ.
Video FLUX 3 có thể dài bao lâu?
PoYo chấp nhận thời gian dài toàn số từ 5 đến 20 giây và hỗ trợ đầu ra 720p và 1080p.
FLUX 3 có nguồn mở không?
BFL đã công bố một bộ xương sống Dev mở FLUX 3, nhưng trọng lượng, giấy phép và ngày phát hành vẫn chưa được công bố.
FLUX 3 API có sẵn trên PoYo không?
Phải, dùng cái Trang mô hình FLUX 3 hoặc tích hợp một trong năm thẻ nhận dạng mô hình video PoYo được ghi chép.
FLUX 3 khác với FLUX 2 bằng cách nào?
FLUX 2 tập trung vào việc tạo ra hình ảnh và chỉnh sửa. FLUX 3 mở rộng gia đình thành một mô hình thống nhất cho hình ảnh, video, âm thanh bản địa và dự đoán hành động. Xem chi tiết FLUX 3 so với FLUX 2 so sánh.
Kết luận cuối cùng
FLUX 3 không chỉ là một nâng cấp mô hình hình ảnh khác. Nó biến FLUX từ một gia đình tập trung vào hình ảnh thành một nền tảng đa phương thức được thiết kế để kết nối ngoại hình, chuyển động, âm thanh và hành vi vật lý.
Các khả năng thú vị nhất là rõ ràng: sản xuất trực tuyến trực tuyến bản địa, video dựa trên tham chiếu, đối thoại đa ngôn ngữ, kiểu chữ mạnh mẽ hơn và một kiến trúc chia sẻ mở rộng cho dự đoán hành động. PoYo hiện cung cấp năm dòng video công việc được phát hành với ID mô hình được ghi chép, điều khiển và giá cả mỗi giây.
Sử dụng PoYo FLUX 3 trang mô hình để tạo video ngay bây giờ, hoặc đọc Tài liệu API trước khi tích hợp. Cứ tiếp tục xử lý các chi tiết hình ảnh, hành động và Dev chưa được phát hành riêng biệt với các video cuối hiện có.
Nguồn: Black Forest Labs FLUX 3 thông báo, FLUX 3 x mô phỏng

