FLUX 3: Gambar, Video, Audio dan Semua Yang Kita Ketahui
Pelajari apa FLUX 3 adalah, bagaimana gambar, video, audio asli dan kemampuan aksi bekerja, dan bagaimana untuk mengakses lima video produksi workflows pada PoYo.


Black Forest Labs mengumumkan FLUX 3 pada bulan Juli 23, 2026. Ini adalah perubahan terbesar untuk FLUX keluarga model sejauh ini: daripada hanya fokus pada pembuatan dan pengeditan gambar, FLUX 3 adalah model dasar multimodal yang dilatih melalui gambar, video, audio dan aksi.
FLUX 3 tersedia pada PoYo melalui lima alur kerja video produksi: teks-ke-video, gambar-ke-video, generasi frame pertama dan terakhir, ekstensi video, dan keyframes yang ditempatkan. Pembagian FLUX 3 API halaman di PoYo mencakup generator langsung, ID model, kontrol yang didukung, dan harga.
Panduan ini memisahkan apa yang secara resmi diumumkan oleh Black Forest Labs dari detail yang masih belum diketahui.
FLUX 3 Dengan sekelip mata
| Fitur | Informasi yang diumumkan secara resmi |
|---|---|
| Pengembang | Laboratorium Hutan Hitam |
| Tanggal pengumuman | Juli 23, 2026 |
| Status saat ini | Lima video produksi workflow tersedia di PoYo |
| Cara | Gambar, video, audio dan prediksi tindakan |
| Input | Teks, gambar dan video referensi |
| Kemampuan gambar | Generasi dan pengeditan |
| Kemampuan video | Teks-ke-video, gambar-ke-video, video-ke-video, lanjutan dan keyframes |
| Audio asli | Ya |
| Durasi video maksimum yang diumumkan | Sampai 20 detik dalam satu generasi |
| Dialog Berbahasa | Diumumkan |
| Umum PoYo API akses | Tersedia sekarang |
| Publik API ID model dan harga | Dipublikasikan di PoYo Dokumen dan halaman model |
Apa yang terjadi FLUX 3?
FLUX 3 adalah model multimodal yang terintegrasi. Black Forest Labs mengatakan ia dilatih pada gambar, video dan audio pada saat yang sama sehingga modalitas membatasi dan saling menginformasikan.
Gambar menggambarkan struktur spasial. Video menambah waktu dan gerakan. Audio memberikan bukti tentang peristiwa dan interaksi fisik. Bahasa menghubungkan sinyal tersebut dengan instruksi dan tujuan abstrak. FLUX 3 dirancang untuk mempelajari representasi bersama daripada memperlakukan setiap media sebagai tugas generasi terisolasi.
Ini adalah arah produk yang berbeda dari FLUX 2, yang terutama merupakan generasi gambar dan keluarga pengeditan. FLUX 3 masih menghasilkan dan mengedit gambar, tapi juga menghasilkan video dengan audio asli dan menyediakan dasar untuk prediksi tindakan.

Pembagian FLUX 3 Keluarga Model
Black Forest Labs telah mengumumkan empat aplikasi utama dari FLUX 3 foundation.
FLUX 3 Gambar
FLUX 3 Gambar mencakup sintesis gambar dan pengeditan melalui API dan akses berat pribadi. BFL mengatakan model ini menangani gaya, rasio aspek dan resolusi yang bervariasi, mengikuti prompt yang kompleks dengan lebih akurat dan meningkatkan rendering teks multilingual.
FLUX 3 Video
FLUX 3 Video menghasilkan dan mengedit video dengan audio asli. Ini menerima referensi teks, gambar dan video dan mendukung beberapa alur kerja, termasuk kelanjutan dan generasi yang dikendalikan keyframe.
FLUX 3 Dev
FLUX 3 Dev adalah tulang belakang multimodal terbuka yang diumumkan. BFL menggambarkan sebagai dasar untuk pembuatan konten dan prediksi tindakan. Perusahaan belum mempublikasikan bobot, lisensi, persyaratan perangkat keras atau tanggal rilisnya.
FLUX 3 Aksi dan FLUX- mimik
FLUX 3 juga mendukung prediksi tindakan melalui mitra penelitian dan komersial yang terpilih. FLUX-mimic, dikembangkan dengan robotik mimik, menerapkan representasi dunia visual model untuk tindakan robot. Ini adalah penelitian khusus dan industri arah, bukan konsumen gambar atau video generator.
FLUX 3 Kemampuan Gambar
FLUX 3 tetap menjadi model gambar utama meskipun lingkupnya lebih luas daripada sebelumnya FLUX releases.
Black Forest Labs telah mengumumkan:
- Generasi teks-ke-gambar
- Pengeditan gambar
- Berbagai gaya visual dan rasio aspek
- Resolusi output yang bermacam-macam
- Pengendalian yang lebih baik terhadap panggilan yang kompleks
- Generasi teks multilingual yang lebih akurat
- API dan akses pribadi
Contoh resmi berkisar dari foto-foto dekat realistis dan gambar studio seperti produk hingga lukisan dan ilustrasi datar. Mereka menunjukkan keragaman gaya, tetapi mereka dipilih sampel peluncuran daripada ukuran konsistensi independen.

Detail produksi penting masih hilang. BFL belum menerbitkan final FLUX 3 Gambar API parameter, resolusi maksimum, latensi, batas tarif atau harga.
FLUX 3 Kemampuan Video
FLUX 3 dapat menghasilkan video dengan audio hingga 20 detik lama dalam satu generasi. Aliran kerja yang diumumkan meliputi:
- Teks-ke-video: membuat klip lengkap dari deskripsi tertulis.
- Gambar-ke-video: menganimasi frame awal atau menggunakan gambar sebagai referensi visual.
- Video-ke-video: membawa karakter, subjek atau elemen visual dari klip sumber ke adegan lain.
- Video dan audio lanjutan: memperluas urutan audiovisual yang ada.
- Keyframe-to-video: menghasilkan transisi terkontrol antara momen yang ditentukan.
- Dialog multilingual: menghasilkan konten yang diucapkan dalam beberapa bahasa.
- Rantai multi-shot: menghubungkan klip ke dalam urutan yang lebih panjang menggunakan alur kerja agen.
- Tipografi animasi: menghasilkan desain gerakan dan teks animasi.
Audio model asli bukan ditambahkan sebagai langkah pos-proses terpisah. Hal ini penting untuk peristiwa di mana suara, gerakan dan waktu perlu sepakat.
Bagaimana Self-Flow Sesuai dengan FLUX 3
FLUX 3 dibangun pada Pembagian Diri, metode yang dikembangkan oleh Black Forest Labs untuk menyelaraskan generasi multimodal dan pemahaman dalam satu arsitektur.
Penelitian awal BFL membandingkan Self-Flow dengan aliran konvensional yang cocok di seluruh gambar, video dan audio generasi. Perusahaan melaporkan kesalahan generasi normal yang lebih rendah dan pembelajaran yang lebih cepat pada tugas manipulasi downstream.
Hasil ini membantu menjelaskan arsitektur, tetapi mereka tidak harus ditafsirkan sebagai benchmark publik lengkap dari final FLUX 3 produk. Model dan evaluasi harness masih dikembangkan.
Awal FLUX 3 Evaluasi Video
Black Forest Labs menerbitkan hasil preferensi manusia awal untuk 10 detik, 720p klip teks-video dengan audio. Dalam ujiannya, FLUX 3 lebih disukai daripada:
- Grok Imagine Video di sampai 69% Perbandingan
- Kling v3 Pro di 60%
- Happy Horse v1 di 59%
- Kuda Berbahagia 1.1 di 57%
- Seedance 2.0 dan Gemini Omni Flash masuk 52%
- Runway Gen-4.5 di 77%
- Luma Ray 3.2 di 93%
Ini adalah evaluasi awal yang diterbitkan oleh vendor, bukan papan leader independen. BFL secara eksplisit mengatakan model dan pengaturan evaluasi masih berkembang. Pemilihan prompt, pengaturan pengambilan sampel, evaluator dan versi model yang bersaing semuanya dapat mempengaruhi hasil preferensi.
FLUX 3 Ketersediaan pada PoYo
PoYo saat ini mengekspos lima ID model video produksi:
flux-3/text-to-videoflux-3/image-to-videoflux-3/first-last-frame-to-videoflux-3/extend-videoflux-3/keyframes-to-video
Aliran kerja ini menghasilkan 5–20 klip detik di 720p atau 1080p, mendukung delapan aspek rasio, dan dapat membuat sinkronisasi audio asli. Biaya alur kerja standar 34 kredit per detik pada 720p atau 58 kredit per detik pada 1080p. Biaya perpanjangan video 82 atau 106 kredit per detik masing-masing.
Peluncuran ini berlaku untuk PoYo FLUX 3 video workflow. FLUX 3 Gambar, Aksi, dan Open Weight FLUX 3 Dev backbone tetap menjadi bagian terpisah dari peta jalan BFL yang lebih luas; PoYo tidak menampilkan mereka seperti yang dimasukkan dalam video saat ini API bebaskan. Lihatlah FLUX 3 Dokumentasi API untuk bidang dan batas permintaan saat ini.
FLUX 3 Penggunaan Kasus
Penciptaan dan pengeditan gambar
FLUX 3 Gambar dapat mendukung visual produk, ilustrasi editorial, periklanan, desain multilingual dan pengeditan yang dikontrol referensi.
Video pendek dengan suara sinkronisasi
Generasi audiovisual asli berguna untuk adegan dialog, demonstrasi produk, klip sosial, desain animasi dan konsep cerita di mana suara harus sesuai dengan tindakan.
Karakter dan gaya kontinuitas
Referensi gambar dan video dapat membawa subjek pusat atau bahasa visual ke adegan baru. Rantai multi-shot bisa memperpanjang ini ke urutan yang lebih panjang.
Prasyarat
Keyframe, klip referensi dan input gambar dapat membantu tim kreatif mengeksplorasi transisi, gerakan kamera dan struktur adegan sebelum produksi konvensional.
Penelitian AI fisik
FLUX 3Perwakilan dunia bersama juga dapat disesuaikan untuk prediksi tindakan, seperti yang ditunjukkan oleh FLUX- kolaborasi mimis.
Pertanyaan yang Sering Ditanyakan
Apakah FLUX 3 dibebaskan?
Black Forest Labs mengumumkan FLUX 3 pada bulan Juli 23, 2026. PoYo sekarang menyediakan lima produk video endpoint yang mencakup teks, gambar, frame pertama dan terakhir, sumber-video ekstensi, dan keyframes posisi.
Apakah FLUX 3 model gambar atau model video?
Ini adalah model yayasan multimodal. Varian yang diumumkan mencakup pembuatan dan pengeditan gambar, video dengan audio asli, dan prediksi aksi.
Apakah FLUX 3 menghasilkan audio?
Ya. FLUX 3 Video menghasilkan audio asli bersama dengan video dan mendukung dialog multilingual.
Berapa lama bisa FLUX 3 Video itu?
PoYo menerima durasi bilangan bulat dari 5 melalui 20 detik dan dukungan 720p dan 1080p output.
Apakah FLUX 3 sumber terbuka?
BFL mengumumkan berat badan terbuka FLUX 3 Dev spine, tapi berat, lisensi dan tanggal rilis belum dipublikasikan.
Apakah FLUX 3 API tersedia pada PoYo?
Ya. Gunakan FLUX 3 halaman model atau mengintegrasikan salah satu dari lima dokumen PoYo ID model video.
Bagaimana itu FLUX 3 berbeda dari FLUX 2?
FLUX 2 fokus pada pembuatan dan pengeditan gambar. FLUX 3 memperluas keluarga menjadi model yang terpadu untuk gambar, video, audio asli dan prediksi aksi. Lihat detailnya FLUX 3 vs FLUX 2 Perbandingan.
Kesimpulan Akhir
FLUX 3 bukan hanya peningkatan model gambar lain. Itu berubah FLUX dari keluarga yang berfokus pada gambar menjadi platform multimodal yang dirancang untuk menghubungkan penampilan visual, gerakan, suara dan perilaku fisik.
Kemampuan yang paling menarik jelas: generasi audiovisual asli, video yang didorong oleh referensi, dialog multilingual, tipografi yang lebih kuat dan arsitektur bersama yang memperluas ke arah prediksi tindakan. PoYo sekarang membuat lima video workflow yang dirilis tersedia dengan ID model terdokumentasi, kontrol, dan harga per detik.
Gunakan PoYo FLUX 3 halaman model untuk menghasilkan video sekarang, atau membaca Dokumentasi API sebelum terintegrasi. Teruslah memperlakukan detail Gambar, Aksi, dan Dev yang belum dirilis secara terpisah dari video akhir yang tersedia saat ini.
Sumber: Laboratorium Hutan Hitam FLUX 3 Pengumuman, FLUX 3 x meniru
