FLUX 3 Video: Native Audio, 20-Klip detik dan Fitur Kunci
Menjelajahi FLUX 3 Video, termasuk audio asli, 20- generasi detik, teks-ke-video, gambar-ke-video, referensi video, lanjutan dan dialog multilingual.


FLUX 3 Video Black Forest Labs adalah yang pertama FLUX model untuk generasi audiovisual penuh. Ini menciptakan video dan audio asli bersama-sama, menerima teks, gambar dan referensi video, dan menghasilkan klip hingga 20 detik dalam satu generasi.
FLUX 3 Video sekarang tersedia di PoYo melalui lima alur kerja produksi dengan ID model yang diterbitkan, kontrol permintaan, dan penentuan harga per detik. Pembagian FLUX 3 API halaman di PoYo menyediakan generator langsung untuk teks, gambar, frame pertama dan terakhir, ekstensi sumber video, dan keyframes yang ditempatkan.
FLUX 3 Video dengan Sekilas
| Fitur | Dukungan diumumkan |
|---|---|
| Teks-ke-video | Ya |
| Gambar-ke-video | Ya |
| Referensi gambar | Ya |
| Video ke video | Ya |
| Video dan audio lanjutan | Ya |
| Keyframe-to-video | Ya |
| Audio asli | Ya |
| Dialog Berbahasa | Ya |
| Durasi maksimum satu generasi | Sampai 20 detik |
| Rasio aspek | Berbagai format diumumkan |
| Tipografi animasi | Diumumkan |
| Sequence multi-shot | Rantai agen diumumkan |
| Umum PoYo API | Tersedia sekarang |
Apa yang terjadi FLUX 3 Video?
FLUX 3 Video adalah salah satu aplikasi dari FLUX 3 model dasar multimodal. Tidak seperti model gambar yang disesuaikan untuk menghasilkan bingkai, FLUX 3 telah dilatih melalui gambar, video dan audio dalam arsitektur bersama.
Tujuannya adalah untuk memodel lebih dari sekadar penampilan visual. Video mengajarkan gerakan dan hubungan temporal. Audio memberikan informasi tentang dampak, materi, pidato dan peristiwa lingkungan. Latihan bersama memungkinkan suara yang dihasilkan untuk terhubung dengan apa yang terjadi di layar.
Ini juga mengapa FLUX 3 mencakup lebih dari pembuatan konten ke prediksi tindakan melalui varian penelitian khusus.
Resmi FLUX 3 meluncurkan media dari Black Forest Labs.
Teks-ke-Video
Teks-ke-video membuat klip langsung dari deskripsi adegan tertulis. Pesan yang berguna dapat mendefinisikan:
- Subyek dan tindakan
- Lokasi dan waktu
- Posisi dan gerakan kamera
- Gaya visual
- Dialog bicara
- Suara lingkungan
- Waktu dan urutan peristiwa
- Rasio aspek
FLUX 3 dapat menghasilkan bagian visual dan audio dalam satu pass. PoYo permintaan mengekspos prompt, durasi, resolusi, rasio aspek, toggle audio, dan input gambar, sumber-video, atau keyframe yang dibutuhkan oleh alur kerja yang dipilih.
Gambar-ke-video
FLUX 3 mendukung dua pendekatan yang didorong oleh gambar.
Animasi frame awal
Sebuah gambar dapat mendefinisikan frame pertama, setelah itu model menciptakan gerakan dan suara. Ini berguna untuk menganimasi gambar produk, ilustrasi, potret atau adegan yang dirancang.
Input referensi visual
Gambar juga dapat bertindak sebagai referensi identitas, subjek atau gaya tanpa menjadi frame pertama secara harfiah. Hal ini dapat membantu menjaga karakter, objek atau arah visual dalam adegan baru.
Pada PoYo, gambar-ke-video menerima satu sumber gambar, generasi frame pertama dan terakhir menerima dua gambar tertib, dan generasi keyframe menerima hingga sepuluh gambar yang ditempatkan. Periksa arus API dokumentasi untuk persyaratan unggah dan format file.
Video-ke-video
Video-to-video menggunakan klip sumber sebagai referensi dan membawa elemen sentral ke adegan atau konteks yang berbeda.
Aplikasi potensial meliputi:
- Memindahkan karakter yang sama ke lingkungan baru
- Menyaring kembali rekaman dalam gaya visual lain
- Menjaga gerakan sambil mengubah adegan
- Membuat variasi dari tembakan yang ada
- Menggunakan kinerja sebagai referensi temporal
Video-ke-video tidak menjamin identitas yang sempurna atau pelestarian gerakan. PoYo saat ini mengekspos sumber-video lanjutan melalui flux-3/extend-videotidak boleh bingung dengan titik akhir video-restyling umum yang terpisah.
Video dan Audio Lanjutkan
FLUX 3 dapat melanjutkan video input dan audio. Model lanjutan harus memperluas beberapa hal bersama:
- Penampilan subjek
- Gerakan kamera
- Laluan objek
- Pencahayaan dan lingkungan
- Dialog atau suasana
- Ritme dan waktu acara
Aliran kerja ini dapat memperpanjang gambar pendek atau menghasilkan beat cerita berturut-turut tanpa memulai setiap klip dari prompt yang tidak terkait.
Keyframe-to-Video
Keyframe-to-video menghasilkan transisi antara momen visual yang ditentukan. Bentuk awal dan akhir dapat mengkomunikasikan komposisi dengan lebih tepat daripada teks saja.
Penggunaan yang mungkin meliputi:
- Transformasi produk
- Transisi kamera
- Gerakan karakter antara pose
- Sebelum dan sesudah urutan
- Animasi logo atau tipografi
- Prasaksari dari storyboard ke motion
PoYo mendukung hingga sepuluh keyframe yang ditempatkan. Setiap keyframe memberikan gambar URL dan indeks bingkai, yang memungkinkan waktu transisi dikendalikan secara langsung.
Generasi Audio Native
Audio asli adalah FLUX 3 Fitur yang menentukan video. Model ini menghasilkan suara sebagai bagian dari adegan yang sama daripada bergantung sepenuhnya pada pipa audio terpisah.
Suara yang sejalan dengan peristiwa
Tindakan seperti dampak, gerakan dan interaksi mekanis dapat menghasilkan suara yang disesuaikan dengan peristiwa yang terlihat. BFL mengatakan model ini sangat kuat dalam menghubungkan suara dengan peristiwa fisik.
Audio lingkungan
Sebuah adegan dapat mencakup suasana yang sesuai dengan lokasi, cuaca dan aktivitasnya. Itu mungkin memberikan draf pertama yang lebih lengkap daripada generasi video diam.
Dialog Berbahasa
Black Forest Labs mencantumkan dialog multilingual sebagai kemampuan inti. Pengumuman peluncuran tidak memberikan daftar bahasa yang lengkap atau akurasi pidato yang diukur untuk setiap bahasa.
Video dan audio lanjutan
Model ini dapat memperluas input audiovisual, berpotensi mempertahankan suasana, konteks pidato dan waktu acara ke bagian baru.
Generasi asli tidak menghilangkan post-produksi. Kekuatan dialog, pengucapan, sinkronisasi bibir, tingkat audio dan artefak yang tidak diinginkan masih membutuhkan tinjauan.
Durasi dan resolusi
PoYo menerima durasi bilangan bulat dari 5 melalui 20 detik dan dukungan 720p dan 1080p output di delapan aspek rasio. Audio asli dapat diaktifkan dalam permintaan yang sama.
Biaya teks standar, gambar, frame pertama dan terakhir, dan arus kerja keyframe 34 kredit per detik pada 720p atau 58 kredit per detik pada 1080p. Biaya perpanjangan video 82 kredit per detik pada 720p atau 106 kredit per detik pada 1080p. Frame rate, codec, waktu generasi, dan detail operasional lainnya harus diperiksa dalam arus FLUX 3 Dokumentasi API.
Karakter dan Gaya yang konsisten
FLUX 3 menggunakan referensi visual untuk membantu menjaga elemen sentral di seluruh adegan. BFL mengatakan referensi dapat menjaga karakter konsisten dalam urutan multi-tampilan berlangsung beberapa menit.
Output yang lebih lama dibuat dengan menyalurkan klip individu, bukan dengan menghasilkan beberapa menit dalam satu panggilan. Setiap tembakan masih mungkin memerlukan:
- Pilihan referensi
- Kontinuitas prompt
- Perencanaan Transisi
- Pemeriksaan identitas
- Pemeriksaan kontinuitas audio
- Pengeditan dan perakitan
Rantai agen dapat mengotomatiskan sebagian dari perencanaan, tetapi tidak mengubah 20-Limit generasi tunggal detik ke dalam tembakan terus-menerus tak terbatas.
Tipografi dan Desain Animasi
BFL menyoroti tipografi yang kuat dan desain animasi sebagai FLUX 3 Kemampuan video. Ini bisa mendukung:
- Poster gerakan
- Urutan judul
- Pengumuman produk
- Tipografi kinetik
- Iklan sosial
- Interface dan animasi grafis
Teks yang dihasilkan masih harus diperiksa frame per frame. Judul mungkin terlihat benar dalam satu saat dan cacat selama gerakan.
Hasil Evaluasi Awal
Dalam tes preferensi manusia awal BFL, FLUX 3 dibandingkan dengan beberapa model video. Perusahaan melaporkan tingkat preferensi mulai dari 52% terhadap Seedance 2.0 dan Gemini Omni Flash untuk 93% melawan Luma Ray 3.2.
Hasil ini membutuhkan konteks:
- Mereka diterbitkan oleh pengembang model.
- Mereka menggunakan 10 detik, 720p klip teks-video dengan audio.
- Pembagian FLUX 3 Kegiatan kandidat dan evaluasi masih dalam pengembangan.
- Hingga hasil dapat meringkas subset bukan setiap kategori prompt.
- Reproduksi independen belum tersedia.
Angka-angka ini adalah bukti awal yang berguna, bukan bukti bahwa FLUX 3 lebih baik secara universal.
Kasus Penggunaan yang Praktis
Adegan pendek yang didorong oleh dialog
Bahasa asli dan ekspresi wajah membuat FLUX 3 relevan dengan momen narasi pendek dan konsep karakter multilingual.
Video produk dan merek
Gambar referensi dapat membangun produk atau identitas visual, sementara suara asli menciptakan draf kampanye yang lebih lengkap.
Video sosial
Rasio aspek yang berbeda, teks animasi dan durasi pendek cocok dengan iklan, pengumuman dan format sosial vertikal.
Prasyarat
Gambar, video referensi dan keyframes dapat mengubah storyboard menjadi pratinjau yang bergerak untuk keputusan kamera, waktu dan transisi.
Variasi video dan lanjutan
Tim dapat mengeksplorasi adegan alternatif, memperpanjang tembakan atau membawa karakter sentral ke konteks lain.
Bercerita multi-shot
Klip berantai dapat menciptakan urutan yang lebih panjang sementara referensi visual membantu menjaga konsistensi.
FLUX 3 Video API Ketersediaan
FLUX 3 Video tersedia sekarang di PoYo melalui lima ID model produksi:
flux-3/text-to-videoflux-3/image-to-videoflux-3/first-last-frame-to-videoflux-3/extend-videoflux-3/keyframes-to-video
Semua lima penggunaan PoYoAliran generasi asinkron untuk pengiriman tugas dan pengambilan status. Gunakan FLUX 3 halaman model untuk generasi interaktif atau Dokumentasi API untuk rincian integrasi.
Pertanyaan yang Sering Ditanyakan
Apakah FLUX 3 Video tersedia sekarang?
Ya. PoYo menyediakan lima aliran kerja produksi untuk teks, gambar, frame pertama dan terakhir, ekstensi sumber video, dan keyframes yang ditempatkan.
Apakah FLUX 3 Video menghasilkan suara?
Ya. Ini menghasilkan audio asli bersama dengan video, termasuk suara lingkungan dan dialog multilingual.
Berapa lama bisa FLUX 3 Video bisa?
BFL mengatakan satu generasi bisa sampai 20 detik. Garis-garis yang lebih panjang dapat disusun dengan mengetuk klip.
Apakah FLUX 3 mendukung gambar ke video?
Ya. Ini dapat menganimasi frame awal atau menggunakan gambar sebagai referensi visual.
Apakah mendukung video ke video?
Ya. BFL mengatakan video sumber dapat membimbing elemen sentral seperti karakter dalam adegan atau konteks baru.
Bisa FLUX 3 melanjutkan video yang ada?
Ya. Video-dan-audio lanjutan adalah salah satu alur kerja yang diumumkan.
Bahasa mana yang FLUX 3 dukungan?
BFL mengumumkan dialog multilingual tetapi belum mempublikasikan daftar bahasa yang didukung.
Apa yang dilakukan FLUX 3 Video API biaya?
Biaya alur kerja standar 34 kredit per detik pada 720p atau 58 di 1080p. Biaya perpanjangan video 82 kredit per detik pada 720p atau 106 di 1080p.
Kesimpulan
FLUX 3 Video menggabungkan beberapa alur kerja yang sebelumnya membutuhkan model terpisah: teks-ke-video, animasi gambar, transformasi video, lanjutan, transisi keyframe dan generasi audio.
Perbedaan yang paling penting bukan hanya 20-durasi detik. Ini adalah upaya untuk menghasilkan gerakan dan suara dari satu representasi bersama, sambil menerima referensi di berbagai media.
Bacalah semua yang diketahui saat ini tentang FLUX 3, membandingkan FLUX 3 dan FLUX 2, atau penggunaan FLUX 3 pada PoYo.

