Semua artikel
panduan9 menit baca

FLUX 3 Video: Native Audio, 20-Klip detik dan Fitur Kunci

Menjelajahi FLUX 3 Video, termasuk audio asli, 20- generasi detik, teks-ke-video, gambar-ke-video, referensi video, lanjutan dan dialog multilingual.

FLUX 3 Video: Native Audio, 20-Klip detik dan Fitur Kunci
panduan

FLUX 3 Video dengan audio asli dan referensi multimodal

FLUX 3 Video Black Forest Labs adalah yang pertama FLUX model untuk generasi audiovisual penuh. Ini menciptakan video dan audio asli bersama-sama, menerima teks, gambar dan referensi video, dan menghasilkan klip hingga 20 detik dalam satu generasi.

FLUX 3 Video sekarang tersedia di PoYo melalui lima alur kerja produksi dengan ID model yang diterbitkan, kontrol permintaan, dan penentuan harga per detik. Pembagian FLUX 3 API halaman di PoYo menyediakan generator langsung untuk teks, gambar, frame pertama dan terakhir, ekstensi sumber video, dan keyframes yang ditempatkan.

FLUX 3 Video dengan Sekilas

Fitur Dukungan diumumkan
Teks-ke-video Ya
Gambar-ke-video Ya
Referensi gambar Ya
Video ke video Ya
Video dan audio lanjutan Ya
Keyframe-to-video Ya
Audio asli Ya
Dialog Berbahasa Ya
Durasi maksimum satu generasi Sampai 20 detik
Rasio aspek Berbagai format diumumkan
Tipografi animasi Diumumkan
Sequence multi-shot Rantai agen diumumkan
Umum PoYo API Tersedia sekarang

Apa yang terjadi FLUX 3 Video?

FLUX 3 Video adalah salah satu aplikasi dari FLUX 3 model dasar multimodal. Tidak seperti model gambar yang disesuaikan untuk menghasilkan bingkai, FLUX 3 telah dilatih melalui gambar, video dan audio dalam arsitektur bersama.

Tujuannya adalah untuk memodel lebih dari sekadar penampilan visual. Video mengajarkan gerakan dan hubungan temporal. Audio memberikan informasi tentang dampak, materi, pidato dan peristiwa lingkungan. Latihan bersama memungkinkan suara yang dihasilkan untuk terhubung dengan apa yang terjadi di layar.

Ini juga mengapa FLUX 3 mencakup lebih dari pembuatan konten ke prediksi tindakan melalui varian penelitian khusus.

Resmi FLUX 3 meluncurkan media dari Black Forest Labs.

Teks-ke-Video

Teks-ke-video membuat klip langsung dari deskripsi adegan tertulis. Pesan yang berguna dapat mendefinisikan:

  • Subyek dan tindakan
  • Lokasi dan waktu
  • Posisi dan gerakan kamera
  • Gaya visual
  • Dialog bicara
  • Suara lingkungan
  • Waktu dan urutan peristiwa
  • Rasio aspek

FLUX 3 dapat menghasilkan bagian visual dan audio dalam satu pass. PoYo permintaan mengekspos prompt, durasi, resolusi, rasio aspek, toggle audio, dan input gambar, sumber-video, atau keyframe yang dibutuhkan oleh alur kerja yang dipilih.

Gambar-ke-video

FLUX 3 mendukung dua pendekatan yang didorong oleh gambar.

Animasi frame awal

Sebuah gambar dapat mendefinisikan frame pertama, setelah itu model menciptakan gerakan dan suara. Ini berguna untuk menganimasi gambar produk, ilustrasi, potret atau adegan yang dirancang.

Input referensi visual

Gambar juga dapat bertindak sebagai referensi identitas, subjek atau gaya tanpa menjadi frame pertama secara harfiah. Hal ini dapat membantu menjaga karakter, objek atau arah visual dalam adegan baru.

Pada PoYo, gambar-ke-video menerima satu sumber gambar, generasi frame pertama dan terakhir menerima dua gambar tertib, dan generasi keyframe menerima hingga sepuluh gambar yang ditempatkan. Periksa arus API dokumentasi untuk persyaratan unggah dan format file.

Video-ke-video

Video-to-video menggunakan klip sumber sebagai referensi dan membawa elemen sentral ke adegan atau konteks yang berbeda.

Aplikasi potensial meliputi:

  • Memindahkan karakter yang sama ke lingkungan baru
  • Menyaring kembali rekaman dalam gaya visual lain
  • Menjaga gerakan sambil mengubah adegan
  • Membuat variasi dari tembakan yang ada
  • Menggunakan kinerja sebagai referensi temporal

Video-ke-video tidak menjamin identitas yang sempurna atau pelestarian gerakan. PoYo saat ini mengekspos sumber-video lanjutan melalui flux-3/extend-videotidak boleh bingung dengan titik akhir video-restyling umum yang terpisah.

Video dan Audio Lanjutkan

FLUX 3 dapat melanjutkan video input dan audio. Model lanjutan harus memperluas beberapa hal bersama:

  • Penampilan subjek
  • Gerakan kamera
  • Laluan objek
  • Pencahayaan dan lingkungan
  • Dialog atau suasana
  • Ritme dan waktu acara

Aliran kerja ini dapat memperpanjang gambar pendek atau menghasilkan beat cerita berturut-turut tanpa memulai setiap klip dari prompt yang tidak terkait.

Keyframe-to-Video

Keyframe-to-video menghasilkan transisi antara momen visual yang ditentukan. Bentuk awal dan akhir dapat mengkomunikasikan komposisi dengan lebih tepat daripada teks saja.

Penggunaan yang mungkin meliputi:

  • Transformasi produk
  • Transisi kamera
  • Gerakan karakter antara pose
  • Sebelum dan sesudah urutan
  • Animasi logo atau tipografi
  • Prasaksari dari storyboard ke motion

PoYo mendukung hingga sepuluh keyframe yang ditempatkan. Setiap keyframe memberikan gambar URL dan indeks bingkai, yang memungkinkan waktu transisi dikendalikan secara langsung.

Generasi Audio Native

Audio asli adalah FLUX 3 Fitur yang menentukan video. Model ini menghasilkan suara sebagai bagian dari adegan yang sama daripada bergantung sepenuhnya pada pipa audio terpisah.

Suara yang sejalan dengan peristiwa

Tindakan seperti dampak, gerakan dan interaksi mekanis dapat menghasilkan suara yang disesuaikan dengan peristiwa yang terlihat. BFL mengatakan model ini sangat kuat dalam menghubungkan suara dengan peristiwa fisik.

Audio lingkungan

Sebuah adegan dapat mencakup suasana yang sesuai dengan lokasi, cuaca dan aktivitasnya. Itu mungkin memberikan draf pertama yang lebih lengkap daripada generasi video diam.

Dialog Berbahasa

Black Forest Labs mencantumkan dialog multilingual sebagai kemampuan inti. Pengumuman peluncuran tidak memberikan daftar bahasa yang lengkap atau akurasi pidato yang diukur untuk setiap bahasa.

Video dan audio lanjutan

Model ini dapat memperluas input audiovisual, berpotensi mempertahankan suasana, konteks pidato dan waktu acara ke bagian baru.

Generasi asli tidak menghilangkan post-produksi. Kekuatan dialog, pengucapan, sinkronisasi bibir, tingkat audio dan artefak yang tidak diinginkan masih membutuhkan tinjauan.

Durasi dan resolusi

PoYo menerima durasi bilangan bulat dari 5 melalui 20 detik dan dukungan 720p dan 1080p output di delapan aspek rasio. Audio asli dapat diaktifkan dalam permintaan yang sama.

Biaya teks standar, gambar, frame pertama dan terakhir, dan arus kerja keyframe 34 kredit per detik pada 720p atau 58 kredit per detik pada 1080p. Biaya perpanjangan video 82 kredit per detik pada 720p atau 106 kredit per detik pada 1080p. Frame rate, codec, waktu generasi, dan detail operasional lainnya harus diperiksa dalam arus FLUX 3 Dokumentasi API.

Karakter dan Gaya yang konsisten

FLUX 3 menggunakan referensi visual untuk membantu menjaga elemen sentral di seluruh adegan. BFL mengatakan referensi dapat menjaga karakter konsisten dalam urutan multi-tampilan berlangsung beberapa menit.

Output yang lebih lama dibuat dengan menyalurkan klip individu, bukan dengan menghasilkan beberapa menit dalam satu panggilan. Setiap tembakan masih mungkin memerlukan:

  • Pilihan referensi
  • Kontinuitas prompt
  • Perencanaan Transisi
  • Pemeriksaan identitas
  • Pemeriksaan kontinuitas audio
  • Pengeditan dan perakitan

Rantai agen dapat mengotomatiskan sebagian dari perencanaan, tetapi tidak mengubah 20-Limit generasi tunggal detik ke dalam tembakan terus-menerus tak terbatas.

Tipografi dan Desain Animasi

BFL menyoroti tipografi yang kuat dan desain animasi sebagai FLUX 3 Kemampuan video. Ini bisa mendukung:

  • Poster gerakan
  • Urutan judul
  • Pengumuman produk
  • Tipografi kinetik
  • Iklan sosial
  • Interface dan animasi grafis

Teks yang dihasilkan masih harus diperiksa frame per frame. Judul mungkin terlihat benar dalam satu saat dan cacat selama gerakan.

Hasil Evaluasi Awal

Dalam tes preferensi manusia awal BFL, FLUX 3 dibandingkan dengan beberapa model video. Perusahaan melaporkan tingkat preferensi mulai dari 52% terhadap Seedance 2.0 dan Gemini Omni Flash untuk 93% melawan Luma Ray 3.2.

Hasil ini membutuhkan konteks:

  • Mereka diterbitkan oleh pengembang model.
  • Mereka menggunakan 10 detik, 720p klip teks-video dengan audio.
  • Pembagian FLUX 3 Kegiatan kandidat dan evaluasi masih dalam pengembangan.
  • Hingga hasil dapat meringkas subset bukan setiap kategori prompt.
  • Reproduksi independen belum tersedia.

Angka-angka ini adalah bukti awal yang berguna, bukan bukti bahwa FLUX 3 lebih baik secara universal.

Kasus Penggunaan yang Praktis

Adegan pendek yang didorong oleh dialog

Bahasa asli dan ekspresi wajah membuat FLUX 3 relevan dengan momen narasi pendek dan konsep karakter multilingual.

Video produk dan merek

Gambar referensi dapat membangun produk atau identitas visual, sementara suara asli menciptakan draf kampanye yang lebih lengkap.

Video sosial

Rasio aspek yang berbeda, teks animasi dan durasi pendek cocok dengan iklan, pengumuman dan format sosial vertikal.

Prasyarat

Gambar, video referensi dan keyframes dapat mengubah storyboard menjadi pratinjau yang bergerak untuk keputusan kamera, waktu dan transisi.

Variasi video dan lanjutan

Tim dapat mengeksplorasi adegan alternatif, memperpanjang tembakan atau membawa karakter sentral ke konteks lain.

Bercerita multi-shot

Klip berantai dapat menciptakan urutan yang lebih panjang sementara referensi visual membantu menjaga konsistensi.

FLUX 3 Video API Ketersediaan

FLUX 3 Video tersedia sekarang di PoYo melalui lima ID model produksi:

  • flux-3/text-to-video
  • flux-3/image-to-video
  • flux-3/first-last-frame-to-video
  • flux-3/extend-video
  • flux-3/keyframes-to-video

Semua lima penggunaan PoYoAliran generasi asinkron untuk pengiriman tugas dan pengambilan status. Gunakan FLUX 3 halaman model untuk generasi interaktif atau Dokumentasi API untuk rincian integrasi.

Pertanyaan yang Sering Ditanyakan

Apakah FLUX 3 Video tersedia sekarang?

Ya. PoYo menyediakan lima aliran kerja produksi untuk teks, gambar, frame pertama dan terakhir, ekstensi sumber video, dan keyframes yang ditempatkan.

Apakah FLUX 3 Video menghasilkan suara?

Ya. Ini menghasilkan audio asli bersama dengan video, termasuk suara lingkungan dan dialog multilingual.

Berapa lama bisa FLUX 3 Video bisa?

BFL mengatakan satu generasi bisa sampai 20 detik. Garis-garis yang lebih panjang dapat disusun dengan mengetuk klip.

Apakah FLUX 3 mendukung gambar ke video?

Ya. Ini dapat menganimasi frame awal atau menggunakan gambar sebagai referensi visual.

Apakah mendukung video ke video?

Ya. BFL mengatakan video sumber dapat membimbing elemen sentral seperti karakter dalam adegan atau konteks baru.

Bisa FLUX 3 melanjutkan video yang ada?

Ya. Video-dan-audio lanjutan adalah salah satu alur kerja yang diumumkan.

Bahasa mana yang FLUX 3 dukungan?

BFL mengumumkan dialog multilingual tetapi belum mempublikasikan daftar bahasa yang didukung.

Apa yang dilakukan FLUX 3 Video API biaya?

Biaya alur kerja standar 34 kredit per detik pada 720p atau 58 di 1080p. Biaya perpanjangan video 82 kredit per detik pada 720p atau 106 di 1080p.

Kesimpulan

FLUX 3 Video menggabungkan beberapa alur kerja yang sebelumnya membutuhkan model terpisah: teks-ke-video, animasi gambar, transformasi video, lanjutan, transisi keyframe dan generasi audio.

Perbedaan yang paling penting bukan hanya 20-durasi detik. Ini adalah upaya untuk menghasilkan gerakan dan suara dari satu representasi bersama, sambil menerima referensi di berbagai media.

Bacalah semua yang diketahui saat ini tentang FLUX 3, membandingkan FLUX 3 dan FLUX 2, atau penggunaan FLUX 3 pada PoYo.

Sumber: Laboratorium Hutan Hitam FLUX 3 Pengumuman

Blog · PoYo.aiSemua artikel
HUBUNGI KAMI

Punya proyek?

Ceritakan apa yang Anda bangun. Tim kami akan membantu memilih API AI yang tepat.

Data Anda hanya digunakan untuk menanggapi pertanyaan ini.

PoYo AI

Siap menjelajahi model?

Jelajahi model gambar, video, audio, dan bahasa di PoYo.

Lihat model AI