Semua artikel
panduan8 menit baca

FLUX 3: Gambar, Video, Audio dan Semua Yang Kita Ketahui

Pelajari apa FLUX 3 adalah, bagaimana gambar, video, audio asli dan kemampuan aksi bekerja, dan bagaimana untuk mengakses lima video produksi workflows pada PoYo.

FLUX 3: Gambar, Video, Audio dan Semua Yang Kita Ketahui
panduan

FLUX 3 Model multimodal untuk gambar, video, audio dan aksi

Black Forest Labs mengumumkan FLUX 3 pada bulan Juli 23, 2026. Ini adalah perubahan terbesar untuk FLUX keluarga model sejauh ini: daripada hanya fokus pada pembuatan dan pengeditan gambar, FLUX 3 adalah model dasar multimodal yang dilatih melalui gambar, video, audio dan aksi.

FLUX 3 tersedia pada PoYo melalui lima alur kerja video produksi: teks-ke-video, gambar-ke-video, generasi frame pertama dan terakhir, ekstensi video, dan keyframes yang ditempatkan. Pembagian FLUX 3 API halaman di PoYo mencakup generator langsung, ID model, kontrol yang didukung, dan harga.

Panduan ini memisahkan apa yang secara resmi diumumkan oleh Black Forest Labs dari detail yang masih belum diketahui.

FLUX 3 Dengan sekelip mata

Fitur Informasi yang diumumkan secara resmi
Pengembang Laboratorium Hutan Hitam
Tanggal pengumuman Juli 23, 2026
Status saat ini Lima video produksi workflow tersedia di PoYo
Cara Gambar, video, audio dan prediksi tindakan
Input Teks, gambar dan video referensi
Kemampuan gambar Generasi dan pengeditan
Kemampuan video Teks-ke-video, gambar-ke-video, video-ke-video, lanjutan dan keyframes
Audio asli Ya
Durasi video maksimum yang diumumkan Sampai 20 detik dalam satu generasi
Dialog Berbahasa Diumumkan
Umum PoYo API akses Tersedia sekarang
Publik API ID model dan harga Dipublikasikan di PoYo Dokumen dan halaman model

Apa yang terjadi FLUX 3?

FLUX 3 adalah model multimodal yang terintegrasi. Black Forest Labs mengatakan ia dilatih pada gambar, video dan audio pada saat yang sama sehingga modalitas membatasi dan saling menginformasikan.

Gambar menggambarkan struktur spasial. Video menambah waktu dan gerakan. Audio memberikan bukti tentang peristiwa dan interaksi fisik. Bahasa menghubungkan sinyal tersebut dengan instruksi dan tujuan abstrak. FLUX 3 dirancang untuk mempelajari representasi bersama daripada memperlakukan setiap media sebagai tugas generasi terisolasi.

Ini adalah arah produk yang berbeda dari FLUX 2, yang terutama merupakan generasi gambar dan keluarga pengeditan. FLUX 3 masih menghasilkan dan mengedit gambar, tapi juga menghasilkan video dengan audio asli dan menyediakan dasar untuk prediksi tindakan.

FLUX 3 arsitektur transformator multimodal

Pembagian FLUX 3 Keluarga Model

Black Forest Labs telah mengumumkan empat aplikasi utama dari FLUX 3 foundation.

FLUX 3 Gambar

FLUX 3 Gambar mencakup sintesis gambar dan pengeditan melalui API dan akses berat pribadi. BFL mengatakan model ini menangani gaya, rasio aspek dan resolusi yang bervariasi, mengikuti prompt yang kompleks dengan lebih akurat dan meningkatkan rendering teks multilingual.

FLUX 3 Video

FLUX 3 Video menghasilkan dan mengedit video dengan audio asli. Ini menerima referensi teks, gambar dan video dan mendukung beberapa alur kerja, termasuk kelanjutan dan generasi yang dikendalikan keyframe.

FLUX 3 Dev

FLUX 3 Dev adalah tulang belakang multimodal terbuka yang diumumkan. BFL menggambarkan sebagai dasar untuk pembuatan konten dan prediksi tindakan. Perusahaan belum mempublikasikan bobot, lisensi, persyaratan perangkat keras atau tanggal rilisnya.

FLUX 3 Aksi dan FLUX- mimik

FLUX 3 juga mendukung prediksi tindakan melalui mitra penelitian dan komersial yang terpilih. FLUX-mimic, dikembangkan dengan robotik mimik, menerapkan representasi dunia visual model untuk tindakan robot. Ini adalah penelitian khusus dan industri arah, bukan konsumen gambar atau video generator.

FLUX 3 Kemampuan Gambar

FLUX 3 tetap menjadi model gambar utama meskipun lingkupnya lebih luas daripada sebelumnya FLUX releases.

Black Forest Labs telah mengumumkan:

  • Generasi teks-ke-gambar
  • Pengeditan gambar
  • Berbagai gaya visual dan rasio aspek
  • Resolusi output yang bermacam-macam
  • Pengendalian yang lebih baik terhadap panggilan yang kompleks
  • Generasi teks multilingual yang lebih akurat
  • API dan akses pribadi

Contoh resmi berkisar dari foto-foto dekat realistis dan gambar studio seperti produk hingga lukisan dan ilustrasi datar. Mereka menunjukkan keragaman gaya, tetapi mereka dipilih sampel peluncuran daripada ukuran konsistensi independen.

Resmi FLUX 3 sampel gambar

Detail produksi penting masih hilang. BFL belum menerbitkan final FLUX 3 Gambar API parameter, resolusi maksimum, latensi, batas tarif atau harga.

FLUX 3 Kemampuan Video

FLUX 3 dapat menghasilkan video dengan audio hingga 20 detik lama dalam satu generasi. Aliran kerja yang diumumkan meliputi:

  • Teks-ke-video: membuat klip lengkap dari deskripsi tertulis.
  • Gambar-ke-video: menganimasi frame awal atau menggunakan gambar sebagai referensi visual.
  • Video-ke-video: membawa karakter, subjek atau elemen visual dari klip sumber ke adegan lain.
  • Video dan audio lanjutan: memperluas urutan audiovisual yang ada.
  • Keyframe-to-video: menghasilkan transisi terkontrol antara momen yang ditentukan.
  • Dialog multilingual: menghasilkan konten yang diucapkan dalam beberapa bahasa.
  • Rantai multi-shot: menghubungkan klip ke dalam urutan yang lebih panjang menggunakan alur kerja agen.
  • Tipografi animasi: menghasilkan desain gerakan dan teks animasi.

Audio model asli bukan ditambahkan sebagai langkah pos-proses terpisah. Hal ini penting untuk peristiwa di mana suara, gerakan dan waktu perlu sepakat.

Bagaimana Self-Flow Sesuai dengan FLUX 3

FLUX 3 dibangun pada Pembagian Diri, metode yang dikembangkan oleh Black Forest Labs untuk menyelaraskan generasi multimodal dan pemahaman dalam satu arsitektur.

Penelitian awal BFL membandingkan Self-Flow dengan aliran konvensional yang cocok di seluruh gambar, video dan audio generasi. Perusahaan melaporkan kesalahan generasi normal yang lebih rendah dan pembelajaran yang lebih cepat pada tugas manipulasi downstream.

Hasil ini membantu menjelaskan arsitektur, tetapi mereka tidak harus ditafsirkan sebagai benchmark publik lengkap dari final FLUX 3 produk. Model dan evaluasi harness masih dikembangkan.

Awal FLUX 3 Evaluasi Video

Black Forest Labs menerbitkan hasil preferensi manusia awal untuk 10 detik, 720p klip teks-video dengan audio. Dalam ujiannya, FLUX 3 lebih disukai daripada:

  • Grok Imagine Video di sampai 69% Perbandingan
  • Kling v3 Pro di 60%
  • Happy Horse v1 di 59%
  • Kuda Berbahagia 1.1 di 57%
  • Seedance 2.0 dan Gemini Omni Flash masuk 52%
  • Runway Gen-4.5 di 77%
  • Luma Ray 3.2 di 93%

Ini adalah evaluasi awal yang diterbitkan oleh vendor, bukan papan leader independen. BFL secara eksplisit mengatakan model dan pengaturan evaluasi masih berkembang. Pemilihan prompt, pengaturan pengambilan sampel, evaluator dan versi model yang bersaing semuanya dapat mempengaruhi hasil preferensi.

FLUX 3 Ketersediaan pada PoYo

PoYo saat ini mengekspos lima ID model video produksi:

  • flux-3/text-to-video
  • flux-3/image-to-video
  • flux-3/first-last-frame-to-video
  • flux-3/extend-video
  • flux-3/keyframes-to-video

Aliran kerja ini menghasilkan 5–20 klip detik di 720p atau 1080p, mendukung delapan aspek rasio, dan dapat membuat sinkronisasi audio asli. Biaya alur kerja standar 34 kredit per detik pada 720p atau 58 kredit per detik pada 1080p. Biaya perpanjangan video 82 atau 106 kredit per detik masing-masing.

Peluncuran ini berlaku untuk PoYo FLUX 3 video workflow. FLUX 3 Gambar, Aksi, dan Open Weight FLUX 3 Dev backbone tetap menjadi bagian terpisah dari peta jalan BFL yang lebih luas; PoYo tidak menampilkan mereka seperti yang dimasukkan dalam video saat ini API bebaskan. Lihatlah FLUX 3 Dokumentasi API untuk bidang dan batas permintaan saat ini.

FLUX 3 Penggunaan Kasus

Penciptaan dan pengeditan gambar

FLUX 3 Gambar dapat mendukung visual produk, ilustrasi editorial, periklanan, desain multilingual dan pengeditan yang dikontrol referensi.

Video pendek dengan suara sinkronisasi

Generasi audiovisual asli berguna untuk adegan dialog, demonstrasi produk, klip sosial, desain animasi dan konsep cerita di mana suara harus sesuai dengan tindakan.

Karakter dan gaya kontinuitas

Referensi gambar dan video dapat membawa subjek pusat atau bahasa visual ke adegan baru. Rantai multi-shot bisa memperpanjang ini ke urutan yang lebih panjang.

Prasyarat

Keyframe, klip referensi dan input gambar dapat membantu tim kreatif mengeksplorasi transisi, gerakan kamera dan struktur adegan sebelum produksi konvensional.

Penelitian AI fisik

FLUX 3Perwakilan dunia bersama juga dapat disesuaikan untuk prediksi tindakan, seperti yang ditunjukkan oleh FLUX- kolaborasi mimis.

Pertanyaan yang Sering Ditanyakan

Apakah FLUX 3 dibebaskan?

Black Forest Labs mengumumkan FLUX 3 pada bulan Juli 23, 2026. PoYo sekarang menyediakan lima produk video endpoint yang mencakup teks, gambar, frame pertama dan terakhir, sumber-video ekstensi, dan keyframes posisi.

Apakah FLUX 3 model gambar atau model video?

Ini adalah model yayasan multimodal. Varian yang diumumkan mencakup pembuatan dan pengeditan gambar, video dengan audio asli, dan prediksi aksi.

Apakah FLUX 3 menghasilkan audio?

Ya. FLUX 3 Video menghasilkan audio asli bersama dengan video dan mendukung dialog multilingual.

Berapa lama bisa FLUX 3 Video itu?

PoYo menerima durasi bilangan bulat dari 5 melalui 20 detik dan dukungan 720p dan 1080p output.

Apakah FLUX 3 sumber terbuka?

BFL mengumumkan berat badan terbuka FLUX 3 Dev spine, tapi berat, lisensi dan tanggal rilis belum dipublikasikan.

Apakah FLUX 3 API tersedia pada PoYo?

Ya. Gunakan FLUX 3 halaman model atau mengintegrasikan salah satu dari lima dokumen PoYo ID model video.

Bagaimana itu FLUX 3 berbeda dari FLUX 2?

FLUX 2 fokus pada pembuatan dan pengeditan gambar. FLUX 3 memperluas keluarga menjadi model yang terpadu untuk gambar, video, audio asli dan prediksi aksi. Lihat detailnya FLUX 3 vs FLUX 2 Perbandingan.

Kesimpulan Akhir

FLUX 3 bukan hanya peningkatan model gambar lain. Itu berubah FLUX dari keluarga yang berfokus pada gambar menjadi platform multimodal yang dirancang untuk menghubungkan penampilan visual, gerakan, suara dan perilaku fisik.

Kemampuan yang paling menarik jelas: generasi audiovisual asli, video yang didorong oleh referensi, dialog multilingual, tipografi yang lebih kuat dan arsitektur bersama yang memperluas ke arah prediksi tindakan. PoYo sekarang membuat lima video workflow yang dirilis tersedia dengan ID model terdokumentasi, kontrol, dan harga per detik.

Gunakan PoYo FLUX 3 halaman model untuk menghasilkan video sekarang, atau membaca Dokumentasi API sebelum terintegrasi. Teruslah memperlakukan detail Gambar, Aksi, dan Dev yang belum dirilis secara terpisah dari video akhir yang tersedia saat ini.

Sumber: Laboratorium Hutan Hitam FLUX 3 Pengumuman, FLUX 3 x meniru

Blog · PoYo.aiSemua artikel
HUBUNGI KAMI

Punya proyek?

Ceritakan apa yang Anda bangun. Tim kami akan membantu memilih API AI yang tepat.

Data Anda hanya digunakan untuk menanggapi pertanyaan ini.

PoYo AI

Siap menjelajahi model?

Jelajahi model gambar, video, audio, dan bahasa di PoYo.

Lihat model AI