
Black Forest Labs ha annunciato FLUX 3 il 23 luglio 2026. Si tratta del più grande cambiamento apportato finora alla famiglia di modelli FLUX: invece di concentrarsi solo sulla generazione e l'editing delle immagini, FLUX 3 è un modello di fondazione multimodale addestrato su immagini, video, audio e azioni.
FLUX 3 è ora disponibile su PoYo con cinque workflow video di produzione: testo-video, immagine-video, primo/ultimo fotogramma, estensione e fotogrammi chiave. PoYo FLUX 3.
Questa guida separa ciò che Black Forest Labs ha annunciato ufficialmente dai dettagli che rimangono sconosciuti.
FLUX 3 in breve
| Caratteristica | Informazioni annunciate ufficialmente |
|---|---|
| Sviluppatore | Black Forest Labs |
| Data dell'annuncio | 23 luglio 2026 |
| Stato attuale | Cinque workflow video di produzione disponibili su PoYo |
| Modalità | Immagini, video, audio e previsione delle azioni |
| Input | Testo, immagini e riferimenti video |
| Funzionalità dell'immagine | Generazione e modifica |
| Funzionalità video | Testo in video, immagine in video, video in video, continuazione e fotogrammi chiave |
| Audio nativo | Sì |
| Durata massima del video annunciata | Fino a 20 secondi in una generazione |
| Dialogo multilingue | Annunciato |
| Accesso generale PoYo API | Disponibile ora |
| ID modello API pubblici e prezzi | Consulta la documentazione PoYo corrente per ID modello, parametri e prezzi. |
Cos'è FLUX 3?
FLUX 3 è un modello multimodale unificato. Black Forest Labs afferma di essere stato addestrato su immagini, video e audio contemporaneamente in modo che le modalità si vincolino e si informino a vicenda.
Un'immagine descrive la struttura spaziale. Il video aggiunge tempo e movimento. L'audio fornisce prove su eventi e interazioni fisiche. Il linguaggio collega questi segnali a istruzioni e obiettivi astratti. FLUX 3 è progettato per apprendere una rappresentazione condivisa anziché trattare ciascun mezzo come un'attività di generazione isolata.
Si tratta di una direzione del prodotto diversa da FLUX 2, che è principalmente una famiglia di generazione e modifica di immagini. FLUX 3 continua a generare e modificare immagini, ma produce anche video con audio nativo e fornisce una base per la previsione dell'azione.

La famiglia di modelli FLUX 3
Black Forest Labs ha annunciato quattro applicazioni principali della base FLUX 3.
FLUX 3 Image
FLUX 3 Image copre la sintesi e la modifica delle immagini tramite API e accesso privato ai pesi. BFL afferma che il modello gestisce stili, proporzioni e risoluzioni diversi, segue istruzioni complesse in modo più accurato e migliora il rendering del testo multilingue.
FLUX 3 Video
FLUX 3 Video genera e modifica video con audio nativo. Accetta testi, immagini e riferimenti video e supporta diversi flussi di lavoro, tra cui la continuazione e la generazione controllata dai fotogrammi chiave.
FLUX 3 Dev
FLUX 3 Dev è il backbone multimodale open-weight annunciato. BFL lo descrive come una base per la creazione di contenuti e la previsione delle azioni. L'azienda non ha ancora pubblicato pesi, licenza, requisiti hardware o data di rilascio.
FLUX 3 Action e FLUX-mimic
FLUX 3 supporta anche la previsione delle azioni attraverso partner selezionati nella ricerca e nel settore commerciale. FLUX-mimic, sviluppato con Mimic Robotics, applica la rappresentazione visiva del mondo del modello alle azioni robotiche. Si tratta di una direzione specialistica per ricerca e industria, non di un generatore consumer di immagini o video.
Funzionalità di FLUX 3 Image
FLUX 3 rimane un modello di immagine importante anche se il suo ambito è più ampio rispetto alle versioni precedenti di FLUX.
Black Forest Labs ha annunciato:
- Generazione da testo a immagine
- Modifica delle immagini
- Diversi stili visivi e proporzioni
- Risoluzioni di uscita multiple
- Migliore gestione dei prompt complessi
- Generazione di testo multilingue più accurata
- API e accesso privato ai pesi
Gli esempi ufficiali spaziano da primi piani fotorealistici e immagini in studio simili a prodotti a dipinti e illustrazioni piatte. Dimostrano diversità di stile, ma sono campioni di lancio selezionati piuttosto che una misura indipendente di coerenza.

Mancano ancora importanti dettagli per la produzione. BFL non ha pubblicato i parametri finali dell'API FLUX 3 Image, la risoluzione massima, la latenza, i rate limit o il prezzo.
Funzionalità video di FLUX 3
FLUX 3 può generare video con audio della durata massima di 20 secondi in una singola generazione. I flussi di lavoro annunciati includono:
- Da testo a video: crea una clip completa da una descrizione scritta.
- Da immagine a video: anima un fotogramma iniziale o utilizza immagini come riferimenti visivi.
- Da video a video: trasporta personaggi, soggetti o elementi visivi da una clip sorgente in un'altra scena.
- Continuazione video e audio: estende una sequenza audiovisiva esistente.
- Keyframe-to-video: genera transizioni controllate tra momenti definiti.
- Dialogo multilingue: genera contenuti parlati in più lingue.
- Concatenamento di riprese multiple: collega le clip in sequenze più lunghe utilizzando un flusso di lavoro agente.
- Tipografia animata: produce motion design e testo animato.
L'audio del modello è nativo anziché aggiunto come fase di post-elaborazione separata. Ciò è importante per gli eventi in cui suono, movimento e tempismo devono concordare.
Come si inserisce Self-Flow in FLUX 3
FLUX 3 si basa su Self-Flow, un metodo sviluppato da Black Forest Labs per allineare la generazione e la comprensione multimodale in un'unica architettura.
La ricerca preliminare di BFL confronta il Self-Flow con la corrispondenza del flusso convenzionale nella generazione di immagini, video e audio. L'azienda segnala un errore di generazione normalizzato inferiore e un apprendimento più rapido sulle attività di manipolazione a valle.
Questi risultati aiutano a spiegare l'architettura, ma non vanno interpretati come un benchmark pubblico completo dei prodotti FLUX 3 finali. Il modello e l'infrastruttura di valutazione sono ancora in fase di sviluppo.
Prime valutazioni video FLUX 3
Black Forest Labs ha pubblicato risultati preliminari sulle preferenze umane per clip da testo a video di 10 secondi, a 720p e con audio. Nei suoi test, FLUX 3 è stato preferito a:
- Grok Imagine Video fino al 69% dei confronti
- Kling v3 Pro nel 60%
- Happy Horse v1 nel 59%
- Happy Horse 1.1 nel 57%
- Seedance 2.0 e Gemini Omni Flash nel 52%
- Runway Gen-4.5 nel 77%
- Luma Ray 3.2 nel 93%
Queste sono valutazioni iniziali pubblicate dal fornitore, non una classifica indipendente. BFL afferma esplicitamente che il modello e l’impostazione della valutazione sono ancora in evoluzione. La selezione dei prompt, le impostazioni di campionamento, i valutatori e le versioni dei modelli concorrenti possono influenzare i risultati delle preferenze.
Disponibilità di FLUX 3
Cinque workflow video di produzione disponibili su PoYo:
flux-3/text-to-videoflux-3/image-to-videoflux-3/first-last-frame-to-videoflux-3/extend-videoflux-3/keyframes-to-video
PoYo genera clip da 5–20 secondi a 720p o 1080p, con otto rapporti e audio nativo. I workflow standard costano 34/58 crediti al secondo; l’estensione 82/106.
Il rilascio riguarda i workflow video FLUX 3. Image, Action e Dev restano elementi separati della roadmap. FLUX 3 API.
Casi d'uso di FLUX 3
Generazione e modifica delle immagini
FLUX 3 Image può supportare immagini di prodotto, illustrazioni editoriali, pubblicità, design multilingue ed editing controllato da riferimenti.
Brevi video con audio sincronizzato
La generazione audiovisiva nativa è utile per scene di dialogo, dimostrazioni di prodotti, clip social, progetti animati e concetti di storie in cui il suono deve corrispondere all'azione.
Coerenza di personaggi e stile
I riferimenti a immagini e video possono trasportare un soggetto centrale o un linguaggio visivo in nuove scene. Il concatenamento di più riprese potrebbe estenderlo a sequenze più lunghe.
Pre-visualizzazione
I fotogrammi chiave, le clip di riferimento e gli input di immagini possono aiutare i team creativi a esplorare le transizioni, il movimento della telecamera e la struttura della scena prima della produzione convenzionale.
Ricerca sull'intelligenza artificiale fisica
La rappresentazione condivisa del mondo di FLUX 3 può essere adattata anche alla previsione delle azioni, come dimostra la collaborazione FLUX-mimic.
Domande frequenti
FLUX 3 è stato rilasciato?
Cinque workflow video di produzione disponibili su PoYo.
FLUX 3 è un modello immagine o un modello video?
È un modello di fondazione multimodale. Le varianti annunciate riguardano la generazione e la modifica di immagini, video con audio nativo e previsione dell'azione.
FLUX 3 genera audio?
Sì. FLUX 3 Video genera audio nativo insieme al video e supporta il dialogo multilingue.
Quanto possono durare i video FLUX 3?
PoYo: 5–20 s, 720p/1080p.
FLUX 3 è open source?
BFL ha annunciato un backbone FLUX 3 Dev open-weight, ma i pesi, la licenza e la data di rilascio non sono stati ancora pubblicati.
FLUX 3 API è disponibile su PoYo?
Disponibile ora. FLUX 3.
In cosa FLUX 3 è diverso da FLUX 2?
FLUX 2 si concentra sulla generazione e la modifica delle immagini. FLUX 3 espande la famiglia in un modello unificato per immagini, video, audio nativo e previsione delle azioni. Consulta il confronto dettagliato tra FLUX 3 e FLUX 2.
Considerazioni finali
FLUX 3 non è semplicemente un altro aggiornamento del modello di immagine. Trasforma FLUX da una famiglia incentrata sull'immagine in una piattaforma multimodale progettata per collegare aspetto visivo, movimento, suono e comportamento fisico.
Cinque workflow video di produzione disponibili su PoYo.
Consulta la documentazione PoYo corrente per ID modello, parametri e prezzi. FLUX 3 API.