guides

FLUX 3: Immagine, Video, Audio e Tutto Ciò Che Sappiamo

Poyo.ai Team
Updated
8 min read
Share:

FLUX 3 modello multimodale per immagini, video, audio e azione

Black Forest Labs ha annunciato FLUX 3 il 23 luglio 2026. Si tratta del più grande cambiamento apportato finora alla famiglia di modelli FLUX: invece di concentrarsi solo sulla generazione e l'editing delle immagini, FLUX 3 è un modello di fondazione multimodale addestrato su immagini, video, audio e azioni.

FLUX 3 è ora disponibile su PoYo con cinque workflow video di produzione: testo-video, immagine-video, primo/ultimo fotogramma, estensione e fotogrammi chiave. PoYo FLUX 3.

Questa guida separa ciò che Black Forest Labs ha annunciato ufficialmente dai dettagli che rimangono sconosciuti.

FLUX 3 in breve

CaratteristicaInformazioni annunciate ufficialmente
SviluppatoreBlack Forest Labs
Data dell'annuncio23 luglio 2026
Stato attualeCinque workflow video di produzione disponibili su PoYo
ModalitàImmagini, video, audio e previsione delle azioni
InputTesto, immagini e riferimenti video
Funzionalità dell'immagineGenerazione e modifica
Funzionalità videoTesto in video, immagine in video, video in video, continuazione e fotogrammi chiave
Audio nativo
Durata massima del video annunciataFino a 20 secondi in una generazione
Dialogo multilingueAnnunciato
Accesso generale PoYo APIDisponibile ora
ID modello API pubblici e prezziConsulta la documentazione PoYo corrente per ID modello, parametri e prezzi.

Cos'è FLUX 3?

FLUX 3 è un modello multimodale unificato. Black Forest Labs afferma di essere stato addestrato su immagini, video e audio contemporaneamente in modo che le modalità si vincolino e si informino a vicenda.

Un'immagine descrive la struttura spaziale. Il video aggiunge tempo e movimento. L'audio fornisce prove su eventi e interazioni fisiche. Il linguaggio collega questi segnali a istruzioni e obiettivi astratti. FLUX 3 è progettato per apprendere una rappresentazione condivisa anziché trattare ciascun mezzo come un'attività di generazione isolata.

Si tratta di una direzione del prodotto diversa da FLUX 2, che è principalmente una famiglia di generazione e modifica di immagini. FLUX 3 continua a generare e modificare immagini, ma produce anche video con audio nativo e fornisce una base per la previsione dell'azione.

Architettura del trasformatore multimodale FLUX 3

La famiglia di modelli FLUX 3

Black Forest Labs ha annunciato quattro applicazioni principali della base FLUX 3.

FLUX 3 Image

FLUX 3 Image copre la sintesi e la modifica delle immagini tramite API e accesso privato ai pesi. BFL afferma che il modello gestisce stili, proporzioni e risoluzioni diversi, segue istruzioni complesse in modo più accurato e migliora il rendering del testo multilingue.

FLUX 3 Video

FLUX 3 Video genera e modifica video con audio nativo. Accetta testi, immagini e riferimenti video e supporta diversi flussi di lavoro, tra cui la continuazione e la generazione controllata dai fotogrammi chiave.

FLUX 3 Dev

FLUX 3 Dev è il backbone multimodale open-weight annunciato. BFL lo descrive come una base per la creazione di contenuti e la previsione delle azioni. L'azienda non ha ancora pubblicato pesi, licenza, requisiti hardware o data di rilascio.

FLUX 3 Action e FLUX-mimic

FLUX 3 supporta anche la previsione delle azioni attraverso partner selezionati nella ricerca e nel settore commerciale. FLUX-mimic, sviluppato con Mimic Robotics, applica la rappresentazione visiva del mondo del modello alle azioni robotiche. Si tratta di una direzione specialistica per ricerca e industria, non di un generatore consumer di immagini o video.

Funzionalità di FLUX 3 Image

FLUX 3 rimane un modello di immagine importante anche se il suo ambito è più ampio rispetto alle versioni precedenti di FLUX.

Black Forest Labs ha annunciato:

  • Generazione da testo a immagine
  • Modifica delle immagini
  • Diversi stili visivi e proporzioni
  • Risoluzioni di uscita multiple
  • Migliore gestione dei prompt complessi
  • Generazione di testo multilingue più accurata
  • API e accesso privato ai pesi

Gli esempi ufficiali spaziano da primi piani fotorealistici e immagini in studio simili a prodotti a dipinti e illustrazioni piatte. Dimostrano diversità di stile, ma sono campioni di lancio selezionati piuttosto che una misura indipendente di coerenza.

Esempi di immagini ufficiali FLUX 3

Mancano ancora importanti dettagli per la produzione. BFL non ha pubblicato i parametri finali dell'API FLUX 3 Image, la risoluzione massima, la latenza, i rate limit o il prezzo.

Funzionalità video di FLUX 3

FLUX 3 può generare video con audio della durata massima di 20 secondi in una singola generazione. I flussi di lavoro annunciati includono:

  • Da testo a video: crea una clip completa da una descrizione scritta.
  • Da immagine a video: anima un fotogramma iniziale o utilizza immagini come riferimenti visivi.
  • Da video a video: trasporta personaggi, soggetti o elementi visivi da una clip sorgente in un'altra scena.
  • Continuazione video e audio: estende una sequenza audiovisiva esistente.
  • Keyframe-to-video: genera transizioni controllate tra momenti definiti.
  • Dialogo multilingue: genera contenuti parlati in più lingue.
  • Concatenamento di riprese multiple: collega le clip in sequenze più lunghe utilizzando un flusso di lavoro agente.
  • Tipografia animata: produce motion design e testo animato.

L'audio del modello è nativo anziché aggiunto come fase di post-elaborazione separata. Ciò è importante per gli eventi in cui suono, movimento e tempismo devono concordare.

Come si inserisce Self-Flow in FLUX 3

FLUX 3 si basa su Self-Flow, un metodo sviluppato da Black Forest Labs per allineare la generazione e la comprensione multimodale in un'unica architettura.

La ricerca preliminare di BFL confronta il Self-Flow con la corrispondenza del flusso convenzionale nella generazione di immagini, video e audio. L'azienda segnala un errore di generazione normalizzato inferiore e un apprendimento più rapido sulle attività di manipolazione a valle.

Questi risultati aiutano a spiegare l'architettura, ma non vanno interpretati come un benchmark pubblico completo dei prodotti FLUX 3 finali. Il modello e l'infrastruttura di valutazione sono ancora in fase di sviluppo.

Prime valutazioni video FLUX 3

Black Forest Labs ha pubblicato risultati preliminari sulle preferenze umane per clip da testo a video di 10 secondi, a 720p e con audio. Nei suoi test, FLUX 3 è stato preferito a:

  • Grok Imagine Video fino al 69% dei confronti
  • Kling v3 Pro nel 60%
  • Happy Horse v1 nel 59%
  • Happy Horse 1.1 nel 57%
  • Seedance 2.0 e Gemini Omni Flash nel 52%
  • Runway Gen-4.5 nel 77%
  • Luma Ray 3.2 nel 93%

Queste sono valutazioni iniziali pubblicate dal fornitore, non una classifica indipendente. BFL afferma esplicitamente che il modello e l’impostazione della valutazione sono ancora in evoluzione. La selezione dei prompt, le impostazioni di campionamento, i valutatori e le versioni dei modelli concorrenti possono influenzare i risultati delle preferenze.

Disponibilità di FLUX 3

Cinque workflow video di produzione disponibili su PoYo:

  • flux-3/text-to-video
  • flux-3/image-to-video
  • flux-3/first-last-frame-to-video
  • flux-3/extend-video
  • flux-3/keyframes-to-video

PoYo genera clip da 5–20 secondi a 720p o 1080p, con otto rapporti e audio nativo. I workflow standard costano 34/58 crediti al secondo; l’estensione 82/106.

Il rilascio riguarda i workflow video FLUX 3. Image, Action e Dev restano elementi separati della roadmap. FLUX 3 API.

Casi d'uso di FLUX 3

Generazione e modifica delle immagini

FLUX 3 Image può supportare immagini di prodotto, illustrazioni editoriali, pubblicità, design multilingue ed editing controllato da riferimenti.

Brevi video con audio sincronizzato

La generazione audiovisiva nativa è utile per scene di dialogo, dimostrazioni di prodotti, clip social, progetti animati e concetti di storie in cui il suono deve corrispondere all'azione.

Coerenza di personaggi e stile

I riferimenti a immagini e video possono trasportare un soggetto centrale o un linguaggio visivo in nuove scene. Il concatenamento di più riprese potrebbe estenderlo a sequenze più lunghe.

Pre-visualizzazione

I fotogrammi chiave, le clip di riferimento e gli input di immagini possono aiutare i team creativi a esplorare le transizioni, il movimento della telecamera e la struttura della scena prima della produzione convenzionale.

Ricerca sull'intelligenza artificiale fisica

La rappresentazione condivisa del mondo di FLUX 3 può essere adattata anche alla previsione delle azioni, come dimostra la collaborazione FLUX-mimic.

Domande frequenti

FLUX 3 è stato rilasciato?

Cinque workflow video di produzione disponibili su PoYo.

FLUX 3 è un modello immagine o un modello video?

È un modello di fondazione multimodale. Le varianti annunciate riguardano la generazione e la modifica di immagini, video con audio nativo e previsione dell'azione.

FLUX 3 genera audio?

Sì. FLUX 3 Video genera audio nativo insieme al video e supporta il dialogo multilingue.

Quanto possono durare i video FLUX 3?

PoYo: 5–20 s, 720p/1080p.

FLUX 3 è open source?

BFL ha annunciato un backbone FLUX 3 Dev open-weight, ma i pesi, la licenza e la data di rilascio non sono stati ancora pubblicati.

FLUX 3 API è disponibile su PoYo?

Disponibile ora. FLUX 3.

In cosa FLUX 3 è diverso da FLUX 2?

FLUX 2 si concentra sulla generazione e la modifica delle immagini. FLUX 3 espande la famiglia in un modello unificato per immagini, video, audio nativo e previsione delle azioni. Consulta il confronto dettagliato tra FLUX 3 e FLUX 2.

Considerazioni finali

FLUX 3 non è semplicemente un altro aggiornamento del modello di immagine. Trasforma FLUX da una famiglia incentrata sull'immagine in una piattaforma multimodale progettata per collegare aspetto visivo, movimento, suono e comportamento fisico.

Cinque workflow video di produzione disponibili su PoYo.

Consulta la documentazione PoYo corrente per ID modello, parametri e prezzi. FLUX 3 API.

Fonti: Annuncio FLUX 3 di Black Forest Labs, FLUX 3 x mimic

Share: