FLUX 3: Imagen, video, audio y todo lo que sabemos
Descubre las capacidades de imagen, vídeo, audio nativo y acción de FLUX 3 y cómo usar cinco flujos de vídeo de producción en PoYo.


Black Forest Labs anunció FLUX 3 el 23 de julio de 2026. Es el mayor cambio realizado hasta ahora en la familia de modelos FLUX: en lugar de centrarse únicamente en la generación y edición de imágenes, FLUX 3 es un modelo fundacional multimodal entrenado con imágenes, video, audio y acción.
FLUX 3 ya está disponible en PoYo con cinco flujos de vídeo de producción: texto a vídeo, imagen a vídeo, primer y último fotograma, extensión de vídeo y fotogramas clave posicionados. La página de FLUX 3 en PoYo incluye generador, IDs, parámetros y precios.
Esta guía separa lo que Black Forest Labs ha anunciado oficialmente de los detalles que aún se desconocen.
FLUX 3 de un vistazo
| Característica | Información anunciada oficialmente |
|---|---|
| Desarrollador | Black Forest Labs |
| Fecha de anuncio | 23 de julio de 2026 |
| Estado actual | Cinco flujos de vídeo disponibles en PoYo |
| Modalidades | Imagen, video, audio y predicción de acciones |
| Entradas | Texto, imágenes y referencias de video |
| Capacidades de imagen | Generación y edición |
| Capacidades de video | Texto a video, imagen a video, video a video, continuación y fotogramas clave |
| Audio nativo | Sí |
| Duración máxima de video anunciada | Hasta 20 segundos en una generación |
| Diálogo multilingüe | Anunciado |
| Acceso general a la API de PoYo | Disponible ahora |
| Identificadores de modelos y precios de la API pública | Publicados en la documentación y página de PoYo |
¿Qué es FLUX 3?
FLUX 3 es un modelo multimodal unificado. Black Forest Labs afirma que se entrenó con imágenes, videos y audio al mismo tiempo para que las modalidades se condicionen e informen entre sí.
Una imagen describe la estructura espacial. El video añade tiempo y movimiento. El audio proporciona evidencia sobre eventos e interacciones físicas. El lenguaje conecta esas señales con instrucciones y objetivos abstractos. FLUX 3 está diseñado para aprender una representación compartida en lugar de tratar cada medio como una tarea de generación aislada.
Esta es una dirección de producto diferente a la de FLUX 2, que es principalmente una familia para la generación y edición de imágenes. FLUX 3 sigue generando y editando imágenes, pero también produce video con audio nativo y proporciona una base para la predicción de acciones.

La familia de modelos FLUX 3
Black Forest Labs ha anunciado cuatro aplicaciones principales de la base fundacional de FLUX 3.
FLUX 3 Image
FLUX 3 Image abarca la síntesis y edición de imágenes mediante API y acceso privado a los pesos. BFL afirma que el modelo gestiona diversos estilos, relaciones de aspecto y resoluciones, sigue instrucciones complejas con mayor precisión y mejora la representación de texto multilingüe.
FLUX 3 Video
FLUX 3 Video genera y edita video con audio nativo. Acepta texto, imágenes y referencias de video, y admite varios flujos de trabajo, incluida la continuación y la generación controlada mediante fotogramas clave.
FLUX 3 Dev
FLUX 3 Dev es la base multimodal de pesos abiertos anunciada. BFL la describe como una base para la creación de contenido y la predicción de acciones. La empresa aún no ha publicado sus pesos, licencia, requisitos de hardware ni fecha de lanzamiento.
FLUX 3 Action y FLUX-mimic
FLUX 3 también admite la predicción de acciones mediante determinados socios de investigación y comerciales. FLUX-mimic, desarrollado con mimic robotics, aplica la representación visual del mundo del modelo a las acciones robóticas. Se trata de una dirección especializada de investigación e industria, no de un generador de imágenes o videos para consumidores.
Capacidades de imagen de FLUX 3
FLUX 3 sigue siendo un modelo de imágenes importante, aunque su alcance sea más amplio que el de las versiones anteriores de FLUX.
Black Forest Labs ha anunciado:
- Generación de texto a imagen
- Edición de imágenes
- Múltiples estilos visuales y relaciones de aspecto
- Múltiples resoluciones de salida
- Mejor gestión de instrucciones complejas
- Generación de texto multilingüe más precisa
- Acceso mediante API y a pesos privados
Los ejemplos oficiales abarcan desde primeros planos fotorrealistas e imágenes de estudio similares a fotografías de producto hasta pinturas e ilustraciones planas. Demuestran diversidad de estilos, pero son muestras seleccionadas del lanzamiento, no una medida independiente de la consistencia.

Aún faltan detalles importantes para producción. BFL no ha publicado los parámetros finales de la API de FLUX 3 Image, la resolución máxima, la latencia, los límites de frecuencia ni el precio.
Capacidades de video de FLUX 3
FLUX 3 puede generar videos con audio de hasta 20 segundos de duración en una sola generación. Los flujos de trabajo anunciados incluyen:
- Texto a video: crear un clip completo a partir de una descripción escrita.
- Imagen a video: animar un fotograma inicial o utilizar imágenes como referencias visuales.
- Video a video: trasladar personajes, sujetos o elementos visuales de un clip de origen a otra escena.
- Continuación de video y audio: ampliar una secuencia audiovisual existente.
- Fotograma clave a video: generar transiciones controladas entre momentos definidos.
- Diálogo multilingüe: generar contenido hablado en varios idiomas.
- Encadenamiento de múltiples tomas: conectar clips para crear secuencias más largas mediante un flujo de trabajo agéntico.
- Tipografía animada: producir motion design y texto animado.
El audio del modelo es nativo, no se añade mediante un paso independiente de posprocesamiento. Esto es importante en eventos en los que el sonido, el movimiento y el tiempo deben coincidir.
Cómo encaja Self-Flow en FLUX 3
FLUX 3 se basa en Self-Flow, un método desarrollado por Black Forest Labs para alinear la generación y la comprensión multimodales en una misma arquitectura.
La investigación preliminar de BFL compara Self-Flow con el flow matching convencional en la generación de imágenes, video y audio. La empresa informa de un menor error de generación normalizado y un aprendizaje más rápido en tareas posteriores de manipulación.
Estos resultados ayudan a explicar la arquitectura, pero no deben interpretarse como un benchmark público completo de los productos finales de FLUX 3. El modelo y el sistema de evaluación aún están en desarrollo.
Primeras evaluaciones de video de FLUX 3
Black Forest Labs publicó resultados preliminares de preferencia humana para clips de texto a video de 10 segundos, con resolución de 720p y audio. En sus pruebas, FLUX 3 fue preferido frente a:
- Grok Imagine Video en hasta el 69% de las comparaciones
- Kling v3 Pro en el 60%
- Happy Horse v1 en el 59%
- Happy Horse 1.1 en el 57%
- Seedance 2.0 y Gemini Omni Flash en el 52%
- Runway Gen-4.5 en el 77%
- Luma Ray 3.2 en el 93%
Estas son evaluaciones iniciales publicadas por el proveedor, no una clasificación independiente. BFL afirma explícitamente que el modelo y la configuración de evaluación siguen evolucionando. La selección de instrucciones, los parámetros de muestreo, los evaluadores y las versiones de los modelos competidores pueden afectar a los resultados de preferencia.
Disponibilidad de FLUX 3
PoYo ofrece cinco IDs de modelos de vídeo de producción:
flux-3/text-to-videoflux-3/image-to-videoflux-3/first-last-frame-to-videoflux-3/extend-videoflux-3/keyframes-to-video
Los flujos generan clips de 5–20 segundos a 720p o 1080p, admiten ocho relaciones de aspecto y audio nativo sincronizado. Los flujos estándar cuestan 34/58 créditos por segundo; la extensión cuesta 82/106.
Este lanzamiento corresponde a los flujos de vídeo FLUX 3 de PoYo. FLUX 3 Image, Action y Dev siguen siendo partes separadas de la hoja de ruta. Consulta la documentación de la API.
Casos de uso de FLUX 3
Generación y edición de imágenes
FLUX 3 Image puede admitir imágenes de producto, ilustración editorial, publicidad, diseño multilingüe y edición controlada mediante referencias.
Videos cortos con sonido sincronizado
La generación audiovisual nativa es útil para escenas con diálogo, demostraciones de productos, clips para redes sociales, diseños animados y conceptos narrativos en los que el sonido debe coincidir con la acción.
Continuidad de personajes y estilos
Las referencias de imagen y video pueden trasladar un sujeto central o un lenguaje visual a nuevas escenas. El encadenamiento de múltiples tomas podría extender esta capacidad a secuencias más largas.
Previsualización
Los fotogramas clave, los clips de referencia y las entradas de imagen pueden ayudar a los equipos creativos a explorar transiciones, movimientos de cámara y estructura de escenas antes de la producción convencional.
Investigación en IA física
La representación compartida del mundo de FLUX 3 también puede adaptarse a la predicción de acciones, como demuestra la colaboración FLUX-mimic.
Preguntas frecuentes
¿Se ha lanzado FLUX 3?
Black Forest Labs anunció FLUX 3 el 23 de julio de 2026. PoYo ya ofrece cinco endpoints de vídeo para texto, imágenes, primer/último fotograma, extensión y fotogramas clave.
¿FLUX 3 es un modelo de imágenes o de video?
Es un modelo fundacional multimodal. Las variantes anunciadas abarcan la generación y edición de imágenes, video con audio nativo y predicción de acciones.
¿FLUX 3 genera audio?
Sí. FLUX 3 Video genera audio nativo junto con el video y admite diálogos multilingües.
¿Cuánto pueden durar los videos de FLUX 3?
PoYo acepta duraciones enteras de 5 a 20 segundos y salida 720p o 1080p.
¿FLUX 3 es de código abierto?
BFL ha anunciado una base de pesos abiertos FLUX 3 Dev, pero los pesos, la licencia y la fecha de lanzamiento aún no se han publicado.
¿La API de FLUX 3 está disponible en PoYo?
Sí. Usa la página de FLUX 3 o uno de los cinco IDs documentados.
¿En qué se diferencia FLUX 3 de FLUX 2?
FLUX 2 se centra en la generación y edición de imágenes. FLUX 3 amplía la familia con un modelo unificado para imágenes, video, audio nativo y predicción de acciones. Consulta la comparación detallada entre FLUX 3 y FLUX 2.
Conclusión
FLUX 3 no es simplemente otra actualización de un modelo de imágenes. Cambia FLUX de una familia centrada en imágenes a una plataforma multimodal diseñada para conectar la apariencia visual, el movimiento, el sonido y el comportamiento físico.
PoYo ofrece los cinco flujos de vídeo publicados con IDs, controles y precios por segundo documentados.
Genera vídeo en la página de FLUX 3 o consulta la documentación. Los elementos Image, Action y Dev no publicados siguen separados.
Fuentes: Anuncio de FLUX 3 de Black Forest Labs, FLUX 3 x mimic
