Todos los artículos
guides9 min de lectura

FLUX 3: Imagen, video, audio y todo lo que sabemos

Descubre las capacidades de imagen, vídeo, audio nativo y acción de FLUX 3 y cómo usar cinco flujos de vídeo de producción en PoYo.

FLUX 3: Imagen, video, audio y todo lo que sabemos
guides

Modelo multimodal FLUX 3 para imagen, video, audio y acción

Black Forest Labs anunció FLUX 3 el 23 de julio de 2026. Es el mayor cambio realizado hasta ahora en la familia de modelos FLUX: en lugar de centrarse únicamente en la generación y edición de imágenes, FLUX 3 es un modelo fundacional multimodal entrenado con imágenes, video, audio y acción.

FLUX 3 ya está disponible en PoYo con cinco flujos de vídeo de producción: texto a vídeo, imagen a vídeo, primer y último fotograma, extensión de vídeo y fotogramas clave posicionados. La página de FLUX 3 en PoYo incluye generador, IDs, parámetros y precios.

Esta guía separa lo que Black Forest Labs ha anunciado oficialmente de los detalles que aún se desconocen.

FLUX 3 de un vistazo

Característica Información anunciada oficialmente
Desarrollador Black Forest Labs
Fecha de anuncio 23 de julio de 2026
Estado actual Cinco flujos de vídeo disponibles en PoYo
Modalidades Imagen, video, audio y predicción de acciones
Entradas Texto, imágenes y referencias de video
Capacidades de imagen Generación y edición
Capacidades de video Texto a video, imagen a video, video a video, continuación y fotogramas clave
Audio nativo Sí
Duración máxima de video anunciada Hasta 20 segundos en una generación
Diálogo multilingüe Anunciado
Acceso general a la API de PoYo Disponible ahora
Identificadores de modelos y precios de la API pública Publicados en la documentación y página de PoYo

¿Qué es FLUX 3?

FLUX 3 es un modelo multimodal unificado. Black Forest Labs afirma que se entrenó con imágenes, videos y audio al mismo tiempo para que las modalidades se condicionen e informen entre sí.

Una imagen describe la estructura espacial. El video añade tiempo y movimiento. El audio proporciona evidencia sobre eventos e interacciones físicas. El lenguaje conecta esas señales con instrucciones y objetivos abstractos. FLUX 3 está diseñado para aprender una representación compartida en lugar de tratar cada medio como una tarea de generación aislada.

Esta es una dirección de producto diferente a la de FLUX 2, que es principalmente una familia para la generación y edición de imágenes. FLUX 3 sigue generando y editando imágenes, pero también produce video con audio nativo y proporciona una base para la predicción de acciones.

Arquitectura de transformador multimodal de FLUX 3

La familia de modelos FLUX 3

Black Forest Labs ha anunciado cuatro aplicaciones principales de la base fundacional de FLUX 3.

FLUX 3 Image

FLUX 3 Image abarca la síntesis y edición de imágenes mediante API y acceso privado a los pesos. BFL afirma que el modelo gestiona diversos estilos, relaciones de aspecto y resoluciones, sigue instrucciones complejas con mayor precisión y mejora la representación de texto multilingüe.

FLUX 3 Video

FLUX 3 Video genera y edita video con audio nativo. Acepta texto, imágenes y referencias de video, y admite varios flujos de trabajo, incluida la continuación y la generación controlada mediante fotogramas clave.

FLUX 3 Dev

FLUX 3 Dev es la base multimodal de pesos abiertos anunciada. BFL la describe como una base para la creación de contenido y la predicción de acciones. La empresa aún no ha publicado sus pesos, licencia, requisitos de hardware ni fecha de lanzamiento.

FLUX 3 Action y FLUX-mimic

FLUX 3 también admite la predicción de acciones mediante determinados socios de investigación y comerciales. FLUX-mimic, desarrollado con mimic robotics, aplica la representación visual del mundo del modelo a las acciones robóticas. Se trata de una dirección especializada de investigación e industria, no de un generador de imágenes o videos para consumidores.

Capacidades de imagen de FLUX 3

FLUX 3 sigue siendo un modelo de imágenes importante, aunque su alcance sea más amplio que el de las versiones anteriores de FLUX.

Black Forest Labs ha anunciado:

  • Generación de texto a imagen
  • Edición de imágenes
  • Múltiples estilos visuales y relaciones de aspecto
  • Múltiples resoluciones de salida
  • Mejor gestión de instrucciones complejas
  • Generación de texto multilingüe más precisa
  • Acceso mediante API y a pesos privados

Los ejemplos oficiales abarcan desde primeros planos fotorrealistas e imágenes de estudio similares a fotografías de producto hasta pinturas e ilustraciones planas. Demuestran diversidad de estilos, pero son muestras seleccionadas del lanzamiento, no una medida independiente de la consistencia.

Muestras oficiales de imágenes de FLUX 3

Aún faltan detalles importantes para producción. BFL no ha publicado los parámetros finales de la API de FLUX 3 Image, la resolución máxima, la latencia, los límites de frecuencia ni el precio.

Capacidades de video de FLUX 3

FLUX 3 puede generar videos con audio de hasta 20 segundos de duración en una sola generación. Los flujos de trabajo anunciados incluyen:

  • Texto a video: crear un clip completo a partir de una descripción escrita.
  • Imagen a video: animar un fotograma inicial o utilizar imágenes como referencias visuales.
  • Video a video: trasladar personajes, sujetos o elementos visuales de un clip de origen a otra escena.
  • Continuación de video y audio: ampliar una secuencia audiovisual existente.
  • Fotograma clave a video: generar transiciones controladas entre momentos definidos.
  • Diálogo multilingüe: generar contenido hablado en varios idiomas.
  • Encadenamiento de múltiples tomas: conectar clips para crear secuencias más largas mediante un flujo de trabajo agéntico.
  • Tipografía animada: producir motion design y texto animado.

El audio del modelo es nativo, no se añade mediante un paso independiente de posprocesamiento. Esto es importante en eventos en los que el sonido, el movimiento y el tiempo deben coincidir.

Cómo encaja Self-Flow en FLUX 3

FLUX 3 se basa en Self-Flow, un método desarrollado por Black Forest Labs para alinear la generación y la comprensión multimodales en una misma arquitectura.

La investigación preliminar de BFL compara Self-Flow con el flow matching convencional en la generación de imágenes, video y audio. La empresa informa de un menor error de generación normalizado y un aprendizaje más rápido en tareas posteriores de manipulación.

Estos resultados ayudan a explicar la arquitectura, pero no deben interpretarse como un benchmark público completo de los productos finales de FLUX 3. El modelo y el sistema de evaluación aún están en desarrollo.

Primeras evaluaciones de video de FLUX 3

Black Forest Labs publicó resultados preliminares de preferencia humana para clips de texto a video de 10 segundos, con resolución de 720p y audio. En sus pruebas, FLUX 3 fue preferido frente a:

  • Grok Imagine Video en hasta el 69% de las comparaciones
  • Kling v3 Pro en el 60%
  • Happy Horse v1 en el 59%
  • Happy Horse 1.1 en el 57%
  • Seedance 2.0 y Gemini Omni Flash en el 52%
  • Runway Gen-4.5 en el 77%
  • Luma Ray 3.2 en el 93%

Estas son evaluaciones iniciales publicadas por el proveedor, no una clasificación independiente. BFL afirma explícitamente que el modelo y la configuración de evaluación siguen evolucionando. La selección de instrucciones, los parámetros de muestreo, los evaluadores y las versiones de los modelos competidores pueden afectar a los resultados de preferencia.

Disponibilidad de FLUX 3

PoYo ofrece cinco IDs de modelos de vídeo de producción:

  • flux-3/text-to-video
  • flux-3/image-to-video
  • flux-3/first-last-frame-to-video
  • flux-3/extend-video
  • flux-3/keyframes-to-video

Los flujos generan clips de 5–20 segundos a 720p o 1080p, admiten ocho relaciones de aspecto y audio nativo sincronizado. Los flujos estándar cuestan 34/58 créditos por segundo; la extensión cuesta 82/106.

Este lanzamiento corresponde a los flujos de vídeo FLUX 3 de PoYo. FLUX 3 Image, Action y Dev siguen siendo partes separadas de la hoja de ruta. Consulta la documentación de la API.

Casos de uso de FLUX 3

Generación y edición de imágenes

FLUX 3 Image puede admitir imágenes de producto, ilustración editorial, publicidad, diseño multilingüe y edición controlada mediante referencias.

Videos cortos con sonido sincronizado

La generación audiovisual nativa es útil para escenas con diálogo, demostraciones de productos, clips para redes sociales, diseños animados y conceptos narrativos en los que el sonido debe coincidir con la acción.

Continuidad de personajes y estilos

Las referencias de imagen y video pueden trasladar un sujeto central o un lenguaje visual a nuevas escenas. El encadenamiento de múltiples tomas podría extender esta capacidad a secuencias más largas.

Previsualización

Los fotogramas clave, los clips de referencia y las entradas de imagen pueden ayudar a los equipos creativos a explorar transiciones, movimientos de cámara y estructura de escenas antes de la producción convencional.

Investigación en IA física

La representación compartida del mundo de FLUX 3 también puede adaptarse a la predicción de acciones, como demuestra la colaboración FLUX-mimic.

Preguntas frecuentes

¿Se ha lanzado FLUX 3?

Black Forest Labs anunció FLUX 3 el 23 de julio de 2026. PoYo ya ofrece cinco endpoints de vídeo para texto, imágenes, primer/último fotograma, extensión y fotogramas clave.

¿FLUX 3 es un modelo de imágenes o de video?

Es un modelo fundacional multimodal. Las variantes anunciadas abarcan la generación y edición de imágenes, video con audio nativo y predicción de acciones.

¿FLUX 3 genera audio?

Sí. FLUX 3 Video genera audio nativo junto con el video y admite diálogos multilingües.

¿Cuánto pueden durar los videos de FLUX 3?

PoYo acepta duraciones enteras de 5 a 20 segundos y salida 720p o 1080p.

¿FLUX 3 es de código abierto?

BFL ha anunciado una base de pesos abiertos FLUX 3 Dev, pero los pesos, la licencia y la fecha de lanzamiento aún no se han publicado.

¿La API de FLUX 3 está disponible en PoYo?

Sí. Usa la página de FLUX 3 o uno de los cinco IDs documentados.

¿En qué se diferencia FLUX 3 de FLUX 2?

FLUX 2 se centra en la generación y edición de imágenes. FLUX 3 amplía la familia con un modelo unificado para imágenes, video, audio nativo y predicción de acciones. Consulta la comparación detallada entre FLUX 3 y FLUX 2.

Conclusión

FLUX 3 no es simplemente otra actualización de un modelo de imágenes. Cambia FLUX de una familia centrada en imágenes a una plataforma multimodal diseñada para conectar la apariencia visual, el movimiento, el sonido y el comportamiento físico.

PoYo ofrece los cinco flujos de vídeo publicados con IDs, controles y precios por segundo documentados.

Genera vídeo en la página de FLUX 3 o consulta la documentación. Los elementos Image, Action y Dev no publicados siguen separados.

Fuentes: Anuncio de FLUX 3 de Black Forest Labs, FLUX 3 x mimic

Blog · PoYo.aiTodos los artículos
HABLEMOS

¿Tienes un proyecto?

Cuéntanos qué estás creando. Nuestro equipo te ayudará a elegir la API de IA adecuada.

Usaremos tus datos solo para responder a esta consulta.

PoYo AI

¿Listo para explorar modelos?

Descubre modelos de imagen, vídeo, audio y lenguaje en PoYo.

Ver modelos de IA