Todos los artículos
guides23 min de lectura

Wan Animate 2: Características, modelos, ComfyUI y guía completa

Aprende cómo funciona Wan Animate 2, compara los modelos Base, Distilled y Lite, configura ComfyUI o Diffusers y planifica hardware, prompts y flujos de trabajo.

Wan Animate 2: Características, modelos, ComfyUI y guía completa
guides

Un personaje articulado de cuento es animado por un proyector mientras unas lentes ópticas muestran distintos ángulos de cámara

Wan Animate 2 es un framework de código abierto del equipo de Wan para animar personajes. A partir de una imagen de referencia y un vídeo de movimiento, genera una nueva secuencia en la que el personaje reproduce la actuación sin perder su identidad visual. A diferencia del pipeline anterior de Wan2.2 Animate, el nuevo sistema alimenta directamente un Diffusion Transformer rediseñado con el vídeo de movimiento; ya no depende de un extractor intermedio de poses o movimientos para obtener la señal principal.

La otra gran novedad es el control de perspectiva mediante texto. La cámara de salida ya no tiene que imitar exactamente la del vídeo de movimiento: el creador puede transferir una actuación y, al mismo tiempo, solicitar otro ángulo del personaje. El equipo publicó el código de inferencia y los pesos Base y Distillation el 7 de agosto de 2026. También anunció Wan-Animate-2-Lite como variante orientada al streaming, aunque Lite no formó parte de esa primera publicación pública de pesos.

Esta guía distingue los hechos confirmados de las hipótesis de la comunidad, explica cómo elegir el modelo adecuado y detalla las opciones de uso mediante el repositorio oficial, Diffusers y el nuevo flujo de trabajo de ComfyUI.

Información comprobada el 17 de agosto de 2026. Wan Animate 2 evoluciona con rapidez. Los nombres de los nodos, el empaquetado de los modelos y las optimizaciones de hardware pueden cambiar. Consulta el repositorio oficial de Wan-Animate-2 antes de montar un flujo de trabajo de producción.

Wan Animate 2 de un vistazo

Elemento Información confirmada
Desarrollador Equipo de Wan
Lanzamiento público 7 de agosto de 2026
Tarea principal Animación de personajes mediante imagen de referencia impulsada por un vídeo
Cambio principal Condicionamiento del vídeo de movimiento de extremo a extremo dentro de un Diffusion Transformer rediseñado
Control de cámara Control de perspectiva mediante texto
Familia de modelos publicada Pesos 14B Base y Distillation
Modelo eficiente anunciado Wan-Animate-2-Lite
Integraciones oficiales Scripts del repositorio, Diffusers y ComfyUI
Ejemplo de salida oficial Exportación a 24 fps
Licencia del repositorio Apache License 2.0
Configuración oficial de referencia a 720p 8× GPU NVIDIA A800 con la configuración predeterminada del repositorio
Configuración oficial probada a 480p 2× GPU NVIDIA A800

¿Qué es Wan Animate 2?

Wan Animate 2 no es un modelo general de texto a vídeo. Su flujo de trabajo principal tiene tres entradas:

  1. Una imagen de referencia que define el personaje objetivo y la apariencia de la escena.
  2. Un vídeo de movimiento que proporciona la animación a lo largo del tiempo.
  3. Una descripción de texto estructurada que indica la apariencia del personaje, el fondo y, opcionalmente, la perspectiva deseada.

El resultado es un nuevo vídeo renderizado del personaje. Por eso, el modelo resulta interesante para personajes digitales, presentadores virtuales, avatares estilizados, mascotas publicitarias, animaciones breves y previsualización de movimiento.

El nombre puede resultar confuso. El checkpoint descargable se publica como Wan2.2-Animate-2-14B, pero Wan Animate 2 es un framework nuevo, no simplemente un cambio menor de nombre del flujo de trabajo original Wan2.2 Animate. Los resultados de búsqueda de “wan 2.2 animate”, “wan animate” y “wan animate 2” actualmente se solapan, por lo que siempre debes comprobar el nombre del checkpoint y la versión del nodo antes de descargar archivos.

Características clave de Wan Animate 2

1. Condicionamiento directo mediante el vídeo de movimiento

Los sistemas anteriores de animación de personajes suelen convertir primero una actuación en representaciones de pose, rostro, esqueleto u otros datos de movimiento. Cada conversión puede eliminar detalles o introducir errores de alineación antes de la generación.

Wan Animate 2 procesa el vídeo de movimiento directamente dentro de su Diffusion Transformer rediseñado. Su objetivo declarado es reproducir el movimiento con mayor fidelidad y conservar mejor la identidad sin un extractor intermedio. Eso no implica que desaparezca todo el preprocesamiento en cada implementación, pero la señal principal ya no se reduce a una secuencia de poses antes de llegar al modelo.

2. Mayor conservación de la identidad

La imagen de referencia define el rostro, el cuerpo, la ropa y el estilo del personaje. El condicionamiento directo busca mantener esos rasgos estables mientras el vídeo de movimiento cambia la pose y la expresión.

Aun así, conviene comprobar la consistencia de la identidad en situaciones difíciles: giros rápidos, autooclusiones, manos delante de la cara, desenfoque de movimiento, acciones de cuerpo completo, proporciones inusuales y grandes cambios de escala. Una demostración de lanzamiento impecable no sustituye las pruebas repetidas con tu propio personaje.

3. Control de perspectiva basado en texto

La transferencia de movimiento tradicional suele heredar la cámara de la actuación original. Wan Animate 2 añade un control textual capaz de separar la perspectiva de salida de la del vídeo de movimiento.

Por ejemplo, un clip frontal puede guiar el movimiento mientras el prompt solicita una vista de tres cuartos o una cámara ligeramente más baja. Esto resulta útil cuando la actuación es correcta, pero el encuadre del vídeo original no coincide con el plano deseado.

Los cambios de perspectiva siguen siendo reconstrucciones generativas. Pueden mostrar partes del personaje que no aparecen en la imagen de referencia. Por eso, conviene revisar el frente, la espalda, el vestuario y los accesorios para detectar detalles inventados o inconsistentes.

4. Modelos Base y Distilled

El lanzamiento público incluye un modelo Base para el proceso de inferencia completo y un modelo Distillation que requiere menos pasos de eliminación de ruido. El ejemplo oficial de Diffusers utiliza 40 pasos con Base y 10 con Distilled.

El ejemplo de Distilled también establece guidance_scale=1.0 y utiliza el solver de flujo Euler. Son ajustes específicos de ese modelo: copiar la configuración de Base en el checkpoint Distilled no permite compararlos de forma fiable.

5. Un modelo Lite orientado al streaming

La introducción del proyecto indica que Wan-Animate-2-Lite reduce la latencia de inferencia hasta alcanzar umbrales de tiempo real para la animación de personajes en streaming. Esta es una dirección importante para avatares en directo y agentes interactivos.

Sin embargo, las notas de lanzamiento del 7 de agosto enumeran los pesos Base y Distillation, pero no un checkpoint Lite. Considera Lite una variante anunciada hasta que el equipo publique sus pesos, un endpoint, una demostración documentada o métricas de latencia reproducibles. El concepto de «tiempo real» también depende de la resolución, la duración del clip, el tamaño del lote y el hardware, así como de si la latencia se mide por fotograma o de extremo a extremo.

6. Múltiples formas de ejecutar el modelo

El proyecto oficial documenta sus propios scripts de inferencia y una interfaz de Gradio. Diffusers también admite Wan Animate 2, y ComfyUI ha incorporado un flujo de trabajo nativo basado en nodos. Las tres vías comparten las entradas esenciales, pero difieren en el formato de los modelos, la gestión de memoria y el grado de control operativo.

Comparación de modelos de Wan Animate 2

Modelo o paquete Estado público Configuración oficial habitual Mejor uso inicial Principal desventaja
Wan Animate 2 Base Pesos publicados 40 pasos de Diffusers en el ejemplo Evaluación de calidad y renderizados finales Mayor coste computacional
Wan Animate 2 Distillation Pesos publicados 10 pasos, guidance 1.0, Euler Iteración y pruebas de producción más rápidas Puede sacrificar parte de la fidelidad por velocidad
Wan Animate 2 Lite Anunciado Sin ajustes públicos del checkpoint en el lanzamiento inicial Futura animación interactiva o en streaming La disponibilidad y la latencia práctica siguen sin verificarse
Paquete Base Diffusers Publicado torch.bfloat16, 40 pasos Aplicaciones Python que usan herramientas de Hugging Face Sigue requiriendo recursos GPU considerables
Paquete Distilled Diffusers Publicado torch.bfloat16, 10 pasos, sin CFG, Euler Inferencia Python con menos pasos Debe utilizar la configuración específica de Distilled

Los repositorios de Diffusers son formatos de distribución, no niveles de modelo adicionales. Utiliza el checkpoint Base para Diffusers o el checkpoint Distilled para Diffusers según el pipeline que quieras ejecutar.

Cómo funciona Wan Animate 2

A nivel práctico, el flujo de trabajo se ve así:

  1. Prepara la imagen de referencia. Usa un personaje claramente visible, iluminación estable y suficiente resolución para mostrar los detalles faciales y del vestuario.
  2. Prepara el vídeo de movimiento. Mantén al intérprete visible, evita cortes innecesarios y comienza con un clip corto que muestre exactamente el movimiento que necesitas.
  3. Describe la apariencia, no la acción. En el flujo oficial, un LLM crea una descripción objetiva del personaje y el fondo, sin mencionar la acción ni atribuir emociones.
  4. Codifica las tres entradas. La imagen de referencia define la identidad, el vídeo proporciona el movimiento temporal y el prompt aporta instrucciones de apariencia y perspectiva.
  5. Realiza la eliminación de ruido con inferencia Base o Distilled. El modelo produce un vídeo latente temporalmente coherente condicionado por las tres fuentes.
  6. Decodifica y exporta. El ejemplo oficial de Diffusers exporta a 24 fps.

Esta división de funciones es importante. No intentes contradecir el vídeo de movimiento mediante una acción incompatible en el prompt de apariencia. Deja que el vídeo controle la actuación y utiliza el texto para definir con claridad el personaje objetivo y la cámara.

Requisitos de hardware y expectativas realistas

Wan Animate 2 es un modelo de vídeo de 14 000 millones de parámetros, por lo que la configuración oficial de referencia exige muchos más recursos que un flujo habitual de generación de imágenes en hardware de consumo.

El repositorio indica que su configuración paralela predeterminada está optimizada para 8× GPU A800 a 720p. El equipo también probó 480p con 2× GPU A800. Otras configuraciones requieren cambios en el archivo YAML de configuración paralela.

Son configuraciones probadas oficialmente, no requisitos mínimos universales. Tampoco demuestran que una GPU de consumo concreta vaya a fallar: el offloading, la cuantización, una resolución menor, los clips más cortos y las optimizaciones de ComfyUI pueden alterar el consumo de memoria. Del mismo modo, no garantizan una velocidad razonable en una tarjeta más modesta.

Para un plan de prueba local realista:

  • comienza a 480p con un vídeo de movimiento corto;
  • usa el checkpoint Distilled antes que Base;
  • evita los lotes largos hasta que un clip se complete de forma fiable;
  • supervisa tanto la VRAM como la RAM del sistema;
  • registra por separado el tiempo de inicio en frío y el tiempo de generación;
  • compara el coste por salida utilizable, no solo los segundos por vista previa.

Las conversiones FP8 o GGUF creadas por la comunidad pueden reducir la barrera de hardware, pero no son los mismos artefactos que los checkpoints BF16 oficiales. Verifica la fuente, la suma de comprobación, la compatibilidad de nodos y la calidad de salida antes de usar una conversión en producción.

Cómo instalar Wan Animate 2 desde el repositorio oficial

La configuración oficial utiliza Python 3.11, PyTorch 2.7 con paquetes wheel de CUDA 12.6, FlashAttention y una instalación editable del repositorio.

git clone --recursive https://github.com/Wan-Video/Wan-Animate-2.git
cd Wan-Animate-2

conda create -n wan_animate_2 python=3.11 -y
conda activate wan_animate_2

pip install torch==2.7.0 torchvision==0.22.0 torchaudio==2.7.0 \
  --index-url https://download.pytorch.org/whl/cu126
pip install -r requirements.txt
pip install flash-attn --no-build-isolation
pip install -e .

Descarga el checkpoint principal con la CLI de Hugging Face:

pip install "huggingface_hub[cli]"
huggingface-cli download Wan-AI/Wan2.2-Animate-2-14B \
  --local-dir ./ckpts/

El repositorio contiene archivos YAML separados para la inferencia Base y Distillation. Revisa sus configuraciones paralelas antes de iniciar un trabajo; los valores predeterminados asumen la configuración con varias A800 descrita anteriormente.

Wan Animate 2 con Diffusers

Hasta que la compatibilidad llegue a la siguiente versión empaquetada identificada por el proyecto, las instrucciones oficiales instalan Diffusers desde el código fuente:

pip install git+https://github.com/huggingface/diffusers.git
pip install flash-attn --no-build-isolation

Un pipeline Base mínimo sigue este patrón:

import torch
from diffusers import WanAnimate2Pipeline
from diffusers.utils import export_to_video, load_image

pipe = WanAnimate2Pipeline.from_pretrained(
    "Wan-AI/Wan2.2-Animate-2-14B-Diffusers",
    torch_dtype=torch.bfloat16,
).to("cuda")

result = pipe(
    image=load_image("reference.png"),
    driving_video="driving.mp4",
    prompt=(
        "Subject appearance: a small wooden courier with a teal vest, "
        "cream shirt, coral shoes, and a paper cap. "
        "Background: a simple navy theater stage. "
        "Viewpoint: front three-quarter view, slightly low camera."
    ),
    height=800,
    width=640,
    num_inference_steps=40,
)

export_to_video(result.frames[0], "wan-animate-2-output.mp4", fps=24)

Para el paquete Distilled, comienza con la configuración publicada:

pipe = WanAnimate2Pipeline.from_pretrained(
    "Wan-AI/Wan2.2-Animate-2-14B-Distilled-Diffusers",
    torch_dtype=torch.bfloat16,
).to("cuda")

result = pipe(
    image=load_image("reference.png"),
    driving_video="driving.mp4",
    prompt=prompt,
    num_inference_steps=10,
    guidance_scale=1.0,
    flow_solver="euler",
)

Los ejemplos son puntos de partida, no código de despliegue. Un servicio también necesita validación de entradas, límites de decodificación de vídeo, tiempos de espera, control de colas, calentamiento del modelo, almacenamiento de salidas y gestión de errores.

Flujo de trabajo de Wan Animate 2 en ComfyUI

ComfyUI es la opción más accesible para quienes quieren entender y modificar el pipeline de forma visual. La nueva integración gira en torno a WanAnimate2ToVideo. El nodo WanAnimate2Cache acelera cálculos repetidos a cambio de usar más memoria del sistema. En su presentación del lanzamiento, ComfyUI afirma que la caché puede reducir aproximadamente a la mitad el tiempo de generación. La mejora real, sin embargo, depende del grafo, el hardware, la resolución y la duración del clip.

Configuración paso a paso

  1. Actualiza ComfyUI. Usa una versión que incluya los nodos de Wan Animate 2. Si al abrir la plantilla aparecen nodos principales ausentes, puede que tu versión Stable o Desktop sea anterior a la necesaria.
  2. Carga el flujo de trabajo de Wan Animate 2. Comienza con la plantilla oficial o el flujo de trabajo de ComfyUI publicado en lugar de reconstruir el grafo de memoria.
  3. Comprueba los archivos del modelo. Confirma que cada nodo de carga apunta a recursos de Wan Animate 2. Un checkpoint antiguo de Wan2.2 Animate no es intercambiable con el nuevo modelo Animate 2.
  4. Sube la imagen de referencia. Prefiere un único sujeto sin obstrucciones, con detalles que sigan siendo legibles después del redimensionamiento.
  5. Carga el vídeo de movimiento. Recórtalo antes de generar. Una prueba de cinco segundos es más fácil de diagnosticar que un clip largo con varias acciones mezcladas.
  6. Escribe la descripción de apariencia. Detalla los rasgos visibles del sujeto y del fondo. Añade una indicación breve de cámara si quieres un punto de vista distinto al del vídeo de movimiento.
  7. Elige Base o Distilled. Usa Distilled para las primeras pruebas de compatibilidad y movimiento; cambia a Base cuando el flujo sea estable y necesites comparar la calidad final.
  8. Establece dimensiones conservadoras. Comienza alrededor de 480p y mantén el ancho y la altura compatibles con los requisitos latentes del flujo de trabajo.
  9. Activa la caché solo después de obtener un resultado de referencia fiable. Así será más fácil saber si un problema de memoria o de salida procede del flujo principal o de la optimización.
  10. Pon en cola una generación corta. Inspecciona la identidad, las manos, la oclusión, la sincronización del movimiento, el punto de vista y la estabilidad entre el primer y último fotograma antes de aumentar la resolución o la duración.

No mezcles los flujos de trabajo antiguos y nuevos de ComfyUI

El flujo de trabajo antiguo de Wan2.2 Animate utiliza nodos como WanAnimateToVideo y puede preprocesar entradas DWPose, de rostro, máscara y fondo para los modos Move o Mix. El flujo de Wan Animate 2 emplea la nueva ruta WanAnimate2ToVideo y el condicionamiento directo mediante vídeo de movimiento.

Si un tutorial te pide descargar el original wan2.2_animate_14B_bf16.safetensors, clip_vision_h, un estimador de poses y máscaras del modo Mix, probablemente esté describiendo el modelo anterior. Ese tutorial puede seguir siendo útil, pero no es una guía de instalación de Wan Animate 2.

Configuraciones iniciales recomendadas

Objetivo Modelo Resolución Pasos Guidance Solver Notas
Primera ejecución exitosa Distilled Clase 480p 10 1.0 Euler Mantén el clip corto y la caché desactivada
Iteración de movimiento Distilled Clase 480p 10 1.0 Euler Compara vídeos de movimiento antes de aumentar la calidad
Comparación de calidad Base Igual que la prueba 40 Usa el valor predeterminado de Base Valor predeterminado del pipeline Cambia solo la ruta del modelo y las configuraciones necesarias
Evaluación a 720p Base o Distilled 720p Específico del modelo Específico del modelo Específico del modelo Úsalo solo después de validar memoria y duración
Prueba de punto de vista Distilled primero Clase 480p 10 1.0 Euler Renderiza el mismo movimiento con dos indicaciones de cámara

Estas configuraciones reflejan los ejemplos oficiales siempre que es posible. No afirman que todos los paquetes locales de ComfyUI expongan los mismos controles ni que 480p sea compatible con todas las GPU.

Guía de creación de prompts

El repositorio oficial recomienda generar una descripción objetiva de la imagen con un LLM. Su ejemplo utiliza una estructura estricta en chino: primero la apariencia del sujeto y después el fondo, sin descripción de acciones, juicios subjetivos ni emociones inferidas.

Una plantilla independiente del idioma es:

Subject appearance: [species or person, face, hair, body proportions,
clothing, colors, materials, accessories].
Background: [location, major objects, lighting, dominant colors].
Viewpoint: [front, profile, rear, three-quarter, high, low, close, wide].

Mejor prompt

Subject appearance: a stylized wooden courier with a round carved face,
short dark hair, a cream paper cap, teal vest, ivory shirt, and coral shoes.
Background: a simple miniature theater with a muted navy curtain and warm
gold stage light. Viewpoint: front three-quarter full-body view, slightly low.

Prompt más débil

A happy courier runs dramatically, waves at the camera, jumps over a box,
and looks excited in a beautiful cinematic scene.

La versión más débil repite instrucciones de movimiento que ya contiene el vídeo y añade expresiones subjetivas. Si una descripción en inglés ofrece malos resultados, prueba primero la estructura en chino recomendada por el repositorio antes de concluir que el modelo no puede preservar al personaje.

Fortalezas y limitaciones

Dónde destaca más Wan Animate 2

  • Transferencia de movimiento sin reducir la actuación del vídeo a una secuencia intermedia de poses.
  • Conservación de identidad y estilo basada en referencias.
  • Un punto de vista de cámara que puede diferir del vídeo de movimiento.
  • Opciones Base y Distilled con menos pasos para pruebas de calidad/velocidad.
  • Rutas oficiales del repositorio, Diffusers, Gradio y ComfyUI.
  • Licencia de repositorio Apache 2.0 y pesos publicados.

Aspectos que aún requieren pruebas cuidadosas

  • Grandes requisitos oficiales de múltiples GPU para configuraciones de 480p y 720p.
  • Acción rápida, desenfoque de movimiento intenso, oclusiones, manos y rotación corporal.
  • Clips largos y continuidad de identidad entre planos.
  • Grandes cambios de cámara que requieren inventar detalles del personaje no visibles.
  • Escenas con múltiples personajes e interacciones con objetos.
  • Diferencias de calidad entre Base, Distilled, FP8 y versiones cuantizadas por la comunidad.
  • El momento de lanzamiento y la latencia real en uso práctico de Wan-Animate-2-Lite.

Las primeras comparativas publicadas en redes ofrecen resultados dispares. Algunos creadores destacan el control del movimiento y la perspectiva; otros prefieren sistemas anteriores en ciertos casos de acción rápida o transferencia de vídeo a vídeo. Una conversación de la comunidad y un primer vídeo comparativo pueden inspirar pruebas, pero no documentan cada intento, todos los ajustes, los derechos sobre el material de origen ni el coste por clip aceptado. Trátalos como hipótesis que comprobar, no como una clasificación.

Wan Animate 2 frente a Wan2.2 Animate

Área Wan2.2 Animate Wan Animate 2
Diseño principal Animación y reemplazo de personajes unificados Animación de personajes de extremo a extremo a partir de una imagen y un vídeo de movimiento
Ruta de movimiento Esqueleto alineado espacialmente y otras señales de control procesadas El vídeo de movimiento se procesa directamente en el DiT rediseñado
Modos habituales Move y Mix/reemplazo de personajes Animación de personajes basada en referencia con condicionamiento directo de vídeo
Relación con la cámara Generalmente más vinculada a los controles de origen La perspectiva controlada por texto puede diferir del vídeo de movimiento
Nodo habitual de ComfyUI WanAnimateToVideo WanAnimate2ToVideo
Opciones públicas de velocidad LoRAs de la comunidad y paquetes optimizados Pesos oficiales Base y Distillation; Lite anunciado
Nombres de checkpoints Variantes Wan2_2-Animate-14B Variantes Wan2.2-Animate-2-14B

Elige el flujo de trabajo anterior cuando necesites específicamente su proceso documentado de reemplazo Move/Mix o ya dispongas de un grafo de producción estable. Evalúa Wan Animate 2 cuando la fidelidad directa del movimiento, la identidad o el control independiente de la perspectiva sean más importantes.

Mejores casos de uso

Wan Animate 2 es una opción prometedora para:

  • personajes estilizados animados a partir de la actuación de un actor;
  • presentadores virtuales y prototipos de avatares;
  • mascotas publicitarias y personajes de marca;
  • previsualización de distintos ángulos de cámara a partir de una sola toma de movimiento;
  • clips sociales cortos e inserciones narrativas;
  • desarrollo conceptual para videojuegos, animación y cine;
  • investigación sobre animación en streaming cuando Lite esté disponible de forma reproducible.

Hoy resulta menos adecuado para escenas largas sin cortes, demostraciones de producto que exijan precisión, acciones complejas con muchos personajes o retransmisiones en directo, a menos que tus propias pruebas confirmen la consistencia y la latencia necesarias.

Licencia y uso comercial

El repositorio Wan-Animate-2 está licenciado bajo Apache 2.0. En general, esto permite su uso, modificación y distribución, incluido el uso comercial, sujeto a las condiciones de la licencia.

La licencia del repositorio es solo una parte de la revisión jurídica de un proyecto comercial. Los equipos también deben disponer de derechos sobre la imagen de referencia, la actuación grabada, la imagen de la persona, la ropa, la música y los recursos del fondo. No animes la identidad o la actuación de una persona real sin su consentimiento. Conserva los avisos de licencia y atribución correspondientes al redistribuir código o paquetes modificados.

Dónde acceder a Wan Animate 2

Utiliza estos recursos principales:

Poyo.ai actualmente dispone de una API de Wan Animate existente con rutas independientes para move y replace. Esa referencia corresponde al modelo de producción anterior, no al nuevo checkpoint Wan Animate 2 descrito en esta guía. Este artículo no afirma que Wan Animate 2 esté disponible actualmente mediante la API de Poyo.ai.

Veredicto final

Wan Animate 2 se apoya en dos decisiones arquitectónicas importantes: procesar directamente el vídeo de movimiento y permitir que el texto defina una perspectiva distinta de la fuente. Con ello aborda dos problemas persistentes de la animación de personajes: la pérdida de detalles del movimiento y una cámara atada al encuadre de la grabación del intérprete.

Los modelos Base y Distilled ya permiten probar el sistema mediante el código oficial, Diffusers y ComfyUI. Las limitaciones prácticas también están claras: la configuración oficial de hardware es enorme, el modelo es reciente, la disponibilidad de Lite sigue sin resolverse y los movimientos difíciles aún exigen una evaluación controlada.

Empieza con una generación corta a 480p usando Distilled, mantén objetiva la descripción de apariencia, cambia una sola variable cada vez y compara los resultados por sus fotogramas realmente aprovechables, no por el impacto de una demostración de lanzamiento. Ese proceso aporta más información que cualquier afirmación universal sobre el «mejor modelo de animación de personajes».

FAQ

¿Wan Animate 2 es lo mismo que Wan2.2 Animate?

No. Wan Animate 2 utiliza una arquitectura de extremo a extremo rediseñada que procesa directamente el vídeo de movimiento y añade control de perspectiva mediante texto. El nombre del checkpoint todavía contiene Wan2.2, lo que causa confusión en búsquedas y tutoriales.

¿Wan Animate 2 es de código abierto?

El repositorio oficial y los pesos publicados son públicos, y el repositorio cuenta con licencia Apache 2.0. Revisa la licencia y los archivos del modelo para tu caso específico de distribución o uso comercial.

¿Qué modelos de Wan Animate 2 puedo descargar?

El lanzamiento del 7 de agosto incluye los pesos Base y Distillation. Hay paquetes de Diffusers para ambos. Wan-Animate-2-Lite fue anunciado, pero no figuraba entre los primeros pesos publicados.

¿Cuál es la diferencia entre Base y Distilled?

Los ejemplos oficiales de Diffusers utilizan 40 pasos para Base y 10 para Distilled. Distilled también emplea un valor de guidance de 1.0 y el solver de flujo Euler. Comienza con Distilled para iterar y compara Base con las mismas entradas antes del renderizado final.

¿Puede Wan Animate 2 ejecutarse en ComfyUI?

Sí. Utiliza una compilación actualizada de ComfyUI y el flujo de trabajo de Wan Animate 2 basado en WanAnimate2ToVideo. No lo confundas con el gráfico anterior de Wan2.2 Animate basado en WanAnimateToVideo.

¿Qué GPU necesito para Wan Animate 2?

El repositorio oficial está ajustado para 720p con 8× GPU A800 e informa de pruebas a 480p con 2× GPU A800. Otro hardware puede funcionar mediante offloading o pesos optimizados, pero estas cifras oficiales no establecen un mínimo universal para una GPU de consumo.

¿Wan Animate 2 admite animación en tiempo real?

El equipo indica que Wan-Animate-2-Lite alcanza los umbrales de tiempo real para streaming, pero las notas de lanzamiento iniciales no incluyen pesos de Lite. Espera un paquete público reproducible y prueba la ruta completa de latencia antes de planificar un producto en directo.

¿Puede la cámara de salida diferir del vídeo de movimiento?

Sí. El control de punto de vista mediante texto es una de las funciones principales del modelo. Los cambios grandes pueden requerir que el modelo genere detalles no visibles, por lo que debes revisar cuidadosamente la consistencia del personaje y el vestuario.

¿Debe el prompt describir la acción?

Normalmente no. Deja que el vídeo de movimiento defina la acción. El flujo de trabajo oficial recomienda una descripción objetiva del personaje y del fondo, sin acciones ni emociones inferidas. Añade una indicación breve de perspectiva cuando sea necesario.

¿Poyo.ai ofrece la nueva API de Wan Animate 2?

No en el momento de esta comprobación de estado. La versión actual de Wan Animate en Poyo.ai corresponde a la API anterior de move/replace. Utiliza el repositorio oficial, los paquetes de Diffusers o el flujo de trabajo de ComfyUI para la nueva versión de Wan Animate 2.

Blog · PoYo.aiTodos los artículos
HABLEMOS

¿Tienes un proyecto?

Cuéntanos qué estás creando. Nuestro equipo te ayudará a elegir la API de IA adecuada.

Usaremos tus datos solo para responder a esta consulta.

PoYo AI

¿Listo para explorar modelos?

Descubre modelos de imagen, vídeo, audio y lenguaje en PoYo.

Ver modelos de IA