ComfyLab
MiniMax H3 en ComfyUI: Motion Director para Vídeos Largos en RTX 3090

MiniMax H3 en ComfyUI: Motion Director para Vídeos Largos en RTX 3090

24GB VRAM (RTX 3090) -- pico real 23,4GB (I2V) y 22,84GB (Ref2VA), ambos con margen ajustado VRAM Avanzado 9 min MiniMax H3 Motion Director (FL2VA/I2V y Ref2VA/R2V con character sheet)
Savien

Read in English →

MiniMax H3 tiene un límite práctico de duración por generación — no puedes simplemente pedir 30 o 60 segundos de un tirón. Un canal de YouTube (Laura Tech/LoRAtech) mostraba un custom node llamado Motion Director que encadena varios segmentos de 5 segundos dentro de un único proyecto, con continuidad de movimiento y audio entre ellos. Ya habíamos verificado que el nodo es real — j955229/ComfyUI-MiniMax-H3-Motion-Director — y esta vez lo instalamos y lo probamos de verdad en nuestra RTX 3090, dos veces: una en modo imagen-a-vídeo puro, y otra en modo Reference-to-Video con un character sheet como ancla de identidad.

De un vistazo

AspectoDetalles
Nodoj955229/ComfyUI-MiniMax-H3-Motion-Director, GPL-3.0, v1.2.0 en el momento de esta prueba
Estructura de la prueba3 segmentos × 120 frames = 360 frames (15,000s a 24fps), en las dos variantes
Variante I2VUn fotograma de referencia único, modo i2v, 319,8s, VRAM pico ~23,4GB
Variante Ref2VACharacter sheet de 4 fotogramas, modo r2v, 336,5s, VRAM pico 22,84GB
GPU de pruebaRTX 3090 24GB — una sola GPU, no generalizable
ResultadoLas dos generan 15s exactos sin errores; Ref2VA mantiene mejor la identidad de la protagonista en primeros planos; ninguna de las dos resuelve la consistencia del personaje rival

Instalación real: cuatro fricciones que no salen en el vídeo original

  1. Puerto ya ocupado por una instancia sin el nodo. Ya había un ComfyUI corriendo en 127.0.0.1:8188 desde antes de instalar Motion Director, y ese servidor no exponía MiniMaxH3MotionDirector en su lista de nodos disponibles. Hubo que liberar su VRAM y arrancar una segunda instancia en otro puerto con una base de datos SQLite separada para no interferir con la primera.
  2. Dependencia faltante. scenedetect no estaba instalado y hubo que añadirlo manualmente vía pip en el venv de ComfyUI.
  3. Un nodo de atención no disponible. H3SLAAttention devolvía un object_info vacío en esta instalación — se omitió del grafo en vez de forzarlo.
  4. La GUI no cargaba el workflow limpio. Al abrir el workflow original de LoRAtech en la interfaz gráfica de ComfyUI aparecían errores de “Failed to load subgraph blueprints”. No bloqueaba la ejecución por API, pero sí impedía trabajar cómodamente desde la GUI — construimos el grafo directamente en formato API para tener una ejecución reproducible.

El workflow original tampoco corría tal cual: estaba pensado para 1280×736 y 282 frames con el text encoder qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors, que no teníamos instalado. Lo adaptamos a 832×480 y 360 frames exactos (para cerrar en 15,000s limpios a 24fps) usando qwen3vl_32b_minimax_h3_int8_convrot.safetensors, que ya teníamos de artículos anteriores — misma familia de encoder, distinta cuantización, el mismo tipo de sustitución que ya documentamos en el artículo de face swap.

Prueba 1: modo imagen-a-vídeo puro

Proyecto completo de 15s en modo i2v, timeline prompt_batch, 3 segmentos de 120 frames. Un único fotograma de referencia (reutilizado de nuestro artículo anterior sobre la LoRA PDD Acc) arranca el primer segmento; Motion Context se encarga de continuar desde ahí sin necesitar imagen de arranque en los segmentos 2 y 3.

Cinco fotogramas del clip I2V: inicio, frontera entre segmentos, segundo segmento, y climax con arco rojo

De izquierda a derecha: fotograma de referencia, inicio del segmento 1, frontera entre segmentos, segundo segmento (arco de energía rojo), y primer plano de cierre en el segmento 3.

Seed 20260906, 4 steps, sampler er_sde, scheduler simple, cfg 1.0, sigma shift video 6.0/audio 3.0, Motion Context activado con 22 frames de contexto, clear_vram_between_segments activado. Resultado: 319,822 segundos en ComfyUI, confirmado por timestamps del log de ejecución, no una estimación. VRAM: ~2,6GB antes de arrancar, picos entre 19GB y 23,4GB durante la generación, ~2,5GB al terminar — clear_vram_between_segments funcionó como opción de estabilidad real, sin OOM en ningún segmento.

El resultado es publicable como gancho visual: arranque limpio, personajes separados, rooftop neón coherente durante todo el clip, arco de energía grande en el segundo acto, y cierre con un primer plano de la misma protagonista. La limitación real: el rival cambia de lectura visual entre segmentos, y el vestuario de la propia protagonista (el diseño del abrigo) también varía de detalle entre el inicio y el primer plano final.

Prueba 2: Reference-to-Video con character sheet

Mismo proyecto de 15s, mismo Motion Director, pero en modo r2v con una referencia de personaje compartida por los tres segmentos en vez de un único fotograma de arranque.

Character sheet de 4 fotogramas de la protagonista de pelo blanco, usado como referencia de identidad

El character sheet no es una imagen nueva — son 4 fotogramas del propio clip I2V de la prueba 1, compuestos en una rejilla y reutilizados como referencia compartida r2vCommon para esta segunda prueba.

Cada segmento referencia esta hoja con el token {{mmx-ref:picture:white-haired-heroine-sheet}}, que Motion Director compila internamente a <Picture 1> — confirmado en el log real de ComfyUI:

MiniMax H3 Motion Director [批量生成 (r2v)] (segment): 3 segment(s), 360 frames @ 24.00 fps | Output: 832x480 (fixed)
#1 [0:120] 120f - r2v - <Picture 1> ...
#2 [120:240] 120f - r2v - <Picture 1> ...
#3 [240:360] 120f - r2v - <Picture 1> ...
Merged 3 segment audio clip(s) for export=all (360 frames).
Prompt executed in 336.54 seconds

Seed 202609061, mismos 4 steps/er_sde/simple/cfg 1.0, pero sigma shift video 12.0 (el doble que en I2V, coherente con lo que ya sabíamos de Ref2VA en nuestro artículo de face swap) / audio 3.0. VRAM: 2,4GB antes de arrancar (21,7GB libres), pico observado 22,84GB, 2,55GB al terminar (21,58GB libres) — de hecho menos VRAM pico que la variante I2V, aunque más tiempo total (336,54s).

Cuatro fotogramas del clip Ref2VA con character sheet, mostrando mejor consistencia de identidad en primeros planos

El fotograma de 9,8 segundos (segundo desde la derecha) es el más útil como pieza visual: primer plano limpio, pelo blanco, uniforme negro con líneas rojas, lazo rojo y katana reconocibles, sin perder la referencia del tejado de fondo.

No lo presentamos como “Ref2VA gana”: las dos pruebas no parten de la misma condición inicial (un fotograma contra un character sheet de cuatro), así que no es una comparativa controlada uno a uno. Lo que sí podemos decir con la evidencia que tenemos: en primeros planos, el character sheet ayudó a mantener rasgos reconocibles de la protagonista — pelo, uniforme, lazo, katana — de forma más consistente que el fotograma único de la prueba 1.

Tiempo y VRAM: las dos caben en 24GB, con poco margen

VarianteTiempo (ComfyUI)VRAM pico
I2V puro319,8s~23,4GB
Ref2VA + character sheet336,5s22,84GB

Ambas cifras dejan poco margen en una tarjeta de 24GB. No hicimos una comparativa controlada de velocidad contra generar tres clips de 5s por separado y unirlos manualmente — estos son los tiempos absolutos de cada pase completo, no una medida de cuánto ahorra Motion Director frente a la alternativa manual.

Limitaciones de esta prueba

  • Las dos variantes tienen condiciones de partida distintas (un fotograma vs. un character sheet de cuatro) — no es una comparativa controlada, es una comparación de dos formas prácticas de usar el nodo.
  • El rival del duelo cambia de lectura visual entre segmentos en ambas pruebas — el character sheet solo ancla a la protagonista, no a los personajes secundarios.
  • No medimos si generar los tres segmentos por separado y unirlos a mano sería más rápido — solo tenemos los tiempos absolutos de Motion Director.
  • No evaluamos la calidad del audio de forma auditiva controlada — ambos clips generaron audio AAC estéreo sin errores, pero “suena bien” no es algo que verifiquemos objetivamente.
  • No extrapolamos el consumo de VRAM a otras GPUs o resoluciones — es una sola tarjeta, una sola resolución.
  • El workflow original de LoRAtech no se probó “tal cual” en ningún momento — ya necesitó adaptación solo para cargar en esta instalación.

Conclusión

Motion Director cumple lo que promete a nivel de proyecto: permite montar un clip de 15 segundos como tres segmentos de MiniMax H3 encadenados, con continuidad de movimiento y audio unido, sin tener que editar manualmente tres MP4 aparte. No resuelve la consistencia de personaje de forma automática — el rival deriva en las dos pruebas, y solo la variante con character sheet mejora de forma apreciable la identidad de la protagonista en primeros planos. La instalación tuvo más fricción real de la que sugiere cualquier tutorial: un puerto ocupado, una dependencia faltante, un nodo no disponible, y una GUI que no cargaba el workflow limpio.

🏆 Nuestra recomendación

Si tu prioridad es la continuidad de proyecto (audio unido, movimiento que fluye entre segmentos, sin montaje manual), Motion Director cumple en cualquiera de los dos modos. Si además necesitas que el personaje principal se reconozca en primeros planos a lo largo del clip, usa Ref2VA con un character sheet en vez de I2V con un solo fotograma — pero no esperes que resuelva la identidad de personajes secundarios, porque en nuestra prueba el rival sigue derivando en ambos modos. Antes de instalar, prepárate para adaptar el workflow que descargues: resolución, text encoder y algún nodo pueden no coincidir con tu instalación tal cual.


Sigue Leyendo

Si aún no has probado MiniMax H3 en tu RTX 3090, empieza por nuestra prueba de Sage Attention y Sol-Attn. Si lo que buscas es cambiar identidades en vídeo con este mismo modelo, probamos el face swap real con Ref2VA, incluyendo el mismo tipo de sigma shift más alto que vimos aquí. Y si te interesa exprimir la acción rápida, comparamos la LoRA PDD Acc de 8 pasos contra la turbo de 4 pasos.

Preguntas frecuentes

¿Qué es Motion Director y qué problema resuelve?
Es un custom node (`j955229/ComfyUI-MiniMax-H3-Motion-Director`, GPL-3.0, v1.2.0 en el momento de esta prueba) que organiza varios segmentos de generación de MiniMax H3 -- hasta 6 modos (T2V/I2V/FL2V/R2V/V2V/RV2V) -- dentro de un único proyecto, con continuidad de movimiento y audio entre segmentos. Resuelve el límite práctico de duración por generación de MiniMax H3 sin tener que montar manualmente varios MP4 aparte.
¿Ref2VA con character sheet es mejor que I2V puro?
No lo presentamos así, y por una razón concreta: las dos pruebas no parten de la misma condición inicial. La de I2V arranca de un solo fotograma; la de Ref2VA arranca de una referencia compuesta por cuatro fotogramas de la misma protagonista. No es una comparativa controlada uno a uno. Lo que sí podemos decir es que, en nuestra prueba, el character sheet ayudó a mantener rasgos reconocibles (pelo, uniforme, lazo, katana) en los primeros planos mejor que el fotograma único.
¿Qué fricciones reales tuvisteis instalando el nodo?
Cuatro: (1) ya había una instancia de ComfyUI escuchando en el puerto por defecto que no exponía el nodo tras instalarlo -- hubo que liberar su VRAM y lanzar una segunda instancia en otro puerto con base de datos separada; (2) faltaba la dependencia `scenedetect`; (3) el nodo `H3SLAAttention` devolvía un `object_info` vacío en esta instalación, así que lo omitimos; (4) la interfaz gráfica de ComfyUI mostraba errores de "subgraph blueprints" al cargar el workflow original, así que construimos el grafo directamente por API en vez de depender de la GUI.
¿El workflow original de LoRAtech funcionó tal cual?
No sin adaptación. Estaba configurado a 1280×736 y 282 frames con el text encoder `nvfp4_awq`, que no teníamos instalado. Lo ejecutamos a 832×480 y 360 frames exactos (para cerrar en 15,000s a 24fps) con el text encoder `int8_convrot` que ya teníamos de artículos anteriores -- misma familia, distinta cuantización.
¿Es más rápido generar así que en clips separados?
No lo hemos medido -- no hicimos una comparativa controlada contra generar tres clips de 5s por separado y unirlos a mano. Lo que sí registramos son los tiempos absolutos de cada pase completo: 319,8s (I2V) y 336,5s (Ref2VA) en nuestra RTX 3090, ambos para producir el proyecto completo de 15s.
¿Qué falla o no está resuelto en ninguna de las dos pruebas?
El rival (el segundo personaje del duelo) cambia de lectura visual entre segmentos en ambas variantes -- el character sheet solo ancla a la protagonista, no a los personajes secundarios. Tampoco la coreografía sigue literalmente cada verbo del prompt en todos los segmentos. Ninguna de las dos pruebas demuestra consistencia de personaje perfecta, solo continuidad de proyecto razonable.
Compartir X LinkedIn

También te puede interesar