Un canal pequeño de YouTube probó una LoRA de aceleración de 8 pasos que Alibaba PAI publicó para MiniMax H3 — verificamos que es real: alibaba-pai/MiniMax-H3-Acc-LoRAs en HuggingFace, más el custom node Jalen-Brunson/ComfyUI-MiniMax-H3-PDD-Acc que hace falta para usarla. La afirmación central del vídeo: la LoRA turbo de 4 pasos que ya usábamos en artículos anteriores se queda corta en escenas de acción rápida.
No repetimos sus ejemplos — generamos los nuestros, con el mismo prompt y la misma seed en cada comparación, en nuestra propia RTX 3090. Y el hallazgo real no es el que esperábamos encontrar.
De un vistazo
| Aspecto | Detalles |
|---|---|
| LoRA probada | MiniMax-H3-Ref2VA-Acc-8Step.safetensors (Alibaba PAI, oficial) vs minimax_h3_ref2v_turbo_4step_v0.1 (lightx2v, ya usada en artículos anteriores) |
| Escena principal | Duelo de espadas anime, 15,08s (360 frames), 832×480, seed 1007 |
| Escena de confirmación | Pelea corta, 5,17s (124 frames), 832×480, seed 777 |
| Tiempo (escena principal) | 4-step: 229,5s — PDD Acc 8-step: 366,4s (+60%) |
| Tiempo (escena de confirmación) | 4-step: 79,9s — PDD Acc 8-step: 120,3s (+51%) — híbrido: 83,5s (con caché caliente, ver limitaciones) |
| VRAM pico real | 23,27GB (PDD Acc puro) — 23,53GB (híbrido) — ambos de 24GB en RTX 3090 |
| Hallazgo real | No es “4-step feo vs PDD Acc bonito” — ambas se ven bien frame a frame. Es que 4-step mantiene una pose casi idéntica entre el segundo 7 y el 12 del mismo clip; PDD Acc sí progresa la coreografía en ese tiempo |
| Instalación | La LoRA va en models/pdd_acc/ (no en models/loras/), hay ficheros distintos para FL2VA y Ref2VA, y el custom node no se registró hasta un reinicio completo de ComfyUI |
El hallazgo, en vídeo
Mismo prompt (duelo de espadas anime, tejado con lluvia y neones), mismo seed 1007, misma duración: turbo 4-step (izquierda) contra PDD Acc 8-step (derecha).
A primera vista, cualquier fotograma suelto de las dos versiones se ve bien — animación limpia estilo anime, buena separación de siluetas, efectos de energía coherentes con el prompt. La diferencia no salta a la vista en un frame aislado. Salta cuando comparas el MISMO instante de tiempo en los dos vídeos:
Arriba: turbo 4-step en el segundo 7 y en el segundo 12 del mismo clip — la pose de choque apenas cambia entre ambos instantes. Abajo: PDD Acc 8-step en los mismos dos instantes — los personajes se han separado espacialmente, la acción avanzó.
En 5 segundos de clip, la versión de 4 pasos prácticamente mantiene congelada la misma composición de choque — el arco de energía roja sigue ahí, la distancia entre los personajes apenas cambia. La versión de 8 pasos, en el mismo intervalo, muestra una progresión real: separación espacial, continuidad de movimiento, la coreografía avanza. No es que la turbo de 4 pasos genere fotogramas feos — es que parece “atascarse” en una pose en vez de desarrollar la acción en el tiempo.
Confirmación con una segunda escena
Escena de pelea distinta, 5,17s, mismo prompt y seed en las tres variantes: turbo 4-step, PDD Acc 8-step, y el truco híbrido de dos samplers.
Con un prompt y una escena completamente distintos (una pelea con foley claro en vez del duelo de espadas), el patrón se repite: el frame intermedio de la versión de 4 pasos muestra un clinch borroso y difícil de leer, mientras que PDD Acc y el híbrido muestran una postura de combate nítida y clara en el mismo instante. Dos escenas, dos prompts, mismo patrón — no es casualidad de una sola prueba.
Instalación real: nada de esto está en la carpeta que esperas
Tres cosas que ningún tutorial de LoRA normal te prepara para encontrar:
- La carpeta no es
models/loras/. EsComfyUI/models/pdd_acc/, y probablemente no existe todavía en tu instalación — hay que crearla a mano con ese nombre exacto. - Hay dos ficheros, no uno.
MiniMax-H3-FL2VA-Acc-8Step.safetensorsyMiniMax-H3-Ref2VA-Acc-8Step.safetensors(1,37GB cada uno). Usar el que no corresponde a tu checkpoint base no da ningún error — simplemente el resultado sale mal y parece que la LoRA está rota. - El custom node no se registró hasta un reinicio completo. Clonamos
Jalen-Brunson/ComfyUI-MiniMax-H3-PDD-Accsin errores, pero el nodoMiniMaxH3PDDAccApplyno aparecía disponible. La causa: un proceso de ComfyUI anterior había quedado vivo escuchando el mismo puerto tras unkillnormal — hizo faltakill -9y relanzar desde cero para que el nodo se registrara.
El README del propio nodo también exige una receta de sampler más estricta que la turbo normal: sampler euler obligatorio (nada de er_sde ni dpmpp), los sigmas deben venir del propio nodo MiniMaxH3PDDAccApply (no de un BasicScheduler genérico), el CFG de 1.0 se aplica vía BasicGuider en vez del campo cfg del KSampler, y advierte explícitamente contra apilar esta LoRA con LoRAs turbo normales — son dos destilaciones distintas que no se combinan bien.
El truco híbrido: casi igual de bien, pero la cifra de tiempo tiene trampa
El vídeo original proponía encadenar dos samplers para ahorrar tiempo sin perder la calidad de acción: un primer pase con la LoRA PDD Acc de 8 pasos (controla el movimiento), y un segundo pase con la turbo de 4 pasos a denoise bajo, solo para refinar detalle. No dio el valor exacto de denoise — usamos 0,3, decisión nuestra, no del vídeo original.
Visualmente, el resultado es casi indistinguible del PDD Acc puro — tiene sentido, es un refinado ligero sobre el mismo latente de acción ya resuelto. Pero hay que leer la cifra de tiempo (83,5s frente a los 120,3s del PDD Acc puro) con una advertencia real: nuestro log de ComfyUI muestra “0 modelos liberados” en esa ejecución, lo que significa que se benefició de la caché de modelo que quedó caliente de la ejecución de PDD Acc inmediatamente anterior. No es una comparación en frío limpia — no podemos confirmar que el ahorro sea igual de grande si arrancas desde un ComfyUI recién iniciado.
Tiempo y VRAM: en nuestras pruebas, la de 8 pasos tarda más de forma consistente
| Escena | 4-step turbo | PDD Acc 8-step | Diferencia |
|---|---|---|---|
| Duelo de espadas (360 frames) | 229,5s | 366,4s | +60% |
| Pelea (124 frames) | 79,9s | 120,3s | +51% |
El patrón se repite en dos escenas de duración y contenido distintos, con el mismo hardware y resolución (832×480): la LoRA de 8 pasos tarda entre un 51% y un 60% más que la turbo de 4 pasos. No es un caso suelto de una sola prueba. VRAM pico real: 23,27GB con PDD Acc puro, 23,53GB con el híbrido — ambas cifras dejan poco margen en una tarjeta de 24GB. No capturamos el pico de VRAM del baseline de 4 pasos en la escena de pelea (el logger arrancó tarde), así que no podemos dar una cifra de VRAM comparable para esa variante.
Limitaciones de esta prueba
- No pudimos verificar la afirmación del vídeo original sobre el audio (que suena “poco realista” con 4 pasos) — no hicimos una evaluación auditiva controlada.
- El tiempo del truco híbrido se midió con caché de modelo caliente, no en frío — el ahorro real partiendo de un ComfyUI recién iniciado podría ser menor.
- El valor de denoise (0,3) del segundo pase del híbrido es nuestro, no del vídeo original, que no dio una cifra exacta.
- Solo probamos el truco híbrido en la escena de pelea, no en el duelo de espadas — no sabemos si el patrón de “casi igual que PDD Acc puro” se mantiene en un clip 3 veces más largo.
- Una sola GPU (RTX 3090), sin repetición estadística dentro de cada prueba individual — sí repetimos con dos escenas y prompts distintos, que es lo que nos da confianza en el patrón.
- No capturamos VRAM pico del baseline de 4 pasos en la escena de pelea (fallo de instrumentación, no del modelo).
Conclusión
Alibaba PAI no exagera del todo, pero tampoco es la historia simple de “la de 4 pasos es mala”. En dos escenas y prompts distintos, ambas LoRAs producen fotogramas individualmente atractivos — la diferencia real está en si la coreografía avanza en el tiempo o se queda estancada en una pose. La turbo de 4 pasos parece congelar la acción; la PDD Acc de 8 pasos la desarrolla, a cambio de un 51-60% más de tiempo de generación consistente en ambas pruebas.
🏆 Nuestra recomendación
Si tu escena depende de que la acción progrese de forma legible en el tiempo (peleas, movimientos complejos, coreografía), usa la PDD Acc de 8 pasos y acepta el coste de tiempo. Si tu escena es más estática o el movimiento importa menos que la velocidad de iteración, la turbo de 4 pasos sigue siendo una opción razonable — no produce fotogramas feos, solo una coreografía menos dinámica. El truco híbrido merece una prueba si necesitas ese punto intermedio, pero no confíes en el ahorro de tiempo que vimos nosotros sin medirlo tú mismo en frío. Y antes de instalar la LoRA, crea la carpeta models/pdd_acc/ a mano y verifica que descargas el fichero correcto para tu checkpoint (FL2VA o Ref2VA) — el error contrario no avisa, solo produce un resultado peor.
Sigue Leyendo
Si aún no has probado MiniMax H3 en tu RTX 3090, empieza por nuestra prueba de Sage Attention y Sol-Attn. Si lo que buscas es cambiar identidades en vídeo con este mismo modelo, probamos el face swap real con Ref2VA, incluyendo el mismo tipo de sustituciones de LoRA que documentamos aquí. Y si necesitas vídeos de más de unos segundos, probamos Motion Director para encadenar segmentos con continuidad.
Siguientes pasos en ComfyUI
Primeros pasos
Más workflows de vídeo e imagen IA
Preguntas frecuentes
- ¿Qué es exactamente la LoRA PDD Acc y en qué se diferencia de la turbo que ya usábamos?
- Es una LoRA de aceleración oficial publicada por Alibaba PAI (`alibaba-pai/MiniMax-H3-Acc-LoRAs`, ~210 likes en HuggingFace) que reduce la generación a 8 pasos usando un banco de cabezas de decodificación paralela (parallel-decoding head bank) sobre sigmas propios del modelo, en vez del enfoque de destilación de la turbo de 4 pasos de lightx2v que usamos en artículos anteriores. No son intercambiables ni comparables como "misma técnica, distinto número de pasos" -- son dos mecanismos de aceleración distintos.
- ¿Dónde se instala el fichero de la LoRA PDD Acc?
- NO en `models/loras/`, donde iría cualquier LoRA normal. Va en una carpeta propia, `ComfyUI/models/pdd_acc/`, que hay que crear a mano si no existe. Además hay dos ficheros distintos según el checkpoint base -- uno para FL2VA, otro para Ref2VA -- usar el que no toca no da ningún error, simplemente da un resultado incorrecto que parece "la LoRA está rota".
- ¿Vale la pena el truco híbrido de dos samplers (8 pasos + 4 pasos)?
- Visualmente, el resultado es casi idéntico al de 8 pasos puros -- lógico, es un segundo pase de refinado de bajo denoise sobre el mismo latente de acción. Pero hay que leer la cifra de tiempo con cuidado: en nuestra prueba, el híbrido se benefició de una caché de modelo ya caliente por la ejecución de PDD Acc que corrió justo antes ("0 modelos descargados" en el log) -- no es una comparación en frío limpia contra los 8 pasos puros. No podemos confirmar que el ahorro de tiempo sea igual de grande arrancando desde cero.
- ¿Confirmasteis lo que decía el vídeo original sobre el audio?
- No pudimos. El vídeo afirma que el audio suena "poco realista" con la LoRA de 4 pasos en movimiento rápido, y mejor con la de 8 pasos. Los tres clips que generamos sí tienen pista de audio sin errores, pero evaluar si uno "suena peor" que otro requiere oído humano -- no es algo que podamos verificar nosotros de forma objetiva. Lo dejamos como pendiente, no como confirmado ni descartado.
- ¿Por qué esta vez el número de frames de salida sí coincidió exactamente con lo pedido?
- En nuestro artículo anterior sobre face swap con MiniMax H3, tuvimos que sustituir una LoRA que no existía públicamente con el nombre exacto que pedía el workflow original, y sospechamos que esa sustitución causaba un recorte de frames no solicitado. Aquí usamos las LoRAs oficiales tal cual las publica Alibaba PAI y lightx2v, sin sustituir nada -- y en las dos pruebas (360 y 124 frames pedidos) la salida coincidió exactamente. Es un dato más a favor de la hipótesis de aquel artículo, no una prueba definitiva.
- ¿Qué instalación real tuvisteis que resolver que no está en ningún tutorial?
- El custom node no se registró en ComfyUI hasta reiniciar el servidor por completo desde cero -- un `kill` normal del proceso anterior no bastó porque un proceso anterior quedó vivo escuchando el mismo puerto. Hasta hacer `kill -9` y relanzar limpio, el nodo `MiniMaxH3PDDAccApply` no aparecía en la lista de nodos disponibles, aunque el `git clone` se había completado sin errores.
- ¿La receta del sampler es igual que con la turbo de 4 pasos?
- No, es más estricta. El README del nodo exige sampler `euler` obligatorio (nada de `er_sde` ni `dpmpp`), los sigmas tienen que venir del propio nodo `MiniMaxH3PDDAccApply` (no de un `BasicScheduler` genérico), el CFG de 1.0 se aplica vía `BasicGuider` en vez del campo `cfg` normal del `KSampler`, y advierte explícitamente que no hay que apilar esta LoRA con LoRAs turbo normales -- son dos destilaciones distintas que no se combinan bien.