Comparativa de modelos de video / Los modelos

Los modelos

La matriz de palomitas para verlo de un vistazo, el comparador para decidir entre dos, y la tabla completa de los 23 con buscador y filtros.

Matriz rápida

La tabla de palomitas

De un vistazo: lo tiene · no lo tiene · ~ parcial o sin confirmar. Ojo con la diferencia entre las dos columnas de referencias: Refs de imagen = acepta imágenes como "ingredientes" (personaje, objeto, estilo, escena). Refs video / audio = modo omni que además acepta video o audio como referencia (movimiento, voz, timbre). Usar una imagen solo como primer frame NO cuenta como referencia. Pasa el cursor sobre las casillas para ver el detalle.

desliza horizontalmente para ver las 14 columnas →

Modelo Texto a videoImagen a videoRefs de imagenRefs video / audioStart / end frameAudio nativoVoz en español4K nativoMás de 15 sExtiende clipsEdición / V2VOpen sourceAPI públicaEn Magnific
Seedance 2.5
ByteDance
Kling 3.0
Kuaishou
~
Gemini Omni Flash
Google
~~~
MiniMax H3
MiniMax
~~
Wan 3.0 (beta)
Alibaba
~~~~
Veo 3.1
Google
~
HappyHorse 1.1
Alibaba ATH
~~~
Wan 2.7 / 2.2
Alibaba
~
Grok Imagine 1.5
xAI
~~~~
LTX-2.5
Lightricks
~~
Flux 3 Video
Black Forest Labs
~~
Runway Gen-4.5
Runway
~~~
Vidu Q3
Shengshu
~~
Luma Ray3.2
Luma AI
~~
PixVerse V6
AISphere
~
SkyReels V4
Kunlun / Skywork
~~
Muse Video
Meta
~~~~~~~~
Sora 2 †
OpenAI
~~~
Hunyuan 1.5
Tencent
~~~
MAGI-2 Preview
Sand.ai
~~~~~~
Firefly Video
Adobe
~~
Pika 2.5
Pika
~~
Midjourney Video
Midjourney
Total con ✓
de 23 modelos
21221312141734910841714

† Sora 2 está descontinuado: su API se apaga el 24 de septiembre de 2026 · "Voz en español" = genera diálogo hablado en español de forma nativa · "En Magnific" verificado en el catálogo el 20 ago 2026 · Capacidades de referencias y start/end verificadas contra docs oficiales (ai.google.dev, fal.ai, Alibaba Cloud, bfl.ai, lumalabs.ai, docs de PixVerse/Adobe/Midjourney/OpenAI) el 20 ago 2026

Cara a cara

¿Dudas entre dos? Compáralos

VS

Las filas resaltadas son donde los dos modelos difieren · ✓ lo tiene · ✗ no · ~ parcial o sin confirmar · créditos = clip de ~5 s con audio en Magnific

La tabla

23 modelos, cara a cara

23 de 23 modelos · desliza horizontalmente para ver todas las columnas →

Modelo Versión · fecha Duración máx Resolución máx Audio nativo Modos y referencias Open source Dónde usarlo Precio aprox (API) Ranking Ideal para
Seedance 2.5
ByteDance
audio4K
2.5 · 31 jul 2026 30 s en una sola toma, con cambios de escena 4K nativo color 10-bit Sí — diálogo, SFX, música y lip-sync, 10+ idiomas T2V, I2V, first/last frame, hasta 50 referencias (imágenes, video, audio, 3D), edición localizada, extensión No Dreamina, API BytePlus, Magnific, Higgsfield, OpenArt ~$0.10/s (480p) a ~$2/s (4K con audio) #2 I2V arena.ai; 2.0 es #1 I2V en Artificial Analysis Narrativa larga con personajes consistentes; el más completo hoy
Kling 3.0
Kuaishou
audio4K
3.0 + Turbo/Omni · 4 feb 2026 15 s (flexible 3–15 s) 4K nativo, 60 fps Sí — 5 idiomas incl. español; clonación de voz en Omni T2V, I2V, start/end frame, multi-shot nativo, multi-referencias de personajes, Director Mode (cámara) No kling.ai, API, fal, Magnific, Higgsfield ~$0.14/s en fal (Pro); 1080p ≈ $20/min #9 T2V con audio (AA) Fotorrealismo y multi-shot; audio en español nativo
Gemini Omni Flash
Google
audio
Flash · 19 may 2026 10 s 720p nativo (upscale a 1080p); 4K sin confirmar Sí — siempre incluido, estéreo 48 kHz Generación + edición conversacional; T2V, I2V, varias imágenes de referencia; sin end frame (la doc oficial excluye interpolación first→last); refs de video/audio anunciadas pero aún no operativas en la API No Gemini app, Flow, YouTube Shorts, API, Magnific, Higgsfield, OpenArt $0.10/s #1 T2V sin audio (1323) y #2 con audio (AA); #1 arena.ai T2V Iterar rápido hablándole; el mejor prompt-adherence
MiniMax H3
MiniMax (Hailuo)
audioopen parcial
H3 · 31 jul 2026 15 s 2K (2560×1440) Sí — estéreo en la misma pasada Omni-modal: T2V, I2V, first/last frame, referencias multimodales, consistencia entre escenas Parcial — base 33B abierta (768p), pero la licencia excluye EE.UU./UE y el pipeline 2K es cerrado App Hailuo, API, OpenRouter, fal, Magnific, Higgsfield ~$0.13/s (~$7.80/min) #1 I2V arena.ai; #2 T2V sin audio (AA) Físicas creíbles y velocidad; imagen-a-video puntero
Wan 3.0
Alibaba
audiobeta
3.0 beta · 6 ago 2026 30 s 1080p Omni-Reference documental: acepta PDFs, Excel, PPT y webs como entrada; T2V, I2V, multi-referencias Prometido; pesos sin confirmar Alibaba Model Studio; API "coming soon" sin confirmar #1 T2V con audio (1247, AA) Documento-a-video (único); esperar a que abra la API
Veo 3.1
Google
audio4K
3.1 + Fast/Lite · oct 2025 (Lite: mar 2026) 8 s + Extend (supera el minuto) 4K Sí — diálogo multiidioma y SFX T2V, I2V, first/last frame, referencias de "ingredientes", extend No Flow, Gemini API, fal, Magnific, Higgsfield $0.05/s (Lite) – $0.40/s (Standard) #12 T2V con audio (AA); media tabla Extend para piezas largas; 4K asequible con Lite
HappyHorse 1.1
Alibaba (ATH)
audio
1.1 · jun 2026 (1.0: abr) sin confirmar 1080p Sí — audio+video en un solo transformer T2V, I2V, reference-to-video con 1–9 imágenes (cara, ropa, entorno, props), video-edit (V2V); generación muy rápida (~38 s por clip 1080p en H100) Contradictorio entre fuentes — sin confirmar fal, Magnific, Higgsfield, Alibaba Bailian $0.14/s en fal #3 T2V sin audio (1.0, AA) Calidad top a precio medio; el "caballo negro" de 2026
Wan 2.7 / 2.2
Alibaba
audioopen (2.2)
2.7 · abr 2026 15 s 1080p Sí (2.7) — sincronizado T2V, I2V, first+last frame nativo (FLF2V), hasta 9 imágenes de referencia (modo 9-grid), audio conductor (driving_audio), continuación de video 2.2 es el rey open weights (Apache 2.0, MoE); 2.7 liberó modelos selectos fal, Magnific, Higgsfield, local (2.2) $0.10/s en fal #5 T2V con audio (AA) Equilibrio precio/calidad; base open para pipelines propios
Grok Imagine 1.5
xAI
audio
Video 1.5 · may–jun 2026 15 s (app); 10 s (API) 720p; 1080p sin confirmar Sí en la app (música, SFX, canto con lip-sync); en API sin confirmar Solo I2V (imagen + prompt de movimiento); T2V vía pipeline imagen→video No grok.com/imagine, API xAI, fal (5 clips/día gratis), Magnific $4.20/min (~$0.07/s) #4 I2V (AA); el más votado del arena Velocidad brutal (~17 s por clip) y precio; animar imágenes
LTX-2.5
Lightricks
audioopen4K
2.5 · 11 ago 2026 10 s, multishot nativo, duración automática 4K HDR nativo Sí — video+audio en una sola pasada (lip-sync, foley) T2V, I2V, V2V; clip de 10 s generado en 6.8 s en GB200 — 22B open weights; comercial gratis bajo $10M/año; LTX-2 corre en una RTX 4090 Hugging Face, ComfyUI, LTX API/Studio, Magnific (LTX-2) $0.08/s (LTX-2.3 en fal) #1 open weights occidental con audio (AA) Open source serio con audio; control total local
Flux 3 Video
Black Forest Labs
3 · ago 2026 Hasta 20 s 1080p Sí — video con audio en una pasada T2V, I2V, hasta 10 imágenes de referencia, keyframe-to-video (transiciones entre momentos), V2V y continuación generativa video+audio sin confirmar fal, Magnific, Higgsfield $0.085/s en fal #2 T2V arena.ai (1494) Vigilarlo de cerca: entró directo al top
Runway Gen-4.5
Runway
sin audio nativo
4.5 · dic 2025 5–10 s 720p–1080p tier exacto sin confirmar No — audio vía ElevenLabs integrado T2V, I2V (first frame); keyframes y V2V anunciados para 4.5 pero sin confirmar disponibles; "References" es del generador de imagen, no del video; desde jul 2026 su app agrega modelos de terceros (model router) No runway.com, API propia, Adobe Firefly, Magnific $0.12/s API; subs $12–95/mes Fue #1 al salir (dic 2025); ya superado Control de movimiento fino; flujo pro con suite de edición
Vidu Q3
Shengshu
audio
Q3 · ene 2026 (R2V global: abr) 16 s continuos 1080p; 2K/4K premium sin confirmar Sí — diálogo, SFX y música en una salida T2V, I2V, reference-to-video multi-referencia (sujetos, entornos, vestuario, props, estilos), 6 efectos cinematográficos No App Vidu, API, Replicate, WaveSpeed ~$0.45 por 5 s (720p) #15 I2V arena.ai Consistencia por referencias y actuación emocional
Luma Ray3.2
Luma AI
sin audio nativo
Ray3.2 · jun 2026 20 s (1080p) 1080p · HDR 16-bit, export EXR No — ElevenLabs en el ecosistema T2V, I2V, hasta 16 keyframes por clip, Modify V2 (V2V), reframe con transferencia de actuación No App Luma, API, fal, Krea, Magnific $0.10/s en fal Fuera del top del arena Post-producción pro: HDR, EXR y control por keyframes
PixVerse V6
AISphere
audio
V6 · 30 mar 2026 15 s 1080p Sí — con motor multi-shot nativo T2V, I2V, multi-shot, plantillas y efectos virales No App PixVerse, API (desde $100/mes), OpenArt, Magnific ~$0.025/s (Atlas); ~$6.90/min 1080p Media tabla I2V (AA) Contenido social rápido y barato en volumen
SkyReels V4
Kunlun / Skywork
audio
V4 · mar 2026 15 s multi-shot 1080p, 32 fps Sí — doble stream video+audio alineado T2V, I2V, referencias de video/audio, máscaras, inpainting y edición de video unificados V2/A2 sí (2025); pesos de V4 no publicados Plataforma SkyReels, API ~$21/min 1080p #10 T2V con audio (AA) Editar e inpaintear video, no solo generarlo
Muse Video
Meta
audiopreview
1.0 · 7 jul 2026 sin confirmar sin confirmar Sí — nativo Primer modelo de video propio de Meta (Superintelligence Labs) No Preview cerrado; "próximamente en Meta AI" sin confirmar #5 T2V arena.ai a días de salir Aún no se puede usar; apunta alto
Sora 2 / Pro
OpenAI
descontinuado
2 · sep 2025 † abr 2026 20 s 1080p Sí — diálogo y SFX T2V, input_reference (1 imagen que actúa como primer frame), extensión, edición dirigida, personajes desde video (character assets: MP4 de 2–4 s, hasta 2 por video) No Solo API hasta el 24 sep 2026; Magnific aún lo lista. La app cerró el 26 abr 2026 $0.10–0.50/s #8 T2V arena.ai (aún) Nada nuevo: migrar antes de septiembre
Hunyuan 1.5
Tencent
opensin audio
1.5 · nov 2025 5–10 s 720p nativo (1080p con super-resolución) No T2V, I2V, V2V, control por profundidad, estilo por referencia — todo en un checkpoint Sí, el más abierto — Apache 2.0, 8.3B, corre en ~14 GB VRAM, ComfyUI nativo Local, fal, Replicate Gratis en local; céntimos hosteado Comparado con la generación 2025, no la actual Experimentar gratis en tu propia GPU
MAGI-2 Preview
Sand.ai
openpreview
2 · ago 2026 Tomas largas (su especialidad) sin confirmar sin confirmar Open source 24B orientado a duración extendida Sí — 24B Recién salido; distribución en curso sin confirmar #6 I2V (AA) en preview Open source para tomas largas; seguirlo
Firefly Video
Adobe
Ciclo abr 2026 ~5 s por clip 1080p nativo, upscale a 4K Audio del modelo sin confirmar; suite con Generate Soundtrack/Speech T2V, I2V, first/last frame; hub con 30+ modelos de terceros (Veo, Gen-4.5, etc.); Generative Extend en Premiere No firefly.adobe.com, Premiere Pro, API Firefly Services Planes CC; tiers con generación ilimitada Su modelo nativo no compite en el top Seguridad comercial (datos licenciados) y flujo Premiere
Pika 2.5
Pika
sin audio nativo
2.5 · inicios 2026 10 s (hasta 25 s con Pikaframes) 1080p No nativo — lip-sync con Pikaformance T2V, I2V, keyframes, efectos (Pikaffects, PikaTwist), extensión de escena No pika.art; sin API pública destacada Gratis 80 créditos/mes; subs Fuera de los rankings 2026 Efectos virales y juegos visuales baratos
Midjourney Video
Midjourney
sin audio
V1 (era V8) · jun 2025 5 s, extensible a 21 s 720p (planes de pago); mejoras 2026 sin confirmar No Solo I2V (Animate); start + ending frame vía --end; sin T2V directo; Omni Reference (--oref) no es compatible con video No Solo midjourney.com; sin API Subs $10–120/mes (~8× el costo de una imagen) Sin ranking Animar la estética Midjourney, nada más

T2V = texto-a-video · I2V = imagen-a-video · V2V = video-a-video · AA = Artificial Analysis Video Arena · precios en USD · † = fecha de cierre