Vídeos continuos de 30 segundos
El doble que Seedance 2.0. Una historia completa en un solo render, sin pegar segmentos ni rupturas de continuidad.


Presentado en la conferencia FORCE 2026 de Volcano Engine, Dreamina Seedance 2.5 genera vídeos cinematográficos continuos de hasta 30 segundos, acepta hasta 50 referencias multimodales y edita o extiende vídeos existentes solo con texto. Esta guía condensa la documentación oficial: modos de creación, sintaxis de prompts, límites técnicos y precios en DXBuilder.
Seedance 2.5 es un modelo de generación de vídeo por IA centrado en narrativa larga, referencia multimodal y edición precisa. En una sola llamada puede generar una historia completa de 30 segundos con física realista, look cinematográfico y sonido sincronizado — o tomar un vídeo tuyo y transformarlo, extenderlo o repararlo. Es el motor insignia del estudio Seedance 2.5 de DXBuilder. → Studio
El doble que Seedance 2.0. Una historia completa en un solo render, sin pegar segmentos ni rupturas de continuidad.
Hasta 30 imágenes + 10 vídeos + 10 audios en una sola petición. Mantiene personajes, productos, logotipos y estilos consistentes entre escenas.
Sustituye al protagonista, añade o elimina objetos, repara zonas del frame o cambia la banda sonora — solo con texto.
Continúa cualquier vídeo hacia delante o hacia atrás, con transiciones naturales y coherencia de luz y movimiento.
Voz con lip-sync preciso, efectos de sonido y música generados en paralelo con la imagen — sin postproducción.
Prompts y diálogo hablado en español, inglés, portugués, japonés, coreano, árabe, tailandés y más — con sincronización labial.
| Capacidad | Seedance 2.5 | Seedance 2.0 |
|---|---|---|
| Duración máxima por render | 30 segundos | 15 segundos |
| Referencias multimodales | 50 (30 img + 10 vídeo + 10 audio) | 15 (9 img + 3 vídeo + 3 audio) |
| Referencia solo con audio (sin imagen) | ✓ Soportado | ✗ Exige imagen/vídeo |
| Formato de salida | MP4 y MOV (chroma 4:4:4) | Solo MP4 |
| Duración total de refs vídeo/audio | 30 segundos | 15 segundos |
| Planificación pre-generación (white-model 3D) | ✓ | ✗ |
| Comprensión de intención cinematográfica | Muy superior (encuadre, lenguaje de cámara) | Básica |
El motor clasifica cada petición en uno de seis tipos de tarea a partir de las referencias subidas y las palabras del prompt. Los modos de edición, extensión y frames tienen restricciones obligatorias de proporción y duración — respetarlas evita errores de generación.
Cómo activarlo: Solo necesitas un prompt — sin ningún archivo.
Reglas: Sin restricciones: elige libremente proporción (16:9 … 9:16) y duración (4–30s).
"Un dron FPV se sumerge entre rascacielos bajo la lluvia, neones reflejados en el asfalto. <lluvia y motores> (synthwave)"
Cómo activarlo: 1 imagen como frame de arranque + prompt con el movimiento.
Reglas: La proporción se iguala automáticamente a la de la imagen (adaptive). Duración libre 4–30s.
"La persona de la imagen cobra vida: sonríe y su pelo se mueve con la brisa, cámara orbitando 360°."
Cómo activarlo: 2 imágenes: la primera y la última del vídeo. El motor interpola la transición.
Reglas: Proporción heredada del primer frame (adaptive). Duración libre 4–30s.
"Transición cinematográfica del primer al último frame con partículas de luz y físicas realistas."
Cómo activarlo: Combina hasta 30 imágenes (@Image1…), 10 vídeos (@Video1…) y 10 audios (@Audio1…).
Reglas: Proporción y duración libres. ⚠ Evita palabras como "editar" o "continuar" en el prompt — el motor puede reclasificar la tarea y devolver error.
"Reference @Image1 for the character. El personaje camina por un mercado nocturno, movimiento de cámara de @Video1."
Cómo activarlo: Sube un vídeo y usa palabras clave: editar, añadir, eliminar, sustituir, modificar.
Reglas: Proporción: solo adaptive (mantiene la del vídeo). Duración: automática (≈ igual a la original, tolerancia 0,4s). El vídeo de entrada debe durar 4–30s. La duración del vídeo subido cuenta en la facturación.
"Video edit: remove everyone in @Video1 except the protagonist."
Cómo activarlo: Sube un vídeo y usa palabras clave: continuar, extender hacia delante/atrás, continue the story.
Reglas: Proporción: solo adaptive (mantiene la del vídeo). Duración configurable 4–30s o automática. La duración del vídeo subido cuenta en la facturación.
"Extend @Video1. After the window opens, move into the art gallery shown in @Video2."
PRIMER FRAME (1:1)
ÚLTIMO FRAMEPrompt usado: "La chica de la imagen dice «cheese» a la cámara, con un plano orbital de 360 grados". El vídeo de salida hereda automáticamente la proporción 1:1 del primer frame.
Sujeto + acción/evento + escenario y ambiente + estilo visual + movimiento de cámara / cortes + sonido
Puedes omitir partes innecesarias, pero mantén este orden — es la estructura que el modelo fue entrenado para seguir.
(música épica orquestal creciente)
<trueno distante> <olas rompiendo>
{¡Bienvenidos al futuro!} — indica el idioma antes si no es obvio
【DISPONIBLE AHORA】
@Image1, @Video2, @Audio1 — di qué aporta cada asset (apariencia, movimiento, timbre)

Un único render de 30s en estilo steampunk, estructurado en tres ventanas — [0-10s] reloj de latón que se despliega en engranajes, [10-20s] vuelo a través de un zoótropo y teleférico de cobre, [20-30s] barco mecánico, luna gigante y regreso al reloj, con el logotipo de @Image1 apareciendo en el último segundo.
"A premium, highly cinematic 30-second 3D motion-graphics sequence in a refined steampunk style... [0-10s]: A macro close-up of an antique brass clock face unfolds into interlocking gear rings... [10-20s]: The camera glides into an ornate brass zoetrope... [20-30s]: ...In the final second, a logo appears, referring to @Image1."

Un anuncio de galletas donde cada referencia tiene un papel: @Image1 aporta el producto, @Video1 la composición de apertura, @Video2 el movimiento de cámara, @Video3 el impacto del slow-motion, @Video4-6 coreografía, tipografía y cierre de marca. Así se mantiene la consistencia de marca en todo el vídeo.
"...The strawberry flavor refers to @Image1. The opening builds visual focus on the fruit, referring to the composition of @Video1... one cookie snaps in half and enters slow motion, referring to the impact of @Video3..."

Un rap cinematográfico en una playa al atardecer donde el vocalista canta "hola" en 8 lenguas — inglés, chino, japonés, coreano, portugués, tailandés, español y árabe — con sincronización labial precisa, cortes secos al ritmo y 8 planos descritos uno a uno con ventanas de tiempo. Demuestra el soporte nativo de 11 idiomas de Seedance 2.5.
"...Lyrics (precise lip sync): English: 'Hello' / Portuguese: 'Olá' / Japanese: 'こんにちは'... Shot 5 [0:10-0:13] - A musician by the shore; fast lateral dolly... Lyric line 5 (Portuguese 'Olá'). Hard cut."
| Proporción | 480p | 720p |
|---|---|---|
| 16:9 | 854 × 480 | 1280 × 720 |
| 4:3 | 752 × 560 | 1112 × 834 |
| 1:1 | 640 × 640 | 960 × 960 |
| 3:4 | 560 × 752 | 834 × 1112 |
| 9:16 | 480 × 854 | 720 × 1280 |
| 21:9 | 992 × 432 | 1470 × 630 |
De 4 a 30 segundos, o automática — el motor elige la duración ideal para el prompt. En la edición de vídeo, la duración de salida es siempre ≈ igual a la del vídeo original (diferencia máxima de 0,4s).
MP4 — máxima compatibilidad, ideal para publicar en redes sociales y web. MOV Pro — H.264 + chroma yuv444p + audio PCM: fidelidad de color superior para etalonaje, keying y compositing. Recomendado como entrada y salida en flujos de edición/extensión.
Voz, efectos de sonido y música generados nativamente y sincronizados con la imagen, en 11 idiomas: español, inglés, portugués, chino, japonés, coreano, árabe, tailandés, vietnamita, indonesio y malayo.
• Sin vídeo subido: duración generada × tarifa base (45 cr/s en 720p · 21 cr/s en 480p)
• Con vídeo subido (edición/extensión): (duración de subida + duración generada) × tarifa reducida (27 cr/s en 720p · 13 cr/s en 480p)
La duración del vídeo que subes siempre suma al tiempo facturado — recorta el vídeo antes de subirlo si solo necesitas una parte.
Sujeto + acción/evento + escenario y ambiente + estilo visual + movimiento de cámara/cortes + sonido. Omite lo que no necesites — pero mantén el orden.
En vídeos largos, estructura el prompt con marcas [0-10s], [10-20s], [20-30s]. El motor respeta el timing de cada bloque y la historia fluye.
Di explícitamente qué aporta cada asset: "@Image1 da la apariencia del personaje; @Video1 da el movimiento de cámara; @Audio1 da el timbre de la voz".
"Editar", "eliminar", "continuar" y "extender" cambian el TIPO de tarea. Si solo quieres una referencia de estilo, evita esos verbos o la petición puede fallar con error de parámetros.
Si vas a hacer etalonaje, keying o compositing, genera en MOV (chroma 4:4:4 + PCM). Para publicar directamente en redes, MP4 basta y es universal.
Proporción adaptive + duración automática dejan que el motor elija el formato ideal para el contenido. En los modos de edición/extensión/frames es incluso obligatorio.
El motor rechaza imágenes con rostros de personas reales no autorizadas y contenido de marcas registradas. Usa personajes genéricos o tus propios assets autorizados.
Es el modelo de generación de vídeo por IA de última generación de ByteDance, presentado en la conferencia FORCE 2026 de Volcano Engine. Genera vídeos cinematográficos continuos de hasta 30 segundos con audio nativo sincronizado, acepta hasta 50 referencias multimodales (imágenes, vídeos y audio) y realiza edición y extensión de vídeo por prompt. En DXBuilder tienes acceso directo sin necesidad de clave de API.
El 2.5 duplica la duración máxima (30s vs 15s), más que triplica las referencias (50 vs 15), añade salida MOV con chroma 4:4:4, acepta referencias solo de audio, y comprende mucho mejor el lenguaje cinematográfico de las referencias — encuadre, movimiento e intención creativa.
Entre 4 y 30 segundos por render. También puedes dejar que el motor elija automáticamente la duración ideal para tu prompt. En los modos de extensión puedes continuar un vídeo existente varias veces para contar historias más largas.
Sí — nativamente. Usa () para música, <> para efectos de sonido, {} para diálogo hablado con lip-sync y 【】 para subtítulos. Soporta voz en 11 idiomas, incluido el español.
480p y 720p, en 7 proporciones: 16:9, 9:16, 1:1, 4:3, 3:4, 21:9 y adaptive. Salida en MP4 (universal) o MOV profesional con H.264 + yuv444p + PCM para etalonaje y compositing.
Subes un vídeo y escribes el cambio: "elimina a todas las personas excepto al protagonista", "sustituye el personaje de @Video1 por el de @Image1", "quita la música de fondo". El motor mantiene automáticamente la proporción y la duración del vídeo original.
La facturación es por segundo: 45 créditos/s en 720p y 21 créditos/s en 480p. Si subes un vídeo de referencia, su duración se suma al tiempo facturado, pero la tarifa por segundo baja (27 cr/s en 720p, 13 cr/s en 480p). Usa la calculadora de esta página para el valor exacto.
Solo con autorización. El motor bloquea rostros de personas reales no autorizadas y figuras públicas. Para personajes humanos usa imágenes generadas por IA, personajes genéricos o assets propios con derechos.
Hasta 50: 30 imágenes (@Image1–@Image30), 10 vídeos (@Video1–@Video10) y 10 audios (@Audio1–@Audio10). La duración total de los vídeos de referencia no puede superar los 30 segundos, y lo mismo para los audios.
Anuncios de producto de 30 segundos, vídeos de e-commerce, tráilers y cortos cinematográficos, influencers virtuales con personaje consistente, storytelling de marca multi-escena, contenido 9:16 para TikTok/Reels/Shorts y vídeos musicales multilingües.
Sin clave de API, sin configuración — escribe el prompt, elige el formato y el motor hace el resto. Si no tienes ideas, la IA inventa una por ti.
Abrir el Estudio Seedance 2.5