Vídeos contínuos de 30 segundos
O dobro do Seedance 2.0. Uma história completa num só render, sem colar segmentos nem quebras de continuidade.


Apresentado na conferência FORCE 2026 da Volcano Engine, o Dreamina Seedance 2.5 gera vídeos cinemáticos contínuos de até 30 segundos, aceita até 50 referências multimodais e edita ou estende vídeos existentes apenas com texto. Este guia condensa a documentação oficial — modos de criação, sintaxe de prompts, limites técnicos e preços na DXBuilder.
O Seedance 2.5 é um modelo de geração de vídeo por IA focado em narrativa longa, referência multimodal e edição precisa. Numa só chamada consegue gerar uma história completa de 30 segundos com física realista, look cinematográfico e som sincronizado — ou pegar num vídeo teu e transformá-lo, estendê-lo ou repará-lo. É o motor flagship do estúdio Seedance 2.5 da DXBuilder. → Studio
O dobro do Seedance 2.0. Uma história completa num só render, sem colar segmentos nem quebras de continuidade.
Até 30 imagens + 10 vídeos + 10 áudios num só pedido. Mantém personagens, produtos, logotipos e estilos consistentes entre cenas.
Substitui o protagonista, adiciona ou remove objetos, repara zonas do frame ou troca a banda sonora — apenas com texto.
Continua qualquer vídeo para a frente ou para trás, com transições naturais e coerência de luz e movimento.
Voz com lip-sync preciso, efeitos sonoros e música gerados em paralelo com a imagem — sem pós-produção.
Prompts e diálogo falado em português, inglês, espanhol, japonês, coreano, árabe, tailandês e mais — com sincronização labial.
| Capacidade | Seedance 2.5 | Seedance 2.0 |
|---|---|---|
| Duração máxima por render | 30 segundos | 15 segundos |
| Referências multimodais | 50 (30 img + 10 vídeo + 10 áudio) | 15 (9 img + 3 vídeo + 3 áudio) |
| Referência só com áudio (sem imagem) | ✓ Suportado | ✗ Exige imagem/vídeo |
| Formato de saída | MP4 e MOV (chroma 4:4:4) | Só MP4 |
| Duração total de refs vídeo/áudio | 30 segundos | 15 segundos |
| Planeamento pré-geração (white-model 3D) | ✓ | ✗ |
| Compreensão de intenção cinematográfica | Muito superior (enquadramento, linguagem de câmara) | Básica |
O motor classifica cada pedido num de seis tipos de tarefa a partir das referências carregadas e das palavras do prompt. Os modos de edição, extensão e frames têm restrições obrigatórias de proporção e duração — respeitá-las evita erros de geração.
Como ativar: Só precisas de um prompt — sem qualquer ficheiro.
Regras: Sem restrições: escolhe livremente proporção (16:9 … 9:16) e duração (4–30s).
"Um drone FPV mergulha entre arranha-céus à chuva, neons refletidos no asfalto. <chuva e motores> (synthwave)"
Como ativar: 1 imagem como frame de arranque + prompt com o movimento.
Regras: A proporção fica automaticamente igual à da imagem (adaptive). Duração livre 4–30s.
"A pessoa da imagem ganha vida: sorri e o cabelo move-se com a brisa, câmara a orbitar 360°."
Como ativar: 2 imagens: a primeira e a última do vídeo. O motor interpola a transição.
Regras: Proporção herdada do primeiro frame (adaptive). Duração livre 4–30s.
"Transição cinemática do primeiro para o último frame com partículas de luz e físicas realistas."
Como ativar: Combina até 30 imagens (@Image1…), 10 vídeos (@Video1…) e 10 áudios (@Audio1…).
Regras: Proporção e duração livres. ⚠ Evita palavras como "editar" ou "continuar" no prompt — o motor pode reclassificar a tarefa e devolver erro.
"Reference @Image1 for the character. A personagem caminha num mercado noturno, movimento de câmara de @Video1."
Como ativar: Carrega um vídeo e usa palavras-gatilho: editar, adicionar, remover, substituir, modificar.
Regras: Proporção: só adaptive (mantém a do vídeo). Duração: automática (≈ igual à do original, tolerância 0,4s). O vídeo de entrada deve ter 4–30s. A duração do vídeo carregado entra na faturação.
"Video edit: remove everyone in @Video1 except the protagonist."
Como ativar: Carrega um vídeo e usa palavras-gatilho: continuar, estender para a frente/trás, continue the story.
Regras: Proporção: só adaptive (mantém a do vídeo). Duração configurável 4–30s ou automática. A duração do vídeo carregado entra na faturação.
"Extend @Video1. After the window opens, move into the art gallery shown in @Video2."
PRIMEIRO FRAME (1:1)
ÚLTIMO FRAMEPrompt usado: "A rapariga da imagem diz «cheese» para a câmara, com um plano orbital de 360 graus". O vídeo de saída herda automaticamente a proporção 1:1 do primeiro frame.
Sujeito + ação/evento + cenário e ambiente + estilo visual + movimento de câmara / cortes + som
Podes omitir partes desnecessárias, mas mantém esta ordem — é a estrutura que o modelo foi treinado a seguir.
(música épica orquestral crescente)
<trovão distante> <ondas a rebentar>
{Bem-vindos ao futuro!} — indica o idioma antes, se não for óbvio
【DISPONÍVEL AGORA】
@Image1, @Video2, @Audio1 — diz o que cada asset fornece (aparência, movimento, timbre)

Um único render de 30s em estilo steampunk, estruturado em três janelas — [0-10s] relógio de latão que se desdobra em engrenagens, [10-20s] voo através de um zoetrope e teleférico de cobre, [20-30s] navio mecânico, lua gigante e regresso ao relógio, com o logotipo de @Image1 a aparecer no último segundo.
"A premium, highly cinematic 30-second 3D motion-graphics sequence in a refined steampunk style... [0-10s]: A macro close-up of an antique brass clock face unfolds into interlocking gear rings... [10-20s]: The camera glides into an ornate brass zoetrope... [20-30s]: ...In the final second, a logo appears, referring to @Image1."

Um anúncio de bolachas em que cada referência tem um papel: @Image1 dá o produto, @Video1 a composição de abertura, @Video2 o movimento de câmara, @Video3 o impacto do slow-motion, @Video4-6 coreografia, tipografia e final de marca. É assim que se mantém consistência de marca num vídeo inteiro.
"...The strawberry flavor refers to @Image1. The opening builds visual focus on the fruit, referring to the composition of @Video1... one cookie snaps in half and enters slow motion, referring to the impact of @Video3..."

Um rap cinematográfico numa praia ao pôr-do-sol em que o vocalista canta "olá" em 8 línguas — inglês, chinês, japonês, coreano, português, tailandês, espanhol e árabe — com sincronização labial precisa, cortes secos no beat e 8 planos descritos um a um com janelas de tempo. Demonstra o suporte nativo de 11 idiomas do Seedance 2.5.
"...Lyrics (precise lip sync): English: 'Hello' / Portuguese: 'Olá' / Japanese: 'こんにちは'... Shot 5 [0:10-0:13] - A musician by the shore; fast lateral dolly... Lyric line 5 (Portuguese 'Olá'). Hard cut."
| Proporção | 480p | 720p |
|---|---|---|
| 16:9 | 854 × 480 | 1280 × 720 |
| 4:3 | 752 × 560 | 1112 × 834 |
| 1:1 | 640 × 640 | 960 × 960 |
| 3:4 | 560 × 752 | 834 × 1112 |
| 9:16 | 480 × 854 | 720 × 1280 |
| 21:9 | 992 × 432 | 1470 × 630 |
De 4 a 30 segundos, ou automática — o motor escolhe a duração ideal para o prompt. Na edição de vídeo, a duração de saída é sempre ≈ igual à do vídeo original (diferença máxima de 0,4s).
MP4 — máxima compatibilidade, ideal para publicar em redes sociais e web. MOV Pro — H.264 + chroma yuv444p + áudio PCM: fidelidade de cor superior para color grading, keying e compositing. Recomendado como entrada e saída em fluxos de edição/extensão.
Voz, efeitos sonoros e música gerados nativamente e sincronizados com a imagem, em 11 idiomas: português, inglês, espanhol, chinês, japonês, coreano, árabe, tailandês, vietnamita, indonésio e malaio.
• Sem vídeo carregado: duração gerada × tarifa base (45 cr/s em 720p · 21 cr/s em 480p)
• Com vídeo carregado (edição/extensão): (duração do upload + duração gerada) × tarifa reduzida (27 cr/s em 720p · 13 cr/s em 480p)
A duração do vídeo que carregas soma sempre ao tempo faturado — corta o vídeo antes de o carregar se só precisas de uma parte.
Sujeito + ação/evento + cenário e ambiente + estilo visual + movimento de câmara/cortes + som. Omite o que não precisares — mas mantém a ordem.
Em vídeos longos, estrutura o prompt com marcas [0-10s], [10-20s], [20-30s]. O motor respeita o timing de cada bloco e a história flui.
Diz explicitamente o que cada asset fornece: "@Image1 dá a aparência da personagem; @Video1 dá o movimento de câmara; @Audio1 dá o timbre da voz".
"Editar", "remover", "continuar" e "estender" mudam o TIPO de tarefa. Se só queres uma referência de estilo, evita esses verbos ou o pedido pode falhar com erro de parâmetros.
Se vais fazer color grading, keying ou compositing, gera em MOV (chroma 4:4:4 + PCM). Para publicar diretamente nas redes, MP4 chega e é universal.
Proporção adaptive + duração automática deixam o motor escolher o formato ideal para o conteúdo. Nos modos de edição/extensão/frames é mesmo obrigatório.
O motor recusa imagens com rostos de pessoas reais não autorizadas e conteúdo de marcas registadas. Usa personagens genéricas ou os teus próprios assets autorizados.
É o modelo de geração de vídeo por IA de última geração da ByteDance, apresentado na conferência FORCE 2026 da Volcano Engine. Gera vídeos cinemáticos contínuos até 30 segundos com áudio nativo sincronizado, aceita até 50 referências multimodais (imagens, vídeos e áudio) e faz edição e extensão de vídeo por prompt. Na DXBuilder tens acesso direto sem precisares de chave de API.
O 2.5 duplica a duração máxima (30s vs 15s), mais do que triplica as referências (50 vs 15), adiciona saída MOV com chroma 4:4:4, aceita referências só de áudio, e compreende muito melhor a linguagem cinematográfica das referências — enquadramento, movimento e intenção criativa.
Entre 4 e 30 segundos por render. Também podes deixar o motor escolher automaticamente a duração ideal para o teu prompt. Nos modos de extensão podes continuar um vídeo existente várias vezes para contar histórias mais longas.
Sim — nativamente. Usa () para música, <> para efeitos sonoros, {} para diálogo falado com lip-sync e 【】 para legendas. Suporta voz em 11 idiomas, incluindo português.
480p e 720p, em 7 proporções: 16:9, 9:16, 1:1, 4:3, 3:4, 21:9 e adaptive. Saída em MP4 (universal) ou MOV profissional com H.264 + yuv444p + PCM para color grading e compositing.
Carregas um vídeo e escreves a alteração: "remove todas as pessoas exceto o protagonista", "substitui o personagem de @Video1 pelo de @Image1", "remove a música de fundo". O motor mantém a proporção e a duração do vídeo original automaticamente.
A faturação é por segundo: 45 créditos/s em 720p e 21 créditos/s em 480p. Se carregares um vídeo de referência, a duração dele soma ao tempo faturado, mas a tarifa por segundo desce (27 cr/s em 720p, 13 cr/s em 480p). Usa a calculadora nesta página para o valor exato.
Só com autorização. O motor bloqueia rostos de pessoas reais não autorizadas e figuras públicas. Para personagens humanas usa imagens geradas por IA, personagens genéricas ou assets próprios com direitos.
Até 50: 30 imagens (@Image1–@Image30), 10 vídeos (@Video1–@Video10) e 10 áudios (@Audio1–@Audio10). A duração total dos vídeos de referência não pode passar 30 segundos, e o mesmo para os áudios.
Anúncios de produto de 30 segundos, vídeos de e-commerce, trailers e curtas cinemáticas, influencers virtuais com personagem consistente, storytelling de marca multi-cena, conteúdo para TikTok/Reels/Shorts em 9:16 e vídeos musicais multilingues.
Sem chave de API, sem configuração — escreve o prompt, escolhe o formato e o motor faz o resto. Se não tiveres ideias, a IA inventa uma por ti.
Abrir o Estúdio Seedance 2.5