Takes Contínuos Longos (2s a 30s) [Medido por nós]
Gera takes contínuos de 2 a 30 segundos por pedido sem quebras temporais quando estruturados com listas de planos temporizadas.

O Wan 3.0 (`wan3.0-video`) é o modelo topo de gama de geração de vídeo multimodal da Alibaba, oferecendo renderização nativa a 1080p, dinâmica física completa, sincronização labial (lip-sync) nativa multilingue para diálogos e referenciação de múltiplos recursos (assets) até 30 segundos por take contínuo. Todas as métricas de desempenho abaixo refletem testes diretos na API DashScope realizados pela DXBuilder.

Gera takes contínuos de 2 a 30 segundos por pedido sem quebras temporais quando estruturados com listas de planos temporizadas.
Aceita até 10 imagens, 5 clipes de vídeo (≤15s no total), 5 faixas de áudio (≤15s) e 1 documento (100MB/50 páginas) ou ligação web por tarefa de renderização.
Sintetiza diálogos temporizados entre {chavetas} com precisão comprovada de sincronização labial em português europeu e dialetos regionais, além de efeitos sonoros (SFX) atmosféricos.
Mapeia com precisão logótipos e texturas de referência em superfícies dinâmicas (bordados em tecido, letreiros néon, brasas incandescentes) sem degradação gráfica.
Os nossos testes de benchmark confirmam que aumentar os recursos de referência de 0 para 4 itens adiciona zero latência de renderização na GPU.
Edição de vídeo baseada em instruções, extensão temporal encadeada de vídeo e injeção de contexto de pesquisa web ao vivo permanecem por verificar em produção.
| Parâmetro de Produção | Wan 3.0 (DashScope Direto) | Seedance 2.5 PRO |
|---|---|---|
| Duração Máxima de Take Único | 30 Segundos (Contínuo nativo) [Medido] | Até 30 segundos por take |
| Resoluções Nativas | 480p · 720p · 1080p Nativo (Sem upscaling por IA) | 480p · 720p (1080p/4K via Upscaling Topaz) |
| Motor de Áudio e Diálogo | Lip-sync nativo + SFX ambientais + dialetos [Medido] | Pipeline separado de geração de áudio / pós-sincronização |
| Duração da Renderização (Take de 30s) | 33–46 min (720p) · 50 min (1080p) [Medido] | 2–5 min (pipeline rápido) |
| Capacidade de Entrada Multimodal | 10 imagens + 5 vídeos + 5 áudios + 1 doc/link | 50 imagens de referência + vídeo e áudio de referência |
| Custo por Segundo (DXBuilder) | 7.5 cr/s (480p) · 15 cr/s (720p) · 30 cr/s (1080p) | 25 cr/s (480p) · 35 cr/s (720p) · desconto até -25% aos 30s |
Gatilho: Formata prompts com marcadores temporais absolutos e etiquetas explícitas de diálogo: HARD CUT at Xs — [SCALE/ANGLE]: action {spoken dialogue}.
Regras: Prompts em prosa contínua produzem 0–1 cortes em 15s; listas de planos temporizadas executam 4–12 cortes [Medido por nós].
Gatilho: Carrega imagens de referência (identidade do sujeito, guarda-roupa, patch de logótipo) e clipes de áudio com bloqueios explícitos de identidade.
Regras: As fotos do sujeito devem ser limpas e verticais (a rotação EXIF corrompe a geometria facial). A quantidade de recursos de referência (0 a 4) não altera o tempo de renderização [Medido por nós].
Gatilho: Esboça e calibra composição, iluminação e movimento de câmara em renderizações de teste de 5 segundos antes de avançar para as passagens finais completas de 30 segundos a 1080p.
Regras: Poupa mais de 80% do orçamento de créditos durante a calibração do enquadramento; atualiza para 30s/1080p apenas após a fixação da temporização e do reconhecimento de recursos.
HARD CUT at 04:00 — MEDIUM SHOT: Actor turns to camera | HARD CUT at 09:00 — EXTREME CLOSE-UP: Hand grips copper dial.Character speaks directly into lens: {"Temos apenas três minutos antes da ignição."} [AUDIO: heavy mechanical hum, no background music][LOOK LOCK: overcast daylight 5600K, charcoal wool overcoat, wet cobblestone environment, muted cyan color grading]Real gravitational weight, splashing water droplets with inertia, cloth drag resistance, no floating, no weightless wire-work.[NEGATIVE: no superhero emblems, no commercial franchise logos, no copyright costumes, no smooth slide floating motion]Subject accelerates from right edge to center, occupying 40% vertical frame height, moving 35% horizontal distance per second.Cena multicorte temporizada com sincronização labial nativa de diálogos, sonoplastia ambiente e peso físico verificado [Medido por nós].
[LOOK LOCK: Moody neon-lit alley, wet asphalt, 35mm anamorphic, heavy rain]
00:00-00:04 MEDIUM TRACKING SHOT: Detective walks forward with heavy footsteps, rain dripping from brimmed hat.
00:04-00:09 HARD CUT — CLOSE-UP: Detective stops under amber streetlight, looks straight into lens, speaking firmly: {"Não há mais tempo para negociações. O navio já partiu do cais."}
00:09-00:15 HARD CUT — OVER-THE-SHOULDER WIDE: A black cargo boat vanishes into foggy harbor waters. Real gravitational water displacement, heavy splashes.
[AUDIO: continuous heavy rainfall, distant foghorn, crisp vocal dialogue, no background synth music]
[NEGATIVE: no floating, no weightless wire-work, no superhero emblems, no frozen locked-off camera]Sequência completa de 30 segundos avaliada em benchmark, demonstrando a reprodução de logótipo de referência em superfícies físicas com dinâmica de massa real [Medido por nós].
[LOOK LOCK: Blacksmith forge workshop, warm 3200K tungsten backlight, volumetric smoke and rising embers] 00:00-00:08 LOW ANGLE SLOW DOLLY IN: Blacksmith hammers glowing hot steel bar on iron anvil with heavy impact shocks. 00:08-00:16 HARD CUT — MACRO SHOT: Hammer strikes molten metal surface, embossing the DXBuilder geometric logo from @Image1 into glowing orange iron, sparking embers scattering with authentic physics. 00:16-00:24 HARD CUT — MEDIUM PROFILE: Blacksmith plunges the branded metal blade into cold water vat. Instant dense steam eruption and boiling fluid turbulence. 00:24-00:30 HARD CUT — CLOSE-UP HERO SHOT: Water drips off the engraved brand logo on dark Damascus steel, camera maintains subtle hand-held organic drift. [AUDIO: metallic anvil strikes, roaring forge fire, loud water quenching hiss, deep room tone] [NEGATIVE: no static frozen camera, no synthetic plastic texture, no franchise trademarks]

Os presets Premium usam o motor Seedance 2.5 — envias uma selfie e um realizador IA filma um blockbuster de 3 atos contigo como protagonista. De 15 segundos a 1:30.
⚡ 2.5
⚡ 2.5
⚡ 2.5