DX Builder
DX Builder
OFFIZIELLE DOKUMENTATION · MODI · PROMPTS · PREISEByteDance Seedance 2.5 — Vollständiger Leitfaden
← Zurück zum Seedance 2.5 Studio

Seedance 2.5: der vollständige Leitfaden zum fortschrittlichsten Videomodell von ByteDance

Vorgestellt auf der FORCE-2026-Konferenz von Volcano Engine, generiert Dreamina Seedance 2.5 durchgehende Kinovideos von bis zu 30 Sekunden, akzeptiert bis zu 50 multimodale Referenzen und bearbeitet oder verlängert vorhandene Videos allein mit Text. Dieser Leitfaden verdichtet die offizielle Dokumentation — Erstellungsmodi, Prompt-Syntax, technische Limits und DXBuilder-Preise.

30s pro Render480p · 720p7 SeitenverhältnisseMP4 + MOV 4:4:450 Referenzen11 SprachenNatives Audio

Was ist ByteDance Seedance 2.5?

Seedance 2.5 ist ein KI-Videogenerierungsmodell mit Fokus auf lange Erzählungen, multimodale Referenzen und präzise Bearbeitung. In einem einzigen Aufruf generiert es eine komplette 30-Sekunden-Geschichte mit realistischer Physik, Kino-Look und synchronisiertem Ton — oder nimmt eines deiner Videos und transformiert, verlängert oder repariert es. Es ist die Flaggschiff-Engine des Seedance-2.5-Studios von DXBuilder. → Studio

Durchgehende 30-Sekunden-Videos

Doppelt so lang wie Seedance 2.0. Eine komplette Geschichte in einem Render, ohne zusammengeklebte Segmente oder Kontinuitätsbrüche.

50 multimodale Referenzen

Bis zu 30 Bilder + 10 Videos + 10 Audios in einer Anfrage. Hält Charaktere, Produkte, Logos und Stile über Szenen hinweg konsistent.

Promptbasierte Videobearbeitung

Ersetze den Protagonisten, füge Objekte hinzu oder entferne sie, repariere Bildbereiche oder tausche den Soundtrack — allein mit Text.

Videoverlängerung

Setze jedes Video vorwärts oder rückwärts fort, mit natürlichen Übergängen und kohärentem Licht und Bewegung.

Natives synchronisiertes Audio

Präzise lippensynchrone Stimme, Soundeffekte und Musik parallel zum Bild generiert — ohne Postproduktion.

11 native Sprachen

Prompts und gesprochene Dialoge auf Englisch, Portugiesisch, Spanisch, Japanisch, Koreanisch, Arabisch, Thai und mehr — mit Lippensynchronisation.

Seedance 2.5 vs Seedance 2.0: was sich geändert hat

FähigkeitSeedance 2.5Seedance 2.0
Maximale Dauer pro Render30 Sekunden15 Sekunden
Multimodale Referenzen50 (30 Bilder + 10 Videos + 10 Audios)15 (9 Bilder + 3 Videos + 3 Audios)
Nur-Audio-Referenz (ohne Bild)✓ Unterstützt✗ Erfordert Bild/Video
AusgabeformatMP4 und MOV (4:4:4-Chroma)Nur MP4
Gesamtdauer der Video-/Audio-Refs30 Sekunden15 Sekunden
Planung vor der Generierung (3D-White-Model)
Verständnis filmischer AbsichtWeit überlegen (Bildausschnitt, Kamerasprache)Einfach

Die 6 Erstellungsmodi (und die Regeln für jeden)

Die Engine klassifiziert jede Anfrage anhand der hochgeladenen Referenzen und der Wörter im Prompt in einen von sechs Aufgabentypen. Die Modi Bearbeitung, Verlängerung und Frames haben verpflichtende Einschränkungen für Seitenverhältnis und Dauer — sie einzuhalten vermeidet Generierungsfehler.

1 · Text zu Video

So wird's ausgelöst: Du brauchst nur einen Prompt — keinerlei Dateien.

Regeln: Keine Einschränkungen: wähle frei Seitenverhältnis (16:9 … 9:16) und Dauer (4–30s).

"Eine FPV-Drohne taucht im Regen zwischen Wolkenkratzer, Neonlichter spiegeln sich auf dem Asphalt. <Regen und Motoren> (Synthwave)"

2 · Bild zu Video (Erstes Frame)

So wird's ausgelöst: 1 Bild als Start-Frame + ein Prompt mit der Bewegung.

Regeln: Das Seitenverhältnis entspricht automatisch dem Bild (adaptive). Freie Dauer 4–30s.

"Die Person im Bild erwacht zum Leben: lächelt, während sich ihr Haar in der Brise bewegt, Kamera umkreist 360°."

3 · Frame A → Frame B (First/Last)

So wird's ausgelöst: 2 Bilder: das erste und das letzte Frame des Videos. Die Engine interpoliert den Übergang.

Regeln: Seitenverhältnis vom ersten Frame geerbt (adaptive). Freie Dauer 4–30s.

"Filmischer Übergang vom ersten zum letzten Frame mit Lichtpartikeln und realistischer Physik."

4 · Multimodal (Referenzen)

So wird's ausgelöst: Kombiniere bis zu 30 Bilder (@Image1…), 10 Videos (@Video1…) und 10 Audios (@Audio1…).

Regeln: Freies Seitenverhältnis und freie Dauer. ⚠ Vermeide Wörter wie „bearbeiten“ oder „fortsetzen“ im Prompt — die Engine kann die Aufgabe umklassifizieren und einen Fehler zurückgeben.

"Reference @Image1 for the character. Die Figur geht über einen Nachtmarkt, Kamerabewegung von @Video1."

5 · Videobearbeitung

So wird's ausgelöst: Lade ein Video hoch und verwende Auslösewörter: bearbeiten, hinzufügen, entfernen, ersetzen, ändern.

Regeln: Seitenverhältnis: nur adaptive (behält das des Videos). Dauer: automatisch (≈ wie das Original, 0,4s Toleranz). Das Eingabevideo muss 4–30s lang sein. Die Dauer des hochgeladenen Videos zählt zur Abrechnung.

"Video edit: remove everyone in @Video1 except the protagonist."

6 · Videoverlängerung

So wird's ausgelöst: Lade ein Video hoch und verwende Auslösewörter: fortsetzen, vorwärts/rückwärts verlängern, continue the story.

Regeln: Seitenverhältnis: nur adaptive (behält das des Videos). Dauer konfigurierbar 4–30s oder automatisch. Die Dauer des hochgeladenen Videos zählt zur Abrechnung.

"Extend @Video1. After the window opens, move into the art gallery shown in @Video2."

Echtes Beispiel (offizielle Dokumentation): First frame → Last frame
ERSTES FRAME (1:1)ERSTES FRAME (1:1)
LETZTES FRAMELETZTES FRAME

Verwendeter Prompt: „Das Mädchen im Bild sagt ‚cheese‘ in die Kamera, mit einer 360-Grad-Orbitalaufnahme“. Das Ausgabevideo erbt automatisch das 1:1-Seitenverhältnis des ersten Frames.

Prompt-Syntax: die offizielle Formel

Subjekt + Aktion/Ereignis + Szene und Umgebung + visueller Stil + Kamerabewegung / Schnitte + Ton

Du kannst unnötige Teile weglassen, aber behalte diese Reihenfolge bei — es ist die Struktur, auf die das Modell trainiert wurde.

( )Musik

(epische Orchestermusik, anschwellend)

< >Soundeffekte (SFX)

<ferner Donner> <brechende Wellen>

{ }Gesprochener Dialog

{Willkommen in der Zukunft!} — nenne vorher die Sprache, wenn nicht offensichtlich

【 】Untertitel im Bild

【JETZT VERFÜGBAR】

@Referenzen

@Image1, @Video2, @Audio1 — sage, was jedes Asset liefert (Aussehen, Bewegung, Klangfarbe)

Echte Beispiele aus der offiziellen Dokumentation

Seedance 2.5 — 30s steampunk reference input

Durchgehendes 30-Sekunden-Video mit Zeitblöcken

Ein einziger 30s-Render im Steampunk-Stil, in drei Fenstern strukturiert — [0-10s] eine Messinguhr entfaltet sich zu Zahnrädern, [10-20s] Flug durch ein Zoetrop und eine Kupferseilbahn, [20-30s] mechanisches Schiff, riesiger Mond und Rückkehr zur Uhr, mit dem @Image1-Logo in der letzten Sekunde.

"A premium, highly cinematic 30-second 3D motion-graphics sequence in a refined
steampunk style... [0-10s]: A macro close-up of an antique brass clock face unfolds
into interlocking gear rings... [10-20s]: The camera glides into an ornate brass
zoetrope... [20-30s]: ...In the final second, a logo appears, referring to @Image1."
Seedance 2.5 — product ad reference image

Produktwerbung mit 1 Bild + 6 Referenzvideos

Eine Keks-Werbung, in der jede Referenz eine Rolle hat: @Image1 liefert das Produkt, @Video1 die Eröffnungskomposition, @Video2 die Kamerabewegung, @Video3 den Zeitlupen-Impact, @Video4-6 Choreografie, Typografie und Marken-Finale. So bleibt die Markenkonsistenz über ein ganzes Video erhalten.

"...The strawberry flavor refers to @Image1. The opening builds visual focus on the
fruit, referring to the composition of @Video1... one cookie snaps in half and enters
slow motion, referring to the impact of @Video3..."
Seedance 2.5 — multilingual music video reference

Musikvideo mit Gesang in 8 Sprachen und Lippensynchronisation

Ein filmischer Rap an einem Strand bei Sonnenuntergang, in dem der Sänger „Hallo“ in 8 Sprachen singt — Englisch, Chinesisch, Japanisch, Koreanisch, Portugiesisch, Thai, Spanisch und Arabisch — mit präziser Lippensynchronisation, harten Schnitten auf den Beat und 8 einzeln beschriebenen Einstellungen mit Zeitfenstern. Es demonstriert die native Unterstützung von 11 Sprachen in Seedance 2.5.

"...Lyrics (precise lip sync): English: 'Hello' / Portuguese: 'Olá' / Japanese:
'こんにちは'... Shot 5 [0:10-0:13] - A musician by the shore; fast lateral dolly...
Lyric line 5 (Portuguese 'Olá'). Hard cut."

Technische Ausgabespezifikationen

Seitenverhältnis480p720p
16:9854 × 4801280 × 720
4:3752 × 5601112 × 834
1:1640 × 640960 × 960
3:4560 × 752834 × 1112
9:16480 × 854720 × 1280
21:9992 × 4321470 × 630

Dauer

Von 4 bis 30 Sekunden oder automatisch — die Engine wählt die ideale Dauer für den Prompt. Bei der Videobearbeitung ist die Ausgabedauer immer ≈ gleich dem Originalvideo (maximal 0,4s Unterschied).

MP4 vs MOV

MP4 — maximale Kompatibilität, ideal zum Veröffentlichen in sozialen Netzwerken und im Web. MOV Pro — H.264 + yuv444p-Chroma + PCM-Audio: überlegene Farbtreue für Color Grading, Keying und Compositing. Empfohlen als Ein- und Ausgabe in Bearbeitungs-/Verlängerungs-Workflows.

Audio

Stimme, Soundeffekte und Musik nativ generiert und mit dem Bild synchronisiert, in 11 Sprachen: Englisch, Portugiesisch, Spanisch, Chinesisch, Japanisch, Koreanisch, Arabisch, Thai, Vietnamesisch, Indonesisch und Malaiisch.

Referenz-Limits (was du hochladen kannst)

Referenzbilder

  • Formate: JPEG, PNG, WebP, BMP, TIFF, GIF, HEIC/HEIF
  • Abmessungen: 300–6000 px pro Seite; Seitenverhältnis zwischen 0.4 und 2.5
  • Größe: bis zu 30 MB pro Bild
  • Anzahl: 1 (erstes Frame) · 2 (first/last) · bis zu 30 (multimodal)

Referenzvideos

  • Formate: MP4 und MOV (H.264/H.265 + AAC/MP3)
  • Dauer: je 2–30s; Gesamtdauer aller Videos ≤ 30s
  • Auflösung 480p–720p · 24–60 fps · bis zu 200 MB
  • Anzahl: bis zu 10 Videos pro Anfrage

Referenz-Audio

  • Formate: WAV und MP3
  • Dauer: je 2–30s; Gesamtdauer aller Audios ≤ 30s
  • Größe: bis zu 15 MB pro Datei
  • Anzahl: bis zu 10 Audios · funktioniert OHNE Bild/Video (neu in 2.5)

DXBuilder-Preise & Credit-Rechner

10s
0s
Geschätzte Gesamtkosten450 Credits
Tarif: 45 cr/s · Abgerechnete Zeit: 10s (10s generiert)
So funktioniert die Abrechnung:

Ohne hochgeladenes Video: generierte Dauer × Basistarif (45 Cr/s bei 720p · 21 Cr/s bei 480p)

Mit hochgeladenem Video (Bearbeitung/Verlängerung): (Upload-Dauer + generierte Dauer) × reduzierter Tarif (27 Cr/s bei 720p · 13 Cr/s bei 480p)

Die Dauer des hochgeladenen Videos wird immer zur abgerechneten Zeit addiert — schneide das Video vor dem Hochladen zu, wenn du nur einen Teil brauchst.

7 Best Practices für perfekte Renders

1

Folge der Prompt-Formel

Subjekt + Aktion/Ereignis + Szene und Umgebung + visueller Stil + Kamerabewegung/Schnitte + Ton. Lass weg, was du nicht brauchst — aber behalte die Reihenfolge bei.

2

Teile in Zeitfenster auf

Strukturiere den Prompt bei langen Videos mit Markern [0-10s], [10-20s], [20-30s]. Die Engine respektiert das Timing jedes Blocks und die Geschichte fließt.

3

Weise den Referenzen Verantwortlichkeiten zu

Sage explizit, was jedes Asset liefert: „@Image1 gibt das Aussehen der Figur; @Video1 gibt die Kamerabewegung; @Audio1 gibt die Klangfarbe der Stimme“.

4

Vorsicht mit Auslösewörtern

„Bearbeiten“, „entfernen“, „fortsetzen“ und „verlängern“ ändern den TYP der Aufgabe. Wenn du nur eine Stilreferenz willst, vermeide diese Verben, sonst kann die Anfrage mit einem Parameterfehler fehlschlagen.

5

MOV für die Postproduktion

Wenn du Color Grading, Keying oder Compositing planst, generiere in MOV (4:4:4-Chroma + PCM). Zum direkten Veröffentlichen in sozialen Medien reicht MP4 und ist universell.

6

Adaptive ist dein Freund

Adaptives Seitenverhältnis + automatische Dauer lassen die Engine das ideale Format für den Inhalt wählen. In den Modi Bearbeitung/Verlängerung/Frames ist es sogar Pflicht.

7

Keine berühmten Gesichter oder Marken

Die Engine lehnt Bilder mit Gesichtern nicht autorisierter realer Personen und markenrechtlich geschützte Inhalte ab. Verwende generische Charaktere oder deine eigenen lizenzierten Assets.

Häufige Fragen zu Seedance 2.5

Was ist ByteDance Seedance 2.5?

Es ist ByteDances KI-Videomodell der neuesten Generation, vorgestellt auf der FORCE-2026-Konferenz von Volcano Engine. Es generiert durchgehende Kinovideos von bis zu 30 Sekunden mit nativem synchronisiertem Audio, akzeptiert bis zu 50 multimodale Referenzen (Bilder, Videos und Audio) und führt promptbasierte Videobearbeitung und -verlängerung durch. Auf DXBuilder hast du direkten Zugang ohne API-Schlüssel.

Was ist der Unterschied zwischen Seedance 2.5 und Seedance 2.0?

2.5 verdoppelt die maximale Dauer (30s vs 15s), mehr als verdreifacht die Referenzen (50 vs 15), fügt MOV-Ausgabe mit 4:4:4-Chroma hinzu, akzeptiert Nur-Audio-Referenzen und versteht die filmische Sprache der Referenzen weit besser — Bildausschnitt, Bewegung und kreative Absicht.

Wie lang kann ein Seedance-2.5-Video sein?

Zwischen 4 und 30 Sekunden pro Render. Du kannst die Engine auch automatisch die ideale Dauer für deinen Prompt wählen lassen. In den Verlängerungsmodi kannst du ein vorhandenes Video mehrfach fortsetzen, um längere Geschichten zu erzählen.

Generiert Seedance 2.5 Audio und Stimme?

Ja — nativ. Verwende () für Musik, <> für Soundeffekte, {} für lippensynchronen gesprochenen Dialog und 【】 für Untertitel. Es unterstützt Stimmen in 11 Sprachen.

Welche Auflösungen und Formate werden unterstützt?

480p und 720p, in 7 Seitenverhältnissen: 16:9, 9:16, 1:1, 4:3, 3:4, 21:9 und adaptive. Ausgabe in MP4 (universell) oder professionellem MOV mit H.264 + yuv444p + PCM für Color Grading und Compositing.

Wie funktioniert die promptbasierte Videobearbeitung?

Du lädst ein Video hoch und schreibst die Änderung: „entferne alle Personen außer dem Protagonisten“, „ersetze die Figur in @Video1 durch die in @Image1“, „entferne die Hintergrundmusik“. Die Engine behält automatisch Seitenverhältnis und Dauer des Originalvideos bei.

Wie viel kostet ein Seedance-2.5-Video auf DXBuilder?

Die Abrechnung erfolgt pro Sekunde: 45 Credits/s bei 720p und 21 Credits/s bei 480p. Wenn du ein Referenzvideo hochlädst, wird dessen Dauer zur abgerechneten Zeit addiert, aber der Sekundentarif sinkt (27 Cr/s bei 720p, 13 Cr/s bei 480p). Nutze den Rechner auf dieser Seite für den genauen Betrag.

Kann ich Fotos von echten Personen verwenden?

Nur mit Genehmigung. Die Engine blockiert Gesichter nicht autorisierter realer Personen und Persönlichkeiten des öffentlichen Lebens. Verwende für menschliche Charaktere KI-generierte Bilder, generische Charaktere oder eigene lizenzierte Assets.

Wie viele Referenzen kann ich in einem Video kombinieren?

Bis zu 50: 30 Bilder (@Image1–@Image30), 10 Videos (@Video1–@Video10) und 10 Audios (@Audio1–@Audio10). Die Gesamtdauer der Referenzvideos darf 30 Sekunden nicht überschreiten, dasselbe gilt für Audios.

Was kann ich mit Seedance 2.5 erstellen?

30-Sekunden-Produktwerbung, E-Commerce-Videos, Kinotrailer und Kurzfilme, virtuelle Influencer mit konsistenten Charakteren, Multi-Szenen-Markenstorytelling, 9:16-Inhalte für TikTok/Reels/Shorts und mehrsprachige Musikvideos.

Bereit, mit Seedance 2.5 zu drehen?

Kein API-Schlüssel, keine Einrichtung — schreibe den Prompt, wähle das Format und die Engine erledigt den Rest. Wenn dir die Ideen ausgehen, erfindet die KI eine für dich.

Seedance 2.5 Studio öffnen