30 秒连续视频
时长是 Seedance 2.0 的两倍。一次生成完整故事,无需拼接片段,没有连贯性断裂。

Dreamina Seedance 2.5 在火山引擎 FORCE 2026 大会上发布,可生成长达 30 秒的连续电影级视频,接受多达 50 个多模态参考,并仅凭文字即可编辑或延长现有视频。本指南浓缩了官方文档——创作模式、提示词语法、技术限制以及 DXBuilder 价格。
Seedance 2.5 是一款专注于长篇叙事、多模态参考和精准编辑的 AI 视频生成模型。一次调用即可生成物理效果逼真、具有电影质感且声画同步的完整 30 秒故事——也可以对你的视频进行变换、延长或修复。它是 DXBuilder Seedance 2.5 工作室的旗舰引擎。 → Studio
时长是 Seedance 2.0 的两倍。一次生成完整故事,无需拼接片段,没有连贯性断裂。
单次请求最多 30 张图片 + 10 个视频 + 10 个音频。让角色、产品、标志和风格在各场景间保持一致。
替换主角、添加或删除物体、修复画面区域或更换配乐——仅凭文字即可。
向前或向后延续任何视频,过渡自然,光线与运动保持连贯。
口型精准同步的语音、音效和音乐与画面并行生成——无需后期制作。
支持中文、英语、葡萄牙语、西班牙语、日语、韩语、阿拉伯语、泰语等的提示词与口播对白——带口型同步。
| 能力 | Seedance 2.5 | Seedance 2.0 |
|---|---|---|
| 单次生成最大时长 | 30 秒 | 15 秒 |
| 多模态参考 | 50 个(30 图 + 10 视频 + 10 音频) | 15 个(9 图 + 3 视频 + 3 音频) |
| 纯音频参考(无图片) | ✓ 支持 | ✗ 需要图片/视频 |
| 输出格式 | MP4 和 MOV(4:4:4 色度) | 仅 MP4 |
| 视频/音频参考总时长 | 30 秒 | 15 秒 |
| 生成前规划(3D 白模) | ✓ | ✗ |
| 电影意图理解 | 远超前代(构图、镜头语言) | 基础 |
引擎会根据上传的参考素材和提示词中的用词,将每个请求归类为六种任务类型之一。编辑、延长和首尾帧模式对画幅和时长有强制约束——遵守它们可以避免生成错误。
触发方式: 只需一个提示词——无需任何文件。
规则: 无限制:自由选择画幅(16:9 … 9:16)和时长(4–30 秒)。
"FPV 无人机在雨中俯冲穿越摩天大楼,霓虹灯倒映在沥青路面上。<雨声和引擎声>(合成波音乐)"
触发方式: 1 张图片作为起始帧 + 描述运动的提示词。
规则: 画幅自动与图片一致(adaptive)。时长自由 4–30 秒。
"图中的人物活了过来:微笑,头发随微风飘动,镜头 360° 环绕。"
触发方式: 2 张图片:视频的第一帧和最后一帧。引擎自动插值过渡。
规则: 画幅继承自首帧(adaptive)。时长自由 4–30 秒。
"从首帧到尾帧的电影级过渡,伴随光粒子和逼真的物理效果。"
触发方式: 组合最多 30 张图片(@Image1…)、10 个视频(@Video1…)和 10 个音频(@Audio1…)。
规则: 画幅和时长自由。⚠ 提示词中避免"编辑"或"继续"等词——引擎可能重新分类任务并返回错误。
"Reference @Image1 for the character. 角色走过夜市,镜头运动参考 @Video1。"
触发方式: 上传视频并使用触发词:编辑、添加、删除、替换、修改。
规则: 画幅:仅 adaptive(保持视频原画幅)。时长:自动(≈ 与原片相同,容差 0.4 秒)。输入视频须为 4–30 秒。上传视频的时长计入计费。
"Video edit: remove everyone in @Video1 except the protagonist."
触发方式: 上传视频并使用触发词:继续、向前/向后延长、continue the story。
规则: 画幅:仅 adaptive(保持视频原画幅)。时长可配置 4–30 秒或自动。上传视频的时长计入计费。
"Extend @Video1. After the window opens, move into the art gallery shown in @Video2."
首帧(1:1)
尾帧使用的提示词:"画面中的女孩对着镜头说'cheese',镜头 360 度环绕拍摄"。输出视频自动继承首帧的 1:1 画幅。
主体 + 动作/事件 + 场景与环境 + 视觉风格 + 镜头运动 / 剪辑 + 声音
可以省略不需要的部分,但请保持这个顺序——这是模型训练时遵循的结构。
(史诗管弦乐,逐渐增强)
<远处雷声> <海浪拍岸>
{欢迎来到未来!}——如语言不明显,请先注明语言
【现已上线】
@Image1、@Video2、@Audio1——说明每个素材提供什么(外观、动作、音色)

一次生成 30 秒的蒸汽朋克风格视频,分三个时间窗口——[0-10s] 黄铜时钟展开为齿轮,[10-20s] 飞越走马灯和铜制缆车,[20-30s] 机械帆船、巨月并回到时钟,@Image1 的标志在最后一秒出现。
"A premium, highly cinematic 30-second 3D motion-graphics sequence in a refined steampunk style... [0-10s]: A macro close-up of an antique brass clock face unfolds into interlocking gear rings... [10-20s]: The camera glides into an ornate brass zoetrope... [20-30s]: ...In the final second, a logo appears, referring to @Image1."

一支饼干广告,每个参考各司其职:@Image1 提供产品,@Video1 提供开场构图,@Video2 提供镜头运动,@Video3 提供慢动作冲击力,@Video4-6 提供编排、字体设计和品牌收尾。这就是在整支视频中保持品牌一致性的方法。
"...The strawberry flavor refers to @Image1. The opening builds visual focus on the fruit, referring to the composition of @Video1... one cookie snaps in half and enters slow motion, referring to the impact of @Video3..."

日落海滩上的电影级说唱,主唱用 8 种语言演唱"你好"——英语、中文、日语、韩语、葡萄牙语、泰语、西班牙语和阿拉伯语——口型精准同步,卡点硬切,8 个镜头逐一用时间窗口描述。展示了 Seedance 2.5 对 11 种语言的原生支持。
"...Lyrics (precise lip sync): English: 'Hello' / Portuguese: 'Olá' / Japanese: 'こんにちは'... Shot 5 [0:10-0:13] - A musician by the shore; fast lateral dolly... Lyric line 5 (Portuguese 'Olá'). Hard cut."
| 画幅 | 480p | 720p |
|---|---|---|
| 16:9 | 854 × 480 | 1280 × 720 |
| 4:3 | 752 × 560 | 1112 × 834 |
| 1:1 | 640 × 640 | 960 × 960 |
| 3:4 | 560 × 752 | 834 × 1112 |
| 9:16 | 480 × 854 | 720 × 1280 |
| 21:9 | 992 × 432 | 1470 × 630 |
4 到 30 秒,或自动——引擎为提示词选择理想时长。视频编辑时,输出时长始终 ≈ 与原视频相同(最大差异 0.4 秒)。
MP4——兼容性最强,适合发布到社交网络和网页。MOV Pro——H.264 + yuv444p 色度 + PCM 音频:色彩保真度更高,适合调色、抠像与合成。推荐在编辑/延长流程中作为输入和输出格式。
语音、音效和音乐原生生成并与画面同步,支持 11 种语言:中文、英语、葡萄牙语、西班牙语、日语、韩语、阿拉伯语、泰语、越南语、印尼语和马来语。
• 未上传视频: 生成时长 × 基础费率(720p 为 45 积分/秒 · 480p 为 21 积分/秒)
• 上传了视频(编辑/延长):(上传时长 + 生成时长)× 优惠费率(720p 为 27 积分/秒 · 480p 为 13 积分/秒)
上传视频的时长总会计入计费时间——如果只需要其中一部分,请在上传前先剪辑。
主体 + 动作/事件 + 场景与环境 + 视觉风格 + 镜头运动/剪辑 + 声音。不需要的部分可以省略——但要保持顺序。
长视频请用 [0-10s]、[10-20s]、[20-30s] 标记来组织提示词。引擎会遵守每个区块的时间安排,故事更流畅。
明确说明每个素材提供什么:"@Image1 提供角色外观;@Video1 提供镜头运动;@Audio1 提供声音音色"。
"编辑"、"删除"、"继续"和"延长"会改变任务的类型。如果只想要风格参考,请避免这些动词,否则请求可能因参数错误而失败。
如需调色、抠像或合成,请用 MOV 格式生成(4:4:4 色度 + PCM)。直接发布到社交媒体用 MP4 即可,兼容性最好。
自适应画幅 + 自动时长让引擎为内容选择理想格式。在编辑/延长/首尾帧模式中甚至是强制要求。
引擎会拒绝包含未经授权真人面孔和注册商标内容的图片。请使用通用角色或你自己已授权的素材。
它是字节跳动最新一代的 AI 视频生成模型,在火山引擎 FORCE 2026 大会上发布。可生成长达 30 秒、带原生同步音频的连续电影级视频,接受最多 50 个多模态参考(图片、视频和音频),并支持通过提示词进行视频编辑和延长。在 DXBuilder 上无需 API 密钥即可直接使用。
2.5 将最大时长翻倍(30 秒 vs 15 秒),参考数量增至三倍以上(50 vs 15),新增 4:4:4 色度的 MOV 输出,接受纯音频参考,并且对参考素材的电影语言理解更强——构图、运动和创作意图。
每次生成 4 到 30 秒。也可以让引擎自动为你的提示词选择理想时长。在延长模式下,可以多次延续现有视频来讲述更长的故事。
会——原生生成。用 () 表示音乐,<> 表示音效,{} 表示带口型同步的口播对白,【】表示字幕。支持包括中文在内的 11 种语言的语音。
480p 和 720p,7 种画幅:16:9、9:16、1:1、4:3、3:4、21:9 和 adaptive。输出为 MP4(通用)或专业 MOV(H.264 + yuv444p + PCM),适合调色与合成。
上传一个视频并写出修改内容:"删除除主角外的所有人"、"把 @Video1 中的角色替换为 @Image1 中的角色"、"去掉背景音乐"。引擎会自动保持原视频的画幅和时长。
按秒计费:720p 为 45 积分/秒,480p 为 21 积分/秒。如果上传参考视频,其时长会计入计费时间,但每秒费率会降低(720p 为 27 积分/秒,480p 为 13 积分/秒)。请使用本页的计算器获取准确金额。
仅在获得授权的情况下。引擎会拦截未经授权的真人面孔和公众人物。人物角色请使用 AI 生成的图片、通用角色或你拥有权利的素材。
最多 50 个:30 张图片(@Image1–@Image30)、10 个视频(@Video1–@Video10)和 10 个音频(@Audio1–@Audio10)。参考视频的总时长不能超过 30 秒,音频同理。
30 秒产品发布广告、电商视频、电影级预告片和短片、角色一致的虚拟网红、多场景品牌叙事、TikTok/Reels/Shorts 的 9:16 内容以及多语言音乐视频。