Doubao Seedance 系列提示词指南教程

Cosolar 2 阅读 提示词与上下文工程大模型技术

Doubao Seedance 系列提示词指南教程

[!info] 本指南基于火山方舟官方文档编写

本指南中呈现的所有视觉(图片、视频)及音频素材,均由 Seedance/Seedream 系列视觉生成模型自主生成。

1 系列概述

Doubao Seedance 系列(下文简称 Seedance)是火山方舟推出的原生音频与视频联合生成模型,拥有卓越的语义理解与全模态交互能力。该系列支持同时参考视频、图片、音频等全模态素材,能精准锁定人物样貌、动作特效、视觉风格、配音音色等特征,大幅降低提示词编写门槛。

特性维度 Seedance 2.0 Seedance 2.5
视频时长 固定档位 单段 30 秒直出
参考素材上限 较少 最多 50 个
时间戳响应 仅响应镜头序号 响应整数秒时间戳
多视图主体参考 不建议 支持
输出宽高比 固定 6 档 [0.4, 2.5] 任意宽高比
输出格式 支持 MOV 格式
V2V 画质 更好的颜色/亮度/声画一致性
多语言生成 原生支持 10 余种语言

[!tip] 核心定位差异
Seedance 2.0 完成了核心生成能力的突破;Seedance 2.5 在此基础上面向真实生产场景做系统性补强——更长视频、更多素材、更稳定编辑续写、更灵活宽高比、更可控的音画衔接。它让模型从「效果惊艳的创作模型」推进到更接近端到端工业化视频生产的阶段。

2 Seedance 2.5 Skill 工具

[!important] 强烈推荐
使用 Seedance 2.5 skill 对你的提示词进行调优。

安装

在本地项目中通过 NPX 安装:

npx --yes skills@latest add \
  "https://arkdocs.tos-cn-beijing.volces.com/skills/" \
  --skill sd25-pe \
  --yes

使用方式

在 AI 对话框输入 /sd25-pe + 你的提示词内容,即可开始调试提示词。

3 基础公式(Seedance 2.0)

Seedance 的提示词不是单纯的「文案型形容」,而是「工程型指令」:、在什么场景、做什么动作镜头如何运动、按怎样的时间顺序发生。

3.1 三类任务基础公式

参考生视频可细分为三类任务:全模态参考、编辑视频和延长视频。你可以根据任务类型选择提示词基础公式。

全模态参考

从素材中提取部分元素(如主体、风格、场景、音效),生成一个全新视频。

  • 适用场景:动作迁移、主体复用、氛围借鉴等
  • 推荐句式
    • 图片参考:参考 <图片N> 中的 <主体N>,生成…
    • 视频参考:参考 <视频N> 中的 <动作/运镜/风格/音效>,生成…
    • 音频参考:参考 <音频N> 中的音色,生成…

编辑视频

在原视频基础上进行局部或全局修改。未提及的部分,默认保持不变。

  • 适用场景:局部替换、主体抹除、属性修改等
  • 推荐句式
    • 增加元素:清晰描述 <元素特征> + <出现时机> + <出现位置>
    • 修改元素:严格编辑 <视频N>,将其中的 <原特征> 修改为 <新特征>
    • 删除元素:点明需要删除的元素,对于保持不变的元素,在提示词中加以强调,表现更佳

延长视频

在时间维度上延续原视频,要求音视频风格、主体与叙事保持一致。

  • 适用场景:续写剧情、延展动作、补全片段等
  • 推荐句式
    • 延长视频:向前/向后延长 <视频N>,生成…
    • 轨道补全<视频1> + <过渡画面描述> + 接 <视频2> + <过渡画面描述> + 接 <视频3>

[!warning] 注意
编辑 / 延长视频任务,直接使用「<视频N>」指代视频,请勿使用「参考 <视频N>」,以免被误判为参考任务。

组合任务

上述 3 种任务也支持组合使用。

  • 适用场景:参考某个素材,编辑另一个素材。
  • 推荐句式
    • 参考 <图片/视频N>[参考维度],严格编辑 <视频X>[具体编辑内容]

4 进阶公式

4.1 总公式

精准主体 + 动作细节 + 场景环境 + 光影色调 + 镜头运镜 + 视觉风格 + 画质 + 约束条件

简单说就是:先锁定「谁」在「干什么」,再交代「在哪」「什么氛围」,然后告诉模型「怎么拍」,最后用风格、画质和约束条件把结果收紧。

Seedance 本质上是一个全模态 AI 导演:同时读取文字提示词、图片、视频、音频,并在内部拆成「空间层」(画面里有什么)和「时间层」(事情如何随时间变化)两个维度来理解和生成画面。

4.2 六大要素详解

要素 1:定义主体

实际参考的素材中一张图片往往存在多个主体,为了精准引用素材中的特定对象,必须进行明确的主体定义。主体可以是人物、道具、场景等。

推荐句式

将 <图片/视频N> 中的 [主体核心特征] 定义为 <主体N>

核心特征要求:使用 2-3 个清晰、稳定的静态特征(如服饰、发型、外观、类别)进行描述,确保唯一可识别性。

示例

  • 图片1 中穿红色连衣裙、戴草帽的女人定义为 张红
  • 视频1 中穿红色连衣裙、戴草帽的女人定义为 主体1

多主体定义句式

将 <图片/视频N> 中的 [主体1核心特征] 定义为 <主体1>,
将 <图片/视频N> 中的 [主体2核心特征] 定义为 <主体2>...

[!warning] 注意事项

  • 每次涉及主体时需明确指代,避免省略。支持以下两种用法:
    • 未定义主体的简单场景:每次提到主体时使用 <主体N>@<图片N>,强调主体和素材的绑定关系。例如:张三@图片1
    • 已提前定义主体的场景:每次提到主体都使用同一标签。例如:将视频1中的高个子男人定义为警察,矮个子男人定义为小偷,后续描述持续使用对应标签
  • 使用素材库(Asset ID)时,仍需使用 <图片/视频N> 指代主体,不得直接以 Asset ID 替代
  • 描述尽量简洁,避免冗余和语义冲突
  • 空间关系建议优先通过参考图表达,减少复杂文字描述

要素 2:使用分镜时序

模型的内部建模是空间和时间解耦的。因此,一个复杂视频的提示词,最理想的形态是时间轴化分镜:把视频拆成几个分镜,按事件发生顺序动态描述每个分镜。

实操建议

使用镜头顺序,对每一段视频都写一个简单的「镜头 1 / 镜头 2 / 镜头 3」分镜,再合并成完整的提示词。

[!example] 正反案例对比
反面案例:「男人在街头紧张地奔跑,画面很有电影感。」

正面案例

  • 镜头 1:街巷侧拍,男人缓慢起跑,带有急促的呼吸感。
  • 镜头 2:男人撞翻水果摊,镜头快速摇动并给到男人惊恐的特写。
  • 镜头 3:男人翻过矮墙消失,镜头缓慢拉远定格在空荡的街道。

具体规则

  • 使用 镜头1镜头2镜头3 等标识,按事件发生顺序(先主后次)组织内容
  • 不强制限制每段时长,优先让模型根据剧情自然生成节奏
  • [!warning] 重要
    模型对精确时间(如 0-3 秒)的支持不稳定,强行限制时长可能导致生成结果异常。(注:此限制在 Seedance 2.5 中已改善,2.5 可响应整数秒时间戳。)

每个镜头推荐按以下逻辑组织

  1. 运镜或镜头切换方式:如「全景缓慢推近」「固定机位」「镜头切至…」等
  2. 主体动作与表情:描述核心角色 / 物体的关键动作、神态变化
  3. 位置或空间变化:说明主体所处的场景、位置或空间关系
  4. 音频信息:描述对应镜头的音效、人声或背景音乐等

要素 3:动作描述要求

原则 要点 示例
肢体细化 + 程度量化 动作需具体到手、腿、头部、肩背等肢体部位,补充幅度、速度、力度描述 缓慢抬手、快速转头、用力蹬地、微微低头
优先低缓连续小动作 优先选用缓慢、轻柔、连贯的细微动作,规避狂奔、大跳、剧烈翻滚等高爆发动作 缓慢行走、轻轻抬手、微微低头、顺势坐下
补充动作过渡衔接 写明前后动作的惯性与承接关系,保证画面连贯自然 借着转身惯性顺势抬手、从停顿状态自然过渡到举手
情绪具象外化表达 用具体的身体细节表现情绪,替代「很悲伤」「非常愤怒」等抽象词汇 见下表

情绪外化对照表

情绪 外化动作与细节
释然 长长地舒了一口气、紧绷的肩膀完全放松下来、脸上露出久违的、淡淡的微笑、抬头望向远方
喜悦 嘴角抑制不住地上扬、眉眼舒展、脚步变得轻快、下意识地哼起小曲、忍不住原地转个圈
愤怒 双拳紧握、下颌线紧绷、胸口剧烈起伏、眼神如刀般锐利、从牙缝里挤出话语
悲伤 低头、肩膀微微颤抖、眼眶泛红、手指无意识地攥紧衣角、泪水在眼眶里打转但没有落下
紧张 / 焦虑 频繁地看手表、手指不停敲击桌面、呼吸急促、眼神闪躲、无意识地啃咬指甲

要素 4:运镜写法

模型对运镜词理解力很强,直接使用标准运镜术语即可。

常用术语

  • 景别:大全景、全景、中景、近景、特写
  • 运镜:推、拉、摇、移、跟、环绕、俯冲、后拉、上摇、手持晃动
  • 机位:低角度、俯视、第一人称
  • 热门运镜:一镜到底、希区柯克变焦、航拍视角、FPV、子弹时间、手持镜头、回弹变速

[!warning] 注意
一个镜头里尽量只指定 1 种运镜方式,不要同时要求推拉摇移,会增加画面的不稳定性。

小众专业名词需转换为「名词 + 描述性解释」:

示例:「移焦,画面焦点发生平滑转变,原本在前景清晰的树木变模糊,背景中的人物由模糊逐渐变得清晰。」

转场镜头需写清触发点与方式:

示例:「第 5s 快速向左横移转场(向左擦除+自然叠化)」

要素 5:画质、风格与约束词

类别 作用 示例
画质 定义画面清晰度、细节纹理与光影质感 高清,细节丰富,电影质感,色彩自然,光影柔和
风格 设定整体美术画风与视觉调性 赛博朋克冷蓝紫色调、复古胶片、日系清新
约束词 规避画面瑕疵、畸形崩坏及不合理元素 见下方模板

常用约束词模板

  • 避免生成字幕:「保持无字幕」「避免生成任何文字或字幕」
  • 避免生成 Logo:「不要生成Logo」
  • 避免生成水印:「不要生成水印」

要素 6:音画控制符号

Seedance 支持在提示词中使用特殊符号控制音频和文字生成:

符号 信息类型 示例
{} 台词 {你好,世界}。如果台词为小语种(非中英文),需标注语种,如:用日语说道 {こんにちは}
<> 音效 <远处传来狗叫声>
() 音乐 (背景中播放着快节奏的摇滚乐)
【】 字幕 【第一章:启程】

文字生成模板

「文字内容」+「出现时机」+「出现位置」+「出现方式」,「文字特征(颜色、风格)」

[!tip] 说明
Seedance 2.0 能根据情境自动匹配合适的文字风格。如果对文字表现效果要求严格,可参考 Logo 参考用法。

气泡台词写法

「角色」说:"......",角色说话时周围出现气泡,气泡里写着台词。

5 Seedance 2.5 任务体系

5.1 任务分类总览

Seedance 2.5 从传入素材最终是否会锁定输出视频的属性,把任务区分为两类(Seedance 2.0 没有这个区分):

有锁定:编辑/首尾帧/延长

素材会严格成为输出视频时间轴上的一段,是模型输出去适应传入的素材,因此会锁定输出视频的宽高比、甚至时长。

任务类型 任务详细定义 对输出视频锁定的说明
视频编辑 对原视频的画面或音频进行编辑操作 锁定宽高比ratio 必须为 adaptive);锁定时长duration 必须为 -1)。建议 output_format 使用 mov 格式
首帧/首尾帧生视频 输入 1 张图作为首帧生成视频,或输入 2 张图分别作为首帧和尾帧 锁定宽高比ratio 必须为 adaptive);时长可自定义
视频延长 对原视频进行向前/向后延长 锁定宽高比ratio 必须为 adaptive);时长可自定义;建议 output_format 使用 mov 格式

视频编辑触发关键词:编辑视频、增加/加上、删除/去掉、修改/替换/改成

视频延长触发关键词:向前/向后延长、延续、续写

[!note] 编辑任务时长说明
受模型输入帧处理机制影响,输出视频时长可能与输入存在轻微差异(最大约 0.3 秒),但只是部分过渡帧被压缩,输出视频内容基本对齐输入、保持完整/不变。如果使用 Seedance 2.5 生成的视频作为编辑输入,输出时长不会有差距。

无锁定:参考任务/多宫格分镜/关键帧

仅对素材进行语义上的参考,用户可以指定输出视频的宽高/时长属性

任务类型 任务详细定义
主体参考 参考人/物/场景/虚拟角色等主体的外观 ID/声音
运动参考 参考图/视频的运动/动态信息
风格参考 参考图/视频的风格
音频参考 参考音频的音乐/旋律/台词/音色等声音信息
白模参考/渲染 输入粗粒度或细粒度白模视频参考其动态信息、进行渲染
多宫格分镜/故事板参考 参考分镜图的主体/构图/动作/剧情等信息
关键帧参考 输入单/多个图作为关键帧生成视频
视频无缝转场 输入两段视频,模型生成补全间隙实现无缝转场
一键成片 输入多个图/视频生成短片,可添加文字/贴纸/转场等
组合能力 上述提及能力的自由组合应用

5.2 R2V 能力清单

[!info] R2V 能力总览
下表展示 Seedance 2.5 参考生视频的主要能力分类及其子能力。

大类 子能力
参考生视频 主体图参考、主体音视频参考、主体图+主体音色音频参考
运动参考、运动+主体参考
风格图/视频参考、风格图/视频参考+主体参考
音频(音乐/旋律/台词/音色)参考、音频+主体参考
白模参考、白模参考+主体参考、白模参考+主体参考+场景参考
多宫格分镜参考、分镜+主体参考
关键帧分镜参考生视频、首帧/首尾帧参考生视频
编辑视频 视频指令编辑(增加/修改/删除)
视频参考图编辑
视频音频编辑(增加/修改/删除)
延长视频 向前延长/向后延长、向前/向后延长+主体参考
其他 视频无缝转场、素材一键成片、素材+参考视频一键成片

5.3 素材输入建议

维度 建议
输入素材总上限 图片:最多 30 张 4K 分辨率以内;视频:最多 10 段,总时长不超过 30s;音频:最多 10 段,总时长不超过 30s
主体图数量 1-8 主体效果较好;更多可尝试 9-12 主体,但稳定性下降、可能需要抽卡
主体音视频时长 5-10s 效果较好;更长时长稳定性下降、可能需要抽卡
主体音视频数量 1-5 主体效果较好;更多可尝试 6-10 主体,但稳定性下降
不同视角主体图 1-5 主体单视图/多视图均可;超过 5 主体建议「单视图」或拆分为多张不同视图输入
视频编辑时长 20s 以内效果较好;更长时长稳定性下降
视频延长格式 输入视频、输出视频均采用 MOV 格式,以获得最佳声画衔接效果
白模参考 简单建模(粗粒度)参考效果较好,建议仅用简单几何体拼接表示人物/物体/动物等
宫格图参考 目前更适用于 15 个以下分镜;推荐火柴人/线稿分镜,不推荐在分镜图上写过多文字
视频参考图编辑 1-5 张参考图效果较好;更多可尝试 6-8 张

6 Seedance 2.5 提示词写作指南

6.1 写作总原则

把 Seedance 2.5 当作一个视觉内容生产者,用导演的思维书写结构化 Prompt。

6.2 基础写作结构

第一步:素材指代(R2V)

明确每个图/视频/音频的编号(按照上传顺序)与用途(谁是形象、谁是音色、谁是动作、谁是场景…)。

第二步:一句话概述

主体 + 地点 + 事件 + 题材/风格 + 特殊运镜...

第三步:具体情节描述

  • 镜头顺序/时间轴(均可):用时间戳或「镜头 N」切分,逐段描述画面具体内容、运镜、动作、台词、音效等,尽量使用正向描述
  • 反向描述支持:字幕、音频控制,比如「不要字幕」「不要 bgm」

第四步:结尾

补充说明一些贯穿始终的画面细节,比如机位/运镜、环境/场景、声音、氛围等。

6.3 参考类提示词写法

参考素材变多后,素材的映射和指代关系说明非常重要。按照上传素材的顺序对应编号(图 1 / 视频 1 / 音频 1),每个素材进行文本绑定。

[!warning] 重要
不建议只在图片里呈现映射信息,比如主角图片上写「张三」,然后 Prompt 中直接写「张三在学校里 xxxx」,容易导致多人混淆或重复角色。

核心要点

  1. 多主体逐一列清映射关系,人数多时用清单罗列

    • 示例 1:「图 1 的侠客」
    • 示例 2:「img1-2 是人物 1,对应音频 1;img3-4 是人物 2,对应音频 2」
    • 示例 3:「图片 1 是主角张三,图片 1 使用音频 1 音色」
  2. 分工要具体到「参考什么」,部分参考要写明「参考哪一部分」

    • 示例 1:「参考视频 1 中施法的动作,视频 2 的环绕式运镜」
    • 示例 2:「参考图片 1 的光影和滤镜」
  3. 素材足够精准时只做「指代」,减少画面复述

    • 示例:「严格参考视频 1 的动作与运镜,顺序与视频保持一致」(不必额外描述具体细节)

6.4 编辑类提示词写法

明确需要修改的范围和内容,可以配合时间戳进行部分编辑,尽可能说明修改内容从 A 到 B 的过程。

  • 示例 1:「仅编辑视频 1 中男人的台词,修改为「你不要过来啊」,口音调整为东北口音…」
  • 示例 2:「把视频 1 中 4-6 秒男人喝咖啡的动作改变为拖地,其余内容不要变化」
  • 示例 3:「编辑任务:把视频 1 中右侧的亚洲女生改为图片 1 中的黑人女生」

6.5 首尾帧提示词写法

  • 优先使用参数设置图片的 role 为 first_frame/last_frame;此方式会锁定输出视频的宽高比,严格对齐用户输入视频的首帧图
  • 也支持设置 role 为 reference_image,在 prompt 中指定具体图片为首帧和尾帧;此方式不会锁定宽高比,视频效果与首帧和尾帧参考图相近,但不完全匹配
    • 示例 1:「图片 1 为首帧」
    • 示例 2:「图片 3 为首帧,图片 5 为尾帧」

6.6 时间戳用法(Seedance 2.5 新增)

[!important] 2.5 新特性
Seedance 2.0 不响应时间戳只响应镜头序号,而 Seedance 2.5 响应整数秒的时间戳。

时间戳可以更好地理清故事剧情发展,以「1 秒」为单位:

  • 指定时间段内剧情较少:模型会进行一定自由发挥
  • 指定时间段内容过多:会导致过度剪切或剧情遗漏,请注意时长安排的合理性
  • 不建议用时间戳控制频率/频次:比如「一秒摇头 3 次」

支持的时间控制方式

方式 格式 示例
明确的时间区间 注意时间轴连续性,避免「0-3 秒…5-6 秒…」 「0-3 秒…3-7 秒…7-15 秒」或「[1s-4s]…[4s-8s]…[8s-12s]」
时间点控制 指定某时刻发生事件 「第 5s 快速向左横移转场」或「第 2 秒一道金雷能量自画面顶部破空直落…」
相对时间控制 从某个事件发生后计时 「张三呆滞的站在原地,3 秒后周围的人纷纷摇头」或「…主角按下快门后画面定格 1 秒」

6.7 负向控制

控制类型 示例
负向控制字幕 「不额外加入对白字幕」「不要字幕」
负向控制音频-整体 「不要任何声音」
负向控制音频-细分 支持单独控制:音效、背景音乐(bgm)、对白
负向控制 BGM 「无 bgm,只生成环境音和动作音」

6.8 进阶写作

镜头语言

  • 基础通识性内容可直接写:景别(大全景/全景/中景/近景/特写)、运镜(推/拉/摇/移/跟/环绕/俯冲/后拉/上摇/手持晃动)、机位(低角度/俯视/第一人称)
  • 热门运镜可直接写:一镜到底、希区柯克变焦、航拍视角、FPV、子弹时间、手持镜头、回弹变速
  • 过于小众专业的名词需转换为「名词 + 描述性解释」
  • 转场镜头写清触发点与方式,尽可能把转场时间、方式都写明

动作/表情描述

  • 动作:优先用概括性描述(如「连续做了几组高抬腿和空翻」「双方展开近身搏斗」),只在少数有记忆点的动作上写出具体细节,不建议重复写相同的动作
  • 表情:建议写描述性语句,减少成语使用,比如「津津有味地吃饭」写为「脸上带着满足的笑容,大口地吃饭」

白模参考/渲染

  • 文本中写明希望参考白模视频中的什么元素
    • 示例 1(白模无光影变化):「参考 [视频 1] 的运镜、动作…」
    • 示例 2(白模有光影变化):「参考 [视频 1] 的光影变化和…」
  • 叠加输入了参考图时,需写明参考图和白模的对应关系
  • 建议在 Prompt 中详细描述希望生成的视频内容,注意文本描述需要和白模内容相吻合
  • 没有叠加参考图/视频的白模主体,详细描述主体外表/特征效果更佳

[!warning] 白模注意事项
白模视频主体建议仅保留躯体,避免包含【四肢/翅膀】等涉及精细运动的元素;如已包含,需补全其动作序列,以防止渲染结果出现四肢僵化。

细粒度白模视频应不含【轨迹线】【坐标线】【相机 cone】等干扰信息,否则容易泄露到生成后的视频中。

多宫格分镜/故事板

[!important] 关键要点
输入多宫格分镜图(即多个分镜合并在一张图),生成视频画面不会严格对齐分镜图。分镜图主要提供大致的剧情参考。如需严格按分镜图生成,推荐使用多关键帧参考方式。

  • 减少超多分镜输入:目前更适用于 15 个以下分镜,单次输入过多(比如 18 宫格)容易出现静止、顺序错乱
  • 避免脏/锐化的分镜图:不推荐过度锐化、杂乱的 AI 直出分镜图;不推荐在分镜图上写过多文字
  • prompt 避免前后矛盾:注意避免运镜、运动设计不合理等问题

推荐使用火柴人/线稿分镜,并通过 prompt 进行指令控制:

  1. Step 1:写明参考素材的指代关系
  2. Step 2:写整体故事梗概
  3. Step 3:按照分镜完整描述情节内容,至少补齐分镜图中没有的信息,可组合时间戳明确剧情逻辑

概念分镜可直接简写 prompt:

示例:「按照分镜图的顺序,构建一个完整的故事剧情,运镜合理连贯」

关键帧参考

将分镜按照独立参考输入,并按照顺序传入,prompt 需要在第一句写明:

示例:「以图片 1 至图片 7 的顺序作为关键帧,在云海群山间,蓝粉长尾灵鱼凌空遨游,镜头缓缓推向依山而建的古镇,聚焦山顶古塔;画面一转进入雅致中式厅堂,灵鱼穿窗飞入,落入厅堂中央圆池悠然游动;最终视角切至幽暗古寺,白须老僧背对而立,静静凝望巨幅画框,画内正是厅堂与池中灵鱼,新国风浮世绘插画风格」

7 Seedance 2.5 与 2.0 的关键差异

差异点 Seedance 2.0 Seedance 2.5
响应时间戳 不响应时间戳,只响应镜头序号 响应整数秒的时间戳
支持多视图 不建议使用多视图作为主体参考 可以支持
自由宽高比 输出宽高比只有固定 6 档 可通过控制输入素材支持 [0.4, 2.5] 之间任意宽高比
V2V 画质 输出支持 MOV 格式,延长/编辑任务中更好地保持颜色与亮度一致性、声画一致性

8 实战案例

8.1 全模态参考 - 多素材叙事

素材准备

  • @图片1:女主半身照
  • @图片2:宿舍场景参考图
  • @视频1:室内对话运镜参考(中景推拉或轻微摇移)
  • @音频1:室内环境声或轻音乐

提示词

@图片1 中的女孩作为主角,@图片2 作为宿舍场景风格参考,参考 @视频1 的运镜方式。

镜头1:傍晚时分,女孩@图片1 脚步轻快地走到宿舍门口@图片2,镜头中景平稳跟拍,暖黄色日光从窗外洒进走廊,她在门口停顿一下,深呼吸,表情略带紧张。

镜头2:女孩@图片1 推开门走进宿舍,镜头切到室内中景,舍友们一边整理书本一边抬头看向她,其中一人笑着问 {考得怎么样呀,过了吗},镜头在几人之间缓慢切换半身特写。

镜头3:女孩@图片1 先低头露出落寞表情,镜头给到她的近景,随后她抬头憋不住笑意,哈哈大笑说 {骗你们的},舍友们追着打闹起来,镜头缓慢拉远,定格在宿舍内一片欢声笑语的全景画面。

全程画面高清电影纪实风,色调温暖,光影柔和;人物面部稳定不变形,动作自然流畅,无卡顿无闪烁;环境音效与 @音频1 自然融合。

8.2 多主体参考 - 追逐场景

提示词

将视频1中的高个子男人定义为警察,将另一个矮个子男人定义为小偷。场景设定为拥挤的白天集市,阳光明媚,周围有许多水果摊位和密集的行人,充满市井生活气息。

小偷在拥挤的集市人群中惊慌失措地向前狂奔,警察在后方紧随其后全速追赶,两人快速穿梭在各个摊位之间。

手持镜头向前快速跟拍,画面带有轻微真实的晃动感,营造追逐的紧张氛围。

8.3 动作/运镜参考 - 武打场面

提示词

参考视频1的人物动作和镜头语言,生成图片2和图片1的打斗场面,图片2是左边人物,图片1是右边人物。有激烈的背景音乐。

8.4 特效参考 - 粒子效果

提示词

参考视频1的金色粒子特效,让图片2中的人物吹笛子的同时,身边环绕一样的粒子特效。

8.5 视频编辑 - 元素替换

提示词

将视频1中的香水替换成图片1中的面霜,动作和运镜不变。

8.6 视频编辑 - 元素删除

提示词

清除视频1桌面上的其他零件和工具,保持桌面整洁干净,桌面上只有他俩手里的。

8.7 视频编辑 - 元素增加

提示词

在视频1的台面上添加炸鸡、披萨等小吃。

8.8 视频延长 - 向前延长

提示词

向前延长视频1,给白衣男子过肩镜头,白衣男子说英文台词鼓励对方不要放弃。

8.9 视频延长 - 向后延长

提示词

生成视频1之后的内容,迟到的两个男士跑向他们,五个人终于见面,友好聊天。

8.10 轨道补齐 - 转场特效

提示词

视频1,树叶落地的瞬间,激起金色粒子特效,一阵风吹过,接视频2。

8.11 多元素参考 - 场景叙事

提示词

场景设定在图片4中的餐厅内,店内人来人往。图片1里的女孩身着图片2中的服装,正在整理柜台上的物品。图片3中的男孩是一位顾客,他走上前,想要向女孩索要联系方式。图片5中的标识始终显示在画面的右下角。

8.12 商品展示 - 3C 数码

提示词

提取图片1、图片2、图片3的相机,把背景换成白色,相机在一个白色桌子上,镜头以特写的形式聚焦相机,然后以相机为主体缓慢旋转,清晰展示相机的正面侧面以及背面。

8.13 营销创意 - 概念视频

提示词

参考视频1中马的奔跑形态,生成一匹金色的骏马在草原上奔跑,随即定格其奔跑的华丽姿态,变成一个马形的金吊坠。

8.14 气泡台词

提示词

图片1中的两人穿着运动服在学校的操场跑步,女孩看向男孩,自信地笑着说:"We can definitely do it! "镜头切到男孩的近景,他犹豫地回答:"Are you sure? "镜头切回女孩的中近景,她语气轻快地说:"Yes! "情绪明亮而坚定。说话的角色周边出现气泡,气泡里是对应台词。

8.15 画外音视频

提示词

生成带有画外音的视频。一个深沉、平静的男声说:"在宏大的宇宙中,我们的世界不过是一个短暂的瞬间。然而,在其中,生命不顾一切地繁荣。"场景应从夜晚缓慢过渡到黎明,星星逐渐消失,太阳从山后升起。画面底部按照台词出现字幕。

8.16 Seedance 2.5 - 白模渲染

提示词

将视频1进行白模渲染,无 bgm,只生成环境音和动作音。

渲染要求:背景为深蓝与紫色色调的夜晚赛博朋克都市,密集的摩天大楼,楼宇间是巨大的全息广告牌与霓虹灯光,数个飞行器在空中穿梭,闪着微弱的灯光,发出微弱的机械声响;人物为一个身着黑色夜行衣的小浣熊,身影为一道剪影,脚步小心翼翼;人物移动的地点是摩天大楼中的一栋楼的屋顶。

8.17 Seedance 2.5 - 视频指令编辑(老化效果)

提示词

保留 @视频1 的构图、机位、光线与表演节奏,只改写画面里女主的样貌与神情:让她从二十多岁自然地老去到六十岁,眼神里的隐忍慢慢化开,泪光滑过眼角,嘴角一点点扬起,最后破涕为笑。全程一镜到底,不跳切、不闪烁,五官随年龄渐变而不漂移。

8.18 Seedance 2.5 - 视频延长(自然纪录片风格)

提示词

写实自然纪录片风格,电影级真实光影,温暖的午后,在森林草坡上,一只圆滚滚的熊猫幼崽从坡上滚下来。

熊猫黑白毛发蓬松真实,体型小而胖,动作笨拙可爱。场景为绿色森林斜坡,地面覆盖青草、苔藓、三叶草、泥土、小石块、枯枝和少量小黄花,虚化背景中有高大树干与树林。镜头为低机位中远景,轻微手持感,整体基本固定,始终保持熊猫在画面中。

0s-3s:一只熊猫幼崽趴在绿色草坡上,身体圆滚滚,它刚开始顺着斜坡慢慢侧滚,动作笨拙,草叶被身体轻轻压弯。微风拂过,阳光从左上方穿过树林,形成斑驳光影。
3s-8s:熊猫滚到画面右下方,动作逐渐停止,从侧躺变成趴卧。它的圆脸朝向镜头,前爪压在草地上,熊猫趴在前景草丛中,身体调整到舒服的姿势,头部小幅抬起又放低,发出轻微哼唧声。

低机位,轻微手持感,轻微跟随熊猫向右下方移动。景深自然,前景草叶轻微虚化,熊猫主体清晰,背景树林柔和虚化。自然环境音,风声、熊猫滚动时轻微柔软的扑通声,整体温暖、真实、自然。

8.19 Seedance 2.5 - 视频无缝转场

提示词

将【视频 1】和【视频 2】衔接起来,【视频 1】的视角急需飞行至顶端快速折返,视角垂直向下俯冲,然后无缝自然地衔接转场到【视频 2】,在镜头切换的过程中麻将牌慢慢变成高楼。整个场景也对应变化,同时不要改变上传的两个视频。

8.20 Seedance 2.5 - 一键成片

提示词

将所有图片进行一键成片,图片顺序自由安排,生成一个手绘动态涂鸦抠像风格的咖啡店 vlog,记录一只小狗穿着不同可爱服装在咖啡店打卡拍照的趣味日常。生成具有网感的趣味音频或者 bgm。

图片可以微微动起来,live 图的效果,但不要改变原图,保持和原图的高度一致。

8.21 Seedance 2.5 - 视频音频编辑

提示词

将视频中的人声台词,翻译成中文,无字幕,口型做出对应的精准改变,其余均保持不变。

8.22 Seedance 2.5 - 故事板分镜(线稿分镜)

提示词

素材绑定:故事板分镜@图片1,卧室@图片2,李天@图片3,李倩@图片4,《快快乐乐》书籍@图片5。

镜头一:
【全景固定镜头,平视三分构图】冬夜落雪房间,落地窗前,男子双手插裤兜侧立望向窗外飞雪,少女站在身侧静静看向男子,氛围安静克制,雪花持续落在玻璃窗。

镜头二:
【中景过肩镜头】少女后背作为前景,男子转头温和看向少女,少女微微低头沉默,窗外落雪持续。

镜头三:
【中近景,对角线构图】男子捧着书籍《快快乐乐》缓缓递出,少女抬手接过书本。

镜头四:
【少女面部近景,中心构图】少女把书本抱紧在胸口,眼眶泛红,泪珠缓缓滑落,神色感伤。

镜头五:
【男子面部近景,斜向构图】男子温柔浅笑,静静注视落泪少女,眼底带着怅然。

镜头六:
【全景固定镜头】少女转身缓步走出画面,窗前只剩男子独自伫立,双手插兜望向漫天风雪,房间空旷寂静。

8.23 Seedance 2.5 - 参考图+白模替换

提示词

将两人武打素版视频 @视频1 替换为冷兵器对决前的空手试探风。

场景替换为中世纪石堡平台、古老庭院平地、山间堡垒外平台或简洁石砖决斗场,背景为古堡墙体、风、雾、远处山线,地面平整石质 @图片1。

视频中深色衣服的男子的服饰替换为 @图片2,视频中浅色衣服的男子替换为 @图片3。动作仍然保持不变,不改变原始节奏。

AI 特效仅做环境和质感强化:风吹衣摆、轻雾、接触点少量尘土、金属冷色反光质感、轻微颗粒和史诗感调色。整体风格为克制、真实、古典硬派决斗氛围。背景音乐卡点。

8.24 Seedance 2.5 - 多图一键成片(像素风格)

提示词

根据 @图片1 - @图片6 制作一镜到底的像素武侠主题竖版视频,背景音乐使用国风 8bit 武侠风格音乐。全片统一浅蓝底色,像素风格统一,画面干净通透。

镜头1:静止展示 @图片1 的「江湖风云」水墨风格 logo,背景为统一浅蓝底色,画面保持约 1 秒静止。

镜头2:@图片1 中的文字区域消失后,@图片2 的武侠男性角色像素脸部特写从画面底部滑入;角色眨眨眼看向镜头,随后快速向下位移离场;角色离场后,原本 logo 处变为 @图片3 的蓝色「武功秘籍」像素书。

镜头3:紧接 @图片4,像素武侠小人角色从画面下方用力向上跃出,顶起上方的蓝色菱形问号标,问号标上方弹出深蓝色粗体字「今日闯江湖!」;角色落地后摆出 @图片4 的站姿 pose,随后抬手打招呼,接着做出预备跑动作,转身向画面右侧奔跑(奔跑姿态参考 @图片5),镜头跟随角色向右移动,角色从画面右侧跳出画面。

镜头4:@图片6 的 UI 界面从画面右侧位移入画,像素武侠角色从画面右上角跳入,落在「三月廿七日」大字的右下方,张开双臂摆出热情展示的定格姿势,最终定格在该画面。

9 常见问题与优化方案

9.1 风格漂移

典型现象:生成的视频风格与预期不符,例如希望保持 3D 国漫 CG 仙侠风格,但结果漂移成真人风格。

解决方案:在提示词中明确强调风格约束,如「保持 3D 国漫 CG 仙侠风格」。

9.2 人脸一致性

典型现象:视频中人物中途「换脸」,撞脸明星,与参考图不一致。

解决方案:使用参考图进行主体绑定,确保人脸与参考图全程保持一致。

9.3 特效异常

典型现象:数字滚动特效出现明显的无序跳变感。

解决方案:增加正确的数字滚动特效描述后,特效结果会符合预期。

9.4 视频拼接处跳动

典型现象:在衔接处出现画面瞬间跳动或内容回退。

解决方案:优化提示词后衔接处更加平滑。将模型产物转化为白模视频后再进行续写也可提升效果。

9.5 多人主体数量错误

典型现象:输入 8 个参考角色,输出视频有 9 人。

解决方案:将 8 个角色先生成 2 张图后,再使用图生视频。

9.6 生僻字发音错误

典型现象:提示词中生僻字、形近字容易被读错,如「螭龙山」的「螭」发音不对。

解决方案:将易读错文字替换为发音一致的常用同音字。示例:将「螭龙山」改写为「吃龙山」。

[!note] 注意
该方案仅为优化手段,无法完全规避所有发音问题。

9.7 音色参考不准

典型现象:使用参考音频指定音色时,最终生成视频的音频音色与参考音色存在明显偏差。

解决方案

  1. 在提示词中补充细致的音色特征描述,如「使用 @音频1 低厚温润带细碎颗粒感中年男声的音色说」
  2. 保持视频台词风格与参考音频的语气、表述风格相近,有助于提升音色还原度与稳定性

9.8 结尾噪音

典型现象:生成视频结尾有噪音。

解决方案:优化提示词后结尾无噪音。

10 总结

Seedance 2.0 已经完成了核心生成能力的明显突破,而 Seedance 2.5 是在此基础上面向真实生产场景做系统性补强:

  • 更长视频生成:单段 30 秒直出
  • 更多素材参考:最多 50 个参考素材
  • 更稳定的编辑/续写能力:专业级视频编辑与延长
  • 画面宽高比:[0.4, 2.5] 任意宽高比
  • 音画衔接:MOV 格式输出,更好的声画一致性
  • 可控性:时间戳、负向控制、约束词
  • 工作流适配:白模渲染、一键成片、无缝转场
  • 多语言:原生支持 10 余种语言

Seedance 2.5 的价值不只是「单条视频效果更好」,而是让模型在可复用、可交付、可规模化生产这些关键环节上更进一步。它把 Seedance 从「效果惊艳的创作模型」,继续推进到更接近端到端工业化视频生产的阶段。

附录:提示词速查卡

A1 基础公式速查

任务类型 公式
全模态参考 参考 <素材N> 中的 <参考维度>,生成…
编辑-增加 <元素特征> + <出现时机> + <出现位置>
编辑-修改 严格编辑 <视频N>,将其中的 <原特征> 修改为 <新特征>
编辑-删除 点明删除元素 + 强调保持不变的元素
延长 向前/向后延长 <视频N>,生成…
轨道补齐 <视频1> + <过渡描述> + 接 <视频2> + <过渡描述> + 接 <视频3>

A2 进阶公式速查

精准主体 + 动作细节 + 场景环境 + 光影色调 + 镜头运镜 + 视觉风格 + 画质 + 约束条件

A3 符号速查

符号 用途 示例
{} 台词 {你好,世界}
<> 音效 <远处传来狗叫声>
() 音乐 (背景中播放着快节奏的摇滚乐)
【】 字幕 【第一章:启程】

A4 约束词速查

目标 约束词
无字幕 保持无字幕 / 避免生成任何文字或字幕
无 Logo 不要生成 Logo
无水印 不要生成水印
无 BGM 无 bgm,只生成环境音和动作音
无声音 不要任何声音

A5 Seedance 2.5 参数速查

参数 说明 常用值
content.role 素材角色 first_frame / last_frame / reference_image / reference_video / reference_audio
ratio 宽高比 adaptive(跟随素材)或自定义
duration 时长 -1(跟随素材)或自定义秒数
output_format 输出格式 mov(推荐用于编辑/延长)