项目概览
Seedance 2.0 是字节跳动推出的 AI 视频生成模型,支持文字、图片、视频和音轨等多模态输入,在单次推理中生成音画同步的短视频。本条目整理了其提示词工程方法,核心是将“感受描述”翻译为“执行序列”,通过五层公式(主体、动作、镜头、风格、约束)构建提示词,并利用时间编码和参考文件实现精细控制。报告指出,主体描述需具体到年龄、发型、服装等属性;动作应分解为具体执行序列;镜头每代只放一个主运动;风格优先写光线和质感;约束词用于减少抖动、变形等 AI 痕迹。此外,时间编码支持按秒调度画面,参考文件(最多 9 图、3 视频、3 音轨)可提升一致性。报告还介绍了单变量迭代优化方法,并列举了 UGC、产品广告、短片等应用场景。
解决什么问题
报告指出 AI 视频生成存在多重困境:提示词不等于画面,模型需要执行序列而非感受描述;多数用户只用文字输入,未充分利用多模态能力;修改提示词时盲目全改,难以定位问题变量;人类习惯用状态描述(如“夕阳很美”),而模型需要的是镜头语言和动作指令。Seedance 2.0 提示词工程旨在解决这些问题,通过结构化提示和参考文件释放模型能力。
工作方式
报告提出五层提示词公式:主体 → 动作 → 镜头 → 风格 → 约束。主体描述需具体(年龄、发型、服装、配饰等),动作需分解为执行序列(如“举向镜头、停顿、抹开质地”),镜头每代只放一个主运动并控制速度,风格优先写光线和质感(如“golden hour rim light”),约束词用于减少 AI 味(如 avoid jitter、avoid bent limbs)。此外,支持时间编码(如 [0-4s] 格式)按秒调度画面,以及参考文件系统(最多 9 图、3 视频、3 音轨),其中“首尾帧法”通过首帧和尾帧图片让模型自动插值中间过程。迭代优化采用单变量修改,先跑 2-3 个基线版本,再逐个调整变量。
核心能力
- 多模态输入:支持文字、图片、视频、音轨同时输入,最多 12 个参考文件。
- 音画同步生成:在单次推理中同步生成视频和双声道音频。
- 时间编码调度:可在提示中用时间戳精确导演每个阶段的画面。
- 首尾帧法:通过首帧和尾帧图片获得连贯过渡。
- 镜头语言敏感:对运镜描述理解力强,支持固定、推近、跟拍、环绕等。
- 单变量迭代:一次只改一个变量,便于定位问题。
使用前需要了解
- AI 整理 · 本地测试,未经人工复核;依据历史报告节选,不代表当前产品状态。
- 报告指出 Seedance 2.0 最长生成 15 秒视频,不适合超长叙事;复杂物理模拟(碰撞、流体)不如专业引擎;不支持精确口型同步到特定台词;单次生成需要等待,不适合实时需求。此外,主要面向中国市场,国际用户需通过即梦海外版。学习曲线较高,需要掌握五层公式、时间编码和参考系统。
