Seedance 2.0 怎么用(2026):官方 prompt 规范、6 个故障修法、成本
画面中途换脸、凭空冒字幕?字节官方 prompt 规范、6 个有据可查的修法、720p 每秒 $0.16、最低档 $0.04/s,一把 ofox key 三个档位全走通。
Seedance 2.0 吃文本、图片、视频、音频四种输入,吐 4 到 15 秒带同步声音的片子,按输出秒数计费,最低 $0.04/s。字节其实为它发过一份正经的提示词规范:一条公式、四个模型认得的标点符号、一份它希望你别用满的素材预算,还有一串有据可查的故障模式和修法。中文和英文的教程基本只会告诉你「写详细生动的提示词」,上面这些一个字都不提。
这篇就是那份规范,核对时间 2026-08-06,再对上真正在用这个模型的人反馈的情况,以及每种入口下一条片子到底多少钱。
| 能做什么 | 文本 / 图片 / 视频 / 音频转视频,4 到 15 秒,最高 4K,默认带同步音频 |
| 出第一条片要多久 | Dreamina 上约 2 分钟,走 API 约 5 分钟 |
| 需要准备什么 | 一个字节消费端账号,或者一把 API key |
| 最便宜的一条真实片子 | bytedance/seedance-2.0-mini 480p 4 秒 $0.16 |
| 720p 每秒最低价 | Mini $0.08/s,旗舰 $0.16/s |
| 最常见的翻车 | 人物中途换脸,靠单独一张头部特写解决 |
| 数据快照 | 2026-08-06 |
Seedance 2.0 在哪儿能用?
五个入口,其中只有一个能给你不依赖字节消费端账号、还能自己核算的每秒单价。
| 入口 | 是什么 | 实际的坎 |
|---|---|---|
| Dreamina | 字节的国际版网页应用 | 额度数字不公开;人脸偏多的提示词被过滤得厉害 |
| 即梦 | 面向国内的应用 | 要中国手机号和抖音账号,界面只有中文 |
| 豆包 | 字节的消费端助手应用 | 同样需要国内侧账号 |
| ComfyUI | 本地节点图,但节点走 API | 仍然在向托管 API 计费,没有一步跑在你自己的显卡上 |
| API | 任何聚合平台或托管服务商 | 模型权重闭源,所以每条路最终都是别人的托管端点 |
大家最容易搞错的一点:Seedance 2.0 不是开放权重。没有本地安装,没有 GGUF,没有「在 4090 上跑一个」。上面那张表里每一条路的终点都是字节托管的模型,你唯一能选的是谁给你开账单。
想走程序化路线的话,三个档位在 ofox 上是同一个端点:bytedance/seedance-2.0、bytedance/seedance-2.0-fast 和 bytedance/seedance-2.0-mini。完整的请求体和轮询写法在 Seedance 2.0 API 接入指南里。
Seedance 2.0 免费吗?
不免费,而且那些张口就报积分数字的文章是编的。
Dreamina 自己的 Seedance 页面只说 Dreamina「可能为符合条件的用户提供免费试用额度」,并且「具体额度和可用性会有变化,登录后查看你当前的选项」。这是厂商明确不公布数字。那些信誓旦旦写着「260 积分、每日刷新」的文章,抄的是另一篇文章,不是字节。
真正能确定的只有这些:
- 消费端入口会给新账号一些试用额度,具体多少跟账号有关,字节没有任何书面承诺。
- 任何地方都没有免费的 API 档位,每一条程序化路线都按输出秒数计费。
- 真实底价是 Mini 480p 的 $0.04/s。一条 4 秒测试片 $0.16,用来判断这个模型能不能干你要的活,这个价格已经跟免费差不多了。
如果你的目的只是花真钱之前先试试,那就用 Mini 出 480p,别去找一个并不存在的免费档。十条测试片加起来不到两美元。
该用应用还是用 API?
只做一条片子就用应用。同一条片子要做第二遍的那一刻,就该换 API。
这些情况用应用:
- 你在摸模型的边界,想先看看效果再决定投入。
- 你的流程是一次一条,每条都有人在看结果。
- 你要的是内置的编辑界面,而不是把文件下载下来。
这些情况用 API:
- 你在批量出变体,这时候一个每秒单价比一包你算不清的积分划算得多。
- 你要结果进流水线,用
callback_url而不是让人盯着进度条。 - 你想拿同一条提示词 A/B 三个档位,这在 API 上只是改一个字符串。
退出条件:如果你一个月出不到二十条片,也不需要文件进流水线,消费端应用完全够用,这篇剩下的部分可以不看。下面的内容默认你在乎输出质量,在乎到愿意去控制它。
Seedance 2.0 的提示词该怎么写?
写指令,别写描述。 字节的官方提示词指南说得很直白:模型会把你的输入拆成「空间层」(画面里有什么)和「时间层」(怎么随时间变化)。一条读起来像广告文案的提示词,等于什么都没给时间层。
官方公布的进阶公式,顺序是固定的:
精确主体 + 动作细节 + 场景环境 + 光线与色调
+ 运镜 + 视觉风格 + 画质 + 约束
参考类任务另有三个更短的句式,它们之间的区别比看起来重要:
| 任务类型 | 句式 |
|---|---|
| 多模态参考 | Reference <Subject_N> in <Image_N> to generate... |
| 视频编辑 | Strictly edit <Video_N>, and modify <Original> to <New> |
| 视频续写 | Extend <Video_N> forward/backward to generate... |
有个坑在文档里只是一条 note,但很容易踩进去。编辑和续写任务里,直接用 <Video_1> 指代那段片子。要是写成 reference <Video_1>,模型会把整个任务判成参考类任务,你拿到的是一条新片,不是改好的片。
同一份指南里还有三条跟大家习惯的写法相反的规则:
- 优先小幅、慢速、连续的动作。 指南要求避开冲刺、大跳、剧烈翻滚,推荐的是「慢慢走、轻轻抬手、微微低头」。那些写得最带劲的动作提示词,正是最容易崩的。
- 一个镜头只给一种运镜。 同一个镜头里既要推又要拉、既要摇又要移,会明显降低画面稳定性。挑一个。
- 别掐精确时间点。 官方描述「0 到 3 秒」这类指令的支持并不稳定,强行限制「可能导致异常的生成结果」。排好镜头顺序就行,别拿秒表卡。
只要片子不止一个节拍,就写分镜。按事件发生顺序标 Shot 1、Shot 2、Shot 3,每一段依次给运镜、主体动作、位置、声音。指南自己举的反面例子是「一个男人紧张地在街上奔跑,画面很有电影感」,这正是那种读起来漂亮、生成起来稀烂的句子。
Seedance 2.0 到底认哪几个符号?
四个,而且不是装饰。 字节按一套标点约定训练了模型,用来把不同类型的声音彼此分开、也跟画面描述分开。台词用大白话写,正是很多人的片子里台词被烤成屏幕文字的原因。
| 信息类型 | 符号 | 例子 |
|---|---|---|
| 音乐 | () | (fast-paced rock music is playing in the background) |
| 音效 | <> | <dog barking can be heard in the distance> |
| 台词 | {} | {Hello, world} |
| 字幕 | 【】 | 【Chapter One: Departure】 |
附带两个条件。中文和英文以外的台词必须标语种,写成 says in Japanese {こんにちは} 这样。另外指南要求一条片子里台词语种保持一致,别中英混着来,专有名词除外。
参考图到底该放几张?
四到五个。不是十五个。
Seedance 2.0 单次最多接受 9 张图、3 段视频、3 段音频。这个数字出现在每一个关于它的宣传页上,通常还是头条卖点。然后字节自己的指南告诉你别用满:「不建议使用完整的素材上限。素材过多会导致模型难以判断特征优先级」,结果就是风格冲突、主体识别模糊、跑偏你的要求。
官方推荐的配置给每个素材都指派了职能:
- 1 到 2 张人物图,一张面部特写加一张全身,用来锁住长相
- 1 张场景图,定环境和风格
- 1 段运镜参考视频,定镜头语言和节奏
- 1 段音频,控制情绪和音色
顺序也有讲究。越是需要被精确遵循的素材,越要往提示词前面放。
人物为什么演到一半就换脸了?
因为脸的参考被稀释了,不是因为模型不会画脸。
文档写明的根因是混合参考图:一张图同时承载面部、姿势、服装、细节四种参考。脸在整张图里占比很小,模型给它的特征分配的权重就低,背景反而赢了。片子演到一半,人物就悄悄变成另一个人。
修法分三步:
- 单独准备一张只有头的特写。不带肩膀、不带脖子、背景尽量干净,没有表情最好。
- 在提示词里给角色命名并绑定素材,写成「把图 1 里穿红裙戴草帽的女人定义为 Subject 1」,之后每一次提到她都用同一个标签。
- 把脸的参考放在所有素材的最前面。
还有一条反直觉的:不要用三视图或者多视角人设图。它看起来是给模型一个稳定角色的最自然方式,实际上正是「双胞胎」bug 有据可查的成因——模型把不同角度当成了不同的人,同一帧里出现两个一模一样的角色。
Seedance 为什么会加我根本没要的字幕?
因为它是在带字幕的视频上训练出来的,而且指南承认这件事没法彻底压掉。 字节的原话是「目前无法直接 100% 避免生成字幕」。你能拿到的只有三个降低概率的手段:
- 在提示词里写明确的约束,「保持无字幕」「避免生成任何文字或字幕」。
- 参考图先把文字去掉再喂进去,别指望模型会自己忽略。
- 交付格式允许的话,先出横屏再裁。指南明确说横屏出现无关字幕的概率显著低于竖屏,如果你在做竖版社媒内容,这条相当有用。
最后这条属于只有厂商文档里才会写的细节。它也正好跟「竖屏优先」的工作流默认做法相反。
还有什么会坏,怎么修?
有据可查的故障模式一共六个,每个都有修法。它们全是模型行为,不是用户操作问题,所以没有一个能靠「把提示词写得更长」解决。
| # | 症状 | 修法 |
|---|---|---|
| 1 | 人物中途换脸 | 单独头部特写、显式角色标签、重要素材前置、不用多视角人设图 |
| 2 | 冒出你没要的字幕 | 明确约束词、参考素材先去字、出横屏再裁 |
| 3 | 画面里出现别家平台的 logo 或水印 | 加「不要生成水印」「不要生成 logo」作为约束词 |
| 4 | 二次元风格漂成实拍 | 显式写出风格词,或者先把参考图转成目标风格再生成 |
| 5 | 续写拼接处跳帧 | 前一段末尾去掉 6 帧、后一段开头去掉 1 帧,每个接点都做 |
| 6 | 同一帧里出现两个同样的人 | 每个角色绑各自的图、加禁止重复角色的约束、用单人参考图 |
第 5 条最值得背下来,因为它给的是精确数字而不是建议。每个接点 6 帧和 1 帧,用什么剪辑软件都一样。另外反复续写会累积画质劣化,最先花掉的是人脸区域的色块,所以指南建议先把源片转成纯白 3D 模型片再续,并且控制续写次数。
一条 Seedance 2.0 片子多少钱?
按输出秒数计费,单价随分辨率翻。 目录页上那些「$0.04 起」「$0.07 起」是 480p 的地板价,可几乎没人真拿 480p 交付。下面是核对于 2026-08-06 的完整价目表:
| 分辨率 | Mini | Fast | 旗舰 |
|---|---|---|---|
| 480p | $0.04/s | $0.06/s | $0.07/s |
| 720p | $0.08/s | $0.13/s | $0.16/s |
| 1080p | 不支持 | 不支持 | $0.34/s |
| 4K | 不支持 | 不支持 | $1.37/s |
视频转视频每一行都略贵:Mini 720p 是 $0.10/s 对文生视频的 $0.08/s,旗舰 1080p 是 $0.45/s 对 $0.34/s。
一条 5 秒片子,也就是大多数人真正会生成的长度:
| 档位与分辨率 | 5 秒 |
|---|---|
| Mini,720p | $0.40 |
| Fast,720p | $0.65 |
| 旗舰,720p | $0.80 |
| 旗舰,1080p | $1.70 |
| 旗舰,4K | $6.85 |
托管商之间的价差比档位之间还大。 7 月有个做短剧的人在 r/Seedance_AI 贴了一张横向价目表(查看时间 2026-08-06),列的 720p 单价是:BytePlus $0.152/s、SeeGen $0.16/s、Replicate $0.18/s、AtlasCloud $0.194/s、PiAPI $0.20/s、fal $0.302/s。fal 今天公布的价格是 720p 带音频 $0.3034/s、1080p $0.682/s,那张表到现在还站得住。同一个模型、同一份权重,看你从谁那儿买,差价接近 2 倍。
一个每月出 200 条 5 秒 720p 片子的小团队,$0.16/s 是每月 $160,按 fal 当前的 $0.3034/s 则是 $303。选哪个档位是另一个问题,在 Mini、Fast 与旗舰的档位对比里;如果你连要不要选 Seedance 都还没定,那先看 Seedance 与 Wan 的对比。
几乎每个服务商讨论帖里都会出现的一条限制:人物参考是能用的,但受版权保护的角色和公众人物在基本所有路由上都会被过滤。用自己的素材和原创角色来搭。
两个值得抄的社区工作流
这两个都不在官方文档里,都来自晒结果的人,而且都能映射到普通的 API 参数上。
首尾帧补间。 与其凭空生成一条片,不如先做出第一帧和最后一帧,把两张都交给模型,让它补中间。流传的那套提示词写法固定两个部分不动,「Show what happens in between」和「5 different camera angles」,只改中间那句描述动作的话。然后把这一段的最后一帧当作下一段的第一帧,一个镜头一个镜头往前推故事。落到 API 上就是 frame_images 传首帧和尾帧。它拿一次成片的省事换控制节奏的能力,这笔交易通常划算。
路径控制。 在一张静态图上手绘出相机路线,用显眼的颜色,然后把这张标注过的图作为参考喂进去,告诉模型严格沿着画出来的路径走并从成片里抹掉标记。有人晒的效果好到值得知道这个技巧,但要带上那条帖子里赞数最高的回复给的实话:生成出来的飞行路径跟画的那条肉眼可见地对不上。把它当成很强的引导,别当成关键帧动画。
怎么用代码调 Seedance 2.0?
一次 POST,然后轮询。 端点是异步的,不流式,也不阻塞。
import os, time, requests
BASE = "https://api.ofox.run/v1"
H = {"Authorization": f"Bearer {os.environ['OFOX_API_KEY']}"}
job = requests.post(f"{BASE}/videos", headers=H, json={
"model": "bytedance/seedance-2.0-mini",
"prompt": (
"Shot 1: fixed medium shot, a woman in a grey coat walks slowly to a "
"rain-streaked window and stops. Shot 2: slow push-in to a close-up, "
"she gently lowers her head. (soft piano) <rain on glass> "
"Cinematic texture, natural colours, soft lighting. "
"Keep it subtitle-free, do not generate a watermark."
),
"duration": 5,
"resolution": "720p",
"aspect_ratio": "16:9",
}).json()
while True:
r = requests.get(f"{BASE}/videos/{job['id']}", headers=H).json()
if r["status"] in ("completed", "failed", "cancelled", "expired"):
break
time.sleep(2)
print(r["status"], r.get("usage", {}).get("video_cost"))
把 bytedance/seedance-2.0-mini 换成 -fast 或者旗舰,就是全部的换档动作。有地方接 webhook 的话,传 callback_url 代替轮询。包含 frame_images 和 input_references 的完整字段说明在接入指南里;至于该挑哪个视频模型这个更大的问题,在按使用场景选视频 API 那篇。
Seedance 2.5 呢?
它 2026-07-31 发布,截至本文写作时,它的 BytePlus API 定的开放日期是 2026-08-07。 消费端先在即梦和豆包上铺开,这是字节一贯的顺序。
| Seedance 2.0 | Seedance 2.5 | |
|---|---|---|
| 单次时长 | 15 秒 | 30 秒 |
| 参考素材上限 | 9 图、3 视频、3 音频 | 30 图、10 视频、10 音频 |
| 分辨率上限 | 4K | 4K |
| 2026-08-06 的 API 状态 | 各服务商已上线 | 2026-08-07 开放 |
如果你需要超过 15 秒的连续片段,值得等,因为大部分肉眼可见的接缝都出在拼接上。除此之外不值得等:Seedance 2.0 同期已经升到 4K,而且这篇里的一切,提示词公式、符号、素材预算、六个修法,都是针对 2.0 系列写的,往上也照样成立。
那份发布公告里更有价值的部分,是字节 Seed 团队愿意承认自家新模型的哪些不足。他们以团队名义、没有任何个人署名,在 Seedance 2.5 的发布文结尾写道:
「在复杂运动的物理合理性、以及多主体交互场景的稳定性上,仍有提升空间。」
把这句话和提示词指南放在一起看,所有建议都对得上。复杂运动不可靠,所以指南才要求慢速、小幅、连续的动作。多主体交互不稳定,所以单人参考图才比人设图管用,「双胞胎」bug 才会存在。厂商在卖升级的同一周告诉你模型薄在哪儿。顺着这个安排镜头,别顶着来。另外,状态请以 ByteDance Seed 官方页为准,别信任何一篇博客里写的日期,包括这一篇。
常见问题
Seedance 2.0 生成一条片子要多久?
从不到一分钟到几分钟不等,取决于档位、分辨率、时长和当时的托管方负载。接口是异步的就是这个原因:提交后拿到任务 id,每一到两秒轮询一次,或者传 callback_url 让结果自己送上门。
Seedance 2.0 单次最长能生成多长的视频? 单次 15 秒,最短 4 秒。更长的片子靠续写或者分段拼接。2026-07-31 发布的 Seedance 2.5 把单次上限抬到 30 秒。
Seedance 2.0 能离线跑或者自部署吗? 不能。权重是闭源的,没有本地安装包也没有 GGUF。ComfyUI 这类本地工具是通过 API 节点调它,生成仍然发生在托管端点上,仍然按秒计费。
Seedance 2.0 能出声音吗? 能,原生支持,三个档位默认都开。控制方式是模型认得的那几个符号:圆括号写音乐,尖括号写音效,花括号写台词。
Seedance 2.0 支持视频转视频吗? 三个档位都支持,而且比文生视频贵:旗舰版 720p 是 $0.20/s 对 $0.16/s,1080p 是 $0.45/s 对 $0.34/s。续写和编辑都算视频转视频。
我的 Seedance 2.0 提示词为什么被拒了? 多数拒绝来自内容过滤器读到了提示词文本或者某个参考素材。受版权保护的角色和能认出来的公众人物是常见触发点,不同路由的严格程度还不一样。围绕自己的原创素材重搭这个镜头是最稳的解法。
Seedance 2.0 支持哪些画幅? 16:9、9:16、1:1 和自适应。字节明确提到竖屏出片冒无关字幕的概率明显更高,所以先出 16:9 再裁竖版,有时反而是拿到干净竖屏片的省事路径。
本次核实的来源
- 字节 Seedance 2.0 系列提示词指南,官方,2026-07-31 更新
- 字节 Seedance 2.0 系列教程,官方,2026-08-03 更新
- ByteDance Seed,Seedance 2.5 模型页
- ByteDance Seed 的 Seedance 2.5 发布文,2026-07-31
- Dreamina 的 Seedance 页面,免费额度措辞
- ofox Seedance 2.0 模型详情,分辨率分档价
- ofox Seedance 2.0 Fast 模型详情
- ofox Seedance 2.0 Mini 模型详情
- ofox 视频 API 参考,端点与状态枚举
- r/Seedance_AI 服务商价目讨论帖,2026-07-21
- r/seedance2pro 首尾帧补间工作流,2026-05-24
- r/seedance2pro 路径控制工作流,2026-06-04
- Seedance 2.0,维基百科
常见问题
- Seedance 2.0 生成一条片子要多久?
- 从不到一分钟到几分钟不等,取决于档位、分辨率、时长和当时的托管方负载。接口是异步的就是这个原因:提交后拿到任务 id,每一到两秒轮询一次,或者传 callback_url 让结果自己送上门。
- Seedance 2.0 单次最长能生成多长的视频?
- 单次 15 秒,最短 4 秒。更长的片子靠续写或者分段拼接。2026-07-31 发布的 Seedance 2.5 把单次上限抬到 30 秒。
- Seedance 2.0 能离线跑或者自部署吗?
- 不能。权重是闭源的,没有本地安装包也没有 GGUF。ComfyUI 这类本地工具是通过 API 节点调它,生成仍然发生在托管端点上,仍然按秒计费。
- Seedance 2.0 能出声音吗?
- 能,原生支持,三个档位默认都开。控制方式是模型认得的那几个符号:圆括号写音乐,尖括号写音效,花括号写台词。
- Seedance 2.0 支持视频转视频吗?
- 三个档位都支持,而且比文生视频贵:旗舰版 720p 是 $0.20/s 对 $0.16/s,1080p 是 $0.45/s 对 $0.34/s。续写和编辑都算视频转视频。
- 我的 Seedance 2.0 提示词为什么被拒了?
- 多数拒绝来自内容过滤器读到了提示词文本或者某个参考素材。受版权保护的角色和能认出来的公众人物是常见触发点,不同路由的严格程度还不一样。围绕自己的原创素材重搭这个镜头是最稳的解法。
- Seedance 2.0 支持哪些画幅?
- 16:9、9:16、1:1 和自适应。字节明确提到竖屏出片冒无关字幕的概率明显更高,所以先出 16:9 再裁竖版,有时反而是拿到干净竖屏片的省事路径。


