不会写分镜,用 Codex + Seedance 2.5 做第一条 AI 视频
AI 时代,每个人似乎都可以成为“导演”,做出过去需要专业团队才能完成的画面。真正的问题是,一般人不知道第一步该做什么。
我也是一个艺术盲。最近用 AI 做了两条视频,谈不上多好,但至少把流程完整跑通了。我把自己的经验整理出来,算是抛砖引玉。也希望你读完以后,能勇敢迈出第一步:别只临渊羡鱼,先下水捞第一条鱼。
本文的例子都使用我本地的 MiniMax H3。如果你用的是 Seedance 或其它多模态视频模型,具体按钮和能力限制可能不同,但整体制作步骤基本相通。
这篇不要求你会导演、画画或者写专业提示词。你只需要会做选择。视频分析、文案、参考图、提示词和失败检查,都可以交给 Codex 或 ChatGPT 帮你完成。
下面我用“做一条 15 秒左右的穿搭变装视频”作为完整例子。你也可以把题材替换成产品广告、人物短剧、宠物故事或者电影感片段。
一、开始前准备四样东西
第一条视频不用 API,也不用先学剪辑。准备:
- Codex 或支持图片生成的 ChatGPT。
- MiniMax H3 或 Seedance 2.5 的可用界面。
- 一条你想学习的视频链接,或者一句自己的想法。
- 一个文件夹,用来保存参考图、提示词和生成结果。
第一次建议控制在 10–15 秒、一个主角、一个场景。先把流程跑通,再做 30 秒、多人物和复杂对白。
MiniMax H3 和 Seedance 2.5 不是同一个模型。H3 官方支持最多 15 秒,以及首帧、尾帧和多模态参考;Seedance 2.5 官方支持单次最长 30 秒,并支持更多图片、视频和音频参考。不同产品界面开放的功能可能不完全一样。
二、把参考视频或想法交给 Codex,先不要急着生图
打开一个新任务,把链接和下面这段话一起发给 Codex:
1 | 我想学习这条视频的创作结构: |
如果你没有参考视频,可以这样写:
1 | 我想做一条 15 秒的竖屏视频:同一位成年女性在房间里跳一段轻松的小舞,周围有五个不同穿搭的小人。鼠标每点击一个小人,主角就快速换成对应衣服。最后五个小人全部消失,主角穿最后一套继续跳舞。 |
这一轮你只需要判断:这个玩法是不是你想做的,人物和场景是否合适,视频有没有塞太多事情。
三、让 Codex 列一张普通人看得懂的“制作单”
方案确认后,继续问 Codex:
1 | 请把它整理成一张制作单。不要使用导演术语,用普通人能看懂的方式列出: |
穿搭例子的制作单其实很简单:
只有结尾必须落在一个精确画面时,才需要第二张尾帧。普通的连续舞蹈先用一张首帧,更容易保持自然动作。
多人物短剧会需要更多素材。例如我在复制Cuimao“牛来”视频时,使用了主角设定、配角阵容、人物站位、场景空镜、道具和四格分镜,后面第九章会具体讲到。第一条视频先不要把这一套全部搬过来。
四、先生成一张测试图,不要一次生成整套素材
制作单确认后,让 Codex 或 ChatGPT 生成首帧:
1 | 现在开始生成首帧测试图,一次只生成一张。 |
生成后先数人数,再看脸和手脚。不要因为画面第一眼漂亮就直接进入视频。
如果只有一处不对,就告诉模型只改这一处:
1 | 右下角穿牛仔裤的小人被底边裁掉了。 |
如果人物数量、脸和构图同时出错,重新生成通常比连续修补更省时间。
五、让 Codex 根据已经确认的图片写视频提示词
首帧通过以后,把图片交给 Codex,发:
1 | 这张首帧已经确认。请为 MiniMax H3 写一段可以直接复制的视频提示词。 |
六、把素材放进 H3 或 Seedance,先生成一个测试版
使用 H3 做这个穿搭例子时:
- 选择首帧图生视频。
- 只上传确认后的首帧。
- 画幅跟随首帧,选择 15 秒。
- 粘贴 Codex 生成的提示词。
- 先用较低分辨率生成一个测试版,确认流程以后再生成完整质量版本。
七、把生成的视频交回 Codex,让它帮你找具体错误
视频出来以后,先自己正常看一遍。只记录让你明显出戏的地方和大概时间,例如:
1 | 2 秒:粉色小人挡住主角太久。 |
然后把 MP4 发给 Codex:
1 | 这是刚生成的视频。请自己读取视频并抽帧检查。 |
这正是我们检查第一次穿搭结果时看到的情况:小人放大得太大,白色描边停留太久,画面里经常同时存在两个完整人物。
八、一次只修一个主要问题
如果最影响观感的是转场太慢,就先只改转场:
1 | 根据刚才的诊断,修改视频提示词。 |
重新生成后,把两个版本放在一起比较。不要同时更换人物图、动作、镜头、音乐和时长,否则即使变好,也不知道是哪项修改起作用。
如果同一个错误连续出现两次,就回到上游检查首帧和动作设计。不要一直往提示词后面追加“更自然、更稳定、更高质量”。
九、多分镜怎么做
穿搭视频只有一个场景和一个连续镜头。遇到多人物、有对白、需要切换景别的剧情视频,难点会变成:人物换了镜头以后还是不是同一个,手里的东西有没有跳走,前一个镜头的动作能不能接到下一个镜头。下面用 [cuimao_reverse](
https://github.com/michaelpersonal/cuimao_reverse
) 做完整例子。这个项目拆解的是
“牛来”视频开头约 15 秒:一群动物外卖员吃饭,熊猫不断调侃牛,周围角色逐渐笑起来,牛从假装没听见变成准备回应。
这不是Cuimao的原始工程或原始提示词,而是根据公开视频做的教育性重建。项目里的参考图、分镜和提示词都是重新制作的。
9.1 把参考视频交给 Codex,先拆故事变化
普通用户可以先把视频链接和下面这段话交给 Codex:
1 | 请分析下面视频的开头 15 秒: |
Codex 最后把这段剧情压缩成:
1 | 牛低头吃饭、看手机,假装没听见 |
这条变化比“先中景、再双人镜头、最后特写”更重要。镜头要服务谁正在掌控对话,以及喜剧压力如何升级。
9.2 让 Codex 设计参考素材包
制作单确认后,我们让 Codex 把需要的图片拆成五类:
给 Codex 的请求是:
1 | 按照确认后的制作单,为这个 15 秒多人物视频设计参考素材包。 |
其中牛主角的实际提示词是:
1 | 创建一张原创拟人牛外卖员的制作设定图。 |
所有图片确认后,我们把五类素材排成一张参考素材表。这样在 Seedance 里只需要上传一个 `
1`,但提示词仍然可以按区域说明每种素材的职责。
完整的六组生图提示词在 (
https://github.com/michaelpersonal/cuimao_reverse/blob/main/prompts/reference-image-prompts.md
)。
9.3 用确认后的素材生成四格分镜
人物身份和场景没有确认以前,不要做分镜。否则分镜很漂亮,但里面的角色可能已经变成另一版。
我们使用四个检查点:
- 群体建立:牛低头吃饭和看手机。
- 熊猫与牛的双人镜头:熊猫开始调侃。
- 熊猫特写:笑话落地,配角开始笑。
- 牛的反应镜头:作为下一段视频的开始状态。
给 Codex 的分镜任务可以直接这样写:
1 | 人物参考素材包已经确认。请基于同一套人物、服装、场景、道具和灯光,设计一张 2×2 四格分镜。 |
关键是顺序生成:Panel 2 继承 Panel 1,Panel 3 继承 Panel 2。不要让模型从文字独立生成四张毫无关系的漂亮图。
9.4 让 Codex 为每个镜头写开始和结束状态
分镜通过后,把它交回 Codex:
1 | 请根据确认后的四格分镜,为 15 秒视频建立 shot state map。 |
第一个镜头实际被写成:
1 | 00:00–00:04.4|群体建立 |
完整状态图在 (
https://github.com/michaelpersonal/cuimao_reverse/blob/main/templates/shot-state-map.yaml
)。
9.5 让 Codex 编译 Seedance 多参考提示词
参考素材和状态图都通过以后,再生成最终提示词:
1 | 现在请把已经确认的参考素材包、四格分镜和 shot state map 编译成一段 Seedance 多参考提示词。 |
最终提示词首先明确两张图的职责:
1 | @Image 1 是权威参考素材包: |
然后才写三段时间轴。比如第二段:
1 | 00:04.4–00:11.2|熊猫/牛双人镜头 |
完整 15 秒提示词在 (
https://github.com/michaelpersonal/cuimao_reverse/blob/main/prompts/seedance-15s.md
)。
9.6 实际上传到Seedance的顺序
这个项目的快速路径只上传两张图:
1 | @Image 1:reference-pack-contact-sheet.png |
上传后先确认图片编号。提示词把人物身份交给 `
1,把镜头结构交给
2`;编号错了,后面写得再仔细也没有用。
如果使用的平台无法在 15 秒内稳定执行三个镜头,可以只在 4.4 秒或 11.2 秒这种有明确结束状态的边界拆分。下一段需要同时上传上一段成片、最后一帧、人物参考和后续分镜。
9.7 用实际时间点检查成片
生成完成后,把视频交回 Codex:
1 | 请读取生成的 15 秒视频,正常播放一次,再在 4.4 秒、11.2 秒和 15 秒附近逐帧检查。 |
这三个时间点不是随便选的:
- 4.4 秒:群体镜头切到熊猫/牛双人镜头。
- 11.2 秒:双人镜头切到熊猫笑话特写。
- 15 秒:要为牛的反应镜头留下明确起点。
9.8 失败以后怎样局部修
如果第二个镜头里牛的头盔和角发生变化,不需要推翻全部素材。可以这样要求:
1 | 只修复 00:04.4–00:11.2 的第二个镜头。 |
如果多个镜头都出现同一张脸或同一个场景错误,就回到参考素材包修。只有一个边界坏了,才修对应镜头。问题出在哪一层,就回哪一层,不要让模型围着一条坏视频反复“提高质量”。
多分镜视频的核心仍然是这一条:前一个镜头的结束状态 = 后一个镜头的开始状态
人物身份、重心、视线、道具位置、左右关系、光线和残余动作都要一起继承。这样 Codex 才能把复杂剧情拆成普通用户可以逐步确认的几个小决定。
十、第一条视频的完成标准
第一条视频不需要证明你掌握了所有模型。满足下面几项,就算流程跑通:
- 观众能看懂视频里发生了什么变化。
- 主角身份没有明显漂移。
- 参考图片没有互相冲突。
- 每个主要动作都有开始和结束。
- 转场没有长时间遮挡主体。
- 生成失败后,你能说出具体时间和具体问题。
- 图片、提示词和最终视频都保存在同一个项目文件夹。
连续做完两三条以后,再让 Codex 把你已经验证过的流程整理成 Skill。不要第一天就试图自动化一套还没有跑通的方法。









