之前我尝试用 Codex 和 Hyperframes 拆解了抖音一个图书号的爆款视频,

今天我就来出一篇长文,教大家如何一步步拆解抖音爆款视频,并固定一套工作流,从而让自己也拥有用 AI 制作视频的能力。

先把 Codex + Hyperframes 的实际制作顺序跑一遍:工具准备 → 旁白 → 声音 → 画面 → 字幕 → 成片。

后半篇再继续加上我自己的做法:

把拆解结果抽成模板、一次生成多个版本、用数据迭代,再固化成 Skill。目标不是只做出一条视频,而是把它变成一套能重复跑的内容生产流程。

准备工作:先把工具链配齐,不要边做边补

第一步先做工具准备,你至少需要一个能读文件、改项目、执行任务的 Agent,比如 Codex;视频执行层可以用 Hyperframes。

如果你的目标是做信息图字幕动效产品展示知识解释类视频,Hyperframes 很合适;

如果你更强调固定模板高度复制,也可以把 Remotion 作为另一条路线。这里不要同时学十个工具,先选一套跑通。

另外建议准备一个“视频拆解 Skill”。它的任务不是总结视频,而是把原片拆成时间轴:前几秒如何留人、旁白怎么推进、画面怎么切、字幕什么时候出现、声音哪里变化。

最小工具链: Codex(拆解与编排) → Hyperframes(画面/动效) → TTS(配音) → transcript(字幕时间轴) → preview / inspect / render。

先定视频规格,再写旁白,不要一上来就做画面

原文的制作顺序很实用:先明确视频规格,比如 30 秒、9:16、中文、知识类、发抖音还是 X;然后才写旁白。

旁白确定以后,再定视觉方向。例如深色知识类、书封面主视觉、轻微推进、字幕偏大。接着把旁白拆成 4–6 个段落,每一段对应一个画面任务。

这一点很关键:声音决定时间轴。旁白没稳定之前先别花时间做十几个镜头,否则后面一改文案,前面的画面很可能全部返工。

我会要求 Codex 输出:每段时长、旁白、画面、字幕、转场、情绪、素材需求。拿到这张“施工表”,再进入生成阶段。

第一次必须人工拆:先把“为什么有效”看明白

我原本的案例是图书号,结构相对简单:前几秒留住用户,然后进入书籍介绍或书评。当时是先用工具拆原视频,再让 Codex 收集书籍事实、用户高频划线和书评,最后生成旁白。

第一次一定人工把关:事实对不对、前 3 秒能不能留人、句子像不像人话、语气像不像你的账号。AI 先出第一版,人来决定什么能发。

我自己的标准很简单:删掉明显模板句;少用整齐排比;一句只讲一个意思;所有事实都能回到资料。

第一版跑通以后,再把“资料怎么找、旁白怎么写、什么表达不要出现”固定成 Skill。这样第二条视频开始,文案部分才真正进入复用。

plaintext

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
直接复制给 Codex|爆款视频拆解 Prompt

# 任务
把这条对标视频拆成“可复用结构”,不是总结内容。

# 输入
- 对标视频:{链接 / transcript / 视频文件}
- 我的赛道:{AI工具 / 图书 / 电商 / 其他}
- 目标时长:30–45 秒
- 目标平台:抖音

# 输出
1. 前 3–5 秒 Hook:原视频用了什么办法留人
2. Narrative:正文怎么推进,每一段解决什么问题
3. Visual:每段对应什么画面、字幕、素材
4. Rhythm:停顿、转场、BGM、画面变化节点
5. 可复用结构:哪些能学
6. 必须重写部分:原文案、案例、标志性表达、独特画面
7. 按这个结构,为我的新主题生成 3 个不同 Hook

# 要求
- 不复制原视频原句
- 不沿用原作者独特案例
- 缺少事实就标记“待核验”,不要编
- 用 Markdown 输出

声音先处理好:一个不好听的 TTS 会毁掉整条片

原文花了不少篇幅讲声音,这是非常实际的一点。很多 AI 视频看起来没问题,但一听旁白就出戏。中文 TTS 尤其容易出现错字、停顿机械、情绪不对。

最简单的做法是先用你手头稳定的中文 TTS 生成一版,再把最终音频交给 Codex 做分析:语速、停顿、音量、压缩、均衡和情绪是否接近对标。

不要手工猜字幕时间。最终音频定下来以后,重新转 transcript,用真实音频时间轴生成字幕,这样后面字幕与旁白更容易对齐。

声音处理顺序: 旁白定稿 → TTS → 试听 → 调整语速/停顿/音色 → 最终音频 → transcript → 字幕时间轴。

Hyperframes 负责画面,但必须先 preview 再 render

到了画面阶段,把 Codex 已经整理好的镜头表交给 Hyperframes。每一个画面都要有明确的 start、duration、层级和素材,不要让它自由发挥整条视频。

第一次生成一定不要直接渲染最终 MP4。先 preview,检查字体、画面溢出、字幕遮挡、素材比例,再做 validate / inspect。真正的问题往往不是“生成失败”,而是布局小错误和字幕时间差。

如果字幕和语音对不上,就让 Codex 根据音频抽帧/时间轴重新校正;如果画面不像对标,就明确告诉它是构图、字幕位置、节奏还是素材的问题。一般要来回两三轮。

跑到这里,你已经把 Serena 原文里最核心的一段流程完整走完:

爆款拆解 → 旁白 → TTS → transcript → Hyperframes → 校对 → 成片。

接下来才是真正拉开差距的部分。

plaintext

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
实操|把镜头表直接保存成 shot-plan.md

# Video Spec
platform: douyin
ratio: 9:16
duration: 35s
style: dark-tech
subtitle: large

## Scene 01
start: 0s
duration: 3s
voiceover: “{Hook}”
visual: “{首帧主体 + 动作 + 背景}”
subtitle: “{大字幕}”
transition: cut
asset: “{需要的图片/视频}”

## Scene 02
start: 3s
duration: 5s
voiceover: “{正文第1段}”
visual: “{画面描述}”
subtitle: “{字幕}”
transition: push

把整条视频都按这个格式列完,再交给 Hyperframes。先 preview 15–30 秒,确认字体、字幕、画幅和节奏,再 render 最终版本。

不要只复刻一条:先把爆款抽成“视频模板”

如果做完一条就结束,那只是 AI 帮你省了一次剪辑时间。真正有价值的是把这条视频里“不变的东西”留下来。

我会把一条视频拆成五个模板:Hook 模板、旁白结构、镜头结构、字幕规则、视觉规则。比如“3 秒痛点 → 反常识观点 → 3 个解释 → 一个案例 → CTA”,下一条只换主题和案例。

画面也一样。固定标题出现方式、字幕位置、主色、节奏、BGM 类型和 CTA 动画。这样你不是每次做新视频,而是在同一条生产线上更换内容。

plaintext

1
2
你真正应该保存的不是“上一条成片”,而是:
Hook 模板 + 旁白模板 + 镜头模板 + 字幕规则 + 视觉规则。

一条正文至少做 3 个 Hook,让数据替你选

AI 最大的优势不是一次生成完美答案,**而是把试错成本压低。**所以同一条正文,我至少会做 3 个前 3–5 秒版本。

A 版用结果,B 版用痛点,C 版用反常识。后面主体尽量不变。发布以后看前 3 秒留存、完播和评论,先找到“用户为什么愿意留下”。

如果条件允许,再做第二轮变量:换首帧、字幕样式或 CTA。但一轮只改一个变量,否则数据回来你也不知道到底什么起作用。

所以别追求一次生成 100 条。先做 3 个版本,让数据告诉你哪个 Hook 真能留人。

先建素材池:让批量生产不再每条从零找素材

真正开始批量以后,我会单独建一个素材池,按人物、产品、场景、截图、背景、音效、BGM 分类。文件名也不要保留 IMG_4837 这种随机编号,而是直接写成“办公室-焦虑-近景”“书封-主视觉”“城市夜景-推进”这种一眼能看懂的名字。

每次生成新视频时,先让 Codex 根据镜头表匹配已有素材:能复用的直接复用,缺什么再生成什么。这样不仅速度快,账号视觉也更稳定。

同一个账号最好固定人物风格、字幕字体、主色、画幅和常用转场。否则第一镜头是 3D 卡通,下一镜头突然变写实摄影,最后看起来就是典型的“AI 拼盘”。

我更喜欢一个简单比例:70% 使用稳定模板和素材,30% 留给新的镜头、Hook 和表达。批量内容最怕的不是重复,而是每一条都从零开始。

连续跑通 3–5 条,再把流程做成 Skill

很多人第一条都没稳定,就急着做全自动。我的顺序反过来:先手动跑 3–5 条,把所有坑记录下来,再固化。

这个 Skill 的输入可以是一条对标视频或拆解文本;

输出则固定为:是否值得复用、Hook、叙事结构、镜头时间轴、新主题旁白、3 个 Hook 版本、Hyperframes 镜头任务、字幕规则和最终检查清单。

Skill 里必须写验收标准。例如总时长 30–45 秒;前 3 秒出现核心冲突;字幕不超过两行;每 3–5 秒有画面变化;不能复制对标视频的原文案和标志性素材。

再留几个变量:账号赛道、目标受众、视频长度、情绪、CTA、视觉风格。以后换主题,只换变量

plaintext

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
直接复制给 Codex|把跑通流程固化成 Skill

请把我们刚才已经跑通的视频流程整理成一个可重复调用的 Skill。

## 固定流程
对标视频 → 拆结构 → 核验资料 → 写旁白 → 生成 3 个 Hook
→ TTS → transcript → 镜头表 → Hyperframes preview
→ 检查字幕/画幅/节奏 → render → 输出发布素材

## 每次可变参数
- 赛道:
- 目标受众:
- 视频时长:
- 主题:
- 语气:
- CTA:
- 视觉风格:

## 验收标准
- [ ] 前 3 秒出现明确冲突、结果或利益点
- [ ] 不复制对标视频原句和独特素材
- [ ] 字幕最多两行
- [ ] 每 3–5 秒至少一次视觉变化
- [ ] 所有事实可回到来源
- [ ] 至少输出 3 个 Hook 版本
- [ ] 最终同时输出旁白、镜头表、素材清单和发布文案

如果任何一项未通过,先修正,不要直接进入最终渲染。

数据必须重新喂回来,否则自动化只会放大垃圾

真正的闭环不是“AI 自动生成 100 条”,而是“先做 5 条 → 发布 → 看数据 → 找最好的一条 → 修改 Skill → 再跑下一批”。

前 3 秒掉得快,先改 Hook;点击低但完播高,检查首帧和标题;中段跳出,就缩短解释、加快镜头变化;评论多但转化弱,再改 CTA。

每次只处理一个最明显的问题。两三轮以后,你的 Skill 才会从通用生成器,变成真正适合自己账号的生产线。

AI 帮你降低试错成本,不是帮你取消试错。

举个最简单的例子:如果你做的是 AI 工具号,找到一条“3 个功能快速演示”的爆款后,不要复制它的台词。

保留“问题开场 → 3 个功能 → 使用结果 → CTA”这条骨架,换成你自己的工具、实测结果和画面。第一轮只测 Hook,第二轮再测字幕和首帧。这样既能借到成熟结构,又能保证内容信息、案例和表达来自你自己。

plaintext

1
2
3
4
5
6
跑偏时别重来,先这样改:
- 旁白太 AI:要求“删排比、删空话、每句只说一个意思”
- 画面太乱:一次只改构图/字幕/节奏中的一个变量
- 字幕对不上:以最终音频重新生成 transcript,不手调时间
- 成片像 AI 拼盘:锁定人物风格、字体、主色和常用转场
- 数据差:先改前 3 秒 Hook,不要整条推倒重做

如果今天从零开始,我会这样跑第一条

1⃣ 在自己的赛道里找 3 条最近跑出来的视频,不跨赛道乱抄。

2⃣ 选“结构最容易复用”的一条,不选高度依赖真人、明星或独家素材的。

3⃣ 让 Codex 按时间轴拆 Hook / Narrative / Visual / Rhythm。

4⃣ 保留结构,换主题,先写 30–45 秒旁白。

5⃣ 先生成音频并确认节奏,再做 transcript 和镜头表。

6⃣ 用 Hyperframes 先跑 15–30 秒测试片,把字幕、比例、字体和动效调顺。

7⃣ 同一正文做 3 个不同 Hook。

8⃣ 发布后看数据,不凭感觉判断。

9⃣ 连续跑通几条,再把流程固化成 Skill。

🔟 Skill 稳定以后,再考虑定时、批量和更深的自动化。

最后|别把目标定成“学会 AI 视频”,而是搭出自己的生产线

工具一定会继续更新。今天是 Hyperframes,明天也可能出现更顺手的方案。

真正不会过时的是:你知道什么视频值得拆、怎么把结构抽出来、怎么测试不同版本、怎么用数据反馈,以及怎么把跑通的方法固化。

以前做内容,是一条一条做。现在更值得学的,是搭一条会不断测试、不断修正、还能重复生产的内容流水线。

扩展阅读

HyperFrames 官方主页|HeyGen

HyperFrames Quickstart|从安装 Skill 到 Preview / Render

HyperFrames x HeyGen|官方使用说明

参考资料

HeyGen Help Center|HyperFrames 的定位、适用场景与 AI coding agent 工作方式

OpenAI Help Center|ChatGPT 和 Codex 中的 Plugins / Skills

X Help Center|Original Content Rewards:原创内容与复制/实质复刻规则