Codex + Hyperframes:拆解抖音爆款,让普通人也能吃上自媒体这碗饭
之前我尝试用 Codex 和 Hyperframes 拆解了抖音一个图书号的爆款视频,
今天我就来出一篇长文,教大家如何一步步拆解抖音爆款视频,并固定一套工作流,从而让自己也拥有用 AI 制作视频的能力。
先把 Codex + Hyperframes 的实际制作顺序跑一遍:工具准备 → 旁白 → 声音 → 画面 → 字幕 → 成片。
后半篇再继续加上我自己的做法:
把拆解结果抽成模板、一次生成多个版本、用数据迭代,再固化成 Skill。目标不是只做出一条视频,而是把它变成一套能重复跑的内容生产流程。
准备工作:先把工具链配齐,不要边做边补
第一步先做工具准备,你至少需要一个能读文件、改项目、执行任务的 Agent,比如 Codex;视频执行层可以用 Hyperframes。
如果你的目标是做信息图、字幕动效、产品展示、知识解释类视频,Hyperframes 很合适;
如果你更强调固定模板、高度复制,也可以把 Remotion 作为另一条路线。这里不要同时学十个工具,先选一套跑通。
另外建议准备一个“视频拆解 Skill”。它的任务不是总结视频,而是把原片拆成时间轴:前几秒如何留人、旁白怎么推进、画面怎么切、字幕什么时候出现、声音哪里变化。
最小工具链: Codex(拆解与编排) → Hyperframes(画面/动效) → TTS(配音) → transcript(字幕时间轴) → preview / inspect / render。
先定视频规格,再写旁白,不要一上来就做画面
原文的制作顺序很实用:先明确视频规格,比如 30 秒、9:16、中文、知识类、发抖音还是 X;然后才写旁白。
旁白确定以后,再定视觉方向。例如深色知识类、书封面主视觉、轻微推进、字幕偏大。接着把旁白拆成 4–6 个段落,每一段对应一个画面任务。
这一点很关键:声音决定时间轴。旁白没稳定之前先别花时间做十几个镜头,否则后面一改文案,前面的画面很可能全部返工。
我会要求 Codex 输出:每段时长、旁白、画面、字幕、转场、情绪、素材需求。拿到这张“施工表”,再进入生成阶段。
第一次必须人工拆:先把“为什么有效”看明白
我原本的案例是图书号,结构相对简单:前几秒留住用户,然后进入书籍介绍或书评。当时是先用工具拆原视频,再让 Codex 收集书籍事实、用户高频划线和书评,最后生成旁白。
第一次一定人工把关:事实对不对、前 3 秒能不能留人、句子像不像人话、语气像不像你的账号。AI 先出第一版,人来决定什么能发。
我自己的标准很简单:删掉明显模板句;少用整齐排比;一句只讲一个意思;所有事实都能回到资料。
第一版跑通以后,再把“资料怎么找、旁白怎么写、什么表达不要出现”固定成 Skill。这样第二条视频开始,文案部分才真正进入复用。
plaintext
1 | 直接复制给 Codex|爆款视频拆解 Prompt |
声音先处理好:一个不好听的 TTS 会毁掉整条片
原文花了不少篇幅讲声音,这是非常实际的一点。很多 AI 视频看起来没问题,但一听旁白就出戏。中文 TTS 尤其容易出现错字、停顿机械、情绪不对。
最简单的做法是先用你手头稳定的中文 TTS 生成一版,再把最终音频交给 Codex 做分析:语速、停顿、音量、压缩、均衡和情绪是否接近对标。
不要手工猜字幕时间。最终音频定下来以后,重新转 transcript,用真实音频时间轴生成字幕,这样后面字幕与旁白更容易对齐。
声音处理顺序: 旁白定稿 → TTS → 试听 → 调整语速/停顿/音色 → 最终音频 → transcript → 字幕时间轴。
Hyperframes 负责画面,但必须先 preview 再 render
到了画面阶段,把 Codex 已经整理好的镜头表交给 Hyperframes。每一个画面都要有明确的 start、duration、层级和素材,不要让它自由发挥整条视频。
第一次生成一定不要直接渲染最终 MP4。先 preview,检查字体、画面溢出、字幕遮挡、素材比例,再做 validate / inspect。真正的问题往往不是“生成失败”,而是布局小错误和字幕时间差。
如果字幕和语音对不上,就让 Codex 根据音频抽帧/时间轴重新校正;如果画面不像对标,就明确告诉它是构图、字幕位置、节奏还是素材的问题。一般要来回两三轮。
跑到这里,你已经把 Serena 原文里最核心的一段流程完整走完:
爆款拆解 → 旁白 → TTS → transcript → Hyperframes → 校对 → 成片。
接下来才是真正拉开差距的部分。
plaintext
1 | 实操|把镜头表直接保存成 shot-plan.md |
不要只复刻一条:先把爆款抽成“视频模板”
如果做完一条就结束,那只是 AI 帮你省了一次剪辑时间。真正有价值的是把这条视频里“不变的东西”留下来。
我会把一条视频拆成五个模板:Hook 模板、旁白结构、镜头结构、字幕规则、视觉规则。比如“3 秒痛点 → 反常识观点 → 3 个解释 → 一个案例 → CTA”,下一条只换主题和案例。
画面也一样。固定标题出现方式、字幕位置、主色、节奏、BGM 类型和 CTA 动画。这样你不是每次做新视频,而是在同一条生产线上更换内容。
plaintext
1 | 你真正应该保存的不是“上一条成片”,而是: |
一条正文至少做 3 个 Hook,让数据替你选
AI 最大的优势不是一次生成完美答案,**而是把试错成本压低。**所以同一条正文,我至少会做 3 个前 3–5 秒版本。
A 版用结果,B 版用痛点,C 版用反常识。后面主体尽量不变。发布以后看前 3 秒留存、完播和评论,先找到“用户为什么愿意留下”。
如果条件允许,再做第二轮变量:换首帧、字幕样式或 CTA。但一轮只改一个变量,否则数据回来你也不知道到底什么起作用。
所以别追求一次生成 100 条。先做 3 个版本,让数据告诉你哪个 Hook 真能留人。
先建素材池:让批量生产不再每条从零找素材
真正开始批量以后,我会单独建一个素材池,按人物、产品、场景、截图、背景、音效、BGM 分类。文件名也不要保留 IMG_4837 这种随机编号,而是直接写成“办公室-焦虑-近景”“书封-主视觉”“城市夜景-推进”这种一眼能看懂的名字。
每次生成新视频时,先让 Codex 根据镜头表匹配已有素材:能复用的直接复用,缺什么再生成什么。这样不仅速度快,账号视觉也更稳定。
同一个账号最好固定人物风格、字幕字体、主色、画幅和常用转场。否则第一镜头是 3D 卡通,下一镜头突然变写实摄影,最后看起来就是典型的“AI 拼盘”。
我更喜欢一个简单比例:70% 使用稳定模板和素材,30% 留给新的镜头、Hook 和表达。批量内容最怕的不是重复,而是每一条都从零开始。
连续跑通 3–5 条,再把流程做成 Skill
很多人第一条都没稳定,就急着做全自动。我的顺序反过来:先手动跑 3–5 条,把所有坑记录下来,再固化。
这个 Skill 的输入可以是一条对标视频或拆解文本;
输出则固定为:是否值得复用、Hook、叙事结构、镜头时间轴、新主题旁白、3 个 Hook 版本、Hyperframes 镜头任务、字幕规则和最终检查清单。
Skill 里必须写验收标准。例如总时长 30–45 秒;前 3 秒出现核心冲突;字幕不超过两行;每 3–5 秒有画面变化;不能复制对标视频的原文案和标志性素材。
再留几个变量:账号赛道、目标受众、视频长度、情绪、CTA、视觉风格。以后换主题,只换变量。
plaintext
1 | 直接复制给 Codex|把跑通流程固化成 Skill |
数据必须重新喂回来,否则自动化只会放大垃圾
真正的闭环不是“AI 自动生成 100 条”,而是“先做 5 条 → 发布 → 看数据 → 找最好的一条 → 修改 Skill → 再跑下一批”。
前 3 秒掉得快,先改 Hook;点击低但完播高,检查首帧和标题;中段跳出,就缩短解释、加快镜头变化;评论多但转化弱,再改 CTA。
每次只处理一个最明显的问题。两三轮以后,你的 Skill 才会从通用生成器,变成真正适合自己账号的生产线。
AI 帮你降低试错成本,不是帮你取消试错。
举个最简单的例子:如果你做的是 AI 工具号,找到一条“3 个功能快速演示”的爆款后,不要复制它的台词。
保留“问题开场 → 3 个功能 → 使用结果 → CTA”这条骨架,换成你自己的工具、实测结果和画面。第一轮只测 Hook,第二轮再测字幕和首帧。这样既能借到成熟结构,又能保证内容信息、案例和表达来自你自己。
plaintext
1 | 跑偏时别重来,先这样改: |
如果今天从零开始,我会这样跑第一条
1⃣ 在自己的赛道里找 3 条最近跑出来的视频,不跨赛道乱抄。
2⃣ 选“结构最容易复用”的一条,不选高度依赖真人、明星或独家素材的。
3⃣ 让 Codex 按时间轴拆 Hook / Narrative / Visual / Rhythm。
4⃣ 保留结构,换主题,先写 30–45 秒旁白。
5⃣ 先生成音频并确认节奏,再做 transcript 和镜头表。
6⃣ 用 Hyperframes 先跑 15–30 秒测试片,把字幕、比例、字体和动效调顺。
7⃣ 同一正文做 3 个不同 Hook。
8⃣ 发布后看数据,不凭感觉判断。
9⃣ 连续跑通几条,再把流程固化成 Skill。
🔟 Skill 稳定以后,再考虑定时、批量和更深的自动化。
最后|别把目标定成“学会 AI 视频”,而是搭出自己的生产线
工具一定会继续更新。今天是 Hyperframes,明天也可能出现更顺手的方案。
真正不会过时的是:你知道什么视频值得拆、怎么把结构抽出来、怎么测试不同版本、怎么用数据反馈,以及怎么把跑通的方法固化。
以前做内容,是一条一条做。现在更值得学的,是搭一条会不断测试、不断修正、还能重复生产的内容流水线。
扩展阅读
HyperFrames Quickstart|从安装 Skill 到 Preview / Render
参考资料
HeyGen Help Center|HyperFrames 的定位、适用场景与 AI coding agent 工作方式
OpenAI Help Center|ChatGPT 和 Codex 中的 Plugins / Skills





