Codex 自动剪辑:开源爆火涨粉 100w 的人生副本视频(系列一)
人生副本系列特火,很解压,有人用它一个视频涨粉 100w,可以带货、带广告、教徒赚钱,很适合大家做副业。
你可能刷到过这类视频:一张张电影质感的插画,配着低沉的旁白,今天你要体验的人生副本是,在县城躺平的一生;体验 30 岁被裁员的第 100 天。一条 8 分钟的视频讲完一个人的人生。
节奏舒缓、画面治愈、故事扎心,评论区全是看哭了、这就是我。
人生副本赛道在抖音非常火,起号也很简单,看到一个剧本人生的博主,解读自己的人生,爆火涨粉 50w+, 于是我进行了拆解,现在成品来了,8分钟,生成了102张图,总共用时6个小时搞完,全程codex进行,我只做指挥,大概流程这样: 1、输入主题,codex给你主题方向,你来选
开源我月入10w+的Codex的使用方法(超详细教学)
Codex 这种东西,直觉告诉你应该是程序员用的。但最先玩转它的那批人,是产品经理、运营、自媒体博主、大学生、个体户老板——没几个会写代码的。 因为程序员用它,是从 80 分到 95 分。你不会写代码,是从 0 分直接到…
它就是当下短视频里最稳的解压赛道之一:第二人称人生体验叙事。而它的生产,已经从手工剪辑一周一条,进化成了 AI 流水线一天一条。
我用 codex,用了 8h,做了 102 张图,制作了这个视频,你先看看。
然后,我把这套完整的流水线拆给你看,从选题到发布,每一步干什么、用什么模型、为什么这么干,一次讲透。学完你自己就能搭一条。
先说清楚:这类视频到底长什么样
在讲流程之前,先给这类视频定个标准长相,后面每一步都围着它转:
- 第二人称叙事:你是主角,你体验一段人生。这是它和普通故事最大的区别,也是代入感的来源。
- 一句旁白,一张图:每句话对应一幅插画,镜头缓缓推近,配上低沉人声,节奏解压。
- 固定片头:外卖员、代驾、货车司机、白领、老板、医生、教师、工人的暗色人生轮播,最后定格超大主题字,一眼就能认出这个栏目。
- 横屏长视频:4:3 画幅、8~10 分钟,像一部微型纪录片。平台对长视频的完播权重很友好。
- 固定画风:正常人头、自然五官的二维电影化插画。不是 AI 味很重的网红脸,更像动画电影分镜。
记住这五点,后面每一步都是为了让它们成立。
准备清单
开工前,把这几样东西备齐:
\1. 一个能跑多 Agent 流水线的 AI 工具。 这套流程的核心不是让 AI 画一张图,而是让 AI 像工厂一样并行生产:剧本、分镜、生图、配音、渲染五个分支同时跑,互不阻塞。所以你需要的是支持多智能体协作、能调用生图、语音合成和渲染工具的 Agent 环境,而不是单个聊天窗口。
\2. 火山引擎语音合成服务。 声音是这类视频的灵魂。需要开通火山引擎的语音合成能力,20000 字免费,可以白嫖。用它的克隆音色做旁白,语速平缓、压低声线,就是人生副本那个味。
\3. FFmpeg 加剪映。 FFmpeg 负责把一张张静图渲染成缓缓推近不抖动的镜头,再拼接成片;剪映用来出可编辑草稿,方便你发布前微调字幕、换音乐。
\4. 一套固定素材包。 包括片头的人生轮播图、齿轮机械音效、主题卡入场重鼓音效。这套素材固定复用,不用每期重做,它就是你的栏目包装。
备齐这四样,就可以开工了。下面进入正题。
详细步骤:一条视频的生产流水线
在进入具体步骤之前,先理解这套流水线的核心逻辑。
一条 8 分钟的人生副本视频,102 句旁白、102 张正文图。如果串行跑,每张图生图加质检平均 90 秒,102 张就是 153 分钟,两个半小时纯等 AI 画图。102 句 TTS 每句合成 5 秒,一句等完再下一句,又是 8.5 分钟。102 个镜头渲染每个 15 秒,一个接一个压,再加 25 分钟。
光这三项加起来就超过 3 小时。还没算剧本写作、质检、视觉设计的时间。更没算一张图生成失败,你发现后重新排队,再等一轮的时间。而且这三小时里你什么都不能干,只能盯着进度条。
反正我用了8 小时 才等完一条视频,黄花菜都凉了。批量做号根本不可能。
这就是为什么必须并行。不是锦上添花,是不并行这套流水线根本没法量产。
理解了时间压力,再看流水线的结构。套路很简单,前期只设两个人工决策点,确认主题,确认剧本。剧本一旦锁定,后面不再一步一问,而是按依赖关系同时开工。
这张图只看一个关键,箭头表示依赖,不表示所有任务都要排队。
下面,按八个步骤拆开每条产线具体干什么。
第一步:选题,让主模型出 6 个候选再打分
别拍脑袋定主题。第一步是让主控大模型生成 6 个候选人生方向,每个方向从 7 个维度打分:
- 代入感:普通人有没有共鸣,被裁员、相亲失败就比登月强。
- 冲突感:故事有没有张力。
- 延展性:能不能撑起 8~10 分钟的体量。
- 画面可生成性:场景容不容易画出好图。
- 事实风险:涉及健康、法律、金钱、职业的数字有没有可靠来源。
- 平台风险:会不会踩平台红线。
- 原创风险:跟爆款重复度高不高。
这一步跑在你的主控大模型上,Claude 和 GPT这类对话大模型都能干,一次生成六个方向,自动按上面七个维度打分,选最高分,并列时选原创风险更低的。这一步的本质,是把什么选题能火从玄学变成评分制。
好主题的判断标准很简单:前 15 秒必须兑现题目。标题写体验在县城躺平的一生,开头第一句就是今天你要体验的人生副本是,在县城躺平的一生,然后立刻进入人生体验,不铺垫、不预告。
第二步:写第二人称剧本,一句旁白一张图
这是整个流程里最值钱的一步,也是内容质量的分水岭。
剧本有硬性结构:
- 首句固定:今天你要体验的人生副本是,加上本期主题。第二句直接进人生,不写教程式预告。
- 先列 8~10 个剧情节拍,再扩写成完整剧本。剧情节拍是故事的大节点,比如童年、高考、第一份工作、失业、中年、晚年,不是句子数量。
- 事件驱动节奏:每 30~60 秒必须发生一次事件、关系、场景或认知变化。长视频最怕平,这条规则就是防平。
- 三种故事机制,至少选一种打底:
- 欲望兑现:一个属性比如有钱,在日常、浪漫、喜剧、危机里给出不同价值,结尾回到感官锚点。
- 关系升温:注意、记住、照顾、接触、确认逐级发生,每一级升温都要有行动证据,不能光靠台词。
- 社会痛感:一个小问题比如讨好型人格,逐渐损害身体、社交、关系,结尾保留不可追回的代价。
- 一句一图:以句号、问号、感叹号为界拆句,每句话对应一张图。抽象旁白必须转换成能看见的动作和结果,你的安全感在这一刻彻底崩塌这种句子不合格,要改成女生独自坐在玄关地面,手机停留在未接来电页面,门外母亲持续敲门,她双手抱膝、脸色发白才算合格。
剧本同样是主控大模型来写,这一步建议用推理能力更强的模型,Claude 的 Opus 档或者 GPT都能胜任,把上面的结构要求喂进去,让它先列剧情阶段再扩写全文。
主题确认后再写剧本,剧本写完停下来做第二次确认。剧本一旦点头,后面才会启动全部生产,就很难掉头, 这一步非常重要。
第三步:内容质检,让主模型先过四道安检
剧本定稿后,先别急着画图。并行跑一轮内容质检,查四件事:
- 事实:健康、法律、金钱、职业的数字有没有可靠来源?无法核实的数字直接删掉,不编看起来真实的数据。
- 原创:参考爆款只学结构,不复用对方的事件组合、金句、人物关系顺序、分镜顺序。
- 第二人称与口语可读性:通篇都是你,念出来顺不顺。
- 平台风险:有没有违规内容。
这一步还是主控大模型来审,同一套模型既能写也能审,把质检清单发给它,让它逐项过一遍,输出问题清单。质检发现问题只改剧本本身,改完剧本后面所有产物作废重做,所以质检要在生产之前做,越早发现问题越省钱。
第四步:视觉设计,给角色发身份证
这一步解决 AI 视频最大的痛点:角色连续性。AI 画图最大的毛病是同一个人三张脸,这套流程用三层机制锁死:
- 角色身份证:每个长期角色固定编号、性别、年龄阶段、脸型、眉眼鼻嘴比例、发型、体型、一个稳定识别点、按场景编号的服装。性别是跨全片硬锁定字段,从婴儿到老年都不能变。
- 场景表加视觉圣经:所有场景、时间、光线、服装、道具登记在案,统一画风。
- 连续性状态:同一场景连续镜头继承时间光线、服装发型、人物左右位置、房间布局、道具数量和位置。只有剧本明确发生变更时才改。
同时把剧本拆成的一句一图单元扩展成完整分镜:每个镜头确定景别、机位、情绪、动效和转场。动效只允许缓缓推近这类确定性轻运动,转场默认硬切,只有情绪连续的镜头才用 0.12 秒短叠化,这就是人生副本那种安静、电影感的来源。
角色身份证、场景表、视觉圣经和分镜,全部由主控大模型生成,再配合格式校验脚本检查有没有漏镜头、句子有没有被改动。这里不需要专门的设计模型,主控模型加上一套规范就能把人物一致性锁住。
第五步:配音,用克隆音色念剧本
配音和视觉设计互不依赖,可以同时跑。这里用火山引擎的语音合成服务,用克隆音色合成逐句音频,几个请求并行跑,再按剧本顺序拼回一条完整的旁白。
这一步用的是火山引擎的大模型语音合成,资源是克隆音色 seed-icl-2.0,音色号 xxx,24k 采样率,语速保持默认不调速。关键细节是:
- 语速要压住,别为了凑时长偷偷提速,解压感一大半来自慢。
- 用每句音频的真实时长建立时间轴和字幕,不用字数估算,估算出来的字幕必然对不上嘴。
- 字幕白字粗体黑描边,底部居中,一句旁白对应一个字幕段;遇到逗号就换行,逗号本身不显示,任何一行都不出现逗号。
第六步:批量生图,三队列并行出图
视觉圣经完成后,正式进入生图阶段。流程是先锚点后正文:
- 先生成角色母图和场景基准图,这是锚点,后面所有正文图都要引用它们,保证同一张脸。
- 某镜头的角色和场景锚点一通过,立刻释放该镜头,不等全部母图。
- 所有正文图逐张独立生成,但按风险分成三条队列并行跑:
- 高风险队列:手部、手机、工具接触、多人肢体重叠、身份关键镜头。必须全分辨率检查,手要能追溯到手腕前臂、手机屏幕方向合理、筷子烟卷真实接触不穿掌,画坏了直接重画,别替模型解释。
- 角色队列:普通人物镜头,重点查脸型、年龄、发型、服装、左右位置。
- 环境队列:空镜、道路、建筑、房间,重点查场景结构、时间、光线。
- 每张图失败最多重试三次,不阻塞其他队列;全部完成后校验每个镜头恰好一张图,漏图不许交片。
生图走你 Agent 内置的生图模型,每张图都是一次独立调用,坚决不用九宫格拆图或者批量接口。实际生产里 GPT 系列生图模型和火山引擎的 Seedream 这类绘图模型都可以替换,只要支持逐张独立调用、能把角色母图喂进去保持同一张脸就行。
统一画风关键词可以抄作业:
正常人头与自然人脸比例、真实发型、二维插画感不写真摄影、环境细节丰富的电影化生活插画、人物与场景光影统一、干净细腻线稿、柔和赛璐璐上色、画面内无任何文字水印。负面提示词重点排除:真人摄影、3D 渲染、塑料皮肤、Q 版大头、多余手指、手部畸形、肢体融合、乱码文字水印。
第七步:片头加渲染,把静图变成会呼吸的视频
图、音、时间轴齐了,进入渲染:
- 固定片头:6 张暗色人生素材按非等距节奏切换,齿轮机械声推进,主题卡切入前 87 毫秒一记重鼓,定格下三分之一处超大红白斜体主题字。这套片头固定复用,就是你的栏目招牌。
- 正文动效:所有镜头只做中心锁定的平滑推近,图片中心不动,从 1.00 平滑放大到 1.04,近景 1.06,用平滑曲线匀速推进。禁止左右横移、禁止缩小、禁止随机抖动、禁止呼吸回弹、禁止黑边。这就是人生副本安静治愈感的技术来源:画面几乎不动,只有极其克制的推近。
- 并行渲染:几个渲染进程同时渲染单镜头,最后按顺序无损拼接,绝不能按完成先后拼。
- 同步生成剪映草稿:成片之外,同步导出一份可编辑的剪映工程,方便你发布前换背景音乐、调字幕、剪节奏。
这一步没有 AI 模型,跑的是 FFmpeg 渲染引擎,它负责把一张张静图按时间轴做缩放推近,再拼成 H.264 格式的成片;剪映草稿由脚本按同一时间轴生成。模型管创意,渲染管把创意变成能发布的视频,两边各干各的。
第八步:交付验收,发布
成片前做最后一轮验收:剧本完整、每张图都有对应配音时间段、片头覆盖首句、正文无黑边无抖动、时长对得上、无超长静音。验收过了,这条视频就是成品。
验收由主控大模型逐项核对成片参数,再抽帧检查画面。发布建议:一条成品同步发抖音、B 站、小红书、视频号四个平台,同一素材成本几乎为零,收益面却翻了四倍。
结尾
人生副本系列的护城河不在画质,在流水线:选题评分制、第二人称剧本、一句一图、角色身份证、并行生产、固定片头,每一个环节都是可复制、可优化的标准动作。
把这套流程跑通,你一天能产出一条 8 分钟成片。



