AI 视频自动生产线:教你如何用Codex 接管图片路由、Midjourney 关键帧、生视频和 Hyper 剪辑
AI 视频工作流 · 实战拆解
这是我一个长期用的codex工作流分享,平时只要发布任务,基本上除了关键帧部分母版我需要确认,其他全程一键自动完成。
已经跑了两个月了,非常成熟的一套工作流,今天开源给大家看。
记住,做ai视频能真正省时间的,不是再找一个“更强”的模型,而是让脚本、人物资产、关键帧、视频生成和剪辑共享同一条时间线。
从需求到成片,五个环节共享同一套脚本、资产编号、时间线和质量标准。 01 人负责目标与审美判断02 先做图片路由分工03 Midjourney 锁定关键帧04 AI 视频只负责运动05 Hyper 统一剪辑与信息层
核心判断Midjourney 决定画面长什么样,视频模型决定画面怎样动,Hyper 决定观众最终怎样看懂它们。Codex 的价值,是把这三件事接成同一条生产线。
很多人说用 AI 做视频,实际流程还是手工作坊:先写几段提示词,去 Midjourney 抽图;再把图片丢进视频模型;最后打开剪辑软件,一段段对旁白、加字幕、补信息卡。
每个环节都有 AI,但真正费时间的部分没有消失。人物会变,场景会漂,提示词互相打架,生成的视频长短不一。到了剪辑阶段,还要重新理解一遍文案。
我现在的做法,是把关键帧、AI 视频和 HyperFrames 看成一个整体,让 Codex 管理从脚本到成片的全部中间状态。
01 · ROUTING FIRST先做好图片路由,不要一上来就写提示词
同样是“生成一张图”,实际可能是完全不同的任务:确认方向的快速预览、决定全片质感的审美母帧、保持人物连续的正式关键帧,或者带书名、Logo、价格和准确文案的发布画面。
如果不先区分任务,模型选择基本靠感觉。所以 Codex 接到需求后,第一步不是打开生图网站,而是把自然语言整理成一份结构化请求。
一张图该交给谁做,先看用途、连续性、精确文字和最终去向,而不是先看哪个模型更热门。 01 图片路由:先分工,再生成02 快速预览03 AI 视频素材04 连续关键帧05 确定性精修
真正被记录的,不只是提示词每次路由还会留下用途、风险、分辨率、允许变化、禁止项和人工确认阶段。这样后面失败时,Codex 知道该修哪一层,而不是重新猜一遍需求。
02 · MIDJOURNEY KEYFRAMES人物一致性,不是多写几遍“同一个人”
人物一致性最差的做法,是给每个镜头单独写一句“同一个女人”“同一个房间”。模型并不知道这个“同一个”具体指什么。
在这套流程里,Midjourney 的第一项任务不是逐镜抽图,而是先制作连续性母版。人物的年龄、脸部结构、发型、服装和体态,场景的门窗、道路、道具和空间关系,以及整片的色彩、光线和镜头焦段,都先在同一张参考板里建立。
先把版本说清楚当前 Midjourney 网页版默认是 V8.2。V8.x 保持人物和物体一致性的主入口,是 Edit Model Reference;V7 时代的 Character Reference 和 Omni Reference,不要继续当成 V8 的默认操作。
第一步:先清空会偷偷改变结果的旧设置
01 打开 Imagine 输入栏右侧的 Settings,确认整组镜头使用同一个模型版本:V8.2。不要在同一组镜头中途切换版本。02 先固定画幅,例如全片统一 16:9;决定使用 Raw 就整组保持 Raw,不要某几张开、某几张关。Raw 的作用是减少 Midjourney 自己加戏,让画面更听提示词。03 检查 Personalization、Moodboard、Style Reference、Stylize 和速度模式。不是本项目明确要用的就先关闭;要用的则把同一设置固定到全部镜头。04 在 Organize 里为这个项目单独建文件夹。后续母版、候选、通过帧和废片都放在同一处,避免误拿旧项目素材。
第二步:不要只做一张人物图,要做四类母版资产
01 人物母版:同一人物的正面、四分之三侧面、侧面和全身,发型、脸部结构、体态、衣服颜色与鞋子必须看清。02 场景母版:用广角或中广角拍清门、窗、道路、桌椅和主要道具的空间关系;场景不是一团氛围词,而是一张可核对的地图。03 道具母版:会反复出现的书、包、椅子、杯子单独做清晰图。精确书名、Logo 和文字不交给 Midjourney,留到后期。04 风格母版:只负责纸张质感、线条、色彩、光线和镜头气质,不负责人物身份。人物参考和风格参考必须分开。
为什么要分开Style Reference 只应该管画面气质;Edit Model Reference 才承担人物、物体和场景的连续性。把一张图同时当人物、场景、构图和风格,模型会把这些职责混在一起。
第三步:在 Midjourney Web 里这样挂参考图
01 点击 Imagine 输入栏左侧的图片按钮,把批准的人物母版、场景母版和关键道具上传到图片库。02 把人物、场景、道具拖进 Edit Model Reference 区域。V8 Edit Model 最多可以带四张参考图,所以每张图只承担一个明确角色。03 把批准的风格图单独拖进 Style Reference 区域,并点击锁定图标,让它固定在后续提示词上。风格图不要再塞回人物参考区。04 如果要使用 Style Weight,就先在母版阶段找出一个可用值,然后整组镜头保持不变。不要边生成边随手改强度。
📷人物、场景、道具和风格各走各的参考通道;镜头 01—03 只改动作与机位,局部失败回到 Editor,而不是整张重抽。 01 人物、场景、道具进入 Edit Model Reference02 风格母版单独进入 Style Reference03 镜头 01—03 只改动作与机位04 局部错误回到 Editor 修复
第四步:先做 01 号镜头,再用它派生后面的镜头
Codex 实际写的提示词骨架同一人物的固定外貌与服装 + 同一场景的固定空间关系 + 本镜头唯一动作 + 本镜头机位与景别 + 光线和时间 + 禁止变化。
例如 01 号镜头不是写“同一个年轻人在旧房子前”。Codex 会把它展开成:黑色微卷短发、窄脸、蓝色针织上衣、深灰长裤、黄色双肩包;站在同一栋海边石屋的绿色木门外三步;中广角、背后三分之二机位;右手自然下垂,身体面向门;不换衣服、不增加人物、不改变门窗位置。
01 号镜头通过后,点击图片的 Use,把它的提示词和参考图重新带回 Imagine 输入栏。生成 02 号镜头时,只改“右手抬起准备敲门”和镜头景别;人物描述、场景描述、画幅、版本、Raw、风格参考全部不动。生成 03 号镜头时,也只改变坐姿与机位。
小改动不要重新抽整张如果只是手的位置、门把手或局部表情不对,打开 Editor,只擦除需要变化的区域再提交。未被擦除、仍然可见的部分会被保留;重新生成整张图,等于主动放弃已经获得的一致性。
先把人物、场景和道具变成可复用资产,再让每个镜头只改变动作、机位和景别。 01 先建立连续性母版02 人物、场景、道具分开登记03 同一资产绑定全部镜头04 镜头 0105 镜头 0206 镜头 03
生成前:先建立世界
01 锁定文案与旁白时间02 建立人物 / 场景母版03 分配资产 ID 与镜头范围
生成中:只改变当前镜头
01 继承同一份参考资产02 只改动作、机位、景别03 固定画幅、色彩和禁止项
生成后:整组一起审查
01 检查脸、服装与空间漂移02 联系表统一比较03 批准图片写入哈希锁
第五步:不要迷信 Seed,用联系表做最终一致性审查
Seed 适合做提示词 A/B 测试:锁住随机起点,观察你只改一个词以后发生了什么。它不能保存人物、风格或场景,也不应该被当成一致性资产。真正有用的是同一组参考图、同一套固定设置、只改一个镜头变量,以及生成后的整组联系表。
01 脸漂了:换成更清楚、更接近当前机位的人物母版,不要继续叠加形容词。02 衣服漂了:补全身参考,同时把颜色、材质和款式写进每一条镜头提示词。03 场景漂了:补一张能看清空间关系的场景广角图,并把门窗、道路和道具位置写成固定句。04 风格压过人物:降低风格影响,或者换一张更少人物信息的纯风格图;不要让风格图兼任身份图。05 只坏了一个局部:进入 Editor 做遮罩修改;只有整张构图都错了才重新生成。
真正的通过标准不是单张看起来漂亮,而是六张关键帧放在一起时,观众仍然相信这是同一个人、同一个地方、同一组道具,只是动作和机位在变化。
一致性不是一句提示词,而是一条资产链母版 → 资产登记 → 镜头绑定 → 联系表审查 → 哈希锁定
一次真实制作里,第一轮候选把老年女性全部画成了男性。Codex 没有继续重复同一条提示词,而是记录失败原因,缩短描述,把身份要求改成更直接的“SAME ELDERLY WOMAN”,同时排除男性特征,再重新生成。
合格母版被批准后,才会升级为正式资产。后面每一张关键帧都会携带同一份人物和场景绑定;通过的图片排成联系表统一查看,最后被标记为 production master。
03 · KEYFRAME TO VIDEOCodex 怎样写提示词、生成视频,并自动处理失败
关键帧通过以后,Codex 会根据旁白音频生成完整时间线。每个镜头不只有开始和结束时间,还会写清楚观众必须看懂什么、画面只能发生哪一个主动作、哪些运动允许出现,以及什么变化属于人物或场景漂移。
视频模型不负责重新设计画面,只在锁定的关键帧上执行一个清楚动作。 01 动作提示词只写可观察变化02 已批准关键帧03 允许的动作04 同一人物的连续运动05 通过06 可修07 重做
MOTION PROMPT · 抽象情绪,要拆成四个可观察部分 01 起始状态:人物在哪里,手脚和物体处于什么状态02 一个主动作:转身、放手、推椅子或走三步03 可见结果:手松开、肩膀落下、坐到身边04 禁止漂移:不说话、不换脸、不加新动作 不要写“两个人温暖地坐在一起。” 改成“老人稍微转向对方并露出克制的笑;晚辈握紧的手慢慢松开,肩膀随之落下;不要说话,不做口型。”
接下来才做视频路由。Midjourney 负责审美母帧,但不必负责运动。Codex 会根据动作、物理交互、连续性和编辑需求,在不同视频路线之间重新判断。审美作者和运动供应商,是两次不同的选择。
正式提交时,上传的是经过批准、带有哈希记录的关键帧。生成完成后,Codex 会下载文件,记录尺寸和时长,检查黑屏、卡顿、人物崩坏、核心动作做反,以及意外对白和可见标识。
不是所有瑕疵都值得重新生成
一次真实时间线90 秒 → 15 镜 → 13 段原生 AI 视频 → 约 90% 动态覆盖
04 · HYPER EDITING最后用 Hyper,把素材变成一条真正的视频
素材生成完,并不等于视频完成。我用 HyperFrames,也就是 Hyper,完成最后的程序化剪辑。Codex 会根据旁白时间,把视频、字幕、环境声、书封和信息层装进同一条可重复渲染的时间线。
画面服从旁白时钟,生成模型负责场景和动作,Hyper 负责准确文字、节奏、信息层与最终输出。 01 视频轨02 旁白与环境声03 字幕轨04 信息层05 手机安全区复检06 精确文字只在后期加入07 1080 × 1920 成片
四层内容,共用一条旁白时间线
字幕直接来自通过审核的文案,不再重新听写一遍。真实书封、书名、引文和其他精确信息,也全部在这一层加入。生成模型负责人物、空间和动作;Hyper 负责准确文字和版式。
信息块也不是看到画面有空就加一张黑卡。Codex 会先判断观众在哪个位置需要额外解释:是因果关系、时间跳跃、人物关系,还是多条行动线汇合。只有画面和旁白无法立刻说清楚时,才增加信息层。
可以复用的是解释原则,不是黑色圆角卡片历史题材可以从竹简、印章和案卷里推导视觉语言;现代故事可以使用稿纸页边、时间线和人物关系轨道。信息结构相同,视觉表达仍然要从内容里重新长出来。
END · THE REAL AUTOMATION这套流程的核心,不是“一键生成”
这套方法仍然保留几个明确的人工门槛:文案要确认,连续性母版要确认,整组关键帧要确认,最终预览也要确认。
因为 AI 可以自动执行大量工作,但审美方向、人物是否正确、故事有没有被讲歪,暂时还不适合完全交给模型自己批准。
所以我更愿意把 Codex 理解成一个 AI 视频制片系统。它管理的不是某一次生成,而是脚本、资产、提示词、模型、失败记录、时间线和最终交付之间的关系。
最后一句当所有环节开始共享同一套脚本、资产编号、时间线和质量标准,AI 视频才从“抽几段素材”,变成可以持续复用的生产流程。
05 · START HERE如果你也想照着做,先跑通这个最小版本
先别急着把十几个模型和工具一次接完。拿一篇已经定稿的 60—90 秒文案,目标只设一个:同一份输入能够再跑一次,过程里用过什么资产、哪里失败、最后用了哪段素材,都能查到。
这条路线故意保留两样东西:人工确认门和可复跑记录。前者防止 AI 把错误一路放大,后者让下一次生产不必从零开始。 01 建项目模板02 写三份配置03 Codex 拆镜头04 图片路由05 关键帧确认06 生视频并质检07 Hyper 渲染成片08 人工确认门09 记录可复跑
第一步:把项目目录固定下来
每条视频都用同一套目录:script 放定稿文案,assets 放人物、场景、道具和真实素材,keyframes 放批准后的关键帧,videos 放逐镜视频,hyper 放剪辑工程,reports 放路由、质检和失败记录。目录一旦固定,Codex 才知道去哪里读、往哪里写。
第二步:只写三份长期配置
01 PROJECT_PROFILE:写清时长、画幅、分辨率、可用模型和人工确认点。02 STYLE_BIBLE:写清人物、场景、色彩、镜头语言,以及绝对不能出现的东西。03 ASSET_MANIFEST:给每个参考资产登记编号、路径、哈希和批准状态。
这三份文件相当于项目的共同记忆。以后换文案,可以换镜头,但不必重新解释人物是谁、画面应该长什么样、哪些素材已经通过。
第三步:把执行顺序写进 Codex 的总任务指令
读取当前项目的文案、配置和资产清单。 先检查缺失项,不完整就停止并列出。 完整后生成镜头表、时间线和图片路由。 审美母帧交给 Midjourney,精确文字留给确定性后期。 关键帧通过人工确认后,再生成逐镜视频。 对结果执行 PASS / REPAIR / RETRY 质检。 把通过素材写入 Hyper 时间线,加入字幕和信息层,渲染成片。 每一步保存输入、输出、失败原因和文件路径;遇到人工门槛必须停止等待确认。
第四步:先跑一条,再谈全自动
01 让 Codex 先拆镜头和计算时间线,不完整就补材料,不生成。02 按图片职责分流:预览、审美母帧、连续关键帧和精确后期分开处理。03 先确认人物、场景、道具和风格母版,再批量做正式关键帧。04 逐镜生成视频,并按通过、可修、重做三类处理;可修问题优先后期解决。05 把通过素材交给 Hyper,以旁白为时钟加入字幕、信息层和精确文字。06 渲染后检查手机安全区、字幕、书封、引文、黑屏、卡顿和声音,再存档整次运行记录。
真正有用的自动化不是把人彻底拿掉,而是把重复执行交给 AI,把人物、审美、事实和最终发布这些关键判断留给人。第一条完整跑通以后,再把成功的配置复制到下一条视频,这条生产线才会越来越快。
CODEX × KEYFRAMES × AI VIDEO × HYPER
CODEX × KEYFRAMES × 人工智能视频 × 超高清







