eian-collage-broll (已开源):把口播文案变成拼贴 B-roll
如果你平时做口播视频,应该遇到过这种情况。
总觉得画面不丰富,全程就直接在说话,画面很干。
或者要讲的是一段流程、一个抽象概念。
你会想在中间插几秒别的画面,让这句话真正被看见。
这几秒画面,就是 B-roll。
它可以是一段动画,也可以是一个操作过程、一个场景,
或者一句话的视觉隐喻。
教程、知识分享、AI 内容和产品讲解类的视频,都很需要这种画面。
但做 B-roll,最让人头疼的地方不是生成图片,难得是生成图片之前的工作。
随便找一个图像模型,写一句 Prompt,几秒钟以后就能看到一张图。
但一篇完整口播写出来了之后,得先判断哪些句子值得插 B-roll,
还要想清楚这句话该直接解释,还是该用一个隐喻来讲。人物要不要出现?画面需要哪些物件?构图怎么安排?元素最后又该怎样动起来?。
如果这些靠自己想,自己做,一天可能也就过去了。
所以我把自己制作纸拼贴 B-roll 的流程,做成了一个 Skill:eian-collage-broll
一套由创作者主导的编辑风半调纸拼贴风格的B-roll 工作流:把定稿口播转译为鲜明的视觉隐喻,并发展成可进入运动制作的素材包。
先看效果:
Skill的工作是从一篇完整文案出发,第一步是帮助我挑出适合做 B-roll 的原文,然后为每一段设计视觉隐喻,确认构图和尾帧,再由确认过的尾帧倒推首帧,最后写好图生视频所需的动作提示词,并在项目结束时清理已经没有用的中间文件,最终交付给你一个视频生成素材包。
安装连接在最后面。
一、先从口播里找出值得做 B-roll 的句子
我刚开始做这个 Skill 时,想法很直接。
把整篇口播丢进去,让 AI 自动拆段,然后为每段做一张图。
后来发现问题很大!
一篇口播文案里,每个句子都有不同作用,有些句子只是推进语气,而有些补充前面的意思。还有一些文段,转成画面难形成一个清楚的关系。
这样的句子根本就不适合用来做b-roll视频
所以这个skill的第一步是候选提取,先完整理解整篇文案,然后找出文案中语义完整,适合用来做b-roll的段落。
当然这只是针对一篇完整的文章来说的,如果你给出的本来就是一个或者多个段落,Skill 可以直接进入下一步,不用任何多余的说明,skill会自己判断你给的是分好的段落或者是一篇完整文案。
只有一篇完整定稿口播被交进来时,Skill 才会开始找适合单独成立的段落原文,但这个过程skill不会偷偷改写你的文案。
二、把一句话变成画面里的关系
选出一段文案以后,skill也不会马上开始生成图片。
它会根据每个段落提取出贴切的视觉隐喻,确定画面中的具体组件,每个组件的运动关系、然后把主体、动作、主要视觉组、画面重心、留白、背景方向、配色和组装顺序,以及需不需要人物全部设计出来。
你可以上传一张自己的照片,skill会将照片一直保存,以后在需要人物组件的画面中,都会以你的照片作为基准,并在所有画面中保持人物一致性,当然你也可以不上传,这并不会影响skill的正常运转。
通过这一阶段,你可以通过看这些信息来确定是不是我想表达的东西。,以及是不是和原文吻合
如果不对,就直接提出来。这一阶段,有任何不满意,都可以直接修改。
重点说一下,留白和配色,skill里有个硬规定是所有的前景组件加起来不能超过画面的60%,这是为了防止画面太满太乱,也会导致观众抓不住重点。
我还在skill里内置里9种孟菲斯风格的配色组,每组含3种单色,每生成一张 B-roll,只从其中一组里选颜色。
同一个画面里的彩色卡纸组件,也只能在这一组三色体系里变化。
这样做最直接的好处就是:颜色不会乱、让画面更容易建立主次、统一、不单调。
等待确认之后,才进入图片生成阶段。
三、两次确认,分别解决两个问题
eian-collage-broll 里有两个 Gate。
Gate 1 处理创意判断。
这一段口播到底画什么,视觉隐喻是否准确,画面怎样组织,留白留在哪里,元素最后该怎样组装。
Gate 2 处理实际生成出来的结果。
Gate 1 通过以后,Skill 才会制作完成态尾帧。它会先检查候选图,再把候选画面整理成带编号的联系表展示出来。
但这仍不是终点,还需要等待确认,只有明确确认它以后,这张图才会成为正式的 last-frame.png。
这主要解决2个问题:
第一个是,一个想法本身很好,图片做出来以后却偏了。主体姿态不对,画面重心跑掉,留白被填满,纸片之间的关系也和原来的设想不一样。
另一种情况是:图片看着顺眼,放回口播里却没有说出那句话真正想表达的关系。
所以:
Gate 1 先确认画面应该讲什么。
Gate 2 再确认这个画面有没有做对。
当然在第二阶段,skill本身也会检查图片是不是按照Gate 1设计好的方案去生成的,而你只需要做最后确认。
四、先确定尾帧,再往回做首帧
在这个 Skill 生成图片的过程中,是先出尾帧(也就是成品视频的最后一个画面),
在去掉尾帧上的所有前景组件、阴影得到首帧
这极大的保证了视频生成模型在生成视频时的稳定性,
所以最终视频开场是一张空白的纸面。
然后人物、纸片、物件和组件按照已经确认好的顺序进入。
最后停在那张确认过的完成态尾帧里。
而观众看到的过程,也会更接近一张手工拼贴作品被一点点拼出来,而不是一张静态图做几次缩放、淡入和位移动画。
五、每段 B-roll 最后交付什么
尾帧确认以后,Skill 会继续完成剩下的素材。
每个 B-roll item 最后都有三个文件。
first-frame.png
它是视频的起点,由确认过的尾帧回退编辑而来,保留同一张纸面和同一套画布关系。
last-frame.png
它是创作者确认过的完成态拼贴构图,也是后续运动需要到达的终点。
video-prompt.txt
它会把元素的进入顺序、具体动作、完成构图和停留状态写清楚,交给下游图生视频模型使用。
也就是说skill 交付的是可进入运动制作的素材包。
视频的渲染发生在下游图生视频工具里。
这个分工让我更容易把工作做清楚。Skill 先把画面想明白、确认下来,再把运动需要的信息写完整。
视频模型接到的是一组已经准备好的首帧、尾帧和动作提示词,
所以你也可以把最终素材包交给你可以使用的任何一个视频模型。
六、项目做完以后,还要把桌子收好
我以前在用很多skill的时候被发现
skill运行完一次,除了交付给我最终的产品之外,还有一大堆根本用不上的中间文件
于是我总是重复告诉agent,帮我彻底删除掉中间文件
拿这个skill来说,如果项目只做一段 B-roll 时,文件管理还不算麻烦。
多次运行以后,目录很快会多出候选图、联系表、视觉方案、检查文件和各种生成过程里的中间产物。
这对于我这种有洁癖的人来说,不可接受!
所以我在 Skill 里加了一个项目级的收尾步骤。
Project Cleanup
它会等整个项目里所有需要制作的 B-roll 都完成,确认每个 item 的 first-frame.png、last-frame.png 和 video-prompt.txt 已经齐全,自动执行一次统一清理。
它只清理由 Skill 生成、归属明确、已经不再需要保留的中间文件。
最终交付会留下。项目状态会留下。长期保存的参考图会留下。
用户原始上传的文件也会留下。
如果某个文件的身份不够清楚,它也会先保留。
一个流程不仅要能开始、能执行、能交付。做完以后,它也得知道哪些东西该留下,哪些东西可以自己收走。
七、怎么开始用
如果你在用 Codex,可以把 Skill 安装到本机的 Skills 目录。
1 | git clone https://github.com/YIAN6557/eian-collage-broll.git ~/.codex/skills/eian-collage-broll |
地址:
https://github.com/YIAN6557/eian-collage-broll
安装完成后,新开一个 Codex 任务,或者重新加载当前环境。
然后给它一段已经定稿的口播。
1 | eian-collage-broll:<你的口播文案> |
也可以直接说。:用这段文稿做拼贴动画<你的口播文案>
完整口播会先经过候选提取。
你选出要做的连续原文以后,再进入视觉隐喻设计。
确认 Gate 1 的画面方案以后,Skill 才会生成尾帧。
确认 Gate 2 展示出来的候选尾帧以后,首帧和视频提示词会继续完成。
整个项目的 B-roll 都完成后,Project Cleanup 会统一处理已经不再需要的中间文件。
这套 Skill 很适合教程、知识口播、AI 内容、工作方法和产品讲解一类视频。
尤其适合需要把抽象内容变成明确视觉关系的段落。
如果你平时也常常在生成前卡住很久,反复想一段话要不要画、怎么画、画完以后怎样动,那这个skill会适合你,也可能带给你一些灵感,
如果你喜欢,欢迎给个star🌟
最后,本skill灵感来源于gbro-collage-broll,非常棒,有兴趣也可以多多支持噢!谢谢。




