老王之前用 Codex 做过 AI 动画视频,效果非常好。接了 2 个商单,收入 2100,每天还稳定加 20 多个好友。

但成本是真高。得先用别的视频模型把画面生出来,再用 codex 一块块合并,非常麻烦。

最近豆包工作版上线了,还有免费 30 天会员,这活儿一下简单了啊。只要给豆包工作 Agent一段文案,不需要来回切换客户端,它就能自动生成完整视频,中间确认几步就行,工作量大大减少。

更牛的是,我在电脑上制作的素材和视频,直接存到豆包云端电脑,手机上可以实时衔接进度,记录都是同步的,太太方便了。

整体制作思路

整个流程就五步,我拆开讲。

  1. 先把内容定好。写逐字稿,再配音,提取每句话的时间码。稿子得改到能直接配音,专有名词、数字、引导语全改写完全正确,后面画面才不会自己瞎编。==这条时间轴是基准,一步都不能跑偏的。==
  2. 拆镜头,锁画风。把逐字稿和时间码丢给豆包工作 Agent,拿回按播放顺序排好的镜头表。接着定 IP 小人和画风,豆包工作输出一份画风描述,后面所有提示词都引用这一份,画风就不会乱的。
  3. 出画面。豆包工作 Agent 写每镜尾帧提示词,再按提示词出图。画内文字这一步就写好,一镜只能一个 ip 小人,卡片、屏幕、标签不能空着。逐镜看首尾帧和提示词,确认过了再往下进行。
  4. 生成视频,出剪辑方案。首尾帧、提示词、真实秒数给豆包工作 Agent,出静音视频片段。再把所有片段和配音一起给豆包工作 Agent,生成剪辑方案,字幕对不对、BGM 会不会盖人声,看一遍再出终片。
  5. 剪映合成。按方案入轨,加标题、字幕、配音、BGM,生成剪映草稿方便手动修改,再导出 MP4,然后再出横版竖版两张封面。

工具清单

写稿、拆镜、生图、图生视频、出剪辑方案,豆包工作都收在一个入口里,一气呵成。不用来回切工具,真心省事太多了。

写稿、生图、生视频、剪辑方案都在豆包工作里,剪映只管最后那步合成。

实操流程

这套 AI 动画视频制作流程,全程就在豆包工作 Agent的云电脑进行,在豆包工作客户端,工作任务选择云电脑,项目自己新建一个,任意命名即可。

为了方便教学,我把一次性流程拆开讲,大家顺着老王的流程,能直接做出自己风格的 AI 动画视频了。

写逐字稿

逐字稿可以自己提前写好,也可以让豆包工作按你要做的主题生成。给个建议,可以先找几条同题材爆款视频,把文案提取出来,改到能直接配音。

稿子定好后,直接给豆包工作已经生成好的逐字稿,附上一段简单提示词,让它接着走后面的步骤:

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
下面是我定好的口播逐字稿,请按 IP 讲解视频制作流程继续:拆镜头表
逐字稿如下:豆包工作Agent用上这 10 个 skill,找工具、做页面、出文档、控电脑、发小红书,一键完成。

第一个 Find Skills。
不知道装啥就先搜。按场景对比,点一下就装上了,不用一个个翻文档试。

第二个 dashippt。
给个主题,吐出能改的 HTML 幻灯片。浏览器里直接预览,改字换版式,调整格式,是我见过最漂亮的 pptskill

第三个 Frontend Design。
AI 写前端爱搞蓝紫渐变、默认字体那套。挂上这个skill,做网页、小工具、数据看板,顺眼很多。

第四个,文档四件套,
Word Excel PDF PPT 直接读写改。不用先写个 Python 脚本凑合,出来的东西能拿去交付。

第五个 Web Access。
带着本地 Chrome 的登录状态去读网页。小红书、B站、公众号、飞书,搜索 API 抓不到的那种页面,它去翻。

第六个 dbskill。
不知道下一步干啥,先问它。根据处境自动路由到对的 Skill,诊断拆解推进,不用自己翻目录找工具。

第七个 Computer Use。
前面几个管浏览器,这个管桌面。本地软件能打开,系统里的按钮能点。真要动你电脑的时候用它。

第八个 human-writing。
长文先过一遍这个。AI 那套排比、升华、套话删得狠,出来的字冷静,写深度稿刚好。

第九个其实还是 Skill Creator,换个用法。
Skill 规范不会写没关系。跟 Agent 描述一遍流程,它帮你把文件建出来。

第十个 doubao-xhs-skills。
小红书冷启动按真实顺序串了十个技能,从变现倒推到低粉爆款。流程不用自己拼。

评论区 666,看这个文档学习安装

豆包会拆解分镜,每一个分镜会都有多个字段,比如 opening 开头、chapter_slate 报幕、body 正文、ending 结尾。语速按照 1s 中 7 个字算,也可以

配音,提时间码

TTS 出音频,提取每句话的起止时间。我用的是豆包语音,免费有 2w 字的额度,提前复刻了自己的音色,这样比较有自己的 IP 特色。

右上角复制自己的 key,自己截取一下下面的截图,豆包工作就会自动调用语音合成模型,生成 TTS 语音。

如果你第一次用,可以用我的提示词,后续可以把 TTS 固定到自己的 skill 里。

1
2
基于已经生成的分镜,调用豆包语音模型api,调用接口和key我放到了截图
我的音色id是:xxxxx,你开始生成TTS语音

最后,豆包工作 agent 生成了完整的配音镜头和语音,他的思考过程还是比较深度的,基本一次指令,就能达到我的需求,非常满意。

不过,因为我给的逐字稿带空格,导致生成的语音有停顿感,直接让豆包修改即可,X上无法听语音,后面直接看成品吧。

锁 IP 形象

IP 小人得先定下来,不能指望模型每镜自己发挥。你得自己准备一张想要的形象参考图,也可以让 AI 帮你生成。

比如下面这张图,老王拿自己的照片,配上网上找的动漫参考图,让豆包工作生成了一套多角度的 IP 设定图。

定稿后放到 skill 的参考形象文件夹里,后面每次出画面,提示词都必须严格引用这张图和对应描述,IP 形象才会锁死,不会出现每个分镜小人长得不一样的情况。

找到参考图后,可以参考下面的提示词,发给豆包

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
请根据我上传的两张参考图,生成一张 IP 角色多视图设定图(character turnaround sheet),用于后续短视频分镜生图时严格锁定同一人物形象。

【参考图说明】
- 图1:我的真人照片,提取脸型、五官、发型、气质
- 图2:动漫/插画风格参考,提取画风、线条、配色、头身比

【输出要求】
1. 一张图内横向排列 5 个视角,从左到右:正面、左三分之四、左侧面、右三分之四、右侧面
2. 5 个视角必须是同一个人物,脸型、发型、服装、配色完全一致
3. 角色设定:成年男性,Q版三头身,亲和理性气质
4. 服装固定:【在这里写你的固定服装,如:森林绿连帽卫衣 + 深灰工装裤 + 白鞋】
5. 背景:纯白或温白底 #FBF8F0,无场景、无道具、无文字、无水印
6. 每个视角全身站立,姿态自然,便于后续做分镜参考

【禁止项】
- 不要换脸、不要写实成人比例
- 不要每个视角长得不一样
- 不要加第二个人物、宠物、复杂背景
- 不要霓虹色、暗黑科技风

生成后,请同时输出一段 100 字以内的 IP 身份锁定描述(发型、脸型、肤色、服装、头身比),我后续每镜生图都会引用这张图和这段描述。

锁画风

画风需要单独锁定,跟 IP 锁定的方法类似,要单独照参考图。

找一张温白底的手绘风格参考图,再让豆包工作输出一份画风描述,色板、线条、人物比例、字体样式的提示词。

具体的样式随你喜欢选,可以是贴纸,马赛克,VOX 风格等等。

我选择的是一个偏暖黄色版本,卡通风格的物体。

老王一般是直接找到合适的图截图,让 ai 读取画面风格,元素,每个物体大小,人物大小比例等等,这样生成的风格图会比较贴近自己需求的。

你发给豆包一张参考图,然后可以参考我这个提示词,进行复刻。

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
我上传了一张画风参考图。请完整分析这张图里的视觉风格,并把它锁定为本项目后续所有分镜画面的唯一画风标准。

你的任务不是复述图片内容,也不是复制图里的具体场景,而是提取并固定以下风格要素:

1. 背景质感:纸张颜色、留白比例、是否有纸纹或暖色底
2. 线条风格:粗细、颜色、是否手绘抖动、是否铅笔感或墨线感
3. 上色方式:平涂、淡水彩、剪纸拼贴、低饱和块面或其他方式
4. 色彩气质:主色、辅色、强调色、整体冷暖、是否柔和不扎眼
5. 物件画法:机器、卡片、纸张、抽屉、箭头、标签、连接线如何绘制
6. 排版气质:信息图感、讲解感、留白方式、视觉重心组织方式
7. 文字呈现:文字是否写在纸签、铭牌、模块上,字号气质,是否原生融入画面

请输出两部分结果:

第一部分:画风锁定描述
用一段完整文字,明确写出本项目后续必须遵守的画风规则,包括背景、线条、上色、配色、物件质感、排版气质、文字规则、禁止项。这段描述将作为后续每镜生图的固定前缀,不得每次改动。

第二部分:风格样板确认
根据你从我上传的参考图中提取出的风格,生成一张新的 16:9 横屏「画风确认图」。
这张图只用于确认你已经正确理解并锁定了风格,不要求复刻原图的具体场景。
新图要求:
- 完全沿用参考图的画风
- 不出现任何人物、角色、头像、小人、剪影
- 画面包含一个漏斗、一个文件柜、一条主路径箭头、两张纸签标签
- 纸签文字分别写「选题」「归档」
- 背景、线条、配色、纸感、物件画法必须与参考图一致
- 整体温暖、柔和、不扎眼,适合知识讲解类短视频
- 底部预留字幕安全区,不放物件

强制规则:
- 只复制画风,不复制参考图里的具体人物、具体场景、水印、账号元素
- 若参考图里有人物,只学习线条、配色、纸感、物件语言,不得继承人物脸、服装、宠物
- 后续所有分镜生图,都必须先引用这张画风确认图,再引用这段画风锁定描述
- 没有附画风确认图和画风锁定描述的画面,一律视为风格未锁定,不得进入正式出图

现在开始分析我上传的参考图,并输出画风锁定描述和画风确认图。

写提示词和生图

我目前做的 AI 视频类型为清单型,比如列举多个 skill,多个插件,多个 github 等等。每种类型的视频需要生成的画面有所不同,每种类型都需要单独设定一下。

不过,大家懂了原理之后,可以随意制作不同类型的视频的,百变不离其宗的。

下面是豆包工作 Agent 基于前面给的逐字稿分镜,生成的画面。而且,必须要画面和逐字稿匹配,这样才不会有割裂感。

为了万无一失,最后让豆包工作 Agent 生成一张总览全图,包装顺序是对的。

生图的提示词可以参考这一套,发给豆包即可。

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
36
37
38
39
横屏 16:9、1920×1080 暖白纸底 #FBF8F0 的 Q 版手绘知识插图。先画一个完整物理场景,不得变成独立栏目、卡片或立牌。

【画风锁定】
严格参考我上传的画风参考图:暖炭灰略抖细线、低饱和淡水彩、保留纸纹、暖橙强调、青绿路径线。不得继承画风参考图里的人物。

【IP 锁定】
严格参考我上传的 IP 身份参考图:成年男性、黑色上梳短发、圆润 Q 版脸、大棕色眼睛、暖黄棕浅麦肤色、森林绿连帽卫衣、深灰工装束脚裤、白色低帮运动鞋、约三头身。全图只允许 1 个 IP 小人。

【本镜口播原文】
不知道装啥就先搜。按场景对比,点一下就装上了,不用一个个翻文档试。

【语义核心】
Find Skills 按场景对比后一键安装,不用翻文档逐个试。

【视觉隐喻】
一条共享台面的手绘处理工作台:搜索入口 → 场景对比 → 一键安装 → 免翻文档。

【主语义组】
搜索入口:搜索框、场景标签、问号泡
场景对比:对比尺、两列卡、勾选标记
一键安装:安装钮、下载箭、完成勾
免翻文档:文档堆、关闭叉、捷径线

【人物动作】
IP 小人站在操作位,右手指向并实际接触「一键安装」按钮,头、身体、视线同向。

【画内文字】
搜索、对比、安装、免翻文档

【构图】
页面角色:process
层级模式:sequential-flow
阅读路径:左到右单一路径
人物高度:画面 30% 到 36%
主物件占画面 25% 到 45%
底部 y=960 到 1079 纯留白字幕安全区

【禁止】
第二人物、宠物、霓虹色、蓝紫渐变、暗黑背景、悬浮 UI、空卡片、空屏幕、写实 3D、厚重阴影、水印、把整句口播写进画面

图生视频

接下来,基于生成首尾帧、提示词、真实秒数给豆包工作,出静音视频片段,按标注的秒数生成,配音等剪辑阶段再加。

画面定稿后,才进入图生视频。这一步只出静音画面,口播、BGM、音效都留到后面剪辑阶段再加。生成部分视频质感还是很不错了,

每镜要准备四样东西:

  • 首帧图:本镜起始画面,就是前面确认过的尾帧候选图
  • 尾帧图:本镜结束画面,动作落点要和首帧是同一套构图,只是手势、视线、表情有变化
  • 视频提示词:写清楚人物怎么动、物件怎么变、镜头是否固定
  • 真实秒数:按 TTS 时间码算,不是随便填 8 秒。单镜超过 8 秒就按语义拆开,不压语速

有几个硬规则:

  • 必须选静音视频模式,不要让它顺带生成配音
  • 镜头锁定,不要推拉摇移把标题带、画内文字、字幕安全区挤掉
  • IP 形象不能变:绿卫衣男、三头身、同一套脸和衣服
  • 人物默认闭嘴稳定,口播是画外音,不做口型
  • 每镜只做一个主动作,动作幅度克制,结尾至少稳住 1 秒
  • 画内已经写好的文字、标签、面板内容不能变形、不能遮挡、不能乱改

提示词参考下面的,把全部镜头的首尾帧、时长、口播原文一起给豆包工作 Agent:

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
35
前面所有分镜尾帧已经确认通过。请按播放顺序,为每一镜生成静音视频片段。

【输入材料】
- 每镜首帧图
- 每镜尾帧图
- 每镜口播原文
- 每镜真实秒数(来自 TTS 时间码,保留两位小数)
- 已锁定的 IP 身份参考图
- 已锁定的画风参考图

【生成规则】
1. 只生成静音画面,不生成配音、旁白、音乐、音效
2. 每镜按标注的真实秒数生成,不得默认填 8 秒
3. 单镜超过 8 秒时,必须先按语义拆镜,再分别生成
4. chapter_slate 报幕页不生成视频,跳过
5. 镜头锁定,禁止推拉摇移、禁止裁脸、裁手、裁主物件
6. 人物身份必须与 IP 参考图一致,禁止换脸、换装、第二人物
7. 人物默认嘴唇闭合,不做口型
8. 保留画内已有文字和标签,禁止变形、遮挡、改写
9. 底部字幕安全区不能被动作侵入
10. 结尾至少稳定保持 1 秒,方便后面剪辑衔接

【每镜输出格式】
shot_id:
真实秒数:
首帧:
尾帧:
视频提示词:
生成结果:

【镜头清单】
(这里粘贴你已经确认过的分镜表,包含 shot_id、shot_type、source_span、duration_seconds、首尾帧路径)

现在开始按顺序生成全部静音视频片段。每生成一镜,先输出该镜视频提示词,再出视频,我确认后再继续下一镜。
全部静音片段生成完后,先逐镜看一遍,人物有没有变脸、动作有没有穿模、秒数对不对、画内文字有没有被挡住。没问题了,再进入剪辑方案。下面是生成案例视频,仅作参考。

出剪辑方案

全部视频片段和配音给豆包工作 Agent,豆包自己计算入轨顺序、每镜顶部标题、字幕断句、BGM 压低区间、音效打点、封面文案等。

字幕准不准,BGM 会不会盖人声,看一遍再出完整视频。

老王一般会一次性把这些材料丢过去,豆包工作返回的剪辑方案,至少要讲清楚六件事。

第一是入轨顺序,每段视频在时间线上从哪秒开始、到哪秒结束。

第二是页面标题,opening、body、ending 每镜顶部写什么字、什么时候出现。

第三是字幕断句,按 TTS 时间码切句。

第四是 BGM 压低,有人声的时候背景音乐要降 8 到 12 分贝。

第五是音效打点,章节切换、关键点击、完成反馈这几类语义点各打一次,整片不能太多。

可以发这段剪辑方案提示词:

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
19
20
21
22
23
24
25
26
27
28
29
30
31
32
33
34
前面所有静音视频片段、完整配音、逐句时间码、锁定逐字稿和分镜表都已经准备好。请输出一份完整剪辑方案,供后续剪映合成直接使用。

【输入材料】
- 全部静音视频片段(按 shot_id 排序)
- 完整配音音频
- 逐句 TTS 时间码
- 锁定逐字稿
- 分镜表(shot_id、shot_type、source_span、duration_seconds)
- 报幕页清单(chapter_slate_title、duration_seconds)
- 已确认页面标题和封面文案

【剪辑规则】
1. 以配音为主时间轴,视频片段按 TTS 时间码对齐入轨
2. 输出每段视频在时间线上的 start_seconds 和 end_seconds
3. opening、body、ending 每镜补一个页面顶部标题及出现时段
4. chapter_slate 只保留居中报幕大字,不叠加页面顶部标题
5. 字幕按 TTS 时间码断句,删除标点,最多两行,粗体显示
6. 报幕期间可抑制底部字幕,避免和报幕文字重复
7. BGM 从 0 秒铺到成片结束,人声区间做 ducking,降低 8 到 12 分贝
8. 音效只在关键语义点打点,整片 6 到 8 个,章节切换、关键点击、完成反馈三类即可
9. 视频原声默认静音,不与 TTS、BGM 竞争
10. 输出横版封面文案和竖版封面文案,竖版单独写,不从横版硬裁

【输出格式】
1. 时间线总览(总时长、镜头数、轨道结构)
2. clip_assignments 列表(shot_id、入轨起止、是否静态保持、是否静音)
3. page_titles 列表(shot_id、标题文字、出现时段)
4. subtitles 列表(开始时间、结束时间、字幕文本)
5. bgm_plan(曲目、起止、淡入淡出、ducking 区间)
6. sfx_plan(时间点、事件类型、用途说明)
7. cover_copy(横版标题、横版副标题、竖版标题、竖版副标题)
8. 二次审核清单(字幕是否顺、BGM 是否盖人声、报幕和字幕是否冲突)

先输出剪辑方案,不要直接导出成片。我确认方案后,再进入剪映合成。

剪映合成

剪辑方案确认后,最后一步就是进剪映落地。老王一般还是让豆包工作按方案自动入轨,自己只做抽查,我只做最终检查。

按顺序做这几件事:

先把静音视频片段按时间线摆好,再铺配音,字幕跟着 TTS 时间码上,页面标题和报幕大字单独一层,BGM 铺底,关键位置补音效,最后导出 1920×1080 的 MP4。

导出前快速看一遍开头、报幕、字幕最密的一段、镜头交界和结尾,确认没黑帧、没盖人声、没字幕撞标题。

剪映草稿一定要留着,后面改字幕、改 BGM 音量、换封面,都从草稿改,别只改最终 MP4。

剪映合成提示词:

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
剪辑方案已经确认。请按方案生成剪映工程,并完成最终合成导出。

【执行要求】
1. 按 clip_assignments 顺序入轨全部静音视频片段
2. 以配音为主时间轴对齐画面,不拉伸音频
3. 按 page_titles 添加每镜顶部标题
4. 按 subtitles 添加底部字幕,粗体,最多两行,去掉标点
5. 报幕页只保留居中大字,报幕期间抑制底部字幕
6. 按 bgm_plan 添加背景音乐,人声区间执行 ducking
7. 按 sfx_plan 在关键语义点补音效,整片保持稀疏
8. 视频原声保持静音
9. 导出 1920×1080 MP4
10. 同时输出横版封面 1920×1080 和竖版封面 1080×1440,竖版单独构图
11. 保留剪映草稿,方便后续修改

导出后给我:成片预览、草稿路径、封面图,并说明字幕、BGM、报幕三项是否通过检查。

最后,我们看一下部分成片,水印可以搞个贴纸不影响使用。

结尾

AI 生成动画视频对那些不想露脸的人来说,简直是福利。不用恐惧镜头,就能涨粉拿商单赚钱,一举多得啊。

恰好豆包工作 Agent全新升级,下载电脑版豆包工作,就能体验领先的 AI 办公能力,写文案,生图,生视频一把梭搞定,并且手机电脑能够互通,协作非常方便。

如果你学会了,记得回来交个作业给我看。