今天给大家分享下,我做 AI 自媒体知识视频的一些经验和技巧。

我平时做一条 AI 知识视频,成片一般只有几分钟,但前面要做的事情其实不少。选题、查资料、写稿、做演示页面、录屏,最后再把这些东西剪到一起。

我之前做过一期《为什么 AI 越用越蠢》,为了讲清楚上下文窗口是怎么回事,我把整期内容拆成了 11 个演示页面。

里面最麻烦的,反而是看起来最简单的几页动画:6 个格子怎么填满,第 7 条消息怎么把前面的内容挤出去,都得跟口播一一对上。

这篇我就把平时做知识视频的流程拆开讲讲,也拿其中最费时间的一小段做了次测试,看看现在的 AI 到底能不能帮我把这部分工作接过去。

这是我从原视频里抽出来的 33.8 秒机制段。它不是一条完整节目,而是一个单独拿出来也能看懂的知识单元。

1️⃣ 我平时怎么做一条 AI 知识视频

我做 AI 自媒体,平时做一条知识视频,大致会走完这些环节:

资料查证和选题方向 → 阿Lin腔口播稿 → PPT / HTML 演示画面 → 真人口播录屏 → 操作片段 → 后期剪辑

选题阶段,我会先确认这个东西值不值得讲,有没有新的信息,以及普通人看完能不能真的用上。

写稿也不是把资料直接交给 AI 改写。

事实要先查清楚。专业词要翻译成人话。稿子写完以后,还得自己念一遍,哪里拗口就继续改。

到了画面,我通常会把抽象概念拆成 PPT 或 HTML 页面。屏幕负责展示结构、数据和对比,我负责把其中的因果关系讲清楚。

如果涉及网页或软件操作,再单独录一段真实操作。最后把真人口播、演示页面和操作片段放进剪辑软件里组合。

2️⃣ 写稿已经很快了,真正麻烦的是把知识画出来

知识视频和普通素材混剪不太一样。

讲一个产品,可以放界面和操作。

讲一个抽象概念,画面就没那么好找了。

比如我之前做过一期视频,题目叫《为什么 AI 越用越蠢》。

这期讲的不是某个具体软件,也没有现成界面可以直接录。它讲的是上下文窗口、历史消息被挤出、重要要求被噪音淹没。

这些概念没法直接录出来,只能自己设计画面。

为了让普通人听懂,我最后把整期内容拆成了 11 个演示页面。

其中最关键的三页,是这样设计的:

  1. 用 6 个格子表示 AI 一次能看到的内容
  2. 第 7 条消息进来,把最早的信息挤出去或压缩
  3. 最早的「请全程用中文回答」消失,AI 开始冒出英文

我当时就是用这三页,来解释上下文窗口是怎么被填满的。

这里的「6 个格子」只是个比喻,不是说 AI 真的只有 6 个格子。

它想说明的是:对话越来越长以后,AI 能看到的历史可能不再完整。你最早交代过的要求,也可能慢慢离开它当前能看到的范围。

这类画面最费时间。

因为它既要动,还得讲对。格子什么时候填满,第 7 条怎么进入,最早的要求怎么消失,都要跟口播一一对应。

于是我想试一个更具体的问题:

如果我已经有查证过的口播稿和画面逻辑,AI 能不能直接把最难做的这一段动画做出来?

3️⃣ 我没有让它做完整视频,只挑了最难的 30 多秒

原视频大约 6 到 7 分钟。

我没有打算把整条视频全部交给 AI。

开场、个人介绍、使用建议和结尾,用真人口播加演示页面更合适。真正需要测试的,是中间那段解释机制的 MG 动画。

所以这次只取原稿中的一个完整片段:

为了方便理解,假设 AI 一次只能看到 6 格内容。当第 7 条消息进来,最早的内容可能被挤出去,也可能被压缩成一段摘要。所以 AI 不一定变笨了。它可能只是看不到你前面说过的话。

我把这段做成了一条 30 到 40 秒的微型知识视频。

问题、解释和结论都得完整,单独拿出来也能看懂。

4️⃣ 把真实口播稿交给视频 Agent

这次用的工具叫 Fotor Video Agent。

按照官方给出的产品信息,它也是市面上少有支持生成 4K 高清 MG 动画的制作工具之一。

我没有只丢给它一句「做一个 AI 越用越蠢的视频」,让它自己编内容。

知识视频最怕一本正经地讲错。所以我把已经查证过的口播片段、画面逻辑和限制条件一起交给了它。

要求写得比较具体:

  • 16:9 横屏
  • 总时长控制在 30 到 40 秒
  • 中文 MG 科普动画
  • 用格子表示 AI 当前能看到的内容
  • 明确写出「6 格只是帮助理解的假设」
  • 第 7 条进入以后,同时表现「挤出旧内容」和「压缩成摘要」
  • 最后一幕用「请全程用中文回答」被挤出,证明要求为什么会失效

这次输入里,我把口播原文、四幕结构、必须出现的画面、画幅和导出规格都一次说清楚了。

我原本按四幕来设计:

  1. AI 为什么越聊越笨
  2. 6 个格子逐渐装满
  3. 第 7 条进入,旧内容被挤出或压缩
  4. 中文要求消失,AI 回答开始跑偏

我原本只给了它四幕结构,它最后自动拆成了 8 个场景,还把旁白、字幕和时间线一起排好了。

整体逻辑没有跑偏,只是几处屏幕文字太长,我又手动压短了两句。

最终成片是 33.8 秒,16:9,1080P,30fps。时间线里包含 8 个 MG 场景、4 段 Pearl 中文女声旁白、17 条可编辑字幕和一条裁到同等长度的轻科技背景音乐。

分镜表负责检查它有没有理解错,时间线则能看出这不是一段整体焊死的视频。每个 MG 场景、字幕、旁白和 BGM 都有独立轨道。

5️⃣ 生成只是第一步,我更关心它能不能改

知识视频很少一遍就定稿。

有时候是一个词太专业。

有时候是数字更新了。

也可能只是做完以后才发现,这句话放在画面里太长,观众来不及看完。

成片出来以后,我又做了两次修改。

第一次,我直接进 MG 元素编辑,选中了第七幕的一段说明文字。

原文是:

当对话超过 AI 的记忆窗口时,最早的指令会被挤出视野。

我把它压短为:

对话超过记忆窗口后,最早的指令会被挤出视野。

选中文字以后,右侧能直接改文本、字号、字重、行高、对齐和位置。这次修改在画布里即时生效,不需要重新生成整段动画,也没有改动其他场景或消耗新积分。

第二次,我试着用自然语言改其中一幕。

我选中第七幕,只让它改警告条,其他画面、时长、配色和音乐都不要动。具体指令是:

只修改当前第七幕:把「指令已被挤出上下文」的警告条改成橙红色,并增加轻微闪烁强调。其他元素、文字、时长、配色、字幕、旁白和音乐全部保持不变。

修改完成后,第七幕的警告条变成了橙红色,并增加了轻微闪烁。

其他 7 个场景、字幕、旁白和音乐都没有改动。它只更新了我选中的这一幕,没有把整条视频重新生成一遍。

我最关心的其实就是这里:它到底能不能改。

成片能出来,只能算拿到了素材。后面还能继续改,它才真正能接进我的制作流程。

6️⃣ 它在我的工作流里负责哪一段

这次做出来的动画能用,但我不会让一个工具包办整条视频。

资料查证、口播取舍和最终判断,还是要由我负责。

真人口播不会取消。需要证明软件行为的地方,也依然会使用真实操作录屏。

Fotor Video Agent 对应的是中间这一段:

查证过的口播稿 → 知识点可视化 → 可编辑 MG 动画 → 进入最终剪辑

对我来说,它只要能缩短拆页面、排元素和做动画的时间,同时还留得下修改空间,就够了。

至于到底能省多少时间,我现在还没有一个靠谱数字。等后面再多做几个同类片段,才比较得出来。

7️⃣ 最后

我现在用 AI 做视频,已经不太在意某个工具能不能「一键包办全部」。

这次测完,Fotor Video Agent 在我流程里的位置很清楚:把已经写好的口播和画面逻辑,先做成一段带分镜、旁白、字幕和音乐的 MG 初版。

普通文字可以直接改,某一幕的画面也可以单独调整,不用把整条视频重新做一遍。

所以我会把它放在「知识点可视化」这一环。内容对不对,最后怎么剪,还是我自己来。

如果你也想拿自己的文章试一下,可以从这里进入:

Fotor Video Agent