我现在用 AI,越来越在意一件事:聊完以后,事情有没有往前走。

视频要做,素材要整理,知识库也得用起来。一个模型能写出漂亮方案当然好,但真到干活的时候,往往卡在很小的地方。

这条素材留不留?这份资料该放哪里?这个任务缺不缺信息?下一步可以继续,还是得停下来问我?

最近很火的 Jev,让我想认真看一看这些“小判断”。

先把名字说清楚:它叫 Jev,来自 TypeSafe AI,9 月 15 日开放早期访问。它把重点放在软件可以直接使用的结构化判断上。

官方发布说明

热度也有一个可以核查的信号:Vercel 在 9 月 18 日披露,Jev 上线 AI Gateway 的首个 24 小时,已有接近 13% 的付费团队使用。这是该平台的统计范围,不能理解成整个 AI 市场的占有率。

Vercel 的采用数据

但我更关心的是:这跟我们做视频、整理知识库,到底有什么关系?

先用一个很普通的场景讲明白。

假设你准备做一条“普通人怎么用 AI 整理视频素材”的内容,手里有几十条链接、笔记和素材说明。

你需要先把它们分开:哪些适合选题,哪些适合教程,哪些只是广告,哪些需要补资料。

如果每条都让 AI 写一大段分析,你还得重新读一遍,再决定怎么处理。

而在这个环节,你可能只需要一个明确结果:

“教程候选”“新闻线索”“暂不采用”“需要人工看”。

Jev 的用法就接近这个思路:给它当前资料和事先定义好的问题,让它返回选项、评分或真假判断,程序再接着处理。官方提供 Choice、Score、Noul 三类问题。

官方入门说明

对我来说,这种设计有吸引力的地方,在于判断结果能落到下一步动作上。

当然,普通大模型也能分类。这篇文章要讨论的是:当同一种分类要反复做很多次时,专门做判断的模型值不值得单独放进流程。

放到我的使用场景里,我会先考虑三个位置。

下面是我设计的使用方案,还没有接入 Jev 实测,不能当成已经跑通的成绩。

第一个位置,是视频选题的初筛。

我会先定义清楚,什么叫“值得进入候选池”:

• 跟我的内容方向有关。

• 小白看完能做出一个具体动作。

• 有可以继续核验的来源。

• 有适合展示的操作过程。

这几项分别判断,比直接问“能不能爆”有用。

因为一条内容最后有没有人看,还受标题、表达、发布时间和受众影响。没有哪个评分能替我保证结果。

我希望得到的是一张方便筛选的表:相关性、可操作性、资料完整度、待核验事项。

然后由我挑出值得展开的几条,再去写脚本、做演示。

第二个位置,是知识库资料的归类建议。

用久了 AI,文件很容易越攒越多。新工具说明、报错记录、提示词、视频流程混在一起,下次还得重新找。

我会给分类流程固定几个入口,例如“视频制作”“工具配置”“故障排查”“待整理”。

让 Jev 根据资料内容给出归类建议。拿不准的先留在待整理区,原文件不动。

这里有个细节:我会先让它生成清单,自己看过几轮,再考虑是否自动移动文件。分类错误如果悄悄积累,知识库反而更难用。

第三个位置,是任务开始前的信息检查。

比如我说:“做一条介绍 AI 工具的短视频。”

真正开工前,至少要知道给谁看、发在哪里、时长多少、要不要配音、有哪些参考素材。

这个环节可以拆成几道单独的问题:受众是否明确?有没有参考?素材权限是否有说明?还有哪些字段需要补充?

最后把缺项列出来,集中问一次,省得做到一半反复返工。

不过,也别把所有检查都交给模型。文件存不存在、分辨率够不够、片长是多少,用程序检查更直接。需要理解语义的部分,再考虑让 Jev 参与。

做视频的人,尤其要分清它能读什么。

截至 9 月 20 日,官方列出的 Jev 1.13 只接收文本,不直接接收图片、音频或视频;英语表现也优于其他语言。

当前模型说明

所以,不能把一堆 MP4 丢进去,就期待它判断镜头好不好看。

在前面那套选题方案里,输入应该是标题、字幕、文字摘要或已经整理好的素材说明。至于画面本身有没有抖动、构图是否合适,需要另外的工具或人工检查。

中文也是一样。我的资料主要是中文,就应该拿真实中文样本测试,尤其是口语、省略句和行业用词,不能直接照搬英文演示的效果。

小白想试,先做一个很小的实验。

别一上来就想着接管整个工作流。

第一步,准备二三十条你自己能判断对错的素材说明。

里面既要有明显适合的,也要有明显不适合的,还要有几条让你犹豫的。你先写好自己的判断,留作对照。

第二步,在取得访问权限后,打开 TypeSafe 的 Playground,把单条素材说明作为 state,再添加分类问题。官方快速开始就是从网页里的文本和问题入手,不必先搭一整套程序。

官方快速开始

第三步,把分类标准写具体。

下面这段可以作为设计问题时的参考;它是需求描述,不是可直接调用的 API 请求:

1
2
3
4
5
6
7
8
9
10
11
12
任务:根据一条素材说明,为视频选题做初步分类。

目标读者:刚开始使用 AI 工具的中文用户。

候选类别:
教程候选:包含明确操作或可展示的使用过程。
新闻线索:主要介绍新消息,需要继续核查。
暂不采用:与 AI 实用内容方向无关,或主要是广告。
待人工判断:资料不足、分类冲突或存在明显歧义。

判断依据仅限提供的素材。
不要把“资料没有写”当成“已经确认没有”。

第四步,看它错在哪里。

如果宣传文案总被分成教程,是不是你没写清楚“教程必须有操作过程”?如果模糊资料总被强行归类,是不是缺少“待人工判断”这个选项?

先改规则,再换一批没看过的样本验证。不要反复修改同一批题,直到分数好看,就宣布能用了。

第五步,只把经过验证的小环节接入流程。

一开始可以每天生成一份候选清单,自己审核。等你知道它经常在哪类内容上出错,再决定哪些结果可以自动进入下一步。

如果想让 Codex 帮你做测试页面,可以直接说明:

1
2
3
4
5
6
7
8
9
10
11
请帮我做一个视频选题初筛的小型验证工具。

先阅读 TypeSafe 当前官方文档,再确定接口写法。
输入是一份我提供的素材说明列表。
按我的分类标准逐条判断,保留待人工判断选项。
展示模型结果、适用的概率与置信信息,以及我的人工标签。
统计分类错误,单独列出不确定和调用失败的记录。

先只生成本地结果表,不移动原文件,不发布内容。
API 凭据通过安全环境配置读取,不写入代码和报告。
没有凭据时提供明确标注的演示模式,不伪造真实调用。

这段提示词的目的,是让测试有输入、有对照、有错误记录。页面做得多漂亮,可以放在后面。

网上那些“快几百倍、便宜几百倍”,应该怎么看?

官方确实展示了约 194 倍速度、445 倍成本优势,但对应的是它选定的工作流评测。官方也说明,这些结果可能处于真实收益的较高一端。

官方评测说明

因此,不能据此推导出:接上 Jev,整个视频项目就会快 194 倍。

你的时间可能花在搜素材、下载、配音、生成画面、剪辑和渲染上。分类这一小步变快了,整个项目能省多少时间,要看它原本占多少。

目前官方列价是每百万输入 token 0.042 美元,输出免费。按总计一千万输入 token 算,单算这部分模型费用约为 0.42 美元;实际还要看问题文本、重试以及其他服务的费用。

模型价格

我会把价格当作值得测试的理由。最后是否留下来,看的是少花的钱和省下的时间,能不能覆盖新增的检查与维护。

还有一个容易误解的地方:有置信信息,不代表不会判断错。

官方文档说明,Choice 和 Score 的 confidence 来自输出概率分布,Noul 不带这个字段。不能把一个 confidence 数字,直接当作你的业务准确率。

置信信息说明

比如,一个模型很坚定地把广告分成教程,依然是错的。

所以我会把“模型说自己多确定”和“它在我的样本里实际判断得怎样”分开看。

此外,官方当前也列出了数字计算、日期比较、无关内容过多和对抗性文本等方面的弱点。

已知局限

这些信息会直接影响流程设计:精确计算放到程序里,输入只保留相关资料,外部文章里的文字不能被当成操作授权。模型负责提出判断,是否执行仍由流程规则决定。

对我这种经常做视频、整理资料的人来说,Jev 最值得观察的,是它能不能把重复的小判断处理得更省事。

我不会要求它一上来替我决定整条视频该怎么做。先从每天都在重复、标准又能说清楚的一步开始:把素材分好,把缺项找出来,把需要我看的内容留下。

当这些小地方顺了,AI 才更像是在接着干活。

你现在的工作里,有没有哪一个判断,每天都要重复几十次?我会从那里开始试。