这几天超级火🔥的 Jev,我发现很多人都只是看热闹,不知道怎么参与进去,包括我自己。所以我详细调研、按步骤走进去之后,写成这份教程,希望帮到更多像我一样的小白,把这个判定模型真正用起来。

先说清楚它是谁。X 上这个 Jev,跟游戏主播 FaZe Jev 不是一回事。这里说的是 TypeSafe AI 在 2026 年 9 月公开的模型。官网在

typesafe.ai

,进去就能排队。它不聊天,不写文案,不写代码,也不陪你讨论人生。你给它一份材料,再给它几道事先写好的题,它只返回结构化答案,以及每个答案的概率。

官方把它叫 System One Model,第一款公开模型就叫 Jev。你可以把它理解成软件里的判断零件:这封客服信交给谁,这步该点哪个按钮,这封邮件要不要马上回。大模型继续负责写和想,Jev 负责判和分流。

如果你打开官网找不到对话框,页面没坏。欢迎页自己写了:Not a generative chat model。找不到聊天框,是正常的。

官方创始人那条原帖刷得很凶,技术说明在 TypeSafe 博客里:

Introducing System One Models & Jev
介绍 System One 模型与 Jev

。里面有一句最好懂:把它想成一次带判断力的函数调用,现场材料进去,带类型、带概率的决策出来。名字来自杰文斯悖论,意思是东西变便宜以后,用量往往会不降反升。它快、便宜的代价也写在明面上:Jev 不能生成文字。聊天模型负责写给人看的句子,它负责给程序一个勾选项。

System One 可以先记成「快判断」。人做选择题、过闸、分流时,靠的是快判断。写长文、做证明、慢慢想,是另一套慢思考。Jev 站在快判断这一边。所以你在练习场里看不到对话框。

界面上会反复跳英文。先看这张对照表,右边才是人话。左边的词,点按钮时再认。

一、先把五个概念立住

它是判定器。 ChatGPT 一类模型会先吐一段话,你再从这段话里把「退款」抠出来写进代码。Jev 把顺序倒过来:你先规定答案只能是哪些,它只能从里面选,并告诉你有多有把握。官方那句比较准:材料进去,带类型、带概率的决策出来。

一次调用只有三块。 State 是原始材料,一段客服消息或一段 JSON。Questions 是你事先定义的问题,每道题只能是 Noul、Choice、Score 三种之一。Answers 按你起的键名返回。代码读键,别去解析散文。

三种题,就是全部题型。 Noul 是是非题,返回 0 到 1 的「是」的概率。Choice 是单选题,你列出选项,它选一个,并给出每个选项的概率。Score 是评分题,你规定有顺序的等级,它按这把尺子打分,分数可以是小数。一次调用可以同时问好几道。真正费时间的,是把「我想知道什么」写成清楚的问题和标准。

confidence 是集中程度。 0.92 只说明答案比较集中,不保证在你的业务里一定对。官方说的 zero hallucinations,指输出被锁在你规定的类型里。正确用法是拿自己的历史样本盲测,画出自动放行线。

英文更稳,中文能用但要测。 输入目前只吃文字,包括 JSON。图片、语音、视频要先转成文字。中文能跑,口译、繁体、产品黑话都要自己拿真实样本对照。

官方可以记的量级:端到端大约 70 到 500 毫秒;输入大约每百万 token 0.042 美元,也就是每十亿输入 42 美元;输出按官方口径不单独计费。单请求上下文大约 64k,其中 state 和最长问题合计大约 32k。这些是厂商和第三方整理出来的数字,会变,以控制台账单为准。

二、申请到第一次跑通

不要一上来接仓库。按这五步走,卡在哪一步就停在哪一步。

打开

typesafe.ai

加入 Waitlist。通过后登录

console.typesafe.ai

。文档在

docs.typesafe.ai

。X 上有人几十分钟到一天能过,也有人更久。别改十个邮箱硬刷。

申请时把两句话写具体:我在做什么,打算用 Jev 做什么。比如你在做独立开发者工具,想给工单做付款、技术、其他分流。这比只写「研究 AI」好过。有人碰到最后一题问最爱的 meme,按实写就行。愿意把用途写清楚的,社区反馈通过更快。

通过后不是一个对话框,是一个工作台。左侧常见 Home、Playground、Usage、API Keys、Documentation。首页右侧能复制 Agent Prompt,能看到 Key 入口和用量。用量统计可能延迟十几分钟,刚跑完别以为没扣。

很多人一进账单区会愣:我没绑卡,为什么能用?社区截图比较一致,通过后常见赠送 5 美元。充值点 Add funds。自动续费要先把卡加上。5 美元按官方单价够你把 Playground 和第一段代码跑熟。

打开练习场 Playground。左边贴现场材料 State,右边写试卷 Questions,点开始判定 Run。练习材料用这条,不泄密:

「我的月订阅被扣了两次款。可以帮我核对这两笔付款吗?」

同时写三道题。Noul:这条消息是否催促马上处理。Choice:这条消息属于哪一类,选项写成付款、功能故障、使用帮助、功能建议、正向反馈、其他。Score:客户不耐烦的程度,按你自己写死的三到五档。

点 Run。你要看的不是一段解释,是它选了哪一项,每项概率多少,confidence 是多少。高把握可以考虑自动过,中间档交给大模型,低把握转人工。有人用大约 80% 当自动放行线,那是别人的线。你要用自己的旧数据画。

三、Questions 怎么写

这是最容易卡死的一步。社区有一张中文上手图,把键名、类型、选项和返回值画在一起了,建议对着看。

State 只放判断需要的材料。客服原话、已经发生的事实。别把整本公司制度贴进去。每道题先写人话,再选类型。人话写不清,换类型也救不了。Choice 的选项必须互斥。别同时出现「售后」和「退货」,除非你能用一句话讲清差别。Score 的 criteria 用数组,从低到高。Noul 通常不需要 criteria。

一个能直接改的骨架:

{ “is_urgent”: { “type”: “noul”, “instructions”: “这条消息是否表达必须马上处理?” }, “department”: { “type”: “choice”, “instructions”: “应该由哪个团队处理?”, “criteria”: { “billing”: “付款、扣费、退款、对账”, “technical”: “故障、连不上、集成报错”, “sales”: “价格、套餐、新签约” } }, “frustration”: { “type”: “score”, “instructions”: “客户表现得有多沮丧?”, “criteria”: [ “冷静,只是在陈述事实”, “不满,但还保持礼貌”, “非常愤怒,使用强烈措辞” ] } }

键名自己起,返回答案会沿着这些键回来。用英文下划线,后面好写代码。

四、能做什么,暂时别做什么

适合它的,都是答案集合事先想得清的事。

常见几类:客服分流,内容初审,邮件是否紧急,Agent 在有限动作里选下一步,浏览器一堆按钮里点哪一个,高把握自动过、低把握再问大模型。社区里还有邮箱归类、交易邮件记税前分类、内容审核接口这类玩法。共同点是选项事先存在,不需要它写一篇话。

写文案、写代码、开放问答、解释为什么、陪聊、直接看图看视频,这些它接不住。你业务里如果没有任何一次调用其实只是让模型返回一个选项,可以先观察,不必追。有这样的调用,再拿真实历史数据测 70% 到 90% 那一档,过了再从高阈值往下加闸门。

一个能落地的分流规则,只作起点:confidence 大于 0.9,代码自动执行;0.7 到 0.9,交给大模型复核;低于 0.7,转人工。阈值必须用你自己的样本校准。退款、删数据、对外发消息,即使把握很高,第一周也建议人工盯。

五、第一段可以落地的代码

Playground 跑通以后,再碰 API。请求打到 POST

https://api.typesafe.ai/v1/systemone

。Header 带 Authorization: Bearer 你的KEY,以及 Content-Type: application/json。模型名常用 jev-latest,也见过 jev-1.13.0,以当时文档为准。

先把 Key 放到环境变量 TYPESAFE_API_KEY,不要写进仓库。

const res = await fetch(“

https://api.typesafe.ai/v1/systemone

“, { method: “POST”, headers: { Authorization: Bearer ${process.env.TYPESAFE_API_KEY}, “Content-Type”: “application/json”, }, body: JSON.stringify({ model: “jev-latest”, state: “我的月订阅被扣了两次款。可以帮我核对这两笔付款吗?”, questions: { is_urgent: { type: “noul”, instructions: “这条消息是否催促马上处理?”, }, department: { type: “choice”, instructions: “应该由哪个团队处理?”, criteria: { billing: “付款、扣费、退款、对账”, technical: “故障、连不上、集成报错”, sales: “价格、套餐、新签约”, }, }, frustration: { type: “score”, instructions: “客户有多沮丧?”, criteria: [“冷静陈述”, “不满但礼貌”, “非常愤怒”], }, }, }), });

const data = await res.json(); console.log(data.answers);

返回里读 answers。is_urgent.noul 是 0 到 1,department.choice 是选中的键,department.probabilities 是每个选项的概率,department.confidence 是这道题的集中程度,frustration.score 是分数。判定之后的动作由你的 if 来写。Jev 不会替你执行业务。

想让 Agent 来调,社区常见四步:官网申请;在 Codex 或 Claude Code 里安装 TypeSafe Skill;控制台建 Key;提示词里写 Use the TypeSafe skill。安装命令以控制台首页 Quickstart 当时显示的为准,常见写法是 npx skills add typesafe-ai/skills –skill typesafe-ai。那是第二天的事。

六、建议按这个顺序练

用「扣了两次款」那条,在 Playground 同时跑三道题,截图留下。

把选项「配送」和「退换货」故意写重叠,再跑一遍,看它怎么飘。改到互斥,再跑。你会体会到试卷比模型名重要。

准备 30 条自己的旧消息,人工先标好该谁处理。用同一套 Questions 盲测。统计高把握里错了几条,低把握里对了几条,画出你的自动放行线。

把同一批中文样本,题干改成英文再跑,记下差别。以后中文业务至少抽测。

把第一段代码跑通,打印 answers,不要打印整段散文。

这五步做完,你就不是在收藏刷屏。

七、Playground 怎么读结果

左边 State 就当现场。你是客服主管,手里只有客户刚发来的那几句话。Jev 不会上网查订单,也不会猜这人是不是 VIP。你没写进 State 的,它就没有。

右边 Questions 就当试卷。试卷必须在开考前印好。现场再改选项,叫重新出题。

点 Run 之后按这个顺序读。第一眼看它选了哪个键。第二眼看第二名差多少,billing 56%、technical 44%,这叫纠结。第三眼看 confidence,低把握时即使第一名看起来对,也不该自动执行。第四眼看三道题有没有打架,比如 Noul 说不紧急,Score 却打到非常愤怒。打架时优先检查 State 是不是太短。

同一条材料至少跑两次。第一次用中文题干,第二次把 instructions 和 criteria 改成英文,State 仍用中文。把两次答案记在表里。这张表比评测博主的截图更接近你的业务。

八、三个能对着改的例子

客服工单。State 用扣款那条。问紧急、问部门、问情绪。department 是 billing 且 is_urgent 高于 0.75,进加急对账;department 是 technical,进故障队列;frustration 落在最高档,无论部门是什么,都抄送人工主管。情绪高不等于该退款,只等于该有人出面。

内容初审。State 是即将发出的帖子正文。Noul 问是否包含明显辱骂。Choice 写成放行、需人工、直接拒绝。Score 打品牌风险。Noul 很低且 Choice 是放行且 Score 低,才自动发。任何一项踩线,进人工。不要让它直接按发布。

Agent 选下一步。State 是当前任务描述加已经试过的步骤。Choice 写成继续当前模型、换成更强模型、停下来问人、改去检索文档。Noul 问是否已经具备足够信息可以给结论。选项必须是动作。别写成「思考一下」「再试试」。

九、用 30 条旧数据画放行线

准备一个表格,四列:原始文本、你人工标的部门、Jev 选的部门、confidence。找 30 条真实旧消息,不要现编。现编太干净,看起来会假准。

全部跑完后,先别看总准确率。先切两刀。只看 confidence 大于 0.85 的那些行,12 条里错 0 条,这条线可以当自动分流候选;12 条里错 3 条,线太松,提到 0.92 再看。再只看低于 0.6 的那些行,对错各半,说明它在说自己不知道,这是健康的。

单独看中文黑话行。订单号、内部套餐名、你们才用的缩写,最容易把 Choice 带偏。解决办法是把这些词写进 criteria 的解释里,或在 State 前加一行说明。它不读你公司维基,除非你塞进这一次的 State。

30 条仍然很少,但够你决定今天要不要接到正式分流。连 30 条都对不齐,不要接。

十、钱、速度,和你该有的预期

官方单价按输入算,输出按口径免费。5 美元赠金够把教室作业做完,通常不够把全年生产流量打满。上线前用自己的平均 State 长度乘调用次数估一笔账。别用「193 倍更快」做预算,用「我每条工单大概 800 个 token、一天 2000 条」做预算。

单次判定常常明显快过让大模型先写一段再解析。用户感知到的慢,经常不在模型,在你把低把握请求又丢回大模型以后。分流的意义,是让高把握的那一批不再排队。

社区有人拿它替换压缩摘要,结论是更快,留下的原文更像原文。别指望它变成更聪明的作家,指望它变成更快的打钩人。

十一、主要的限制

没写进 State 的订单状态,它不会查。 目前文本为主,麻将牌面、截图里的按钮要先变成字。 你已经能用关键词稳定解决的事,不必强行换它。

关键动作要自己落库:谁在何时、用哪套 Questions、得到哪个答案、最后执行了什么。 模型名、单价、赠金、排队策略都可能改。生产环境把模型名写死,把单价做成配置。

十二、卡住了按这些排

申请一直不过,把用途写具体。 找不到聊天框,用练习场或接口。 Questions 不会写,先在纸上写三句人话,再标成 Noul、Choice、Score。 中文不准,同一批样本用英文题干对照。 confidence 很高但判错,拿旧数据盲测,别迷信把握。 不知道去哪开通额度,回控制台,通过后常见先有 5 美元。 401,检查 Key 有没有进当前环境。 类型报错,核对 type 只能是 noul、choice、score;Choice 的 criteria 用对象,Score 用数组。

什么都分到「其他」,通常是前几个选项写太窄。什么都分到同一个部门,通常是 State 太短,或某个部门的解释吞掉了别的部门。两次跑同一条还跳,先看 Questions 有没有改过,再看 confidence,低把握的跳应转人工。本地可以上线 401,是部署环境没带上 KEY。觉得比大模型还慢,检查是不是判定完又让大模型重新判定了一遍。

十三、FAQ

1️⃣ Jev 是 ChatGPT 的平替吗?

它不聊天。它接的是你业务里「其实只让模型选一个选项」的那一层。

2️⃣ 必须会写代码吗?

第一天不必。Playground 就能完成概念和第一条练习。要接业务再写那二十行。

3️⃣ 必须会英语吗?

界面不少是英文。对照标注图能点下去。题干可以中文,但要抽测。

4️⃣ 在哪里充值?

控制台账单区 Add funds。

5️⃣ Key 存在哪?

环境变量或本机密钥库。别发群,别贴 X,别进 Git。

6️⃣ 模型名写什么?

先写 jev-latest。锁定生产再改成文档里的具体版本号。

7️⃣ 中文能不能用?

能。英文更稳。上线前用自己的中文样本测。

8️⃣ 能不能看图?

图要先转成文字描述或结构化字段。

9️⃣ confidence 0.9 能自动退款吗?

第一周不要。先自动分流,退款仍人工或规则确认。

🔟 一次能问多少题?

可以一次问多道。同一份 State 能一次问完的,就一次问完。

1️⃣0️⃣ criteria 写很长会不会更好?

写清边界即可。把小说写进 criteria,token 更贵,判断未必更稳。

1️⃣1️⃣ 返回答案能当文案发给客户吗?

发给客户的话仍由模板或大模型写。Jev 只决定走哪条模板。

1️⃣2️⃣ Skill 装上了还不调?

提示词里写 Use the TypeSafe skill,并确认 Agent 读得到 Key。

1️⃣3️⃣ 能不能替代整个 Agent?

不能。它重构的是工作流里某个判断节点。

1️⃣4️⃣ 今天该不该 All in?

先列自己业务里「其实只返回一个选项」的调用。一个都没有,就观察。有,就做 30 条旧数据那一表。

1️⃣5️⃣ 产品经理看到哪可以停?

看到 30 条表。你能独立完成画线,就已经能判断要不要让工程师接。

1️⃣6️⃣ 工程师的最小闭环是什么?

环境变量、一段 fetch、三道题、把 answers 打进日志、用 30 条回放。别先做平台。

十四、上线前勾这些

Questions 是否互斥,同事不看文档也能选。 State 是否只包含系统里真有的字段。 30 条旧数据是否已经盲测,高把握错误率是否可接受。

低把握是否有去处。 退款、删除、对外发送是否仍被规则拦住。 Key 是否只在服务器环境变量里。 模型名是否写死,是否记录当时版本。

日志是否记下 question 版本号、answers、最终动作。 中文样本是否单独看过。 账单告警是否设置,赠金到期是否有人盯。 有没有一键关闭自动执行、只保留记录的开关。

前六项不过,不要接生产。

十五、怎么嵌进现有业务

别新开一个「Jev 中台」。从已经存在的 if 下手。你现在如果已经有一段「标题包含退款就进财务」,先并行:旧规则照跑,Jev 也跑,只记日志,不改路由。跑一周,看两者在哪些样本上打架。打架的那些,才是 Questions 要改的地方。

一周后,只把高把握且与旧规则一致的那部分交给自动走。其余仍走旧规则或人工。这叫双轨。切换是演示词,双轨才能上线。

跟同事可以这么说。大模型像一个会写字的同事,Jev 像一个只会勾选项的同事。前者贵、慢、话多,适合起草。后者便宜、快、话少,适合过闸。先让会勾选项的人把明确件拿走,再让会写字的人处理含糊件。评审时把 30 条表带上。没有表,先别开会。

十六、去哪里获取

排队和产品看

typesafe.ai

,进去申请就能开始。 控制台、Key、Playground、账单在

console.typesafe.ai

。 字段和最新限制看

docs.typesafe.ai

。 想先用普通人的话理解它,可以打开

whatisjev.com/zh-tw

。 想看 X 上这两天的长文和演示,可以翻

jev-hub

官方数字和社区实测不是同一层东西。厂商说更快更便宜、输出带校准把握。更有用的判断是:它接的是选择题这一层;今天能用的多半是接口,不是成品应用;值钱的是按把握分流。

希望本次的教程对你有所帮助 (。・ω・。)ノ♡,抓紧去玩 Jev 吧~这是一款让人惊叹的全新 AI 大模型,一定会改变你对 AI 的理解!