不会聊天、不写代码,Jev 把判断压缩成一个数字:我跑了一下午,只花 8 美分

阅读时长:9分钟

大模型有个隐性成本:你让它判断"下一个该调哪个工具",它先写 500 字解释为什么,最后才给结论。那 500 字里,真正有用的就 3 个单词,剩下全是你付费的废话。

Jev 是把这件事反过来做的模型:不生成文字,只输出判断结果 + 概率 + 置信度。它把"判断"本身压缩成一个数字,任务结束。结果就是官方宣称的:在适合它的任务上,速度比传统大模型快 20~200 倍,成本低 40~400 倍。

TL;DR

  • Jev 是 TypeSafe 的判断型模型,三类输出:Choice(多选一)、Score(打分)、Noul(是不是),每次返回概率 + 置信度。
  • 官方定价:输入 $0.042/百万 token(约 0.28 元/百万),输出免费
  • 快的根本原因:不逐 token 生成解释,直接把任务压缩成判断结果,算完就停。
  • 概率让判断可自动化:90%+ 自动执行 / 60-90% 确认 / <60% 交人工,置信度控制"这次判断本身靠不靠谱"。
  • 我实测一上午消耗 $0.0008(8 美分),主要跑工具路由、客服分类、内容风险打分。

Jev 和 ChatGPT 到底差在哪?

同一个问题问两种模型,回答长度差一个数量级。

拿"帮我选截图工具"举例,候选是 ShareX / Snipaste / Flameshot / PicPick,条件是免费 + Windows + 启动快 + 能标注 + 不需要图片管理。

传统大模型:生成 800 字对比分析,逐个点评优缺点,最后推荐一个。Token 费用按生成长度走,越详细越贵。

Jev:直接返回

Snipaste: 72%
ShareX: 19%
Flameshot: 7%
PicPick: 2%
confidence: 0.99

一行结果,任务结束。不写"为什么推荐 Snipaste",不列各自优劣,只给你判断本身。

这就是 Jev 的设计取舍:放弃长文本生成,换取判断速度。它不是"更便宜的 ChatGPT",是"专门干判断这件事的模型"。

Choice / Score / Noul 三类判断,各自解决什么问题

Jev 把判断分成三个原语,覆盖绝大多数 Agent 决策场景:

类型 回答的问题 典型场景
Choice 多选一:最该选哪个 下一步调哪个工具、任务交给哪个模型、工单分给哪个部门
Score 程度有多高(不是二分) 用户多生气、内容风险多高、候选多符合要求
Noul 是不是(返回概率) 是不是广告、是否要求退款、是否存在安全风险

三者组合能覆盖很多"Agent 内务":

  • 工具路由:当前任务在 web_search / search_flights / calendar / send_email 里选下一步
  • 模型分流:简单查询走 fast 便宜模型,复杂推理走 frontier,避免所有任务都喂给贵模型
  • 客服工单:一条用户反馈同时跑三个判断——分类(Choice)、不满程度(Score)、退款意图(Noul),一次调用拿全
  • 自动化 Gate:退款、发邮件、删文件前,先判断"这个动作安全吗",过了概率门槛才放行

我实测里最有用的是客服工单三合一:一条反馈"更新后同步全挂了,重装两次没好,我买的是永久版,今天不解决就退款",一次调用同时拿到分类(Bug)、愤怒度(Score 3)、退款意图(Noul 0.87)。三个判断并行,不需要三次调用。

为什么便宜到"一上午 8 美分"?成本账本摊开

Jev 的输入 $0.042/百万 token,输出免费。我跑了一上午工具路由 + 客服打分 + 内容审核测试,总消耗 $0.0008

横向对比一下就明白为什么:

操作 Jev 成本 传统大模型(同等输入规模)
单次工具路由判断 ~$0.00001 ~$0.0003-0.001
1000 次客服分类 ~$0.01-0.02 ~$0.3-1
一天高频自动 Gate(1 万次) ~$0.15 ~$4-10

便宜不只是单价低,是输出端直接归零。传统模型每生成一个字都在计费,Jev 的判断结果本身极短,又输出免费,两次成本优势叠加。

这也是为什么 Jev 特别适合高频、低价值单次的判断场景——单次调用省 40 倍不性感,但一天跑一万次 Gate,账单差距是实打实的几十美元/天。

概率门槛:判断怎么变成自动化

光给概率没用,真正值钱的是能拿概率设自动化边界。我用的分档规则:

>= 0.90: 自动执行,不打扰人
0.60 ~ 0.90: 生成建议,等用户确认
< 0.60: 直接交给人工

置信度(confidence)是另一层保险——它衡量"这次判断本身有多稳"。90% 的概率但置信度 0.4,说明模型对这个具体输入其实没把握,不该自动放行。两层一起卡,误判率比单看概率低一截。

这套组合在 Agent 安全监控里最实用:每次执行动作前先判断"安全吗",高置信 + 高概率才放行,否则拦下来给人看。

什么时候不该用 Jev

Jev 的边界要说清楚,不然容易滥用:

  • 需要从零生成内容(写文章、写代码、生成对话)→ Jev 不擅长,这是传统模型的地盘
  • 候选集是开放的(让它"想所有可能的答案")→ Jev 只在你给定的候选范围里判断,不是无中生有
  • 需要长解释(用户要看推理过程)→ 它故意不生成,省了也少了透明

它定位就是 Agent 流水线里的决策节点:上游收集信息、给候选,Jev 出判断,下游执行。别指望它替代大模型做创意,它只负责"在已有选项里选对的那个"。

常见问题

Q1: Jev 和普通小模型(如 7B 级别)有什么区别?

A: 小模型也能做分类,但 Jev 的输出结构化(概率 + 置信度 + 三类判断原语),专为 Agent 决策流设计。小模型给的是自由文本,Jev 给的是可直接进 if-else 的结构化判断。

Q2: 现在怎么申请 / 获取?

A: 官网 typesafe.ai,Join Waitlist 填邮箱,几小时到几天不等。注册送 $5 额度。API Key 在 console 页面创建,只出现一次。

Q3: 能和 Claude Code / OpenClaw 这类 Agent 框架集成吗?

A: 官方提供 skill 安装入口,把 Quickstart 内容交给 Agent 即可。本质就是多一个可调用的判断 API,和你现有的 Agent 编排框架并行用,不冲突。

Q4: 国内有没有可用的开源复现?

A: 有。APUS 做了 Jev 的国内首批开源复现,方向和"判断型模型"一致。想要离线 / 自托管 / 不被海外定价卡的,看这条路线。

Q5: 概率 72% 的"选 Snipaste"能直接信吗?

A: 单看不一定。要叠置信度一起看,并且自己定门槛(我设 0.9 自动、0.6 确认)。72% + 置信度 0.99 才值得自动放行。

Q6: 为什么输出免费,这不是亏本吗?

A: 判断结果 token 极少(一行几个 token),推理算力集中在输入侧;输出侧边际成本低,官方用"输出免费"做定价钩子,实际账单主要看输入量。

相关阅读

© 2026 softon.top

本站已稳定运行 263 天 9 小时 · 122 篇文章

使用 Hugo 构建 主题 Stack 由 Jimmy 设计 由 softon 魔改

最近构建时间:2026-09-21 17:06:46 CST