一篇文章讲透 Jev 模型为什么会爆火。
Jev 模型这两天火的一塌糊涂,今天我想写一篇文章和大家聊聊我所理解的 Jev,保证通俗易懂。
很多人觉得,Jev 不就是一个更便宜、更快的小模型吗?有什么玄乎的。不不,它和小模型的逻辑完全不一样。
或者这么讲,理解 Jev 或者任何新技术,最好的办法,是先去思考它到底试图解决什么问。理解它从何而来,何以至此。
过去这几年,大语言模型的进步还是非常明显,它已经可以自己推理、调用工具,连续完成复杂的长程任务。
对于今天主流的自回归 LLM 来说,核心机制是基于已有上下文预测并生成下一个 Token,再一个个往后生成。
哪怕它在做推理、调用工具或者长程任务,这些过程通常也还是建立在这种逐 Token 生成的范式上。
但在软件系统中,还有一类任务极其高频。它们根本不需要 AI 做复杂推理,系统只需要 AI 做一个关键判断。
比如用户写了一封邮件,它来帮忙判断这是不是退款请求,亦或者应该转给哪个部门处理。
如果大家写过代码肯定会知道,这就是我们熟悉的 if else 语句。
订单金额大于 100,就执行 A;库存小于 10,就执行 B。
可是,一旦条件变成对自然语言和现实语义的理解,普通的 if 就很难写了。
Jev 想解决的,正是这个问。
程序把当前的信息和要判断的问交给它,Jev 的输出结果可以是 yes/no 概率、固定选项里的选择,或者定义好尺度上的分数。再后面的流程继续由代码控制。
所以我觉得理解 Jev 最简单的一句就是,它想给软件加上一种会理解语义的 if 语句。
再举个例子。比如一个客服系统收到一条消息,用户说这个产品买回来只用了三天,就出了问,你们这个品控太差了。然后发了几个愤怒的表情,甚至还有脏。
嗯,这是前两天我给小米客户发过的。
客服看到这句,马上就知道用户已经很不耐烦了,而且大概率遇到了产品问。
但之前程序很难理解这句。程序不懂语义啊。
Jev 做的,就是把这种语义判断直接交给模型。输入是这段和要判断的问。比如这是不是退款请求、应该分给哪个部门,Jev 直接返回判断结果和对应概率。
所以它更像是软件里的一个判断组件。
这也就很好理解,为什么 TypeSafe 把 Jev 叫做 System One Model。
System One 来自诺贝尔奖获得者丹尼尔·卡尼曼那本很有名的书《思考,快与慢》。书里把人的思考粗略分成两个系统。
System 1 是那种非常快的判断。比如看到一个人怒气冲冲地走过来,基本不用认真分析,也知道他现在心情不太好。很多时候,我们甚至意识不到自己完成了这个判断。
System 2 就慢很多。碰到一道复杂的数学,或者需要认真权衡几个方案的时候,大脑会停下来仔细思考琢磨。
如果借用这个框架来看过去两年的大模型,会发现整个行业的重点都是 System 2 这一侧。
尤其 Reasoning Model 出现以后,模型会花更多时间和 Token 进行推理。
TypeSafe 这家创业公司反过来问了一个问。软件里的所有 AI 任务,真的都需要这么认真地推理吗?
显然不是。
就像刚才那个客服例子。判断这个用户是不是在要求退款,需要模型写几千个 Token 的推理过程吗?完全没必要。人看一眼几乎立刻就能形成判断。
软件代码里充满了很多这样的判断。
所以 TypeSafe 的思路是,既然现在所有模型都在优化推理能力,那能不能专门做一个模型,负责那些需要理解语义,但根本不需要复杂推理的快速判断?
这就是 Jev 所谓的 System 1。它被设计成专门处理快速判断和决策的模型,至于那些需要复杂推理的任务,则交给更强的 Reasoning Model。
这里也终于能解释,为什么我前面一直说 Jev 不能简单理解成一个更便宜的小模型。
今天我们常见的小模型,虽然更小、更快、更便宜,但大体还在沿用 LLM 的生成方式。
模型接到输入之后,依然要一个 Token 接一个 Token 地往后生成。哪怕最后只是想判断这封邮件属于退款还是投诉,它也要先把答案生成出来。
Jev 则是放弃了自由文本生成。我们提前告诉它有哪些问、答案可以有哪些类型,它直接给出判断和对应的概率,而且多个判断可以并行完成。
TypeSafe 为此重新设计了模型架构、采样方式和训练方法。
所以 Jev 的快和便宜,并不只是因为模型做小了。更重要的原因是,它把任务收窄到了判断这件事上,然后围绕这个目标重新设计了一整套模型。
为什么专门把判断这件事做成一个模型,会有价值?
因为一旦把 AI 放进真实的软件系统里,就会发现判断这件事的调用频率可能高得吓人。
比如一个大型电商平台每天收到几百万条客服消息。每进来一条,可能都要判断它是什么问、紧不紧急、应该交给谁。
如果每一个判断都调用一次 GPT 或 Claude,当然也能做。
问是太贵,也太慢。
前面说了,大模型每一次回答都要不断生成 Token。可这里程序可能最后只需要一个结果,是或者不是,A 还是 B。
TypeSafe 给出的数据是,Jev 可以在 100 毫秒左右处理完这种情况,价格是每百万输入 Token 0.042 美元,输出免费。
按照里面一个大约 300 Token 的客服工单粗略计算,跑 10 万次判断,成本大约只有 1.26 美元。
对了,Jev 这个名字也很有趣,来自经济学家 William Stanley Jevons。William 提出过一个很有名的 Jevons Paradox,也就是杰文斯悖论。
大意是,一项资源变得更高效、更便宜以后,人类对它的消耗未必会减少,反而可能增加。
放到今天很好理解。比如电越来越便宜、越来越容易获得以后,人们往往会把电接入更多设备和场景,最后催生出更多需求。
TypeSafe 的逻辑也是如此。
如果一次语义判断真的便宜到几乎可以忽略,速度也只有几十到几百毫秒,软件可能就会开始疯狂使用这种能力。
过去代码里一个普通的 if,现在可能变成一次 AI 判断。
一条客服消息进来,可以做五六次判断。
一个 Agent 每执行一步,也可以先判断这一步有没有风险、该用哪个工具、要不要升级到更强的模型。
用户甚至意识不到它存在,但一次普通操作背后,已经调用了几十次很小的 AI 判断。
我觉得,在模型竞争已经无比激烈的今天,Jev 能让大家眼前一亮,核心还是它让大家看到了另辟蹊径的可能性。
也许我们可以把智能做得足够轻、足够快、足够便宜,然后把它塞进软件里的每一个 if else。
真妙。妙不可言。
@aigc1024
 
 
Back to Top