**前OpenAI研究员迪奥戈·阿尔梅达推出新模型Jev,主动放弃文本生成能力,专门做“判断”(选择、打分、是否),在Agent系统中间环节快约200倍、成本降至1/400,解决大模型在不需要语言的场景下被浪费的问题。** **要点** **1. 颠覆性定位:只判断,不聊天** Jev由InstructGPT论文共同作者阿尔梅达开发,砍掉大模型最核心的文本生成能力,专注输出判断结果(如类别、分数、是/否),不写任何句子或解释,在分类、路由等中间任务上完全替代通用大模型。 **2. 性能与成本优势显著** 官方数据显示,同样一个分类判断,Jev延迟可压到几十毫秒(GPT-4o需几秒),速度提升近200倍;每次调用消耗算力极小,成本仅为传统模型的四百分之一。 **3. 多场景验证落地效果** 浏览器Agent中,机票搜索流程从几分钟缩短到7秒;上下文压缩场景下,128万token经Jev筛选后仅剩8.6万,压缩93%且关键信息未丢;大批量文档处理中,777次分类判断总成本仅约0.25美分。 **4. 爆火的关键在于时机契合** 过去一年Agent从概念走向实际部署(如Anthropic内部Agent占比半年内从1%飙至26%),大量中间判断调用完整大模型导致高延迟和高成本,Jev恰好填补了这一空白,推出时机比技术本身更重要。 **5. 核心启示:需求匹配优于能力全能** Agent系统真正需要语言能力的环节可能不到一半,大量中间步骤只需简单判断。Jev揭示了“用会说话的模型干无需说话的活”这一普遍错配,提醒产品将需求精准匹配置于追求全能之上。
新模型Jev爆火:曾帮ChatGPT学会聊天的人,为啥做个不聊天AI?
2026-09-21 21:04

新模型Jev爆火:曾帮ChatGPT学会聊天的人,为啥做个不聊天AI?

本文来自微信公众号: 快刀青衣 ,作者:快刀青衣


大量中间步骤,并不需要AI会说话。


不少朋友可能发现,虽然最近这两三个月新的大模型层出不穷,但我却很少聊这些。


原因很简单,我觉得现阶段,这几个顶尖大模型的能力虽然有差别,但整体都已经非常强了。


比起纠结到底选什么大模型,我们更应该关注,到底用AI解决什么问题。


还有一个原因,过去一年,大模型赛道上来来回回都是那几张熟面孔:GPT、Claude、Gemini、DeepSeek……


大家卷的方向也差不多,谁写得更好,谁推理更强,谁上下文更长,真是你方唱罢我登场。


不过,今天我要跟你聊一个这两天新冒出来的东西,叫Jev。


它简直就像我们在管理学故事里常见的「鲶鱼」一样,掀起了讨论热潮,刷屏了整个硅谷开发者社区。


它火得很猛。创始人的发布帖两天拿了超过3000万次浏览、6万多个赞,DCVC领投了4000万美元的种子轮,有媒体说估值大约2亿美元。


我更感兴趣的是它做的一个选择,同时也能解答大家的一个问题:这模型凭啥突然火了?


要知道,Jev这个模型主动砍掉了大模型最核心的一项能力:生成文本。它不会写文章,不会写代码,甚至不会聊天。


它重点只做一件事:判断。


造它的人叫迪奥戈·阿尔梅达,前OpenAI研究员,也是2022年InstructGPT论文的共同作者之一。


InstructGPT这篇论文地位非常高,因为它是ChatGPT的直系前身,也就是让AI学会听人话、像人一样说话的那套训练方法。


阿尔梅达是参与者之一,所以,也有唯恐天下不乱的短视频把他称为「ChatGPT之父」。怎么说呢,反正我觉得ChatGPT挺不容易的,我差不多见过七八个人被称为它的爸爸了。


不过我的好奇心就来自这里:他当初可是帮AI学会聊天的人,离开OpenAI之后花了两年时间,造了一个不会聊天的AI。为什么?他图什么?


他在发布帖的视频里解释了动机,大意是:现在的AI Agent系统,有一个巨大的浪费。


我们来想一个场景。你是一家公司的客服主管,每天收到几千封客户邮件,需要分拣到不同的处理队列里,退款的归退款,投诉的归投诉,咨询的归咨询。


你让一个大模型来干这事,它会怎么做呢?


它会认认真真读完每封邮件,然后写一大段分析:这封邮件的客户情绪偏负面,涉及产品质量问题,建议归类为投诉类,优先级为高。


写得很好。但软件系统根本不需要这段话。软件需要的只是一个词,「投诉」;或者一个数字,「3」;或者一个判断,「是或否」。


中间那一大段文字,没人会读,也没有软件会用。它就是凭空生成出来,又凭空消失掉了。


这就像一个人被要求做选择题,但他每次都非要先写一篇议论文,然后再从里面提取出ABCD。


阿尔梅达说,在今天的Agent系统里,这种浪费无处不在。一个复杂的AI工作流可能要做上百次判断,每次都让大模型跑一整套生成流程,等于用大炮打蚊子。


而Jev的做法是,把这些「小判断」单独拎出来,用一个专门训练过的模型来处理。它只输出三种东西:选择、打分、是否。


不写句子,不做解释,不输出任何人类语言。


快多少呢?官方给的数据是,同样一个分类判断,GPT-4o可能要花几秒甚至更久,Jev可以压到几十毫秒,快了近200倍。


再说成本。因为它不需要生成任何文本,每次调用消耗的算力极小,官方说成本只有原来的四百分之一。


当然,这些倍数大家看看就好,因为比的是特定任务上的峰值表现,不是所有场景都这样。但核心逻辑是成立的:在不需要语言输出的任务上,压根不需要一个会说话的模型。


那它到底好使在哪?我翻了一圈发布这两天媒体和社区里的讨论,还有官方放出来的案例,挑几个具体说说。


第一个是浏览器Agent。Browser Use的创始人格雷戈尔·祖尼奇做了一个演示,让AI帮他搜一张从苏黎世飞伦敦的机票。


用传统大模型驱动的浏览器Agent,光是在页面上判断该点哪个按钮、该往哪个输入框填内容,就磨磨蹭蹭花了好几分钟。


换成Jev处理这些中间判断,整个流程7秒钟跑完。因为每一步的判断延迟从秒级压到了毫秒级,累计下来,差距就是几十倍。


第二个是上下文压缩。现在的Agent动不动就要处理超长文本,一个复杂任务的上下文可能撑到上百万token。


Jev可以做一件事:逐段扫描这些上下文,判断每一段跟当前任务有没有关系,没关系的直接扔掉。


有人测试过,128万token的上下文,经过Jev筛完只剩8.6万,缩了93%,而且关键信息没丢。


这就相当于,你让一个实习生先帮你把一百页的报告划出重点段落,你只需要看那七八页就行了。


第三个是大批量文档处理。有个开发者测试了一下,用Jev跑777次分类判断,总共花了大约0.25美分,不到两分钱人民币。


对那些每天要处理海量文档的企业来说,这个成本意味着,以前用不起的场景,现在可能可以随便跑了。


但值得关注的是,类似这样只用来判断的东西早就有人做过,为什么偏偏是Jev在这个时间点爆了?


我觉得,让它这次火起来的,是时机。


过去一年,AI Agent从概念走向实际部署,越来越多的开发者真的开始在生产环境里跑Agent了。


举个例子,Anthropic最近披露了一组内部数据,他们自己的研发流程里,半年前能被Agent主导的任务占比还不到1%,现在已经飙到了26%,有3万个Agent在同时运行。


这还只是一家公司。


Agent跑得越多,那些中间环节的小判断就越多。每次都调大模型跑完整的生成流程,账单高得离谱,延迟慢得想骂人。


特别是现在越顶级的大模型,思考时间越长。甚至一个小问题,顶级模型都会觉得:人肯定不会问这么简单的问题,一定有深意。


Jev不是第一个看到这个问题的,但它的出现,恰好是所有人都受够了的时候。


你看,推出时机,可能比技术本身更重要,这件事本身就是一个挺好的案例。当然,Jev这个故事里最让我有感触的,是我们之前忽略的一个问题。


过去两年,大模型变得越来越强,能写文章,能写代码,能推理,能多模态,所有人都在卷「全能」。我们也习惯了,遇到什么任务都往大模型上扔。


但拆开来看,Agent系统里真正需要语言能力的环节,可能连一半都不到。大量的中间步骤,要的只是一个选择、一个评分、一个是或否。


我们一直在用会说话的模型,去干不需要说话的活。


这个错配,不是谁故意为之,而是因为之前没有别的选择。你手上只有锤子,什么都得当钉子。现在Jev出来了,它未必是最终答案,但它至少让大家意识到了这个错配的存在。


做产品也一样。现在AI把很多工具层面的能力拉平了,人人都能做网站,人人都能写APP。做出来不难,难的是做出来有人用。


Jev给我的启发是,先别急着想「我能做什么」,先问一个更基本的问题:我的用户到底需要什么?


需求匹配得准,比一味追求能力全面更重要。


说了这么多,除了技术本身,我还挺佩服这个团队做的事情,因为他们做的是一件反共识的事,并不是别人怎么做,自己就怎么做。


也许正因为这样,阿尔梅达才能在之前参与做出擅长说话的AI,现在又做出了不会说话的Jev。


1.Jev官网介绍:


https://typesafe.ai/blog/introducing-system-one-models-and-jev


2.Jev官方文档:


https://docs.typesafe.ai/introduction

AI创投日报频道: 前沿科技
本内容来源于网络 原文链接,观点仅代表作者本人,不代表虎嗅立场。
如涉及版权问题请联系 hezuo@huxiu.com,我们将及时核实并处理。
正在改变与想要改变世界的人,都在 虎嗅APP