**Jev作为极快、极便宜的判定模型迅速走红,但准确率仅约64%且不负责完整交付;它更适合作为内部判断模块嵌入Agent流程,而非直接服务终端用户,其真正影响在于触发AI调用量的杰文斯式膨胀。** **要点** **1. Jev定位为“质检员”而非完整交付者** Jev只做选择、打分、判断真假,不生成最终内容,适合藏在Agent内部做路由、检索验证或风险判断,承认在数字、多步推理等场景存在短板。 **2. 实测准确率约64%,成本虽低但错误代价可能更大** 硅星人Pro用50条中文客服消息测试显示完整准确率在64%–65.2%,平均响应不到一秒、单次成本0.002美元,但判断错误一次带来的损失往往高于省下的费用。 **3. 便宜判断将引发AI调用总量暴增(杰文斯悖论)** 当判断成本趋近于零,开发者会在更多环节插入模型调用(路由前、检索后、生成后、执行前),每次更省但总量暴涨,推动AI在流程中的渗透率。 **4. 速度错觉可能掩盖真实交付时长** 模型回答快让人误以为工作推进,但核对、补背景、改方向、查错等隐性时间未被计入;生成速度属于模型,交付速度属于完整工作流程,两者差距显著。 **5. 短期爆火后判断能力将趋于隐形** 同类能力会快速涌现、价格继续下降,Jev作为品牌能否留存取决于判断质量与生态;普通用户应让擅长生成的模型做材料研究,让代码和人工守住高风险出口。
Jev很快,但我们使用AI从来不只为了「快」
2026-09-21 13:03

Jev很快,但我们使用AI从来不只为了「快」

本文来自微信公众号: Agent陌晨 ,作者:陌晨,原文标题:《Jev很快,但我们使用AI从来不只为了「快」》


大家好,我是陌晨。


这几天,Jev突然成了AI圈的新宠。


快得离谱,便宜得离谱,还把大模型最擅长的长篇回答直接砍了。你给它一段上下文,再给几个选项,它只负责做选择、打分、判断真假,然后把概率交给程序。


TypeSafe给它取了一个挺唬人的名字,System One Model。按照官方说法,Jev常见响应时间在70到500毫秒,每百万输入Token只要0.042美元。


我先泼一点冷水。


Jev这波热度,大概率会昙花一现。


先别急着喷,我说的是Jev作为明星模型的热度。它代表的产品方向,反而值得长期关注。


首先,我想问大家,我们使用任何chat、skill、agent都是为了快吗?肯定不是,我们是为了交付。


运营方案。需求文档。解决方案...


如果只是为了快,没达到预期交付,肯定会被唾弃。


这种快,除了让失败提前发生,没有多大价值。


工作里的速度,只有在结果能交付以后才成立。


Jev有意思的地方,恰好在这里。它很早就承认自己不负责完整交付。


它适合藏在Agent内部,判断要调用哪个模型,检索结果是否相关,任务该继续还是停下,某个结果要不要交给人工。它像流水线上的质检员,动作很快,每次只看一个清楚的问题。


问题也随之出现。


TypeSafe自己的文档写得很坦白,Jev在数字、日期、多步推理、长篇干扰信息和对抗内容上都有短板,它也不能替你生成最终内容。Choice保证答案不会跑出预设选项,却不保证它一定选对。


硅星人Pro用50条中文客服消息做过一组测试。Jev的完整准确率大约在64%到65.2%,平均响应不到一秒,成本约0.002美元。它确实快,也确实便宜,准确率却没有压过更强的通用模型。


样本不大,不能拿来给Jev判死刑。但它提醒了我,判断错一次要付出什么代价,往往比单次调用省了多少钱更重要。


用户不会长期为一个选择题模型兴奋。平台会把它变成一个默认功能,像缓存、路由和重试一样,藏在系统里面。


Jev这个名字可能退下去,便宜判断带来的变化却刚刚开始。


1865年,英国经济学家杰文斯研究煤炭时发现,机器用煤效率提高后,煤炭总消耗量没有跟着下降。单位成本低了,使用场景变多,社会反而烧掉了更多煤。


后来,人们把它叫作杰文斯悖论。


把煤换成智能,这件事就很好理解了。


当一次判断又慢又贵,开发者只会在关键节点调用模型。等判断便宜到接近不要钱,路由前可以问一次,检索后可以问一次,生成完再检查一次,低置信度重跑一次,准备执行时还可以加一道风险判断。


每次都更省,调用总量却会暴涨。


AI越便宜,我们越容易给流程塞进更多AI。


这也解释了我为什么对各种速度榜单越来越谨慎。


METR曾找来16名有经验的开源开发者,完成246项真实任务。那组早期研究里,参与者使用当时的AI工具后平均慢了19%,可他们事前觉得自己会快24%。METR今年更新时也提醒,新工具可能已经带来加速,只是新数据存在明显的选择偏差。


这项研究不能证明AI让人变慢。它只戳破了一种很常见的错觉。


模型回答得快,人会感觉工作已经往前走了。可读输出、补背景、改方向、查错误、重新执行,时间都被藏在后面。聊天框早就停止吐字,任务还没结束。


内容工作里,这种错觉更明显。模型生成几千字只用一分钟,核对来源、删掉废话、调整语气、补齐读者真正需要的部分,可能还要来回折腾很久。运营方案也是一样,页面写满不算完成,团队知道下一步做什么,负责人愿意签字,执行中遇到问题有人接得住,这才算交出去。


生成速度属于模型,交付速度属于整套工作流程。


两者差得挺远。


所以我判断Jev,大概会走一条很典型的路。


短期爆火,被大量Agent接入。随后同类能力越来越多,价格继续下降,判断模块逐渐隐形。Jev作为品牌还能不能留下,要看它的判断质量、校准能力和开发者生态,单靠快和便宜守不住太久。


对普通用户来说,眼下也没必要纠结谁会赢。


写运营方案,让擅长研究和生成的模型先把材料吃透。整理需求文档,让Skill约束格式和检查项。高频、低风险的小判断,可以交给Jev这类模型。涉及金额、权限、对外发布和不可逆操作,继续让代码规则与人工确认守住出口。


更快吐出答案的AI已经很多,稀缺的是能把事情做完,并且敢让人验收的系统。


Jev可能只是今年AI圈里的一束烟花。


但依然不影响它给焦虑的我们带来新鲜感。


我是陌晨,下次见。

AI创投日报频道: 前沿科技
本内容由作者授权发布,观点仅代表作者本人,不代表虎嗅立场。
如对本稿件有异议或投诉,请联系 tougao@huxiu.com。
正在改变与想要改变世界的人,都在 虎嗅APP