本文来自微信公众号: Agent陌晨 ,作者:陌晨,原文标题:《Jev很快,但我们使用AI从来不只为了「快」》
大家好,我是陌晨。
这几天,Jev突然成了AI圈的新宠。
快得离谱,便宜得离谱,还把大模型最擅长的长篇回答直接砍了。你给它一段上下文,再给几个选项,它只负责做选择、打分、判断真假,然后把概率交给程序。
TypeSafe给它取了一个挺唬人的名字,System One Model。按照官方说法,Jev常见响应时间在70到500毫秒,每百万输入Token只要0.042美元。
我先泼一点冷水。
Jev这波热度,大概率会昙花一现。
先别急着喷,我说的是Jev作为明星模型的热度。它代表的产品方向,反而值得长期关注。
首先,我想问大家,我们使用任何chat、skill、agent都是为了快吗?肯定不是,我们是为了交付。
运营方案。需求文档。解决方案...
如果只是为了快,没达到预期交付,肯定会被唾弃。
这种快,除了让失败提前发生,没有多大价值。
工作里的速度,只有在结果能交付以后才成立。
Jev有意思的地方,恰好在这里。它很早就承认自己不负责完整交付。
它适合藏在Agent内部,判断要调用哪个模型,检索结果是否相关,任务该继续还是停下,某个结果要不要交给人工。它像流水线上的质检员,动作很快,每次只看一个清楚的问题。
问题也随之出现。
TypeSafe自己的文档写得很坦白,Jev在数字、日期、多步推理、长篇干扰信息和对抗内容上都有短板,它也不能替你生成最终内容。Choice保证答案不会跑出预设选项,却不保证它一定选对。
硅星人Pro用50条中文客服消息做过一组测试。Jev的完整准确率大约在64%到65.2%,平均响应不到一秒,成本约0.002美元。它确实快,也确实便宜,准确率却没有压过更强的通用模型。
样本不大,不能拿来给Jev判死刑。但它提醒了我,判断错一次要付出什么代价,往往比单次调用省了多少钱更重要。
用户不会长期为一个选择题模型兴奋。平台会把它变成一个默认功能,像缓存、路由和重试一样,藏在系统里面。
Jev这个名字可能退下去,便宜判断带来的变化却刚刚开始。
1865年,英国经济学家杰文斯研究煤炭时发现,机器用煤效率提高后,煤炭总消耗量没有跟着下降。单位成本低了,使用场景变多,社会反而烧掉了更多煤。
后来,人们把它叫作杰文斯悖论。
把煤换成智能,这件事就很好理解了。
当一次判断又慢又贵,开发者只会在关键节点调用模型。等判断便宜到接近不要钱,路由前可以问一次,检索后可以问一次,生成完再检查一次,低置信度重跑一次,准备执行时还可以加一道风险判断。
每次都更省,调用总量却会暴涨。
AI越便宜,我们越容易给流程塞进更多AI。
这也解释了我为什么对各种速度榜单越来越谨慎。
METR曾找来16名有经验的开源开发者,完成246项真实任务。那组早期研究里,参与者使用当时的AI工具后平均慢了19%,可他们事前觉得自己会快24%。METR今年更新时也提醒,新工具可能已经带来加速,只是新数据存在明显的选择偏差。
这项研究不能证明AI让人变慢。它只戳破了一种很常见的错觉。
模型回答得快,人会感觉工作已经往前走了。可读输出、补背景、改方向、查错误、重新执行,时间都被藏在后面。聊天框早就停止吐字,任务还没结束。
内容工作里,这种错觉更明显。模型生成几千字只用一分钟,核对来源、删掉废话、调整语气、补齐读者真正需要的部分,可能还要来回折腾很久。运营方案也是一样,页面写满不算完成,团队知道下一步做什么,负责人愿意签字,执行中遇到问题有人接得住,这才算交出去。
生成速度属于模型,交付速度属于整套工作流程。
两者差得挺远。
所以我判断Jev,大概会走一条很典型的路。
短期爆火,被大量Agent接入。随后同类能力越来越多,价格继续下降,判断模块逐渐隐形。Jev作为品牌还能不能留下,要看它的判断质量、校准能力和开发者生态,单靠快和便宜守不住太久。
对普通用户来说,眼下也没必要纠结谁会赢。
写运营方案,让擅长研究和生成的模型先把材料吃透。整理需求文档,让Skill约束格式和检查项。高频、低风险的小判断,可以交给Jev这类模型。涉及金额、权限、对外发布和不可逆操作,继续让代码规则与人工确认守住出口。
更快吐出答案的AI已经很多,稀缺的是能把事情做完,并且敢让人验收的系统。
Jev可能只是今年AI圈里的一束烟花。
但依然不影响它给焦虑的我们带来新鲜感。
我是陌晨,下次见。
