Jev 是什么:60 个真实应用之后,它到底替不了大模型,Jev 模型最近很火

@servasyy_ai 在 Jev 发布数日内检索到 60 个有运行证据的应用,并写了自己的失败与两轮测试。本文按其框架说明:Jev 只做选择题,带把握分数;热闹多在转发,能直接用的多是框架接口。官方数字是厂商自报,生产前要用自己的数据盲测。

Jev 上线不到一周,句子比产品先满。

“快两百倍”“永不出错”“大模型要被取代”。@servasyy_ai 用 TikHub 去重后,只把“作者贴了运行结果、代码、网站或入口”算作真实,数到 60 个已做出的应用,另有 5 个已测待上线。这不等于成熟商用,数字多为作者自报。他同时写了另一半更少见的东西:四次塞进自己的日常工具全失败,两轮正经测试才跑通。

文章只做三件事:说清它是什么、把跑通的用途分类、把水份摊开。下面按这条线写,不把厂商对比表当成行业标准。


官网和调用入口

官方通道常需排队,通过后发密钥。OpenRouter 可按量调用 typesafe/jev 一族,请求走 Decisions 接口,不是普通聊天补全。第三方通道能马上试,不等于官方 SLA。价格公开口径大约是输入每百万 token 0.042 美元、输出免费;延迟官方写过约 0.07 到 0.5 秒。上下文有上限(常见讨论是约 32K 量级)。都以控制台和文档为准。


它是涂答题卡的模型,不是会写作文的模型

ChatGPT、Claude 往外写字。Jev 吃一段状态和事先定好的题,一次性返回结构化答案,并带“有几成把握”。题型只有三种:单选、刻度打分、是/否概率。

快和便宜来自输出空间被锁死:不算散文,只算选项概率。训练目标按官方说法偏校准——报 70% 时,长期应大约对 70%。它不能聊天、不能写代码、不能写文案、不能看图。

Hacker News 上三条质疑,帖主认为值得留下。所谓永不幻觉,多半指不会答到选项外面,选错仍可能,TypeSafe 方面也承认过。前沿模型这词容易借光,更老实的说法是:在选择题这件事上把速度和成本推高了。速度对比若拿“写完整段话的大模型”对“只涂一个字母的 Jev”,并不公平。Doom 演示喂的是坐标不是画面,证明反应快,不证明会打游戏。

结论可以收成一句:Jev 取代大模型是伪命题。大模型想规则,Jev 在生产里高频执行小判断。它抢的是从前不值得上 AI 的那类分支。


真跑通的,大多长一个样子

数量最多的是给 Agent 当决策器:每一步都在有限动作里选一个。Browser Use 的 Jev Ultrafast 把页面收成带编号的元素清单,让 Jev 选做什么、对哪个,文本生成只在需要打字时交给小模型。仓库自报搜机票一类任务从约 9.5 秒到 7.1 秒,并带测量脚本。这是帖主眼里证据最完整的一条。

其次是海量逐条分类:输出免费、输入便宜时,对大批文本问“归哪一类、要不要进入下一道闸”,账才算得过来。具体业务规则仍由你写,模型只在你给定的选项里打勾。

最值得盯的是把握分数:高把握自动过,低把握再问大模型或人。前提是校准真的准。说 90% 却只对 70%,闸门就是漏的。

还有实时界面预测、仿真和控制实验。帖主提醒:仿真是模拟数据;Jev 不能看图,网上“自动驾驶”已被工程师否掉,当形状探索即可。

“已接入产品”被他看得更重:有人在真产品里承担判错后果。模仿 Jev 的别的模型、纯观点、无运行证据的构想,他都没算进 60。那部分数量可能是真实案例的好几倍。


四次失败,不在接口,在壳

他往自己天天用的工具里塞,接口都返回,中文判断也不差,应用层却卡死。原因收成三条。

它看不到被你砍掉的内容。为了塞进上下文上限先压缩,砍完就无法判断。又快又准的“准”,以你真的把判据喂进去为前提。

订阅制助手里,判断已包在月费里,边际成本接近零。再插一层 Jev,多一跳、多一种故障。省的是按量计费的前沿模型,不是已经买死的座位。

它只会判断,不会搬数据。接进真实流程要靠周围那层插件,而这些壳往往是几天写出来的。失败经常是壳的失败。

教训:想拿它给个人日常提效,路窄;当零件做进产品,才可能。X 上的演示,作者跑通了,你未必拿得到。


两轮测试:能用的少,高把握在简单任务上像样

第一轮:把 60 个案例加 GitHub 上更多 Jev 相关项目,共 217 条介绍喂给 Jev,问今天能不能用。被判为现在可用且证据够的只有约 15 个,其中 14 个是 pydantic-ai、LangChain、Vercel AI SDK 这类接入,应用几乎只剩 jev-ultrafast。Jev 只看文字,不开链接、不跑代码,打的是公开证据分,不是项目质量分。

第二轮:100 条预先标好答案的中文资讯,每条三题,共 300 个判断,对照便宜大模型,从上海串行调用。自报结果:九成以上把握的 255 个全对;若把 80% 当自动放行线,能放掉约 89% 请求、只错 1 个。上海中位约 0.7 秒,比官方慢,但尾部短;对照模型中位接近,最慢一次到过 32 秒。准确率和费用与轻量模型打平。官方“便宜几十到几百倍”比的是前沿模型,对上 Flash 一级并不占便宜。

局限写得很清楚:样本由模板变换而来,任务偏简单;80%–90% 那一档只有十来个样本;分歧多出在标签边界。要下生产结论,得用真实数据盲测。


综合判断可以更短

Jev 是真的。它不是更便宜的大模型。对上轻量模型,多出来的是更稳的时延,以及可拿来分流的把握分数。谁只为“便宜”选它,谁选错了题。

今天能用的,主要是框架里的接口,不是一堆可下载的应用。个人工具里硬塞,大概率先撞墙。

真正值钱的用法是闸门:高把握自动过,低把握交给大模型。今天仍不宜直接上生产——样本简单、中间档校准未看清、官方排队与第三方通道不是同一份承诺。

三步也够用:列出业务里其实只让大模型返回一个选项的调用;没有就别追热点。有,就拿历史数据人工标答案做盲测,盯 70%–90% 那一档的真实正确率。过了,从较高阈值起步,看着数据往下调。

零件有了。产线还是你的。

No comments yet