Jev 模型从 0 到 1 小白教程:把 AI 教会说话的人,做了一个偏偏不说话的模型

Jev 出自 TypeSafe AI,2026 年 9 月 15 日随约 4000 万美元种子轮亮相。它不聊天、不写文档、不写代码,只在你锁死的选项里给出结构化判断,并带上把握度。本文根据 @ai_xiaomu 的拆解,对照官方站点,说明聊天模型为何难进无人值守的流水线,以及“填表式 AI”想接住的那一类自动化。

你最近刷到的 Jev,根本不会说话。

它不能陪聊,不会写周报,也不会补一段函数。可两天里它在 AI 圈里挤到前排:旧金山公司 TypeSafe AI 走出潜行,种子轮约 4000 万美元,试用要排队。

更别扭的是出身。创始人 Diogo Almeida 是前 OpenAI 研究员,参与过把语言模型调教得会听话、会聊天的那套工作。把 AI 教会说话的人里有他一个。现在他做的东西,故意把嘴封上。

他自己问过一个很土的问题:模型在聊天上早就超过普通人了,为什么真实世界里的自动化还是这么少?钱砸进去了,日常软件并没有因此变得真正智能。

Jev 的赌注是:软件需要的不是另一位顾问,是流水线旁一个只打勾、不发表感想的质检员。


先记下官方入口

数字来自官方和媒体转述:快约 20 到 200 倍、便宜约 400 倍、延迟约 70 到 500 毫秒、输入约每百万 token 0.042 美元、输出按“不生成文本”计价为零。对比测试多是厂商自己的工作流,当作宣传口径,不要当成第三方审计。


会聊天,为什么反而成了瓶颈

网店一天几百条客服消息,只想自动分给账务、物流、技术。听起来简单。丢给普通大模型,现场往往是这样:

先写一长段提示词,求它只回部门名,不要发挥。
它有时乖乖回“账务部”,有时又忍不住写建议、写步骤、写安慰。
程序只好再写一层脏逻辑,从散文里抠三个字。
最要命的是偶发跑偏:你只设了三个部门,它给你第四个,或发明一个不存在的组。

文字太自由。自由是聊天的优点,也是自动化的漏洞。万分之一的跑偏,你也不敢把它埋进没人盯着的系统里整夜自己跑。不可靠、不可控、不可预测,就很难被大规模写进真正的软件。

黄小木的比喻准确:ChatGPT 像能说会道的顾问;Jev 像质检员——材料递过去,不寒暄,给一个干脆的判断。扫一眼,出结果。


破局其实很土:把问答改成填表

调用时只交两样东西。

一份“状态”:要判断的材料。可以是“我的卡被扣了两次款”,也可以是整张工单、一段对话、带订单和退款政策的结构化数据。该给的背景一次铺上桌。

一叠“问题”:你要它判断什么。返回值格式事先锁死。程序拿来就用,不必再解析、清洗、猜测。官方说法是:它在数学上不该填出表格之外的答案,因为所有合法输出都是你提前圈定的选项。

这就是所谓 System One:给软件用的快判断,而不是给人看的长回答。

三种题型可以在同一次调用里并行。

单选题。跑鞋尺码发错了,选项只有退换货、物流、账务,它回“退换货”,并给出各选项的把握。若同一条里又夹着莫名扣款,它可能告诉你六成退换货、四成账务,而不是假装自己很确定。

评级题。Bug 报告用三档尺子:0 是外观瑕疵,1 是功能坏了但有绕法,2 是彻底卡死。它可能回 1.3——主要落在第一档,略往卡死偏。档位要写成具体情境,不要写“中等严重”;前面的 0、1、2 对它没有语感,SOP 必须写清每一档长什么样。

判断题。只给“是”的概率,0 到 1。顾客是不是在要求退款?0.99 就是几乎肯定。

同一次还可以再问:派给谁、有多生气、是不是未发货订单。问题彼此独立、一起作答,多问几个,耗时往往几乎不涨。官方因此鼓励一次问完这条材料上可能用到的全部判断。这和普通大模型“少问一句省 token”的习惯相反。


会说“我没把握”,比永远自信更值钱

自动化最怕的不是 95% 正确,是你不知道那 5% 错在哪。Jev 给每个答案带上 confidence。把握高的可以自动跑;一般的先人工确认或补信息;很低的转人工,或交给更贵的推理模型。一个会说“这题超出我能力”的组件,比永远语气坚定的聊天框更适合进流水线。

因为它不生成长文,速度和单价才压得下来。厂商用这个打开两类以前不敢做的活:海量库逐条打标,以及嵌进界面做实时反应。主张成立与否,仍要看你自己的延迟和账单,不要只背倍数。


怎么用:把大问题拆成小格子

不要问“这封邮件是垃圾邮件吗”。那是把许多判断压成一个含糊答案,既看不清依据,也无法微调。

拆开问:是不是在索要登录凭证?是不是声称中了未参与的大奖?是不是在制造必须立刻行动的紧迫感?自称机构与邮箱域名是否对得上?链接显示文字与落地地址是否一致?每个问题具体到几乎没有含糊空间,再由你的程序加权合成风险分。Jev 提供的是带常识判断的积木,不是又一个不受控黑箱。

落地场景也接地气:工单分流、识别退款诉求、标出该优先安抚的对话、从记录里抽出待跟进事项;内容侧按规则挑垃圾广告、辱骂、诈骗、隐私泄露并分级;招聘和线索按你写死的硬标准打分;给另一个大模型当质检——有没有跑题、有没有被套话带偏、引用是否像编的、工具参数是否在范围内。因为它快且便宜,质检成本可以只是主模型的零头。再往上是文档、评论、聊天记录的批量打标,规模大到许多聊天 API 的账单会先把项目打死。

这些都是分类与路由。把它理解成“替你盯梢所有人”,就用歪了。选项和阈值仍是你写的;模型只是在格子里打勾。


写在最后

若整篇只留一句:Jev 便宜、快、不讲话,但能在你画好的表里做判断。

聊天模型解决的是“人愿意继续问”。决策模型想解决的是“程序敢把结果写进 if/else,然后走人”。智能成本每降一个数量级,以前不值得自动化的脏活就会重新排队。那是产品机会,也是提醒:不是所有智能都该先长一张嘴。

排队入口仍在 https://typesafe.ai/ 。能不能进你的系统,不看它会不会寒暄,看格子锁得死不死,以及它说没把握的时候,你的程序有没有把人接回来。

No comments yet