Jev是分类器吗?今天向所有人开放,送1.2亿token
最近大火的 Jev 模型正式公开可用了,还送起步额度。
一大早,Jev 公司 TypeSafe AI 发布官方公告,Jev 现已向所有人开放,无需候补名单。
他们还补充说:所有用户初始都有 5 美元额度,大约相当于 1.2 亿 token。
体验链接:https://console.typesafe.ai/login
过去几天,Jev 在社交平台引发了大量讨论。它是一款专门处理结构化判断的 AI 模型,开发者提供一段上下文,再提出一个范围明确的问题,Jev 就会返回可供程序直接使用的答案和概率。
有网友拿它和 GPT-6 Astra 在 Minecraft 里打赢了末影龙,只用了 8 分 43 秒。
据该网友介绍,总成本不到 1 美元,其中 Jev 花了 0.01 美元,Astra 花了 0.96 美元。目前已开源完整代码。
开源地址:https://github.com/rmalde/minecraft-agent
一个专门做判断的模型
TypeSafe AI 将 Jev 称为「System One model」,也就是系统一模型。
这个概念来自人类的快速思考机制。面对一个问题,我们往往会先凭经验作出直觉判断,再决定是否需要深入分析,Jev 扮演的就是这个快速判断角色。
使用时,开发者先提供一段背景信息,也就是 state,随后定义需要回答的问题,以及允许选择的答案,Jev 会返回结构化结果,并给出相应概率。
以客服工单为例,开发者可以让 Jev 判断工单应该交给哪个团队、是否需要人工审核,以及问题的严重程度。
这些问题对应三种主要输出形式。
Choice 用于选择一个答案,例如支付、账户或前端;Noul 返回某件事发生的概率,例如需要人工审核的可能性;Score 则将结果放入一个有序区间,例如低、中、高。
同一段信息可以同时提交多个问题,Jev 会分别回答,前一个结果不会影响后一个结果,这让它很适合嵌入现有软件,代码继续控制业务流程,Jev 只负责其中一个范围明确的判断。
真正的亮点在泛化能力
大模型研究工程师 Sebastian Raschka 认为,简单把 Jev 看成一个分类器,很容易低估它。
传统 encoder 分类器通常服务于固定任务,模型训练完成后,标签集合也随之确定,一旦场景变化、类别增加,往往需要重新准备数据并训练。
Jev 可以在运行时接收自然语言标签,再结合上下文对不同选项进行评分,开发者更换类别或调整描述时,无需为每套标签单独训练一个模型。
Raschka 判断,Jev 的关键可能更多来自数据和 API 设计,训练算法本身未必复杂。
有网友表示,创始人曾暗示过 Jev 使用了完全合成的数据集,并在已有模型上进行后训练,没有重新进行大规模预训练,这样能省下不少钱。
Jev 的技术归类也引发了争论。
一些开发者认为,标签已经可以在运行时变化,它就不再属于传统的封闭式分类器,更接近 cross-encoder 评分模型或 LLM ranker。
还有人猜测,Jev 会分别处理上下文、问题和候选答案,再输出每个选项的分数。
它究竟该叫什么,目前没有统一答案,但争论也说明,Jev 的产品形态已经超出了传统分类器的使用方式。
它想成为 Agent 的决策层
Jev 最适合处理答案范围明确、需要反复执行的判断任务。
例如在模型路由中,它可以判断一个请求应该交给低成本模型还是高能力模型;在内容审核中,它可以识别风险等级;在 Agent 系统中,它可以检查一次工具调用是否需要人工确认,也可以判断模型输出是否通过质量门槛。
它返回的不只有最终标签,还有完整的概率分布。
当两个选项的概率非常接近时,开发者可以看到模型的犹豫程度。面对 Noul 结果,还可以通过调整阈值改变系统策略。阈值提高后,系统触发某项操作的次数会减少;阈值降低后,策略会更加谨慎。最终决定仍由代码完成,开发者可以设置阈值、加入硬性规则,并规定哪些情况必须交给人工处理。
这种设计让 Jev 更像一个可复用的判断模块,它可以放在 Agent 循环外围,负责模型路由、工具风险检查、结果筛选和质量控制。
它的概率靠谱吗?
Jev 的泛化能力获得了不少认可,它的概率是否足够可靠,也受到质疑。
有网友认为 Jev 模型并没有真正做到「确定性」和「无幻觉」,同样的提示词多次运行会给出不同的概率,而且选项的顺序会大幅改变输出概率。
例如,同一个客户消息,只是把「信息咨询」和「bug 报告」的顺序调换,模型就从偏向选 bug_report 变成偏向选 information。
网友 @predict_addict 称,自己在贷款违约、企业破产和医疗诊断等八个真实数据集上进行了测试,结果显示,Jev 的概率校准明显落后于 CatBoost,并且经常高估负面结果。经过简单的后处理后,部分误差就能得到修正。
还有网友感叹 Jev 太强了,自己只用一个晚上加一个早上就搭建了一个全自动实时交易机器人,该机器人会同时处理链上和链下数据来快速做出买卖决策,结果目前已经亏损了 31680 美元。😂
TypeSafe AI 也在 Jev 1.13 的能力说明中提醒,模型在算术、计数、日期、字面匹配、无关信息干扰、对抗性输入和矛盾条件等任务上表现并不稳定。
参考链接:
https://x.com/rasbt/status/2101672304358948992
https://x.com/typesafeai/status/2101786156572823624?s=20
https://x.com/omarsar0/status/2101774405521301681
https://x.com/rronak_/status/2101544156757950697?s=20
本文来自微信公众号 “机器之心”(ID:almosthuman2014),作者:关注AI的,36氪经授权发布。















