跳到主内容
爱游戏体育入口

Jev是分类器吗?今天向所有人开放,送1.2亿token

2026-09-21 · 孙冬梅 · 更新于 2026-09-27

近期备受关注的 Jev 模型现已正式对外开放,并附赠初始使用额度。

今日早些时候,Jev 的开发公司 TypeSafe AI 发布公告,宣布该模型不再需要候补名单,直接面向所有用户开放。

公告中还提到,每位新用户都将获得 5 美元的初始额度,这大约相当于 1.2 亿个 token。

体验链接:https://console.typesafe.ai/login

过去数天里,Jev 在社交媒体上引发了广泛热议。这是一款专为结构化判断设计的 AI 模型,开发者只需提供一段背景信息,并设定一个边界清晰的问题,Jev 便能返回可直接供程序调用的答案及其概率。

有网友甚至用它和 GPT-6 Astra 在《我的世界》中挑战末影龙,仅用时 8 分 43 秒便成功击败。

据该网友透露,整个过程总花费不到 1 美元,其中 Jev 仅耗资 0.01 美元,而 Astra 则花费了 0.96 美元。相关完整代码已开源。

开源地址:https://github.com/rmalde/minecraft-agent

一个专精判断的模型

TypeSafe AI 将 Jev 定义为“System One model”,即系统一模型。

这一概念借鉴了人类快速思考的机制。面对问题时,我们常凭直觉快速做出判断,再决定是否进行深度分析,而 Jev 正是扮演了这一快速判断的角色。

使用时,开发者先提供一段背景信息(即 state),随后定义需要回答的问题及可选答案,Jev 会返回结构化结果并附带相应概率。

以客服工单为例,开发者可让 Jev 判断工单应分配给哪个团队、是否需要人工审核,以及问题的严重程度。

这些问题对应三种主要输出形式:Choice 用于从多个选项中选取一个答案;Noul 返回某事件发生的概率;Score 则将结果置于有序区间内。

同一段信息可同时提交多个问题,Jev 会分别作答,且前一个结果不会影响后一个结果,这使得它非常适合嵌入现有软件,由代码控制业务流程,而 Jev 只负责其中范围明确的判断环节。

真正的亮点在于泛化能力

大模型研究工程师 Sebastian Raschka 指出,若简单将 Jev 视作一个分类器,很容易低估其价值。

传统 encoder 分类器通常针对固定任务,模型训练完成后,标签集合也随之固化,一旦场景变化或类别增加,往往需要重新准备数据并训练。

而 Jev 能在运行时接收自然语言标签,并结合上下文对不同选项进行评分,开发者更换类别或调整描述时,无需为每套标签单独训练一个模型。

Raschka 推测,Jev 的关键可能更多来自其数据与 API 设计,训练算法本身未必复杂。

有网友提到,创始人曾暗示 Jev 使用了完全合成的数据集,并在已有模型基础上进行后训练,而未重新进行大规模预训练,这能显著降低成本。

Jev 的技术归类也引发了争论。

部分开发者认为,由于标签可在运行时变化,它已不属于传统封闭式分类器,更接近 cross-encoder 评分模型或 LLM ranker。

还有人猜测,Jev 会分别处理上下文、问题和候选答案,再输出每个选项的分数。

它究竟该被归为何类,目前尚无定论,但争论本身也表明,Jev 的产品形态已超越了传统分类器的使用方式。

它想成为 Agent 的决策层

Jev 最适合处理答案范围明确、需要反复执行的判断任务。

例如,在模型路由中,它可判断请求应交给低成本还是高能力模型;在内容审核中,它能识别风险等级;在 Agent 系统中,它可检查工具调用是否需要人工确认,或判断模型输出是否达到质量标准。

它返回的不只是最终标签,还有完整的概率分布。

当两个选项的概率非常接近时,开发者可观察到模型的犹豫程度。面对 Noul 结果,还可通过调整阈值改变系统策略。阈值提高后,系统触发某项操作的次数会减少;阈值降低后,策略则更谨慎。最终决定仍由代码完成,开发者可设置阈值、加入硬性规则,并规定哪些情况必须交给人处理。

这种设计使 Jev 更像一个可复用的判断模块,可放置在 Agent 循环外围,负责模型路由、工具风险检查、结果筛选和质量控制。

它的概率靠谱吗?

尽管 Jev 的泛化能力获得不少认可,但其概率是否足够可靠也受到质疑。

有网友认为,Jev 并未真正实现“确定性”和“无幻觉”,同样的提示词多次运行会给出不同概率,且选项顺序会大幅改变输出概率。

例如,同一客户消息,仅将“信息咨询”和“bug 报告”的顺序调换,模型便从偏向选择 bug_report 变为偏向选择 information。

网友 @predict_addict 称,在贷款违约、企业破产和医疗诊断等八个真实数据集上测试后,结果显示 Jev 的概率校准明显落后于 CatBoost,并常高估负面结果。不过,经过简单后处理后,部分误差便可修正。

还有网友感叹 Jev 过于强大,自己仅用一个晚上加一个早上就搭建了一个全自动实时交易机器人,该机器人同时处理链上和链下数据以快速做出买卖决策,但结果目前已亏损 31680 美元。😂

TypeSafe AI 在 Jev 1.13 的能力说明中也提醒,模型在算术、计数、日期、字面匹配、无关信息干扰、对抗性输入和矛盾条件等任务上表现并不稳定。

参考链接: https://x.com/rasbt/status/2101672304358948992 https://x.com/typesafeai/status/2101786156572823624?s=20 https://x.com/omarsar0/status/2101774405521301681 https://x.com/rronak_/status/2101544156757950697?s=20

本文来自微信公众号 “机器之心”(ID:almosthuman2014),作者:关注AI的,36氪经授权发布。如需了解更多信息,可访问爱游戏网址。

更多文章