云计算百科
云计算领域专业知识百科平台

三分钟带你快速熟悉了解最近爆火的 Jev

三分钟带你快速熟悉了解最近爆火的 Jev

LLM 系列又添一篇番外。最近 AI 圈刷屏的 Jev 不是又一个聊天模型——它不生成文本。这是最近最反直觉的新物种,值得花三分钟搞懂。

一、先说它是什么

Jev 是 TypeSafe AI 发布的第一个 System One Model(系统一模型)。公司由前 OpenAI 研究员 Diogo Almeida 创立(InstructGPT、ChatGPT、GPT-4 的核心参与者),2026 年 9 月出街就拿了 DCVC 领投的 4000 万美元种子轮。

名字来自卡尼曼的《思考,快与慢》:

  • LLM 是系统二:慢思考,生成文本,什么都能干但每个字都要算
  • Jev 是系统一:快直觉,不生成一个字的文本——输入状态(state)+ 类型化问题,直接返回结构化判断

你问它「这封邮件是不是钓鱼?」,它不写一段分析,直接返回一个 0~1 的值和置信度。你的代码可以直接拿去 if-else,不用解析文本。

二、三个原语:它只会回答三种问题

原语问什么返回什么
Choice 从选项里选一个 choice + probabilities + confidence
Score 按评分标准打分 score(0~1)+ probabilities + confidence
Noul 这个说法是真的吗 noul(0~1)

三种问题可以混在同一次调用里,每个问题并行且独立地评估——加问题几乎不增加延迟,也不会因为问题变多产生上下文污染(问题之间互相隔离)。

官方的工单分诊示例,一次调用返回三个判断:

from typesafe_sdk import Choice, Noul, Score, TypeSafeClient

client = TypeSafeClient()

ticket = "Hi, I've been trying to connect my Stripe account for 3 days \\
and the integration keeps failing. I'm losing sales. Please help ASAP."

response = client.system_one(
state=ticket,
questions={
"department": Choice(
instructions="Which team should handle this",
criteria={
"billing": "Payment or subscription issues",
"technical": "Bugs or integration problems",
"sales": "Pricing or account questions",
},
),
"frustration": Score(
instructions="How frustrated the customer appears",
criteria=[
"Calm, just stating facts",
"Frustrated but civil",
"Very angry, strong language",
],
),
"is_urgent": Noul(
instructions="The message conveys urgency or time-sensitivity",
),
},
)

print(response.answers["department"].choice) # "technical"
print(response.answers["frustration"].score) # 1.0
print(response.answers["is_urgent"].noul) # 1.0

注意返回值都是带类型的数据——choice 是枚举、score 是浮点数,代码直接分支、排序、路由,没有「解析模型输出文本」这个脏活。

三、核心设计哲学:原子问题,代码组合

Jev 的用法和 LLM 完全相反。LLM 鼓励「一个大 prompt 干所有事」,Jev 要求每个问题只问一件小事:

  • ❌ 「给这个创业点子打个分」
  • ✅ 拆成三个问题:市场规模打分、技术可行性打分、差异化打分,用你自己的公式在代码里加权合并

好处:优先级变了改一个系数就行,不用重写 prompt;每个判断独立可靠,权重完全在你手里。这和系列第四篇 Skill 的思路异曲同工——确定性的事交给代码,模型只做最小粒度的判断。

四、它和 LLM 是什么关系:不是替代,是搭档

一句话分工:需要写字的找 LLM,需要拍板的找 Jev。

任务用谁
写文章、写代码、总结 LLM(系统二)
工单分类、LLM/工具路由、内容审核 Jev
RAG 重排 Jev(系列第七篇讲过 rerank,这里有了新选项)
Agent 护栏(第一篇的 max_turns 之外再加一道) Jev 判断「这步操作安全吗」
意图识别后接 Function Calling Jev 先分诊,LLM 再执行

注意它和 Function Calling 的区别:LLM 的 Function Calling 也是返回 JSON,但那是生成的文本,有幻觉风险,要解析校验;Jev 返回的是带置信度的类型化值,不存在「编一个不存在的选项」这种失败模式。

价格上也很直白:按输入 token 计费(约 $0.042/百万 token),输出免费——因为它根本没有输出文本。

五、泼点冷水:官方宣传里的水分

系列一贯的作风,宣传话术要过滤着听:

  • 「零幻觉」是营销说法:准确地说它不会「自由发挥编文本」(因为不生成文本),但判断照样可能错——不然返回值里的 confidence 是干什么用的?
  • 加速数字打架:官方说比 LLM 快 193 倍、便宜 444 倍;第三方实测是 518 倍,且某个对比里 Gemini 精度略高(只是贵 1020 倍)。数字都是任务相关的 benchmark,听个量级就好
  • 版本别名会变:jev-latest 指向的模型会悄悄更新,结果可能变——官方文档自己都建议锁定具体版本号
  • 闭源托管 API:没有开源权重,不能自部署,数据要出境的团队先掂量
  • 总结

    概念一句话
    Jev 第一个「系统一模型」:不生成文本,只返回结构化判断
    三原语 Choice(选)、Score(打分)、Noul(真假),混在一次调用里
    设计哲学 原子问题,代码组合——判断粒度最小化,权重在你手里
    与 LLM 关系 写字找 LLM,拍板找 Jev,搭档不是替代
    冷水 「零幻觉」是营销,数字听量级,版本要锁定

    大模型的地图上又多了一块新大陆:生成和判断拆成了两种模型。结合系列前几篇——Agent 的护栏、RAG 的重排、MCP 的路由,都是 Jev 的天然用武之地。感谢追更,点个关注。

    赞(0)
    未经允许不得转载:网硕互联帮助中心 » 三分钟带你快速熟悉了解最近爆火的 Jev
    分享到: 更多 (0)

    评论 抢沙发

    评论前必须登录!