不会还有人不知道JEV吧,只输出决策,不产文本。以 RLCD 训练、并行推理替代自回归

ChatGPT 联合发明人憋了两年,刚放出个新模型 Jev名。名字来源于 Jevons 悖论(效率越高、用量反而越大)。

主流 LLM:生成文本,慢且贵。

Jev:只输出决策,不产文本。以 RLCD 训练、并行推理替代自回归,换来 20-200x 速度、40-400x 成本优势,输出侧免费。


一、它到底是什么

一句话:状态进,带类型的决策出。

你给它一段非结构化内容(一段工单、一封邮件、一份简历、一个 JSON 状态),再加若干「问题」,它返回每个问题的答案——不是字符串,是类型安全的取值,外加概率分布和置信度。

它有且只有三种提问原语,用途由返回形状决定:

Noul:是/否判断。返回 noul,0 到 1 之间的概率,表示「是」的可能性。它没有单独的置信度字段——那个概率本身就是答案。近 1 是强肯定,近 0 是强否定,近 0.5 是「是/否各半」,不是「中等」。

Choice:从一组选项里挑一个。返回 choice、probabilities(每个选项的概率,总和为 1)、confidence。

Score:在你描述好的档位上给一个位置。返回 score(可以是小数,比如 1.3,意思是主要落在第 1 档、有一点落在第 2 档)、legend(档位编号到描述的映射)、probabilities、confidence。

关键性质:一次请求可以混用三种原语;每个问题都对同一份 state 独立评估、并行执行;加问题几乎不增加响应时间,只多一点输入 token。答案被约束在你给的选项里——模型给不出选项外的值。

二、五条上手路径

1. Playground:打开

console.typesafe.ai/playground

登录,粘一段文本当 state,加一个问题试手(比如 Noul:「这条消息是否表达出紧急感?」),再混着加 Choice 和 Score,一次看全部结果。

2. HTTP API:从

console.typesafe.ai/settings/keys

拿 key,POST 到

https://api.typesafe.ai/v1/systemone

,头部 Authorization: Bearer 你的key,model 填 jev-latest。请求体三个字段:state、model、questions。

3. Python SDK:pip install typesafe-sdk(要求 Python 3.10 以上)。客户端自动读环境变量 TYPESAFE_API_KEY,默认调用 jev-latest,请求写法就是把 Choice、Noul、Score 三个对象塞进一个 questions 字典,response.answers 里按你的问题 id 取类型化结果。

4. Agent Skill:npx skills add typesafe-ai/skills --skill typesafe-ai(Claude Code 用户走 plugin marketplace 两条命令)。这是官方为 coding agent 准备的技能包,装了之后 agent 知道请求和响应的形状——官方特别提到,agent 比人更容易犯「一次只问一个问题」的毛病,这个技能会教它一次多问。

5. 还没排到队也能开始:官方开源的 system-one-adapter-python 是 typesafe_sdk 那个 system_one 接口的替代实现,背后接 OpenAI、Anthropic 或你自己的兼容端点。它的用途是拿 LLM 和 TypeSafe 做成本、速度、智能的三方对照,但也可以先用它把接口和代码结构跑通——接口一样,将来换回 Jev 只改一个 provider。可选参数里有两个值得注意:llm_answer_mode 选 probabilities 还是 discrete 决定你的模型是给整条分布还是只给一个值;normalize_probabilities 会把不合法的概率分布重新归一到 1。

三、怎么问才对(这部分才是真正的使用技能)

一个问题只问一个判断。判据是「一个有知识的人看一眼就能答」。好问题:「这条消息是否传达紧急感?」坏问题:「分析这条消息并确定最佳行动」——后者需要慢思考,看到这种问题就该拆。

多因素判断要拆开,在代码里加权合成。官方例子:不要问「给这个创业 pitch 打分」,而是分别问市场规模、技术可行性、差异化,再用你自己的公式合成。好处是优先级变化时你改的是代码里的系数,不用重写提示词。

state 是 JSON 时,在 instructions 里用点号路径指名字段,比如「ticket.messages[0].text 是否请求退款?」「refund_policy 是否支持 ticket.messages[0].text 里提出的退款请求?」,让模型明确该看哪一块。

一次把问题问满,包括投机性问题。官方并行问题手册的数字:13 个问题合成一次调用,比拆成 13 次单独调用便宜 11.5 倍、快 9.6 倍,答案完全一致。单次请求的预算约 32,000 token(约 15 万英文字符),state 和问题共享这个预算。

档位要写情形,不要写程度。「功能坏了但有绕行方案」能匹配状态,「中等严重」不能。另外每档是独立判断的,模型看不到档位编号,所以「比上一档更差」和数字都没意义。同一份 bug 报告:档位写成 0/1/2 三个数字时,模型给出 0.57 分、置信度 0.35;写成具体情形描述时,判断就稳定了。

Choice 的选项列表要留「其他/以上都不是」,否则模型会被迫在错的选项里挑一个。

想要「等级」就用 Score,不要用 Noul。0.5 的 Noul 意思是「是/否平权」,不是「中等水平」。要衡量熟练度就写档位:没经验、了解、每天用、精通。

四、置信度怎么用(把不确定变成系统行为)

Choice 和 Score 才有 confidence,它是从概率分布的形状算出来的统计量:分布越尖越自信,摊得越开越不确定。官方说这只是一个「大多数场景够用」的默认定义,它把完整分布 probabilities 也给你了,你可以自己定义更适合你任务的度量。

官方推荐的三段式:

高置信度:自动执行。

中置信度:继续,但加一道确认、标记复核或补充信息。

低置信度:不执行,转人工或换一条路径。

关键在下一句:阈值不是一个数,它随风险分层。官方的语音银行例子——意图判断置信度低于 0.6 一律转人工;查余额这类低风险动作 0.6 就够,因为最坏结果是用户听一遍余额;批准转账这类高风险动作要求 0.85 以上,否则先反问一句确认。风险容忍度写在你的代码里,不在模型里。

官方还有一句:阈值该定在哪,取决于你的领域和模型在你任务上的表现——从保守值开始,用你自己的数据测。

五、成本和速度的实际感受

输入 0.042 美元/百万 token(每十亿 42 美元),输出免费;端到端 70 到 500 毫秒。官方首页那句「193.6 倍更快、444.6 倍更便宜」出自四个 workflow eval,官方自己承认这是偏乐观的一端。

用例级的价格感:Doom 那个 demo 每秒 10 次查询,约合每小时 7 美元。首页另有对比:输入价格比 Claude Fable 5.1 低 238 倍。

官方 Workflow Evals 站的方法论比数字更值得抄:把策略拆成 harness。同一批任务里,每个被测模型用工作流(拆成 Noul/Choice/Score 加代码规则)都跑得比「把整套策略写成一段提示词」更准、更便宜、更快。举例:haiku 4.5 在工作流里 58.8%,同一策略写成提示词只有 17.1%。参考标签取的是最强两个模型(GPT-6 Astra 与 Claude Fable 5.1,高思考)的平均。他们自己标注了偏差:参考值偏向 OpenAI 与 Anthropic,可能低估自家模型。

六、边界和坑

基数上限 255。超过时改走两阶段:先独立打分,再显式选择,会慢一点。

服务目前在西海岸。官方原话是他们的评测一般在自己(西海岸)的笔记本上跑。

还在 early access,在按顺序放人。

它的目标场景是「看一眼就能判」的原子判断。需要长链条推理的任务不是它的事——那是推理模型的事。

输出永远类型安全,所以它错起来的样子是「在你给的选项里挑错了」,而不是「吐出一个不存在的值」。这是优点(流水线不会崩)也是风险(错误看起来很正常,不会被解析器拦住)。

官方文档:


另外,Browser Use 接上 JEV 这速度有点疯狂

过去大家看 GPT、Claude 操控浏览器,体验其实并不好,因为真的太慢了,中间还经常卡死…

因为让大模型写一堆长篇大论去操作网页,本质上就是杀鸡用牛刀

在网页上点按钮,本质上就是一个离散的多选题,根本不需要 AI 会写诗

JEV 拿到 DOM 结构,以做分类题的速度毫秒级选出该点的元素,只有在需要打字输入时才偶尔回退给小模型

GitHub: https://github.com/browser-use/jev-ultrafast 拿 JEV 做了个开源的微型浏览器 Agent,让它自主打开网页查机票

整个过程:
• 耗时仅仅 7 秒
• 成本只要 $0.0039(折合人民币不到 3 分钱)

1 个赞

前两天出差没来打卡学习,今天转载x几篇jev的,抚摸前额叶,顺便用用看,半导体需求下降

1 个赞

traecode官方也发文啦 来看:https://mp.weixin.qq.com/s/DNr2E1OW63GO0v9dMsrvSA

1 个赞

你的速度也很快快哦

2 个赞

the flash

2 个赞

听起来像是一个强大的通用决策器,但是只输出决策要怎么确认这个决策的可解释性呢?
就有点想在玩海龟汤,你只能通过自己不断猜测来靠近?

2 个赞

好速度!前沿消息来源,又多了一个你

2 个赞

整理了一批 Jev 项目,大家可以参考

  1. fast-jev-compaction
    Claude Code 插件。每次工具调用后,用 Jev 判断哪些内容该保留、压缩或丢弃,减少上下文膨胀。
    https://github.com/tamaratran/fast-jev-compaction

  2. jev-browser
    让 LLM 负责规划,Jev 负责浏览器里的具体选择。支持 CLI、Library 和 MCP。
    https://github.com/Ying-Kai-Liao/jev-browser

  3. jev-search
    把 Jev 用在搜索流程里,负责理解查询、选择信息源、筛选结果。
    https://github.com/superagents-lab/jev-search

  4. Reticle
    给 Web 和桌面应用增加运行时感知能力,帮助 Agent 理解自己正在操作的界面。
    https://github.com/reticlehq/reticle

  5. NanoJev
    一个 Jev 的轻量复现项目,包含并行决策、动态候选项和完整训练流程。
    https://github.com/TianyuCodings/NanoJev

  6. open-alternative-jev
    尝试用开源模型复现 Jev 风格的 System One 决策层,并提供基准测试。
    https://github.com/ikermoel/open-alternative-jev

  7. pi-jev
    把 Jev 接入 Pi coding agent,用来控制工具调用,也支持类型化、带置信度的回答。
    https://github.com/y0usaf/pi-jev

  8. hermes-jev-skills
    直接把 Jev 接进 Hermes、Claude Code 和 Codex,覆盖模型路由、记忆、上下文压缩、Skill 选择和浏览器操作。
    https://github.com/kerpopule/hermes-jev-skills

1 个赞