【实操分享】在TraeCode中成功调用JEV并且用来项目中的核心判断

首先需要了解以下各个知识:

Trae官方对JEV的文章:https://mp.weixin.qq.com/s/DNr2E1OW63GO0v9dMsrvSA

JEV是什么的介绍: 不会还有人不知道JEV吧,只输出决策,不产文本。以 RLCD 训练、并行推理替代自回归

TypeSafe JEV官方仓库skill: skills/skills/typesafe-ai/SKILL.md at main · typesafe-ai/skills · GitHub

TypeSafe: TypeSafe


通过Trae官方文章和typesafe官方skill来实现,过程llm是glm5.3flash,积分消费30以内


一、我的项目背景以及怎么接入

我之前有个项目night-shift: 刚刚好接着traecode中ds模型的忙闲算力使用,来介绍night shift,忙时做设计,闲时稳定批量运行 (感兴趣的同学可以点击链接了解)他是一个框架用来给AI做昼夜分工执行协议的,其中核心思想就是算力贵的时候人做判断,便宜的时候AI做执行;更普遍地说,night-shift 里的人做判断:

直到 TypeSafe 发布了 Jev,我发现这批判断有了专门的模型或许可以来承接


二、为什么是 Jev

System One 决策模型,和 LLM 的区别一句话就能说清:

LLM 帮你写,Jev 帮你判断。

它的接口形态完全为软件消费设计:

{
  "state": "要判断的内容(文本或结构化数据)",
  "model": "jev-latest",
  "questions": {
    "is_urgent": { "type": "noul", "instructions": "这个消息表达了紧迫性吗?" }
  }
}

三种原语覆盖三类判断:

原语 问什么 返回
Choice 闭集选一个 选中项 + 每项概率 + confidence
Score 有序等级打分 等级位置 + 分布 + confidence
Noul yes/no P(yes)

三个特性:

  1. 校准概率是产品本身。Choice/Score 自带 confidence,这是训练目标(RLCD,为校准决策做强化学习)决定的,不是 prompt 工程逼出来的
  2. 多问题一次调用并行。加问题几乎不增加耗时,官方数据 70~500ms。我的场景一次要问 7 个问题,这个特性是体验基石
  3. 便宜到可以忽略。$0.042/1M input tokens、输出免费。实测一轮 7 问评分(约 3000 字任务卡)花 $0.0004,总共消费见文章最后

三、实现

1.其实就是发这段话,包括官方文章和skill,同时我也有自己的设计就是我想要用jev来执行任务卡是否准入到夜间任务队列的判断


2.中间过程忽略几次需求澄清和对话,无非就是说明清楚你的项目背景和设计诉求,以及ai会判断是否合适,并且结合内容来开发,用的llm是glm5.3flash,总消耗积分粗估不到30个积分


3.最终沉淀到协议层中说明判断工具的调用


四、例子

criteria 必须是描述具体情境的有序等级,不能写“好/中/差”。比如验收标准维度(满分 25):

("acceptance_machine_verifiable", 25, [
    "验收标准完全无法机器校验,全靠人工主观判断",
    "多数验收项靠人工主观判断",
    "约一半验收项可机器校验",
    "大部分验收项可机器校验,个别需要人工判断",
    "全部或接近全部可机器校验,个别表述含糊",
    "每一条验收标准都是明确命令或指标,可直接判定通过与否",
]),

调用就是标准的 urllib:

req = urllib.request.Request(
    "https://api.typesafe.ai/v1/systemone", data=payload, method="POST",
    headers={"Authorization": "Bearer " + api_key, "Content-Type": "application/json"},
)

输出长什么样

单卡评分的 JSON(bad-01 为例),维度分、校准置信度、总闸概率全都在:

{
  "total": 23.0,
  "suggestion": "建议 grill 补强后再准入",
  "overall_gate_noul": 0.95,
  "dimensions": {
    "goal_clarity":   {"points": 4.3, "max_points": 20, "confidence": 0.86},
    "acceptance_machine_verifiable": {"points": 0.5, "max_points": 25, "confidence": 0.93},
    "conflict_scope": {"points": 5.0, "max_points": 15, "confidence": 0.98},
    "night_suitability": {"points": 7.8, "confidence": 0.32, "low_confidence": true}
  }
}

注意 night_suitability 的 confidence 只有 0.32——模型在说“这卡夜里跑会出事,但我这个判断本身不太确定”。这个元信息直接变成了 grill 的深挖提示,是纯 LLM 方案给不出的。


最后,成本与体验

一轮完整评分(3000 字任务卡):input 9,196 tokens ≈ $0.0004,亚秒级返回
全部验证过程(9次调用)总成本不足 $0.001
对比:同样的六维评审交给通用 LLM 逐维分析,一次要几美分 + 10 秒以上,且给不出校准置信度

1 个赞

无需充值,gmail申请即可拿下

1 个赞

又能白嫖!

1 个赞

不知道会不会限制,不过目前看花费很低,毕竟输出不用钱,而且其实就是做决策,用不了多少;感觉会被各大llm集成

1 个赞

用了这段时间,下一步可以进去替换之前微调的小模型做的意图路由,做个ab测

1 个赞

callback上一条,跑了ab测,用的之前给微调小模型router的测试集,符合准确93%,微调router之前的效果是97%,diff存在但微调是基于data跑出来,有天然优势且优化了好几轮,所以如果以一次应用率为准的话并且结合成本,jev也是一个good choice;等待tibo集成,jev应该和几大头部配合来用,单独一个怕是会沦为垫脚石最后和openclaw一样;

1 个赞

送这么多token,根本用不完

2 个赞

那么厉害还会是个小模型么。。。动动脑子

1 个赞

快速分类器真有这么多的使用场景么?直接llm一把梭就好了

2 个赞

看不懂怎么都在发,可能太久没有新玩意了,玩了两下感觉真接不上场景,低成本做斗地主外挂

2 个赞

说实话,感觉它是个分类器更准确吧,llm平替

1 个赞

分类,挺多的吧,感觉突然很多国内发都是今天了,大前天x上火,这两天冷却了在找效果,国内信息差才开始

1 个赞

大模型足够覆盖这种分类器了,不是高延迟要求的场景没啥必要。一般来说,我宁可用qwen3.8flash,

1 个赞

这种小模型。。。自己都上不了台面。。你指望它给你判断。。不等于找死

1 个赞