Jev:TypeSafe 首个 System One Model,把决策做成类型安全并便宜两个数量级
typesafe-jev
TypeSafe 首个 System One Model:输出不是字符串而是 Noul/Choice/Score 三种提问原语下的类型安全结构化值,RLCD 训练校准决策概率。官方 13 问并行实验单次调用比拆 13 次便宜约 12.2 倍、快约 10.0 倍;四工作流平均准确率 67.8%、单例 0.0004 美元、0.4 秒,准确率与 opus 5 / sol 同档而成本离开近两个数量级;输入 0.042 美元/M tokens、输出免费。附 OpenJev 本机复现与八处毛边清单。
- 置信度
- 厂商宣称
- 只有官方模型卡/发布会,无独立复测
- 关键指标
- 四工作流平均准确率(官方评测)
- 厂商宣称 · 2026-09
- 成熟度
- 产品
- 研究 → 演示 → 产品 → 生产
我们的判断水位判断:Jev 把「决策」从生成里切出来,做成类型安全输出加校准概率,是基模层少见的形状创新;成本轴离开所有人近两个数量级,使它成为高频小决策(路由、分类、下一步动作)的默认档。差距也清楚:四流平均 67.8% 对 opus 5 / sol 的 73-74%,长链路任务仍该交给顺序旗舰;官方评测的参考标签来自竞品高思考档,读法要带方法论折扣。置信度标 C(厂商宣称):我们有 OpenJev 本机复现路径,但尚未在自有 harness 上跑完对照。
Jev 是 TypeSafe 推出的第一个商用 System One Model:输出不是自由字符串,而是 Noul / Choice / Score 三种提问原语下的类型安全结构化值,类型错误在协议层就不可能发生。训练目标也不是 RLHF 或 RLVR,而是 RLCD——用严格适当评分规则把「决策概率」训练成校准的置信度,让调用方可以直接拿概率做路由与兜底。
它的上下文口径与顺序模型不同:整份状态一次读入,全部问题并行处理。官方并行手册的实验是 13 个问题(8 个 Noul、2 个 Choice、3 个 Score)跑在一份固定版本的 GDPR 维基百科全文上:合成一次调用比拆成 13 次便宜约 12.2 倍、快约 10.0 倍,答案完全一致;快速上手页引用同一实验给的是 11.5 倍与 9.6 倍,量级一致。状态加全部问题合计 64k token,状态加最长单个问题 32k token。
官方评测把任务拆成问题加代码规则,参考标签取当前最强两个模型(GPT-6 Astra 与 Fable 5.1、均开高思考)对每个问题回答的平均。四个工作流上 Jev 平均准确率 67.8%、单例成本 0.0004 美元、单例耗时 0.4 秒;对照组 opus 5 的 workflow 形态是 73.1%、0.1761 美元、37.8 秒,sol 是 74.1%、0.0836 美元、23.3 秒。准确率与 sonnet 5、terra 同档,成本轴上离开所有人近两个数量级。首页「快 193.6 倍、便宜 444.6 倍」出自这组评测,官方承认那是真实收益里偏乐观的一端。
账单是它最硬的部分:输入每百万 token 0.042 美元(每十亿 42 美元),输出免费;比 Claude Fable 5.1 的输入价低 238 倍。Doom 演示每秒 10 次查询约合每小时 7 美元。限额为每秒 25 万 token、每分钟 1200 请求,官方明说早期阶段限额会动态调整。毛边也要记:我们在一个开源的并行约束解码模型(同一类校准概率机制)上跑过 30 条带金标的决策评测,平均置信度 0.82、实际准确率只有 0.70——校准概率这类机制的置信度不能直接当准确率消费。