目录

TypeSafe Jev 模型解析:一个不生成文本的 AI

发布:2026-09-15 官网typesafe.ai 文档docs.typesafe.ai Playgroundconsole.typesafe.ai/playground


一、是什么

TypeSafe AI 的第一款模型,创始人 Diogo Almeida(前 OpenAI 研究员、2022 年 InstructGPT 论文共同作者)。公司融资 4000 万美元,蛰伏两年。

核心定位:不是 LLM,一个字的文本都不生成,只输出带校准置信度的结构化概率判定,给软件直接调用。

把「会聊天」换成「会判断」,做机器原生(machine-native)的决策原语。

创始人的出发点:模型聊天能力早就超人,但真正能嵌进代码的自动化还缺关键一环——LLM 输出字符串,要给软件用就得解析 + 校验,还有跑偏风险。


二、三种提问原语

类型 回答什么 返回
Noul 这个陈述是真的吗? noul,0~1 的是/否概率
Choice 选哪个选项? choice + probabilities + confidence(最多 255 个选项)
Score 在哪个等级? score + legend + probabilities + confidence

三者可混在一次 API 调用里,全部并行评估,共享同一份 state。加问题几乎不增加响应时间。

示例(客服工单路由):

{
  "department": {
    "type": "choice",
    "choice": "technical",
    "probabilities": { "billing": 0.08, "technical": 0.85, "sales": 0.07 },
    "confidence": 0.82
  }
}

设计原则:每个问题只问一件具体的事——「一个有知识的人几秒内能做出的判断」。需要推理链或权衡多因素的,拆成多个问题,在代码里用权重组合。优先级变了就改代码里的系数,不用重写 prompt。


三、核心数据

项目 数值
输入价格 $42 / 十亿 token($0.042 / 百万)
输出价格 免费
延迟 70ms ~ 500ms
宣称加速 工作流场景下快 193.6 倍、便宜 444.6 倍
对比 比 Claude Fable 5.1 输入价低 238 倍
请求预算 约 32000 token / 15 万英文字符

真实成本参考:

  • 1000 条 RSS 判断 ≈ 2 分钱
  • 37 篇文档 × 21 个问题(777 个判断)≈ 0.25 美分

价格可信度:官方自己承认「We can’t prove it isn’t subsidized」——极可能在烧钱换增长,长期价格会降,但这是赌注不是承诺。


四、技术栈(全新三件套)

  1. 新架构:不逐 token 自回归生成,一次查询并行返回全部输出
  2. 并行采样器:硬件感知,多问题共享 state 独立评估,无 context-rot
  3. RLCD 训练法:Reinforcement Learning for Calibrated Decisions(对比 LLM 的 RLHF / RLVR)。目标是置信度等于真实准确率——标 100 条「90% 愤怒」,就该有 90 条真愤怒

命名

  • Jev → 19 世纪经济学家 William Stanley Jevons,Jevons 悖论:效率提升反而让消耗增加。寓意「智能单价每降一个数量级,解锁一个数量级的新用例」
  • System One → 卡尼曼《思考,快与慢》的系统 1(快、直觉),相对系统 2(慢、推理)

五、怎么用

1. Playground(最快验证)

console.typesafe.ai/playground — 登录后粘一段文本当 state,加问题看结果

2. HTTP API

POST https://api.typesafe.ai/v1/systemone
Authorization: Bearer <API_KEY>
Content-Type: application/json

API key 在 console.typesafe.ai/settings/keys 获取。

3. SDK

  • Python:pip install typesafe-sdk(需 ≥3.10)
  • JavaScript:官方有 SDK

4. Agent Skill(对 Hermes / Claude Code 最相关)

npx skills add typesafe-ai/skills --skill typesafe-ai

装完 coding agent 就知道怎么调用,可以在处理任务时用 Jev 做判断。


六、实测表现(第三方)

Every 的 Mike Taylor

  • 37 篇文档 × 21 个问题 = 777 个判断,不到 0.7 秒,约 1/4 美分
  • 12 段文本挑错:Jev 抓到 7 个缺陷中的 6 个(Fable 5.1 全抓到),但快 25 倍、便宜 580 倍
  • 结论:适合当「知识工作的 linter」,能边干活边反复检查,而不是事后抽查

TypeSafe 自家工作流评测(711 个案例,4 个任务)

工作流 Jev 准确率 最佳对比 说明
安全事件 61.7% / 0.3s Opus 66.2% / 15.1s 接近 Sol,低于 Opus
Agent trace 可观测 71.6% / 0.5s Sol 76.6% / 40.3s 略低但快得多
发票处理 61.8% / 0.5s Sol 79.1% / 34.3s 最大质量差距
客服 76.0% / 0.4s Sol 78.3% / 10.1s 接近 Sol,高于 Opus
聚合 67.8% / 0.4s Sol 74.1% / 23.3s 赢在成本和时间,不是准确率

七、⚠️ 边界与风险

1.「零幻觉」是窄口径宣称

只保证不输出 schema 之外的东西(不会吐非法 JSON),不保证语义正确。可以把正确的部门判成 billing——那是模型错误,不是类型错误。

「零幻觉」≠ 零假阳性、零假阴性、零偏差、零过置信。

2. 基准测试是「模型一致性」不是「真值」

参考答案用 GPT-6 Astra + Claude Fable 5.1 的平均判断,不是独立验证过的正确答案。任务和 harness 都是自家的,承认可能有偏。

3. 校准性未被独立验证

置信度曲线的公开数据缺失。官方建议在自己的数据上测阈值——这是好建议,但不是校准保证。

4. 集成成本转移给你

要自己设计决策图、定标签、设阈值、处理低置信度、评估错误。省掉 token 开销,加上软件工程和评估工作。

5. 其他限制

  • ❌ 没有开源权重,纯 API,不能本地部署
  • ❌ 参数、架构、硬件、训练数据、SLA、速率限制全部未披露
  • 中文能力完全未知,所有公开评测都是英文
  • ❓ 免费额度未见公开说明
  • 🔒 数据要发给第三方(隐私边界)

八、定位判断

它不是 ChatGPT 的替代品,是「智能 if 语句」/ 决策层。

典型生产栈:

Jev 做分类/路由/打分 → 普通代码执行策略 → 需要写话时再调 LLM 或模板

适合:高频、重复、对同一份 state 做大量小判断的场景——工单路由、检索重排、Agent 安全闸门、大数据 map-reduce 打标、实时应用、写作 AI 味检查。

不适合:写文章、写代码、解释理由、看图、需要推理链的任务、确定性计算(如价格公式)。

真正的价值:不是「快 200 倍」这种营销数字,而是把不确定性明确暴露在代码边界上——模型停在「判断」,代码掌握「阈值、分支、权限、副作用」。这比让 LLM 一口气吐决策 + 动作健康得多。

现状:early access / waitlist,公开证据支持「便宜快的判断层」,还不足以支持「前沿智能」的说法。等真值评测和校准曲线出来再看。


最后更新:2026-09-17

来源:TypeSafe 官网 + 官方文档 + 第三方评测(Every、Kingy AI、The Register、The Decoder)