TypeSafe Jev 模型解析:一个不生成文本的 AI
发布:2026-09-15 官网:typesafe.ai 文档:docs.typesafe.ai Playground:console.typesafe.ai/playground
一、是什么
TypeSafe AI 的第一款模型,创始人 Diogo Almeida(前 OpenAI 研究员、2022 年 InstructGPT 论文共同作者)。公司融资 4000 万美元,蛰伏两年。
核心定位:不是 LLM,一个字的文本都不生成,只输出带校准置信度的结构化概率判定,给软件直接调用。
把「会聊天」换成「会判断」,做机器原生(machine-native)的决策原语。
创始人的出发点:模型聊天能力早就超人,但真正能嵌进代码的自动化还缺关键一环——LLM 输出字符串,要给软件用就得解析 + 校验,还有跑偏风险。
二、三种提问原语
| 类型 | 回答什么 | 返回 |
|---|---|---|
| Noul | 这个陈述是真的吗? | noul,0~1 的是/否概率 |
| Choice | 选哪个选项? | choice + probabilities + confidence(最多 255 个选项) |
| Score | 在哪个等级? | score + legend + probabilities + confidence |
三者可混在一次 API 调用里,全部并行评估,共享同一份 state。加问题几乎不增加响应时间。
示例(客服工单路由):
{
"department": {
"type": "choice",
"choice": "technical",
"probabilities": { "billing": 0.08, "technical": 0.85, "sales": 0.07 },
"confidence": 0.82
}
}设计原则:每个问题只问一件具体的事——「一个有知识的人几秒内能做出的判断」。需要推理链或权衡多因素的,拆成多个问题,在代码里用权重组合。优先级变了就改代码里的系数,不用重写 prompt。
三、核心数据
| 项目 | 数值 |
|---|---|
| 输入价格 | $42 / 十亿 token($0.042 / 百万) |
| 输出价格 | 免费 |
| 延迟 | 70ms ~ 500ms |
| 宣称加速 | 工作流场景下快 193.6 倍、便宜 444.6 倍 |
| 对比 | 比 Claude Fable 5.1 输入价低 238 倍 |
| 请求预算 | 约 32000 token / 15 万英文字符 |
真实成本参考:
- 1000 条 RSS 判断 ≈ 2 分钱
- 37 篇文档 × 21 个问题(777 个判断)≈ 0.25 美分
价格可信度:官方自己承认「We can’t prove it isn’t subsidized」——极可能在烧钱换增长,长期价格会降,但这是赌注不是承诺。
四、技术栈(全新三件套)
- 新架构:不逐 token 自回归生成,一次查询并行返回全部输出
- 并行采样器:硬件感知,多问题共享 state 独立评估,无 context-rot
- RLCD 训练法:Reinforcement Learning for Calibrated Decisions(对比 LLM 的 RLHF / RLVR)。目标是置信度等于真实准确率——标 100 条「90% 愤怒」,就该有 90 条真愤怒
命名:
- Jev → 19 世纪经济学家 William Stanley Jevons,Jevons 悖论:效率提升反而让消耗增加。寓意「智能单价每降一个数量级,解锁一个数量级的新用例」
- System One → 卡尼曼《思考,快与慢》的系统 1(快、直觉),相对系统 2(慢、推理)
五、怎么用
1. Playground(最快验证)
console.typesafe.ai/playground — 登录后粘一段文本当 state,加问题看结果
2. HTTP API
POST https://api.typesafe.ai/v1/systemone
Authorization: Bearer <API_KEY>
Content-Type: application/jsonAPI key 在 console.typesafe.ai/settings/keys 获取。
3. SDK
- Python:
pip install typesafe-sdk(需 ≥3.10) - JavaScript:官方有 SDK
4. Agent Skill(对 Hermes / Claude Code 最相关)
npx skills add typesafe-ai/skills --skill typesafe-ai装完 coding agent 就知道怎么调用,可以在处理任务时用 Jev 做判断。
六、实测表现(第三方)
Every 的 Mike Taylor:
- 37 篇文档 × 21 个问题 = 777 个判断,不到 0.7 秒,约 1/4 美分
- 12 段文本挑错:Jev 抓到 7 个缺陷中的 6 个(Fable 5.1 全抓到),但快 25 倍、便宜 580 倍
- 结论:适合当「知识工作的 linter」,能边干活边反复检查,而不是事后抽查
TypeSafe 自家工作流评测(711 个案例,4 个任务):
| 工作流 | Jev 准确率 | 最佳对比 | 说明 |
|---|---|---|---|
| 安全事件 | 61.7% / 0.3s | Opus 66.2% / 15.1s | 接近 Sol,低于 Opus |
| Agent trace 可观测 | 71.6% / 0.5s | Sol 76.6% / 40.3s | 略低但快得多 |
| 发票处理 | 61.8% / 0.5s | Sol 79.1% / 34.3s | 最大质量差距 |
| 客服 | 76.0% / 0.4s | Sol 78.3% / 10.1s | 接近 Sol,高于 Opus |
| 聚合 | 67.8% / 0.4s | Sol 74.1% / 23.3s | 赢在成本和时间,不是准确率 |
七、⚠️ 边界与风险
1.「零幻觉」是窄口径宣称
只保证不输出 schema 之外的东西(不会吐非法 JSON),不保证语义正确。可以把正确的部门判成 billing——那是模型错误,不是类型错误。
「零幻觉」≠ 零假阳性、零假阴性、零偏差、零过置信。
2. 基准测试是「模型一致性」不是「真值」
参考答案用 GPT-6 Astra + Claude Fable 5.1 的平均判断,不是独立验证过的正确答案。任务和 harness 都是自家的,承认可能有偏。
3. 校准性未被独立验证
置信度曲线的公开数据缺失。官方建议在自己的数据上测阈值——这是好建议,但不是校准保证。
4. 集成成本转移给你
要自己设计决策图、定标签、设阈值、处理低置信度、评估错误。省掉 token 开销,加上软件工程和评估工作。
5. 其他限制
- ❌ 没有开源权重,纯 API,不能本地部署
- ❌ 参数、架构、硬件、训练数据、SLA、速率限制全部未披露
- ❓ 中文能力完全未知,所有公开评测都是英文
- ❓ 免费额度未见公开说明
- 🔒 数据要发给第三方(隐私边界)
八、定位判断
它不是 ChatGPT 的替代品,是「智能 if 语句」/ 决策层。
典型生产栈:
Jev 做分类/路由/打分 → 普通代码执行策略 → 需要写话时再调 LLM 或模板适合:高频、重复、对同一份 state 做大量小判断的场景——工单路由、检索重排、Agent 安全闸门、大数据 map-reduce 打标、实时应用、写作 AI 味检查。
不适合:写文章、写代码、解释理由、看图、需要推理链的任务、确定性计算(如价格公式)。
真正的价值:不是「快 200 倍」这种营销数字,而是把不确定性明确暴露在代码边界上——模型停在「判断」,代码掌握「阈值、分支、权限、副作用」。这比让 LLM 一口气吐决策 + 动作健康得多。
现状:early access / waitlist,公开证据支持「便宜快的判断层」,还不足以支持「前沿智能」的说法。等真值评测和校准曲线出来再看。
最后更新:2026-09-17
来源:TypeSafe 官网 + 官方文档 + 第三方评测(Every、Kingy AI、The Register、The Decoder)