Jev(TypeSafe AI)实测:不写字的"System One"决策模型
大模型很能写,但 Agent 流水线里 90% 的"决策"其实不需要写字——路由到哪个工具、这条工单归哪组、这条输出安不安全,都是"在已知答案空间里选一个"。Jev 是 TypeSafe AI(创始人 Diogo Almeida,前 OpenAI、InstructGPT 共同作者,$40M 种子轮 DCVC 领投)出的第一个 "System One" 模型:它完全不生成文本,只接收"状态 + 强类型问题",返回"结构化决策 + 校准概率"。
直播实测(已拿到 TYPESAFE_API_KEY)
初版写于还没 key 时,只能靠同门 classifier.dev 间接实证(它底层返回 model: jev-1.13.0)。现已用官方 key 直播跑通三原语 + 中文,端点 POST https://api.typesafe.ai/v1/systemone,鉴权 Authorization: Bearer $TYPESAFE_API_KEY。下面三个用例都是真实返回,未做美化。
用例 1 · 鉴权与模型清单
GET /v1/models → HTTP 200(2.96s,含冷连接 TLS 开销)。返回可用别名:jev-latest(release 2026-09-10)、jev-preview。证明 key 有效、账户可用、服务端在线。
用例 2 · 英文工单:Noul + Choice + Score 一次请求
三个原语一次往返全返回。重点看 department:这条消息既说"Stripe 账号连不上"(technical),又带"losing sales"(sales 信号),Jev 给 technical 0.65 / billing 0.35 / sales 0.0,confidence 仅 0.47——它老实承认"有点歧义、没把握"。这正是 RLCD 校准的价值:不硬装确定,把不确定的甩给人工或二次确认。而 frustration 这种清晰信号直接给 confidence 1.0。校准随问题难度自适应,不是统一刷高的假置信。
用例 3 · 中文评论:Choice + Noul
中文原生可用:指令和文本都是中文,情感判定 negative 拉满(1.0)、是否投诉 0.96,和英文用例一样干净。对中文 Agent 流水线直接可用,不用另接翻译层。
成本实测:用例 2 的 435 input token ≈ $0.000018 / 次(输入 $0.042/1M,输出免费)。量级和官方宣传一致——便宜到可以"每条消息都过一道决策"而不是抽样。
三种问题原语
| 类型 | 返回 | 典型用途 |
|---|---|---|
| Choice | 从 ≤255 个选项里选 1 个 + 各选项概率 + 置信度 | 工单分派、意图路由 |
| Score | 在 2–10 级标尺上给连续分 + 分布 + 置信度 | 严重级评分、质量分级 |
| Noul | 0–1 的"是/否"概率 | 越狱检测、矛盾判定、护栏 |
⚠️ 坑:Noul 没有独立的 confidence 字段(区别于 Choice/Score)。代码里到处读 answer.confidence 会在 Noul 上崩——官方文档明确点名这个陷阱。
关键参数(官方 + 实测)
- 延迟:官方 70–500ms;本环境实测端到端 0.99–1.54s(含出网开销,见上);
- 价格:输入 $0.042 / 1M token,输出免费(不生成 token 字符串);实测 435 token ≈ $0.000018 / 次;
- 上下文:32K;
- 训练:RLCD(Reinforcement Learning for Calibrated Decisions),目标是"校准概率"——实测 department 案例已展示自适应置信(清晰信号 1.0、歧义信号 0.47);
- 并发:同一请求里的多个问题并行评估,问 1 个和问 3 个(用例 2)往返时间接近;
- 模型版本:直播返回
jev-1.13.0,与 classifier.dev 底层版本一致。
接入方式
- Waitlist:typesafe.ai(早期访问,据称 1–2 天发 key);
- Console / Playground:console.typesafe.ai;
- SDK:Python / TypeScript,或直接
POST https://api.typesafe.ai/v1/systemone; - Vercel AI Gateway:模型 ID
typesafe-ai/jev(走 Vercel 额度,同价 $0.042/1M 输入); - OpenRouter(
/api/alpha/decisions)、Cloudflare Workers AI(typesafe/jev)另有独立 key 与限额,非互通代理。
它真正适合干什么(来自社区实装)
- 路由 / 分类 / 护栏:每条进出 LLM 的消息都过一道 Noul 概率,成本低到可以"全量查而非抽样";
- Eval 打分:Langfuse trace 用 Jev 出裁决(needs_review / severity / failure_mode 一次请求搞定);
- Agent 上下文管理:
save-token-jev对每个历史 tool call 问"还相关吗",丢无关的,省 context(不动用户/助手文本); - 高频决策:
jev-trader每个区块链区块做一次买/卖/持;浏览器 agent 每帧选下一个 DOM 元素(≈300ms vs 大模型多秒推理)。
边界 / 我的判断
- 不是 LLM 替代品:不会写代码、不会总结、不给理由。只做"答案空间已知"的高频决策;
- 校准真实可测,但仍需自测:department 0.47 的歧义案例证明校准不是嘴上说说。但概率校准在"你的数据"上才作数,官方数字不能直接外推到你的 workload;
- 基准来自 TypeSafe 自家:其内部 4 个工作流与人类参考约 68% 一致,和"中档 LLM"持平但成本/时延一个量级更低。独立第三方基准仍缺,200x/400x 当上限看、别当典型值;
- 早期访问风险:waitlist + 无 SLA,生产关键路径要兜底(置信阈值 + 人工复核带);
- 中文 OK:实测中文指令/文本直接可用,无需翻译层——对中文 Agent 场景是加分项。
对比 classifier.dev(同门)
| 维度 | classifier.dev | Jev 原版 |
|---|---|---|
| API key | 免 key | 要(早期访问) |
| 形态 | 仅零样本分类 | Choice/Score/Noul 全原语 |
| 成本 | 免费 | $0.042/1M 输入 token(实测 ≈$0.000018/次) |
| 可控性 | 低(托管封装) | 高(自控 key / Gateway / 多路由) |
| 直播实证 | 已实测(jev-1.13.0,143–307ms) | 已实测(jev-1.13.0,三原语 + 中文) |
两者底层是同一个 Jev(版本号一致),区别在封装层:classifier.dev 是"免 key 的零样本分类托管壳",Jev 原版是"全原语 + 自控"的决策 API。轻量分类用前者,要 Noul 护栏 / Score 分级 / 多问题并行就上原版。
评分(直播实证后)
成熟度 / 可信度 ⭐⭐⭐(早期访问、基准自陈、缺第三方独立评测)|生产就绪 ⭐⭐(waitlist、无 SLA,关键路径需兜底)
结论:直播把"间接实证"坐实了——Jev 真能跑、真快、真便宜、真校准、中文可用。但它不是 LLM 替代,是"决策车道"的新价格锚点。适合放进 Agent 的路由/护栏/打分节点,前提是接受早期访问的不确定性与自测校准的责任。