实测测评 · System One 决策模型

Jev(TypeSafe AI)实测:不写字的"System One"决策模型

2026-09-19 · 阅读约 7 分钟 · 已用官方 TYPESAFE_API_KEY 直播实测(非间接推断)

大模型很能写,但 Agent 流水线里 90% 的"决策"其实不需要写字——路由到哪个工具、这条工单归哪组、这条输出安不安全,都是"在已知答案空间里选一个"。Jev 是 TypeSafe AI(创始人 Diogo Almeida,前 OpenAI、InstructGPT 共同作者,$40M 种子轮 DCVC 领投)出的第一个 "System One" 模型:它完全不生成文本,只接收"状态 + 强类型问题",返回"结构化决策 + 校准概率"。

直播实测(已拿到 TYPESAFE_API_KEY)

初版写于还没 key 时,只能靠同门 classifier.dev 间接实证(它底层返回 model: jev-1.13.0)。现已用官方 key 直播跑通三原语 + 中文,端点 POST https://api.typesafe.ai/v1/systemone,鉴权 Authorization: Bearer $TYPESAFE_API_KEY。下面三个用例都是真实返回,未做美化。

用例 1 · 鉴权与模型清单

GET /v1/models → HTTP 200(2.96s,含冷连接 TLS 开销)。返回可用别名:jev-latest(release 2026-09-10)、jev-preview。证明 key 有效、账户可用、服务端在线。

用例 2 · 英文工单:Noul + Choice + Score 一次请求

state: "Hi, I've been trying to connect my Stripe account for 3 days and it keeps failing. I'm losing sales. Please help ASAP." → is_urgent (noul) = 0.98 # 强 urgent(是/否概率) → department (choice) = technical (0.65) | billing 0.35 | sales 0.0 confidence 0.47 → frustration (score) = 1.0 ("Frustrated but civil") confidence 1.0 legend: 0=Calm · 1=Frustrated but civil · 2=Very angry, strong language usage: input 435 · output 73 token · HTTP 200 · 端到端 1.54s

三个原语一次往返全返回。重点看 department:这条消息既说"Stripe 账号连不上"(technical),又带"losing sales"(sales 信号),Jev 给 technical 0.65 / billing 0.35 / sales 0.0,confidence 仅 0.47——它老实承认"有点歧义、没把握"。这正是 RLCD 校准的价值:不硬装确定,把不确定的甩给人工或二次确认。而 frustration 这种清晰信号直接给 confidence 1.0。校准随问题难度自适应,不是统一刷高的假置信。

用例 3 · 中文评论:Choice + Noul

state: "这个商品价格离谱,客服还不理人,我再也不会来了!" → sentiment (choice) = negative confidence 1.0 (positive 0 / neutral 0 / negative 1.0) → is_complaint (noul) = 0.96 usage: input 378 · output 59 token · HTTP 200 · 端到端 0.99s

中文原生可用:指令和文本都是中文,情感判定 negative 拉满(1.0)、是否投诉 0.96,和英文用例一样干净。对中文 Agent 流水线直接可用,不用另接翻译层。

延迟实测:本测试环境(沙箱出网)端到端 0.99–1.54s;冷请求 /v1/models 达 2.96s,主要是出网 TLS/连接开销。模型自身算力应落在官方宣称的 70–500ms 区间,差在我的网络 transit。结论:亚秒级实锤,但别拿我这里的数字当服务器侧基准。

成本实测:用例 2 的 435 input token ≈ $0.000018 / 次(输入 $0.042/1M,输出免费)。量级和官方宣传一致——便宜到可以"每条消息都过一道决策"而不是抽样。

三种问题原语

类型返回典型用途
Choice从 ≤255 个选项里选 1 个 + 各选项概率 + 置信度工单分派、意图路由
Score在 2–10 级标尺上给连续分 + 分布 + 置信度严重级评分、质量分级
Noul0–1 的"是/否"概率越狱检测、矛盾判定、护栏

⚠️ 坑:Noul 没有独立的 confidence 字段(区别于 Choice/Score)。代码里到处读 answer.confidence 会在 Noul 上崩——官方文档明确点名这个陷阱。

关键参数(官方 + 实测)

接入方式

它真正适合干什么(来自社区实装)

边界 / 我的判断

对比 classifier.dev(同门)

维度classifier.devJev 原版
API key免 key要(早期访问)
形态仅零样本分类Choice/Score/Noul 全原语
成本免费$0.042/1M 输入 token(实测 ≈$0.000018/次)
可控性低(托管封装)高(自控 key / Gateway / 多路由)
直播实证已实测(jev-1.13.0,143–307ms)已实测(jev-1.13.0,三原语 + 中文)

两者底层是同一个 Jev(版本号一致),区别在封装层:classifier.dev 是"免 key 的零样本分类托管壳",Jev 原版是"全原语 + 自控"的决策 API。轻量分类用前者,要 Noul 护栏 / Score 分级 / 多问题并行就上原版。

评分(直播实证后)

概念锐度 ⭐⭐⭐⭐⭐("System One"切中 agent 成本痛点,实测三原语 + 中文都站得住)|性价比潜力 ⭐⭐⭐⭐⭐(输出免费 + 亚秒级 + 实测 $0.000018/次)
成熟度 / 可信度 ⭐⭐⭐(早期访问、基准自陈、缺第三方独立评测)|生产就绪 ⭐⭐(waitlist、无 SLA,关键路径需兜底)

结论:直播把"间接实证"坐实了——Jev 真能跑、真快、真便宜、真校准、中文可用。但它不是 LLM 替代,是"决策车道"的新价格锚点。适合放进 Agent 的路由/护栏/打分节点,前提是接受早期访问的不确定性与自测校准的责任。