Jev:前 OpenAI 研究员做了个「不说话」的模型,专给软件做决定

机智流 2026-09-20 08:47

一句话说清:TypeSafe AI 的 Jev 是一台不生成一个字的模型——你扔给它程序状态和一串预定义问题,它一次前向就吐回带校准概率的类型化决策,专给软件当「智能 if」用。

2026 年 9 月 15 日,这家旧金山实验室结束约 2 年隐身期,放出首款 System One 模型 Jev。BusinessWire:DCVC 领投约 4000 万美元 seed;Forbes 等报道口径称估值约 2 亿美元(媒体口径,非公司官方定价)。CEO Diogo Almeida 曾参与 OpenAI 的 RLHF / InstructGPT / ChatGPT / GPT-4 相关工作——他现在反过来赌:软件真正需要的,是敢说不确定、敢给概率、敢被代码直接调用的决策原语。

Jev:前 OpenAI 研究员做了个「不说话」的模型,专给软件做决定图1

官网对比节选:Jev 相对 LLM 工作流自测约 193.6× 快(厂商自测,非独立第三方认证)

先把收获压成几条,决定要不要往下看:

• 输出不是句子,是 Choice / Score / Noul 三种类型化答案 + 校准概率

• 无自回归:一次前向并行答完;官方称输出 token 免费,输入约 $0.042/MTok

• 延迟官方称 70–500ms;首页宣称约 193.6× 快、444.6× 便宜——当厂商自测读

• 「不能幻觉」= 类型外输出不可能;判断仍可错;校准是群体属性

• 仅文本;不会主动查世界知识——你塞什么 state,它就在那上面判断

下文:团队 → 原理 → 应用 → 实操 → 适合谁。文中「智能体」首次点明:指能自己多步规划并调用工具完成任务的 AI 程序。

① 谁在做:履历里藏着产品形状

名单堆砌没意思。更有用的读法:三人各自「被什么问题打过」,几乎直接塑形了 Jev 的接口。

Jev:前 OpenAI 研究员做了个「不说话」的模型,专给软件做决定图2

TypeSafe 团队(官网团队页 · SF 办公室)

Jev:前 OpenAI 研究员做了个「不说话」的模型,专给软件做决定图3

左起:Diogo Almeida(CEO)· Sasha Sheng(COO)· Erik Gafni(CTO)

Diogo Almeida · CEO:官网写他「共同发明了 RLHF 与 InstructGPT」;此前 Google Brain;Forbes 口径:OpenAI 约 4 年优化 ChatGPT 式回答,2024 年离开创办 TypeSafe。他的转向很刺:RLHF 把模型推向取悦人类之后,下一张牌押在「取悦软件」——接口必须像函数,不能像散文。fun fact:曾打进北美英雄联盟前 30、炉石传说前 2。

Sasha Sheng · COO:前 Meta / FAIR,做过 News Feed、AI Experiences;NeurIPS / ECCV 发表;自称 2023 年赢过 7 场 hackathon。把研究原语翻译成开发者一天能抄走的 API、文档与节奏——发布一周内 OpenRouter、Vercel AI SDK、jev-mcp / Pi auto-mode 围上来,不是偶然。API 只有三种原语,很可能是刻意:能进生产的接口,必须少到记不住也会用。

Erik Gafni · CTO:连续创业者(Ravel 多模态 AI + DNA,曾融资约 $9.5M);早期走过 Invitae、Freenome;哈佛医学院做过生信 / ML;曾任 Eventum AI Head of ML。履历关键词是「嵌进会付钱、会告警的流水线」。Jev 的类型洁癖,很像医疗基因流水线:宁愿放弃生成,也要先保证类型宇宙封闭。

融资底色:DCVC 领投约 $40M seed;估值约 $2 亿为报道口径。团队来自 OpenAI / Google Brain / Meta FAIR / Stripe / Airbnb / Plaid / Docker 等;SF 办公室五天到岗。这不是套壳做客服的故事,而是一群人主动放弃字符串生成,去赌软件原生的决策层。

② 原理:System One、三种原语、RLCD

命名借自卡尼曼《思考,快与慢》。System 1:快、直觉、并行;System 2:慢、深思、串行。TypeSafe 把新模型叫 System One Models——不是说更草率,而是承认:软件里绝大多数判断本就是快判断(这单归谁?紧急吗?是否越狱?)。过去租完整推理大模型做这些事,像每次过马路都请数学家解最优路径——能做,但贵、慢、爱跑题。

名字 Jev 致敬杰文斯悖论:蒸汽机更省煤后,煤总消耗反而上升——效率把用途扩大了。他们的类比:智能每便宜一个数量级,用例就炸一个数量级。所以不做「更会写长文」,做「便宜到能塞进每个 if」的决策原语。

Jev:前 OpenAI 研究员做了个「不说话」的模型,专给软件做决定图4

官网隐喻「String Tax」:生成字符串的额外税负 vs 类型化决策的干净路径

接口形状一句话:state + questions → answers

• state:文本或程序状态(字符串 / JSON / 文本数组);目前仅文本

• questions:预定义问题字典;每个指定类型与指令;Choice 还要选项释义

• answers:结构化答案 + 概率分布 + confidence;软件直接分支,不必再祈祷 JSON 解析成功

和 LLM JSON mode 的关键差:LLM 仍在生成字符串再约束;Jev 的输出空间在调用前就被钉死,类型错误在构造上不可能。

整个 API 几乎只有三种原语——这是设计哲学,不是功能残缺:

• Choice:最多 255 选项里选一;返回键、概率分布、confidence;可加 other。高基数(如 Wikiracing)官方用两阶段:先打分再 Choice

• Score:文字描述的 2–10 级量表;可落在级别之间(如 1.4)

• Noul:是/否,返回 0–1 概率。紧急吗?要退款吗?是否越狱?一条概率搞定

一次调用可同时问:归哪个团队(Choice)、客户有多火大(Score)、是否明确要求退款(Noul);再用普通 if 拼工作流。官方爱说的比喻:「智能 if 语句」。

Jev:前 OpenAI 研究员做了个「不说话」的模型,专给软件做决定图5

官方风格示意:Triage → Disposition → Containment;Bool / Score / Choice 并行「读」状态

RLCD = Reinforcement Learning for Calibrated Decisions(校准决策强化学习)。对照:RLHF 优化人类偏好(爱表演确定性);RLVR 优化可验证奖励(数学等);RLCD 优化「在 System One 任务上给出认识上诚实的概率」——更高置信应对应更高准确。校准是群体属性,不保证单次正确;Jev 仍会错,价值在于更可能把「不太确定」写进概率,让门槛逻辑接得住。

采样并行:一次前向吐出所有答案,不是逐 token 往后咬。官方定价口径(可能调整):输入约 $0.042 / MTok;输出 token 免费;延迟官方称约 70–500ms。首页大字约 193.6× 快、444.6× 便宜——厂商自测,非独立第三方认证。官方自己摊开的 nuance 包括:评测多从美西笔记本打到其机房;无法证明定价无补贴;工作流由内部能力团队制作或有偏见;参照取前沿模型平均,偏向 OpenAI / Anthropic 系;对照 LLM 走了 System One wrapper(更准也更慢更贵)。正确姿势:拿自己的工单 / 护栏数据复现,别写进对外 SLA。

Jev:前 OpenAI 研究员做了个「不说话」的模型,专给软件做决定图6

厂商工作流评测:准确率 vs 成本散点(Jev 落在便宜一侧 · 厂商自测)

Jev:前 OpenAI 研究员做了个「不说话」的模型,专给软件做决定图7

厂商自测:结构化输出 / 工具调用错误率对比——Jev 标 0%(类型外输出不可能,不等于判断永不错)

「不能幻觉」边界钉死:

• 类型外输出不可能:没声明的选项不会冒出来;schema mismatch 构造上为 0%

• 判断仍可错:选了 billing 也可能是技术问题;类型正确 ≠ 语义正确

• 校准是群体属性:长期高置信更准;单次仍要门槛与人工兜底

• 无世界知识主动检索:只知道你传入的 state;查库搜网得你自己拼进去

一句话:消灭的是「格式幻觉」和「类型漂移」,不是「认知错误」。软件自动化要的第一层安全,往往正是前者。

③ 应用:智能 if、级联智能体、生态触手

最直白:把「调一次 GPT 再正则抠字段」换成 Jev + 本地 if——

• 工单路由:Billing / Technical / Sales + 紧急度 Noul

• 内容与安全:护栏、越狱检测——不确定就人工

• 对 LLM 输出打分:相关性、完整性、是否胡编工具调用

• 推荐重排、个人自动化(邮件是否值得打断我)

共同点:答案集合已知,仍需语义理解;错一次可用阈值调节;调用频率高到前沿 LLM 会烧钱烧延迟。

Jev:前 OpenAI 研究员做了个「不说话」的模型,专给软件做决定图8

官网视觉:把判断从「生成散文」里拆出来,交给机器可读的决策层

构建智能体系统时,值钱的往往不是「一个模型通吃」,而是级联:Jev 做高频类型化决策(路由、是否继续、是否调工具);确定性代码做校验 / 事务 / 权限 / 审计;前沿 LLM 只吃少数需要生成与长推理的步骤。按操作设门槛:低代价高置信自动;高代价要更高置信或人工;低置信升级大模型或人——得到可审计边界,而不是整条链路一个模糊准确率。

官方 demo:Doom 吃结构化游戏状态选合法动作(目前是文本状态,不是像素);Wikiracing 演示高基数 Choice 与「不幻觉链接」。团队调侃过每秒约 10 次查询(约 $7/小时量级)比预期便宜。

Jev:前 OpenAI 研究员做了个「不说话」的模型,专给软件做决定图9

Jev 标识(官网)

发布后几天就长出来的生态:

• OpenRouter:`typesafe/jev-1.13`,走 Decisions API(不是普通 chat)

• Vercel AI SDK:`experimental_evaluate`,经 AI Gateway 调 `typesafe-ai/jev`

• jev-mcp:挂进 Cursor / Codex / Claude Code 等智能体宿主

• jev-harness / Pi auto-mode:工具边界 go/no-go,失败则闭(fail closed)

• 开发者站 jevai.dev:用例与对照表

④ 实操:申请、最小调用、三档门槛

• 官网 waitlist:https://typesafe.ai/

• 或 OpenRouter:模型名 `typesafe/jev-1.13`,端点 Decisions API

• Vercel:AI SDK 指南 + AI Gateway

• 密钥只放服务端;浏览器直出等于公开钱包

下面是改编自 jevai.dev / OpenRouter 风格的最小 TypeScript 示例——整段复制到服务端;阈值 0.8 只是示意,必须用自己的数据标定。

const apiKey = process.env.OPENROUTER_API_KEY; if (!apiKey) throw new Error("Set OPENROUTER_API_KEY");  const response = await fetch("https://openrouter.ai/api/alpha/decisions", {   method: "POST",   headers: {     Authorization: "Bearer " + apiKey,     "Content-Type": "application/json"   },   body: JSON.stringify({     model: "typesafe/jev-1.13",     state: "My card was charged twice. Please help ASAP.",     questions: {       department: {         type: "choice",         instructions: "Which team should handle this?",         criteria: {           billing: "Payments and refunds",           technical: "Bugs and integrations",           sales: "Pricing and upgrades"         }       },       urgent: {         type: "noul",         instructions: "Does this message need urgent attention?"       }     }   }) });  if (!response.ok) throw new Error("Jev request failed: " + response.status); const { answers } = await response.json();  // 高置信自动、中间人工、低置信升级 LLM——阈值请用自己的数据标定 if (answers.department.choice === "billing" && answers.urgent.noul > 0.8) {   // route to billing review queue }

• 高置信:自动执行(写审计日志,允许抽检)

• 中间带:人工队列 / 二次确认(退款、封禁、对外发送尤甚)

• 低置信:升级前沿 LLM,或让用户补信息后再问 Jev

runbook 提醒:先在历史工单上离线回放画校准曲线再定阈值;记录模型版本与 questions schema 版本;把 state 拼完整(缺上下文的自信错误最常见);高基数 Choice 预留两阶段;与 LLM 级联时明确哪一步允许生成。

⑤ 适合谁、不适合谁

适合

• 答案集合明确、日调用量大、延迟敏感的产品链路

• 智能体里每步都要做的小裁判:是否调工具、是否结束、是否违规

• 对格式错误零容忍的流水线(金融工单、安全运营、客服路由、内容审核)

• 想用级联把 80% 判断交给便宜决策层,把前沿 LLM 成本打下来

不适合

• 要写邮件 / 代码 / 分析报告——Jev 不生成一个字

• 要看图听音看视频——当前仅文本

• 要模型自己上网查最新事实——它不主动检索

• 答案空间无法预定义、必须开放探索的研发任务

• 想把「厂商自测 193.6×」直接写进对外承诺——请先独立复现

收束:Jev 不像又一个聊天模型,更像把「判断」从提示词里拆出来,变成软件可依赖的函数。Diogo 他们用 RLHF 教模型取悦人类之后,又用 RLCD 教模型对软件诚实——下一步不是转发倍数,而是挑一个你已经在付 LLM 钱的小判断,用自己的数据跑一周对照。

Jev:前 OpenAI 研究员做了个「不说话」的模型,专给软件做决定图10

Diogo Almeida · TypeSafe CEO(官网团队页)

链接

TypeSafe 官博 · Introducing System One Models & Jev

https://typesafe.ai/blog/introducing-system-one-models-and-jev

TypeSafe 官网

https://typesafe.ai/

团队页

https://typesafe.ai/team

开发者向说明 · jevai.dev

https://jevai.dev/

BusinessWire · $40M seed(DCVC 领投)

https://www.businesswire.com/news/home/20260915525333/en/TypeSafe-AI-Emerges-From-Stealth-With-%2440M-in-Funding-With-New-Model-for-Composable-AI

Forbes · 约 $2 亿估值报道口径

https://www.forbes.com/sites/the-prompt/2026/09/15/this-200-million-startup-wants-to-fix-ais-overconfidence-problem/

OpenRouter · typesafe/jev-1.13

https://openrouter.ai/typesafe/jev-1.13

Vercel · Jev + AI SDK

https://vercel.com/kb/guide/typesafe-jev-and-ai-sdk

中文解读参考 · Eigent

https://www.eigent.ai/zh-CN/blog/typesafe-ai-jev-system-one-models

依据 TypeSafe 官网 / 官博(2026-09-15)、BusinessWire、Forbes 报道口径、jevai.dev 与 OpenRouter / Vercel 公开文档整理;文中「智能体」= 能自己多步干活的 AI;193.6× / 444.6× 等为厂商工作流自测,含官方已披露 nuance,非独立第三方认证;估值约 $2 亿为媒体报道口径。底部「阅读原文」指向 TypeSafe 官博。

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
AI 软件
more
我国力争到2030年关键软件全面实现智能化升级
莫德纳联合默沙东公布mRNA抗癌新进展,马斯克称医学将成“软件问题”
前Infosys CEO再创业,Hang Ten获5300万美元追加融资,AI重构企业软件交付逻辑
Waymo圣安东尼奥重启Robotaxi服务,软件升级应对积水风险
Lucid Air大规模召回:软件逻辑缺陷引发过热风险,OTA成破局关键
AMD的Rust赌局:一支精英小队,能否改写GPU软件的未来?
整车/Tier1/芯片/传感器/软件重排座次,谁会被写进这本蓝皮书?
麦肯森遭勒索软件团伙入侵,数千万患者敏感数据面临泄露风险
软件定义制造将改变工业半导体需求格局
芯片设备太缺了,软件也成问题
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号