返回今日选题

已核验 · Sep 20, 2026

已独立佐证

TypeSafe 的 Jev 一个字都不输出——带置信度的类型化判定、标价每十亿输入 token 42 美元、上线第一周 API 一度被需求挤爆

2 个信源

公司的框架,出自其 9 月 15 日的博文:Jev 是「a new class of frontier models built to make fast, structured decisions that software can use directly(一类全新的前沿模型,专为做出软件可直接使用的快速、结构化决策而生)」,「available today in early access(今日以 early access 形式可用)」,并且「While Jev gives up string generation, it's optimized for structured outputs and can't hallucinate.(Jev 放弃了字符串生成,为结构化输出而生,不会幻觉。)」推介语:「Think of Jev as a frontier-intelligence function call: unstructured state in, typed probabilistic decisions out.(把 Jev 想成一个前沿智能版的函数调用:非结构化状态进,带概率的类型化决策出。)」TechCrunch 的转译:「a new transformer-based model, Jev, that is not a large language model (LLM). It doesn't output text, but instead produces probabilities, or what the company calls "calibrated decisions."(一个全新的基于 transformer 的模型 Jev,它不是大语言模型(LLM)。它不输出文本,而是输出概率——也就是公司所说的"校准决策"。)」造它的人:Diogo Almeida,TechCrunch 介绍他是「helped build the chatbot and then invent reinforcement learning from human feedback (RLHF)(参与构建了 ChatGPT、而后参与发明了基于人类反馈的强化学习(RLHF))」的 OpenAI 研究员,他对媒体谈起 ChatGPT 时代的工作时说「We have lightning in a bottle, and yet it is not useful(我们手里握着瓶中闪电,但它却不实用)」。钱的事,按公司自己的表格:「Input tokens: $0.042 / MTok ($42 per billion tokens).(输入 token:每百万 0.042 美元(每十亿 42 美元)。)」「Output tokens: FREE (too cheap to meter)(输出 token:免费(便宜到不值得计量))」——同时挂着公司自己的告诫「We can't prove it isn't subsidized(我们无法证明它没有补贴)」。速度是公司自述的:端到端「70ms-500ms」,System One 形态查询上「40x-200x faster(快 40 到 200 倍)」,首页的「193.6x Faster, 444.6x Cheaper.」带脚注「*based on workflows for System One tasks」——博客自己也承认「we expect that these are on the higher end of real world gains(我们预计这些属于真实世界收益中偏高的那一端)」——另有「238x Lower input price than Claude Fable 5.1(输入价格比 Claude Fable 5.1 低 238 倍)」独立的部分属于 TechCrunch:「the company briefly lost the ability to serve users from its API because demand was so high(需求太高,公司一度无法为其 API 提供服务)」;Vercel 的 Pranit Sharma 把安全指令分类器里的 OpenAI ChatGPT Luna 5.6 换成 Jev 后「got results five to 18 times more quickly and with greater accuracy(拿到结果快了 5 到 18 倍,且准确率更高)」;Bryo AI CTO Nikhil Mudholkar 发现 Gemini 在商务邮件分类上略更准确、但「10 to 20 times more expensive(贵 10 到 20 倍)」,并称 Jev 的置信分数才是真差异:「it is the only one that hands back a real probability which makes it ideal for automating workflows!!(它是唯一交还真实概率的,这让它在自动化工作流上再合适不过!!)」用法框架,来自 Armin Ronacher(Earendil CTO,开源模型运行框架 Pi 的构建方):「it delegates the hallucination problem a little bit to the user(它把幻觉问题交还给了用户一点)」——50% 时「maybe this is a coin toss, and I disregard it.(也许这就是抛硬币,我直接丢弃。)」95% 时「sure, then I can do something with it.(那好,我就能拿它做点什么。)」保密的部分:「Almeida is tight-lipped about the model's architecture, which outside observers suspect is built on top of an open-weight LLM.(Almeida 对模型架构守口如瓶,外部观察者怀疑它构建在某个开放权重 LLM 之上。)」Almeida 说它「trained exclusively on synthetic data using a technique he calls "reinforcement learning from calibrated decisions."(完全用合成数据训练。)」——公司自己对这名字的写法是「Reinforcement Learning for Calibrated Decisions (RLCD)」。

为什么现在讲

发布落在 9 月 15 日星期二,TechCrunch 的开发者视角报道 9 月 18 日星期五跟进——聚合号浪潮还没启动,这个周末正是工具类讲解创作者可以抢首发的时间窗。需求信号已经公开:公司自己的推进话术是「bringing developers off the waitlist as quickly as we can(尽快让开发者们脱离候补名单)」,TechCrunch 也报道 API 一度被需求挤爆,观众对准入时间的好奇心正处在峰值。这个选题还接住了它所喂养的自动化讨论:如果一个跳过语言的模型真的能做到每十亿输入 token 42 美元、输出免费——按公司自己的数字、并挂着它自己的补贴告诫——那么「你工作流里的哪个决策值得一个类型化答案而不是一次聊天补全」就成了一个还没被讲烂的新鲜解释题。差异化打法是自带的:这里的每一个数字要么是厂商数字、要么是单个开发者的测试,把归属讲对的创作者,立刻就是这个故事在平台上最值得信任的版本。

推荐理由

今日卡片中最可演示的一条:一个没有聊天窗口的模型自己就能撑起屏幕,Ronacher 引语里 50%/95% 的阈值机制一个下午就能搭出 mock。精度玩法在归属堆栈——厂商跑分带公司自己的脚注、补贴告诫用 TypeSafe 原话、开发者数字按开发者各自保留、RLCD 命名按出处各自保留——因为聚合号一定会把这一切压平成一条更便宜、又不会幻觉的标题。受众比 Gemini 卡片窄(开发者和 AI 工具测评者,而非所有人),这正是它与头条选题互补而不互争的原因。

依据

两个来源,本次运行均已打开:TypeSafe AI 博文(署名「Diogo Almeida, founder, TypeSafe」;博文标注日期 Sep 15, 2026;其「available today」把发布日期锚定在 2026 年 9 月 15 日)与用于跑分块的 typesafe.ai 首页,另有 TechCrunch(Tim Fernholz,2026 年 9 月 18 日上午 11:49(太平洋时间);已通读全文,抓取 raw HTML)。星期-日期对经日历核验:星期五 = 2026 年 9 月 18 日;今天 = 2026 年 9 月 20 日星期日。数字多且全部焊在持有者身上:输入 $0.042/MTok(每十亿 42 美元)、输出免费(公司);70ms-500ms 与 40x-200x(公司);193.6x 更快、444.6x 更便宜,脚注归于公司自己的工作流(公司);输入价格比 Claude Fable 5.1 低 238x(公司);快 5 到 18 倍且准确率更高(Vercel 的测试,据 TechCrunch);贵 10 到 20 倍且 Gemini 略更准确(Bryo AI 的测试,据 TechCrunch);「两个数量级」(公司);API 事故的「briefly(一度)」(TechCrunch)。任何已打开来源中都不存在对这些主张的独立跑分。

这个新模型一个字都不写——只返回带置信度的类型化判定,而造出它的人说,正因如此它才不会幻觉。

切入角度

把它做成一条「没有聊天窗口的模型」讲解。第一拍,形状:类型化判定加校准置信度、而非文本——把公司的「frontier-intelligence function call」一句放上屏幕。第二拍,「不会幻觉」为什么是设计主张:输出预先定义,所以不存在可以出错的自由字符串——设计机制永远跟着主张走,绝不出现光秃秃的「它不会幻觉」。第三拍,钱:每十亿输入 token 42 美元、输出免费——厂商自己的数字,补贴告诫用 TypeSafe 自己的话。第四拍,用在哪:分类、路由、打分、护栏——配上开发者们自己的测试数字,包括 Gemini 略更准的反例。

形式

长视频讲解

演示想法

分屏分类器 mock:左边,聊天模型用一整段话回答一个路由问题、回答还得再解析;右边,Jev 式的类型化答案——{decision, probability}——下方是阈值滑杆,停在 Ronacher 自己举的两个点上(50%「抛硬币,丢弃」vs 95%「拿它做点什么」)。页脚放钱的一行——「$42/十亿输入 token · 输出免费 · 按公司自己的定价说明,而该说明自己说无法证明价格没有补贴」——跑分徽标写「193.6x/444.6x——TypeSafe 自己的工作流跑分」。

平台注意

每个厂商数字都带着持有者出现:「193.6x faster, 444.6x cheaper」必须配「*based on workflows for System One tasks」和博客自己的「higher end of real world gains」让步;「238x lower input price than Claude Fable 5.1」只能作为 TypeSafe 的主张;42 美元价格永远配公司的「We can't prove it isn't subsidized.」开发者数字按开发者各自保留、TechCrunch 作为转述方:Vercel 的 5 到 18 倍、Bryo 的 10 到 20 倍——Bryo 测出 Gemini 略更准确这一点要跟着一起走。「不会幻觉」按它本来的身份出现(预定义输出、类型化答案的设计主张),绝不当普遍准确率保证。架构保持有争议:公司说「新的模型架构」,TechCrunch 报道观察者怀疑构建在开放权重 LLM 之上——两者都标注归属,绝不定论。发布日期是 9 月 15 日星期二——卡片自己的声音里永远不说「今天」。

可用说法

  • TypeSafe AI——其联合创始人 Diogo Almeida 被 TechCrunch 介绍为曾参与构建 ChatGPT、而后参与发明「reinforcement learning from human feedback (RLHF)(基于人类反馈的强化学习)」的 OpenAI 研究员——于 2026 年 9 月 15 日星期二以 early access 形式发布 Jev:公司博文(标注日期 Sep 15, 2026)中说「available today in early access(今日以 early access 形式可用)」,TechCrunch 在 9 月 18 日的报道只把发布时间说成「This week, the company released(本周,公司发布了……)」。TechCrunch:「a new transformer-based model, Jev, that is not a large language model (LLM). It doesn't output text, but instead produces probabilities, or what the company calls "calibrated decisions."(一个全新的基于 transformer 的模型 Jev,它不是大语言模型(LLM)。它不输出文本,而是输出概率——也就是公司所说的"校准决策"。)」公司自己的话:「While Jev gives up string generation, it's optimized for structured outputs and can't hallucinate.(Jev 放弃了字符串生成,为结构化输出而生,不会幻觉。)」,以及「Think of Jev as a frontier-intelligence function call: unstructured state in, typed probabilistic decisions out.(把 Jev 想成一个前沿智能版的函数调用:非结构化状态进,带概率的类型化决策出。)」定价是公司自己的口径:「Input tokens: $0.042 / MTok ($42 per billion tokens).(输入 token:每百万 token 0.042 美元(每十亿 token 42 美元)。)」「Output tokens: FREE (too cheap to meter).(输出 token:免费(便宜到不值得计量)。)」——同时附带公司自己的告诫「We can't prove it isn't subsidized(我们无法证明它没有补贴)」首页的「193.6x Faster, 444.6x Cheaper.(快 193.6 倍、便宜 444.6 倍)」带有脚注「*based on workflows for System One tasks(基于 System One 任务的工作流)」,博客谈到这些数字时说「we expect that these are on the higher end of real world gains(我们预计这些属于真实世界收益中偏高的那一端)」,公司还宣称「238x Lower input price than Claude Fable 5.1(输入价格比 Claude Fable 5.1 低 238 倍)」;它给出的端到端响应时间是「70ms-500ms」,在 System One 形态的查询上「can range from 40x-200x faster(可以快 40 到 200 倍)」。TechCrunch 报道需求高到「the company briefly lost the ability to serve users from its API(公司一度无法为其 API 提供服务)」;按 TechCrunch 的转述,一位 Vercel 工程师在把 OpenAI 的 ChatGPT Luna 5.6 换成 Jev 后测得「five to 18 times more quickly and with greater accuracy(快 5 到 18 倍且准确率更高)」的结果,而 Bryo AI 的 CTO 在商务邮件分类任务上发现 Gemini 略更准确、但「10 to 20 times more expensive(贵 10 到 20 倍)」。

证据链

拆解

一个这么适合引用的发布,同样这么容易被引错。第一层,跑分堆栈:首页的「193.6x Faster, 444.6x Cheaper.」带着公司自己的脚注「*based on workflows for System One tasks」,博客说这些数字是「on the higher end of real world gains(真实世界收益中偏高的那一端)」,同一篇博文谈到自家定价时承认「We can't prove it isn't subsidized(我们无法证明它没有补贴)」——一家预先给自己打了对冲的厂商,等于把现成的归属话术递到了创作者手里,把它丢掉的那一刻,报道就变成了复读。第二层,开发者实测不是跑分:Vercel 的 5 到 18 倍、Bryo 的 10 到 20 倍都是经 TechCrunch 转述的单开发者结果,而 Bryo 的同一个测试还发现 Gemini 略更准确——这个反例是事实的一部分,不是它的脚注。第三层,设计主张:公司的话和 TechCrunch 的转译里「can't hallucinate」都挂在同一个机制上——输出预先定义、答案类型化、不存在自由字符串——所以主张要么带着机制走、要么不出现;TechCrunch 自己那句「because users define the outputs in advance, it cannot hallucinate」就是模板。第四层,有争议的架构:公司页面宣称「新的模型架构」,TechCrunch 则报道 Almeida「tight-lipped(守口如瓶)」、外部观察者怀疑构建在开放权重 LLM 之上——两个带归属的立场,不做合成。第五层,把命名漂移当作精度徽章:TypeSafe 写「Reinforcement Learning for Calibrated Decisions (RLCD)」,TechCrunch 写「reinforcement learning from calibrated decisions」——只差一个介词,而把两者分得清清楚楚的那张卡片,就是数字被打擂台时观众仍然信任的那张。编辑守则:厂商数字带脚注、开发者数字带着开发者本人、设计主张带着机制,这个故事里的任何数字都不许没有持有者。

风险

  • 引用任何数字之前,先打开 TypeSafe 的博客与首页,读一遍承载该数字的句子和脚注;引用厂商数字时必须挂着「按公司自己的跑分」或「按其自己的定价说明」,价格出现时补贴告诫同时出现。每个开发者数字都归属为 TechCrunch 转述的该开发者单次测试;讲「不会幻觉」时,同时带上预定义输出的机制和 Bryo 测试中 Gemini 略更准确的反例。

演示思路

  • 分屏分类器 mock:聊天模型段落 vs 类型化 {decision, probability} 答案,以 Ronacher 的 50%/95% 阈值示例作为互动点,页脚的厂商跑分徽标带上脚注
  • 命名漂移卡片当作精度展示:TypeSafe 的「Reinforcement Learning for Calibrated Decisions (RLCD)」并排 TechCrunch 的「reinforcement learning from calibrated decisions」——教观众识别一句话到底出自哪家