Create

Sign in to ReadmeX

Sign in to join communities, post, vote and chat.

New here?

Story

TypeSafe AI’s Jev turns frequent AI tasks into fast decisions

AI summary

TypeSafe AI’s Jev is a decision model designed to return structured choices, scores, or calibrated yes/no probabilities instead of conversational text. The model launched on September 15 and drew developer attention for reported low latency and pricing, while TypeSafe AI claims of large speed and cost gains have not been independently verified.

Why it matters: Jev highlights a possible shift toward using specialized, low-cost models for the many small decisions inside software systems.

TypeSafe AIJevDiogo Almeida

0
Source text创业邦 科技 · 10 min read

编者按:本文来自微信公众号 “融中财经”(ID:thecapital),作者:王涛,编辑:吾人,创业邦经授权转载。

九月的AI圈本来就不缺热闹,几家大厂的新模型轮番登场,按往年惯例,话题中心应该在它们身上。可过去一周,开发者在X、GitHub和各种技术群里刷屏讨论的,却是一个连完整句子都不肯说的模型。

它叫Jev,9月15日才发布,上线没几天,官方接口就被蜂拥而至的开发者挤到无法调用。到了9月21日,公司索性撤掉候补名单向所有人开放,每个注册用户送5美元额度,折合约1.2亿Token。一个新模型用这种方式“泄洪”,今年并不多见。

做出Jev的公司叫TypeSafe AI,总部在旧金山。公司隐身两年,露面时带着两样东西,一个是模型,另一个是DCVC领投的4000万美元种子轮,约合人民币2.8亿元。Forbes援引一位知情人士的说法,这一轮估值为2亿美元,也就是14亿元上下。

更让人好奇的是创始人Diogo Almeida。他在OpenAI待了四年,参与过RLHF、InstructGPT、ChatGPT和GPT-4的研发。RLHF即基于人类反馈的强化学习,ChatGPT能听懂指令、说话得体,这项技术功不可没。换句话说,他是当年教会大模型“说人话”的那批人之一。离开OpenAI之后,他做出来的东西恰好反了过来。

一个“哑巴”模型,被玩疯了

用过大模型做分类的人,多半有过这种烦恼。只想让它判断一封邮件急不急,回个“是”或“否”就够了,它偏要先铺一段分析,又慢又费Token。Jev的办法简单粗暴,干脆不让模型开口。它读进去的是杂乱的状态信息,吐出来的是开发者预先定义好类型的决策,每个答案都附带一个经过校准的概率。TypeSafe给它起了个名目,叫System One决策模型,典故来自《思考,快与慢》里的“快思考”。人扫一眼就能拍板的事,交给它。

Almeida在一档播客里解释过这套设计。Jev只有三种输出:Choice在给定选项里挑一个,Score用来排序或和阈值比大小,Noul回答是非题,但返回的是概率,由程序决定要不要走进某个分支。说白了,它是写给代码看的。

速度和价格是它出圈的直接原因。官方给出的端到端延迟为70~500毫秒之间,相比于前沿的大模型要快40至200倍之多,每百万个token收费为0.042美元,而输出是免费的。

TypeSafe也曾公布过更加夸张的数据,在自家的工作流程测试中,一些任务最快可以提高193.6倍的速度,最慢也可以降低444.6倍的价格,但是这些数据都是公司在自己做的测试里得到的,并没有经过独立实验室的验证。

公司也会提示实际的表现会根据任务以及比较的方式有所不同。第三方的数据要谨慎一些,在经过独立测试之后发现,它在分类一致率上和DeepSeekV4.1 Flash差不多,中位延迟为0.32秒。即使打折,这个价格也足以让人心动了,有的文章甚至把它的价格比作AI界里的“蜜雪冰城”。

真正把热度提上去的是开发者各种各样的玩法。官方先打出一个样来,让Jev玩初代《毁灭战士》游戏,在每一秒钟里都会做出大约十次的选择来控制角色行走、躲避敌人以及射击等动作,并且连续跑了一个小时大概花费了七美元。

Browser Use团队把该内容接入到了浏览器自动化中,在打开网页、刷出苏黎世飞往伦敦的航班的过程中,整个过程只需要7.1秒,并且花费了0.0039美元。实时通信公司Ably做了一个更加直观的比较,在几分钟之内,Jev做出了47次决策,Gemini和Claude、GPT等也只做了一两次。中文开发者的脚步也没有停歇,在使用大模型出牌的时候明显出现了卡顿的情况,而换上Jev之后单次决策只需要0.7秒的时间,出牌动画还没有播放完毕,下一回合就已经被打发出去了。上述情况都需要快速、密集地做出决策,但是每一个决策本身都不算难。

游戏本身是热闹的,而商业上所做的动作则更能说明问题。Vercel第一时间内把AI网关接入到了Jev中,开发者用它来做大模型的裁判,在几十毫秒之内就完成了对大模型行为是否合法、是否有事实依据进行审核,并且给出了事实一致性的评分结果。当把东西便宜到可以忽略不计的时候,以前那些计算不出来的事情,忽然之间就计算出来了。

ChatGPT的功臣,反手泼了盆冷水

Almeida的履历在圈内很有分量。OpenAI在GPT-4的贡献者名单里,把他列在“基础RLHF与InstructGPT工作”一栏。他在OpenAI花了四年打磨ChatGPT的回答,2024年离开,着手训练一种新的基础模型。另外两位联合创始人里,COO Sasha Sheng此前是Meta和FAIR的研究工程师,Erik Gafni出任CTO。三个人闷头干了两年,外界几乎没听过这家公司的名字。

按常理,这样的人出来创业,多半会做一个更会聊天的模型。Almeida偏偏反着来,他批评的正是自己亲手参与打造的那套方法。

他的逻辑并不绕。RLHF的做法是收集人的偏好再照着优化,等于把人直接放进了训练回路,目标是让人满意,而不是让软件自主运转。他对Forbes说得更直白,行业一直在为人做优化,模型讨好人的本事已经超过了人。他在演讲里讲过一个段子,有人给ChatGPT发了一段放屁音效,请它诚实评价自己“创作”的这首音乐,ChatGPT回答说,这营造出一种很诡异的氛围。人在旁边盯着的时候,这种圆滑无伤大雅。可如果要让软件在后台无人值守地跑,一个明明错了却总想显得自己没错的模型,就成了大麻烦。

所以他敢放话,下一个时代不会是Claude Code的时代,他说自己也爱用Claude Code,但它仍属于“辅助时代”,底子里靠的还是RLHF。这话从ChatGPT的缔造者之一嘴里说出来,多少带点反讽。

投资人买的,很大程度上就是这个判断和说出这个判断的人。美国投资人Trace Cohen的点评很有代表性,在他看来,给一家尚未交付产品的公司开出4000万美元种子轮,押的就是背景,赌的是团队而不是产品。从OpenAI出走的研究员一向是硅谷最抢手的创业者,这类估值逻辑早已见怪不怪。有意思的是,TypeSafe自己在上线前对产品也没什么底。

Almeida后来在播客里回忆,上线前反馈相当糟糕,非技术同事担心他们卖的是“维生素”而不是“止痛药”,公司几乎没有收入,一半以上的测试者没看懂,看懂的人第一反应是问采购审批怎么过。他自己也很害怕,于是拼命推动尽快上线。

上线后的局面,他恐怕也没料到。提高调用上限的申请从各处涌来,按他在播客中的说法,日调用量已超过一万亿Token,深夜也在持续调用,说明是程序在后台运行,而不是人来尝个鲜就走。这个数字目前只有创始人一方的说法,但深夜调用这个细节,确实比注册人数更能说明产品是否被真正用了起来。

名字也有讲究。Jev取自经济学家William Stanley Jevons,即提出杰文斯悖论的那位学者。19世纪蒸汽机越来越省煤,英国的煤炭消耗反倒越烧越多。这个名字的用意不难猜。

“智能大拆分”,动了谁的奶酪

Foundation Capital合伙人Jaya Gupta写过一篇长文,给Jev的走红找了个更大的背景,她称之为“智能大拆分”。她的观察是,过去三年大模型的奇迹在于“打包”,信息抽取、搜索、排序、判断、选工具、写回复乃至高难度推理,都交给同一个足够聪明的模型。开发者省了事,代价却被藏了起来。Agent会把人的一个目标拆成成百上千次机器决策,每一步在成本和延迟上的细微差异层层累积,最终决定整个产品的经济模型。她把其中的浪费叫作“解码税”:软件明明只需要一个“放行”或“拦截”,大模型却要先生成一段文字,程序再把文字翻译回决策。

这笔账最终要算到大模型公司头上。Gupta在文中提到,据报道Anthropic的毛利率超过80%,一个简单的分类任务,只因发生在Claude的调用里,就得按前沿模型的价码付费。

她的推演是,便宜、可预测的高频操作会被逐步分流,留给前沿模型的是更模糊、周期更长、更难验证的问题,每次调用也许更值钱,但被调用的次数会变少。应用层的活儿也跟着变了,要把任务拆开,给每一步买够用且最便宜的智能。过去一套系统也许只抽查1%的行为,判断足够便宜之后,就有机会全部检查一遍,客服对话、交易记录、合同条款都能逐条过。Almeida看中的场景也在这条线上,比如大公司囤积多年、却因为调用大模型太贵而从没分析过的“暗数据”。他举过保险核保的例子,模型读完材料,直接给出某处房产发生过火灾的可能性有多大。

故事讲得漂亮,护城河的问题却几乎同步摆上了桌面。Jev发布后短短两天,GitHub上就冒出了至少六个复刻项目,有人拿Qwen的小模型在笔记本上训练不到两小时,就做出了接口相同的决策模型。

这些复刻不少是冲着“平替”去的。涨得最快的Laya,5天就拿下1.8万个Star。Jared Palmer做的Kev基于Qwen3.5,与TypeSafe官方SDK完全兼容,业务代码不用改,换个请求地址就能切到本地;Bespoke Labs的Nimble基于Qwen3.5-9B,测试准确率90.1%,接近Jev官方公布的93.2%。热闹之下,阿里通义千问在这轮复刻潮里意外当了一回“底座”。复刻品也有短板,有评测认为,面对任意提问和几十个长选项的场景,眼下还得用Jev。

Jev自身的局限同样明显。它是闭源API,模型拿不到手,数据也要传到TypeSafe的服务器上,这对不少企业客户是道门槛。官方所说的“不会幻觉”也要打个折扣,它保证的只是答案不会跑出开发者定义的格式,而不是答案一定正确。

Almeida倒不回避这些。他承认校准并不完美,模型会犯很多错,但只要收益足够高、阈值设得合适,照样可以投入使用。有主持人试用后发现,单步判断很强,步骤一多效果就逐渐下滑,他的回应是,哪些任务适合交给System 1,最终要看实际效果。外部压力也摆在那里,大厂还在持续压低推理成本、提升速度,TypeSafe宣称的优势能守多久,要经过市场检验。

过去几年,大家比的是谁的模型更会想。Jev这一周的热闹,让行业第一次认真坐下来算另一笔账:想一次,到底要花多少钱。

本文为专栏作者授权创业邦发表,版权归原作者所有。文章系作者个人观点,不代表创业邦立场,转载请联系原作者。如有任何疑问,请联系[email protected]。

Read the original →

How we got here

  1. Why people distrust AI but keep using itMIT Technology Review AI · OpenAI
  2. AI Price Competition Shifts Toward Efficiency and Agent Scale创业邦 科技 · OpenAI
  3. OpenAI Promises 28 Days of Releases or Resets Amid User Trust Concerns36氪 人工智能 · OpenAI
  4. Hinton-led paper examines whether automated AI R&D could trigger an intelligence explosion量子位(原生 RSS) · OpenAI
  5. Why AI Image Generators Keep Defaulting to Beautiful Women虎嗅 AI · OpenAI
  6. Apple to Tighten macOS Full Disk Access Amid AI Agent Risks虎嗅 AI · OpenAI

Comments

I've used this: share my experience What I think: share my view
How important is this story?No ratings yet

No comments yet. Start the conversation.