TypeSafe AI公司推出不生成自然语言、专为程序决策设计的轻量级AI模型Jev,主打低延迟(70–500ms)、低成本(每百万token仅0.042美元)和高吞吐,适用于自动化、审核、游戏控制等高频简单判断场景;创始人Diogo Almeida曾参与ChatGPT核心研发,此次反向聚焦‘系统1’式快决策,引发开发者热捧与行业对AI推理成本的重新审视。
九月的AI圈本来就不缺热闹,几家大厂的新模型轮番登场,按往年惯例,话题中心应该在它们身上。可过去一周,开发者在X、GitHub和各种技术群里刷屏讨论的,却是一个连完整句子都不肯说的模型。
它叫Jev,9月15日才发布,上线没几天,官方接口就被蜂拥而至的开发者挤到无法调用。到了9月21日,公司索性撤掉候补名单向所有人开放,每个注册用户送5美元额度,折合约1.2亿Token。一个新模型用这种方式“泄洪”,今年并不多见。
做出Jev的公司叫TypeSafe AI,总部在旧金山。公司隐身两年,露面时带着两样东西,一个是模型,另一个是DCVC领投的4000万美元种子轮,约合人民币2.8亿元。Forbes援引一位知情人士的说法,这一轮估值为2亿美元,也就是14亿元上下。
更让人好奇的是创始人Diogo Almeida。他在OpenAI待了四年,参与过RLHF、InstructGPT、ChatGPT和GPT-4的研发。RLHF即基于人类反馈的强化学习,ChatGPT能听懂指令、说话得体,这项技术功不可没。换句话说,他是当年教会大模型“说人话”的那批人之一。离开OpenAI之后,他做出来的东西恰好反了过来。
用过大模型做分类的人,多半有过这种烦恼。只想让它判断一封邮件急不急,回个“是”或“否”就够了,它偏要先铺一段分析,又慢又费Token。Jev的办法简单粗暴,干脆不让模型开口。它读进去的是杂乱的状态信息,吐出来的是开发者预先定义好类型的决策,每个答案都附带一个经过校准的概率。TypeSafe给它起了个名目,叫System One决策模型,典故来自《思考,快与慢》里的“快思考”。人扫一眼就能拍板的事,交给它。
Almeida在一档播客里解释过这套设计。Jev只有三种输出:Choice在给定选项里挑一个,Score用来排序或和阈值比大小,Noul回答是非题,但返回的是概率,由程序决定要不要走进某个分支。说白了,它是写给代码看的。
速度和价格是它出圈的直接原因。官方给出的端到端延迟为70~500毫秒之间,相比于前沿的大模型要快40至200倍之多,每百万个token收费为0.042美元,而输出是免费的。
TypeSafe也曾公布过更加夸张的数据,在自家的工作流程测试中,一些任务最快可以提高193.6倍的速度,最慢也可以降低444.6倍的价格,但是这些数据都是公司在自己做的测试里得到的,并没有经过独立实验室的验证。
公司也会提示实际的表现会根据任务以及比较的方式有所不同。第三方的数据要谨慎一些,在经过独立测试之后发现,它在分类一致率上和
真正把热度提上去的是开发者各种各样的玩法。官方先打出一个样来,让Jev玩初代《毁灭战士》游戏,在每一秒钟里都会做出大约十次的选择来控制角色行走、躲避敌人以及射击等动作,并且连续跑了一个小时大概花费了七美元。
Browser Use团队把该内容接入到了浏览器自动化中,在打开网页、刷出苏黎世飞往伦敦的航班的过程中,整个过程只需要7.1秒,并且花费了0.0039美元。实时通信公司Ably做了一个更加直观的比较,在几分钟之内,Jev做出了47次决策,Gemini和Claude、GPT等也只做了一两次。中文开发者的脚步也没有停歇,在使用大模型出牌的时候明显出现了卡顿的情况,而换上Jev之后单次决策只需要0.7秒的时间,出牌动画还没有播放完毕,下一回合就已经被打发出去了。上述情况都需要快速、密集地做出决策,但是每一个决策本身都不算难。
游戏本身是热闹的,而商业上所做的动作则更能说明问题。Vercel第一时间内把AI网关接入到了Jev中,开发者用它来做大模型的裁判,在几十毫秒之内就完成了对大模型行为是否合法、是否有事实依据进行审核,并且给出了事实一致性的评分结果。当把东西便宜到可以忽略不计的时候,以前那些计算不出来的事情,忽然之间就计算出来了。
Almeida的履历在圈内很有分量。OpenAI在GPT-4的贡献者名单里,把他列在“基础RLHF与InstructGPT工作”一栏。他在OpenAI花了四年打磨ChatGPT的回答,2024年离开,着手训练一种新的基础模型。另外两位联合创始人里,COO Sasha Sheng此前是Meta和FAIR的研究工程师,Erik Gafni出任CTO。三个人闷头干了两年,外界几乎没听过这家公司的名字。
按常理,这样的人出来创业,多半会做一个更会聊天的模型。Almeida偏偏反着来,他批评的正是自己亲手参与打造的那套方法。
他的逻辑并不绕。RLHF的做法是收集人的偏好再照着优化,等于把人直接放进了训练回路,目标是让人满意,而不是让软件自主运转。他对Forbes说得更直白,行业一直在为人做优化,模型讨好人的本事已经超过了人。他在演讲里讲过一个段子,有人给ChatGPT发了一段放屁音效,请它诚实评价自己“创作”的这首音乐,ChatGPT回答说,这营造出一种很诡异的氛围。人在旁边盯着的时候,这种圆滑无伤大雅。可如果要让软件在后台无人值守地跑,一个明明错了却总想显得自己没错的模型,就成了大麻烦。
所以他敢放话,下一个时代不会是Claude Code的时代,他说自己也爱用Claude Code,但它仍属于“辅助时代”,底子里靠的还是RLHF。这话从ChatGPT的缔造者之一嘴里说出来,多少带点反讽。
投资人买的,很大程度上就是这个判断和说出这个判断的人。美国投资人Trace Cohen的点评很有代表性,在他看来,给一家尚未交付产品的公司开出4000万美元种子轮,押的就是背景,赌的是团队而不是产品。从OpenAI出走的研究员一向是硅谷最抢手的创业者,这类估值逻辑早已见怪不怪。有意思的是,TypeSafe自己在上线前对产品也没什么底。
Almeida后来在播客里回忆,上线前反馈相当糟糕,非技术同事担心他们卖的是“维生素”而不是“止痛药”,公司几乎没有收入,一半以上的测试者没看懂,看懂的人第一反应是问采购审批怎么过。他自己也很害怕,于是拼命推动尽快上线。
上线后的局面,他恐怕也没料到。提高调用上限的申请从各处涌来,按他在播客中的说法,日调用量已超过一万亿Token,深夜也在持续调用,说明是程序在后台运行,而不是人来尝个鲜就走。这个数字目前只有创始人一方的说法,但深夜调用这个细节,确实比注册人数更能说明产品是否被真正用了起来。
名字也有讲究。Jev取自经济学家William Stanley Jevons,即提出杰文斯悖论的那位学者。19世纪蒸汽机越来越省煤,英国的煤炭消耗反倒越烧越多。这个名字的用意不难猜。
Foundation Capital合伙人Jaya Gupta写过一篇长文,给Jev的走红找了个更大的背景,她称之为“智能大拆分”。她的观察是,过去三年大模型的奇迹在于“打包”,信息抽取、搜索、排序、判断、选工具、写回复乃至高难度推理,都交给同一个足够聪明的模型。开发者省了事,代价却被藏了起来。Agent会把人的一个目标拆成成百上千次机器决策,每一步在成本和延迟上的细微差异层层累积,最终决定整个产品的经济模型。她把其中的浪费叫作“解码税”:软件明明只需要一个“放行”或“拦截”,大模型却要先生成一段文字,程序再把文字翻译回决策。
这笔账最终要算到大模型公司头上。Gupta在文中提到,据报道Anthropic的毛利率超过80%,一个简单的分类任务,只因发生在Claude的调用里,就得按前沿模型的价码付费。
她的推演是,便宜、可预测的高频操作会被逐步分流,留给前沿模型的是更模糊、周期更长、更难验证的问题,每次调用也许更值钱,但被调用的次数会变少。应用层的活儿也跟着变了,要把任务拆开,给每一步买够用且最便宜的智能。过去一套系统也许只抽查1%的行为,判断足够便宜之后,就有机会全部检查一遍,客服对话、交易记录、合同条款都能逐条过。Almeida看中的场景也在这条线上,比如大公司囤积多年、却因为调用大模型太贵而从没分析过的“暗数据”。他举过保险核保的例子,模型读完材料,直接给出某处房产发生过火灾的可能性有多大。
故事讲得漂亮,护城河的问题却几乎同步摆上了桌面。Jev发布后短短两天,GitHub上就冒出了至少六个复刻项目,有人拿Qwen的小模型在笔记本上训练不到两小时,就做出了接口相同的决策模型。
这些复刻不少是冲着“平替”去的。涨得最快的Laya,5天就拿下1.8万个Star。Jared Palmer做的Kev基于Qwen3.5,与TypeSafe官方SDK完全兼容,业务代码不用改,换个请求地址就能切到本地;Bespoke Labs的Nimble基于Qwen3.5-9B,测试准确率90.1%,接近Jev官方公布的93.2%。热闹之下,阿里
Jev自身的局限同样明显。它是闭源API,模型拿不到手,数据也要传到TypeSafe的服务器上,这对不少企业客户是道门槛。官方所说的“不会幻觉”也要打个折扣,它保证的只是答案不会跑出开发者定义的格式,而不是答案一定正确。
Almeida倒不回避这些。他承认校准并不完美,模型会犯很多错,但只要收益足够高、阈值设得合适,照样可以投入使用。有主持人试用后发现,单步判断很强,步骤一多效果就逐渐下滑,他的回应是,哪些任务适合交给System 1,最终要看实际效果。外部压力也摆在那里,大厂还在持续压低推理成本、提升速度,TypeSafe宣称的优势能守多久,要经过市场检验。
过去几年,大家比的是谁的模型更会想。Jev这一周的热闹,让行业第一次认真坐下来算另一笔账:想一次,到底要花多少钱。
本文来自微信公众号“融中财经”(ID:thecapital),作者:王涛,编辑:吾人