不聊天只做判断!LangChain验证Jev决策一致性100% 软件原生决策AI赛道加速验证
当全行业追逐通用大模型,一款“不会聊天、不写代码”的AI反而在开发者圈快速刷屏。

当地时间9月20日,全球Agent开发框架龙头LangChain发布Jev模型专项评估报告,为这款近期刷屏开发者圈层的决策型AI补上关键第三方产业验证。测试显示,在500次重复Agent评估任务中,Jev与人工标注的一致性达100%;评分结果方差较GPT-5.6 Luna、Terra等主流大模型低92-913倍,单次调用成本约0.0035美元。低方差、低延迟、低成本的特性,使其适配规模化在线评估、实时风控、Agent调度等高频率决策场景。
这是该模型自正式发布后的又一重要产业验证。此前Jev上线Vercel AI Gateway首日即创下平台最快采用纪录,上线24小时内近13%付费团队启用,采用规模为第二名的2倍以上。
ChatGPT核心参与者创业 反常识路径切中自动化痛点
当地时间9月15日,前OpenAI核心研究员、RLHF与InstructGPT技术核心参与者Diogo Almeida创立的TypeSafe AI结束两年隐身运营,正式发布首款“System One”决策模型Jev,同步完成4000万美元种子轮融资,由DCVC领投。据Forbes援引知情人士消息,公司投后估值约2亿美元。
与全行业追逐通用大模型的路径完全相反,Jev主动舍弃自然语言生成能力,不做对话交互,专门输出带校准置信度的结构化决策结果,可直接作为组件嵌入软件系统,开辟了AI面向自动化场景的全新产品品类。
重构训练目标 破解RLHF的自动化局限
这条差异化路线,源自Almeida对主流AI技术路径的底层反思。作为RLHF技术的核心参与者之一,他在7月31日的公开演讲中提出:主流大模型均围绕人类交互优化,RLHF的奖励机制天然倾向于产出符合人类偏好的回答——“过度承诺不是bug,是特性(Overpromising is a feature)”。
这种特性支撑了对话类AI的产品体验,但难以适配软件自动化场景:大模型的幻觉、输出不稳定、高延迟,使其无法直接嵌入系统作为可靠决策组件。当前AI擅长协助人类工作,但始终需要人在回路中把关,无法实现真正的无人值守自动化。
对此TypeSafe重构了模型的优化目标:从“取悦人类”转向“服务软件”,提出校准决策强化学习(RLCD)训练方法,让模型输出固定格式、带真实概率的判定结果,成为可组合、可复用的软件智能原语。Almeida表示,过去四年AI在人类语言上已经做得足够好,但对自动化而言,“计算机说的是另一种语言”。
三类结构化输出 可直接嵌入软件系统
作为全球首款面向软件嵌入的System One类模型,Jev核心输出标准化、可直接被代码调用的决策结果,所有结果均附带校准后的置信度指标,开发者可根据置信阈值,决定任务自动执行、补充信息或转人工介入。
模型覆盖三类输出形式:
- Choice:多选项分类,返回各选项对应概率;
- Score:按既定规则评分,返回得分与置信度;
- Noul:输出是非命题为真的概率。
官方参数显示,模型端到端延迟在70-500毫秒区间,面向系统嵌入场景的推理效率较主流前沿模型提升40-200倍。输入Token定价为每百万42美元,输出Token成本极低可忽略不计。官方自测工作流场景数据显示,Jev较主流大模型最高提速193.6倍、成本降低44.6倍,官方同时注明该测试场景存在一定偏向性。
热度与争议并存 采用速度破行业纪录
模型上线后快速在开发者圈层引爆,采用速度创下行业纪录,同时市场也出现实测分歧。
除LangChain的验证结果与Vercel的采用数据外,SaaStr创始人Lemkin实测后表示模型存在32%的误放率,宣布弃用;同期开发者社区出现至少6个开源复现项目,在JevBench基准上与官方结果差距仅0.7分。对此Almeida公开回应称:“前沿实验室的主要产品是恐惧或炒作,我希望我们的主要产品是智能。”
行业价值:Agent时代催生分层智能新架构
Jev的市场热度,本质上踩中了Agent规模化落地的核心痛点——海量高频小判断的成本与延迟问题。当Agent真正规模化运行后,单日会产生数十万至数百万次小额判断:下一步调用哪个工具、任务是否完成、信息是否有效。如果全部调用通用大模型,延迟与成本都无法承受。
据了解,Jev的产品定位与命名均源自经典理论映射。其“System One”命名,对应诺贝尔经济学奖得主丹尼尔·卡尼曼的双系统思维理论:系统1负责快速、直觉式的自动化判断,系统2负责慢速、深度的复杂推理。映射到AI架构中,Jev承担系统1角色,承接海量高频标准化判断任务;复杂推理、创意生成等深度任务交由通用大模型对应系统2,二者形成成本与效率平衡的分层智能架构。
而“Jev”的命名,则来自19世纪经济学家威廉·杰文斯提出的“杰文斯悖论”:技术进步带来资源成本大幅下降,反而会推动使用量指数级增长,最终渗透到产业每个角落。对应到AI领域,当单次智能判断的成本降低到近乎可忽略,AI就不再局限于少数核心场景,而是会嵌入到每一处软件逻辑中,成为像函数调用一样普遍的基础组件。
业内分析认为,该路线将AI能力从“人机交互工具”向“软件原生组件”渗透,若规模化验证成立,有望大幅降低AI嵌入软件系统的成本与门槛,推动行业自动化从规则驱动向智能决策驱动升级。
参考资料
[1] TypeSafe AI. TypeSafe AI emerges from stealth with $40M in funding with new model for composable AI[EB/OL]. New York: Business Wire, 2026-09-15[2026-09-21].
[2] TypeSafe AI. Introducing system one models & Jev[EB/OL]. San Francisco: TypeSafe AI Inc., 2026-09-15[2026-09-21].
[3] LangChain Inc. Jev-as-a-judge for agent evals[EB/OL]. San Francisco: LangChain Inc., 2026-09-20[2026-09-21].
[4] Vercel Inc. Jev is the fastest-adopted model in AI Gateway history[EB/OL]. San Francisco: Vercel Inc., 2026-09-18[2026-09-21].
[5] Almeida D. What's next after RLHF?[R/OL]. AI Engineer World's Fair 2026, 2026-07-31[2026-09-21].
[6] Fernholz T. A new kind of AI model from a ChatGPT inventor is thrilling developers[EB/OL]. San Francisco: TechCrunch, 2026-09-18[2026-09-21].

陈宥文
关注:具身智能/产业财经
邮箱:youwen.chen@infocase.world




