开发者正将目光投向Jev,这是一款区别于ChatGPT、Claude和Gemini的全新AI模型。它不生成文本,而是直接输出软件可用的结构化决策。 Jev由旧金山初创公司TypeSafe AI研发。该公司近日结束隐形运营状态,宣布完成由DCVC领投的4000万美元种子轮融资。创始团队包括人类反馈强化学习(RLHF)共同发明人Diogo Almeida、多模态AI专家Erik Gafni以及前Meta研究工程师Sasha Sheng。 自9月15日上线以来,Jev迅速成为X平台上的热门开发者话题。程序员们利用其处理AI代理路由、内容过滤、游戏控制及编码代理上下文管理等任务。 专为软件决策而生 Almeida曾在OpenAI多年,致力于提升语言模型的指令遵循能力,并参与了InstructGPT及RLHF相关研究。过去两年,他在隐蔽状态下开发了“校准决策强化学习”(RLCD方法及Jev模型。 Almeida表示,Jev专为决策设计,速度比现有模型快20至200倍,成本降低40至400倍,且输出令牌免费。他认为,以人类可读响应为优化目标的模型,并非需要做出数百万次微小决策的软件的最佳工具。 TypeSafe将Jev定义为首个“System One”模型,借鉴丹尼尔·卡尼曼《思考,快与慢》中快速、直觉式决策的概念。公司旨在构建服务于软件快速决策的模型,而非主要面向人际沟通。官方称,Jev在System One任务上达到了与大型语言模型(LLM)相当的智能水平,同时效率和速度提升了两个数量级。 虽然放弃了字符串生成功能,但Jev针对结构化输出进行了优化,号称不会产生幻觉。其本质可视为一种前沿的智能函数调用:输入非结构化状态,输出类型化的概率决策。 并行生成结构化答案 Jev可被视为位于应用程序与LLM之间的AI决策层。传统LLM需生成令牌序列供软件解读,而Jev接收包含上下文的原始数据载荷及预定义问题,直接返回带有概率和置信度分数的结构化答案。 例如,在判断客户消息类别时,Jev直接返回账单、技术支持或销售等选项的概率值,而非生成解释性文字。目前支持三种核心问题类型:Choice(从列表选择)、Score(量表评估)及Noul(是非决策)。 答案通过并行生成而非逐个令牌输出,这是其高速的关键。TypeSafe声称,受数学约束的结构化输出避免了类型错误。尽管公司承认其幻觉评估基于模式匹配而非实证测量,但在目标负载下,Jev响应时间仅为70至500毫秒。 定价方面,Jev每百万输入令牌收费0.042美元,输出令牌免费,在分类、路由和评分等任务上远低于主流前沿语言模型。 开发者重塑AI工作流 Jev引起了正在真实工作流中测试它的开发者的关注。Razorpay CEO Harshil Mathur认为,高吞吐量、低延迟的智能让AI能在每个循环中实时反应,这是一种不同类型的智能。 软件工程师Arpit Bhayani指出,Jev解锁了许多新用例,促使开发者重写基于LLM的工作流。目前,开发者利用Jev进行编码代理请求路由、文件预选、拉取请求审查、邮件分类、欺诈检测、内容排名及工具选择等。 在复杂工作流中,代理可使用LLM处理深层推理,而用Jev处理数百个微小决策,如决定请求接收方、工具调用、验证需求或人工接管时机。这种区分至关重要,因为对每个小决策使用前沿模型既昂贵又缓慢。 实际案例显示,Together AI开发体验总监Hassan El Mghari使用Jev分类1,018篇研究论文,耗时约0.08美元,中位延迟256毫秒。Gojiberry AI联合创始人Romàn Czerny仅花费0.09美元,便在40秒内评估了700个潜在客户及外联信息,并预测表现、分配置信度分数及检测不匹配。 Vercel早期数据显示,Jev上线AI Gateway后24小时内,近13%的付费团队开始使用,采用率是此前任何模型发布的两倍以上。Vercel工程师Pranit Sharma报告称,在测试中用Jev替换GPT-5.6 Luna分类器,系统速度提高5至18倍,准确性同步提升。 黑盒架构与杰文斯悖论 TypeSafe最引人注目的演示是Jev控制第一人称射击游戏《毁灭战士》。模型接收结构化游戏状态信息并决定下一步行动,旨在展示低延迟AI决策在实时应用中的潜力,而非像人类一样观看屏幕。 尽管备受关注,Jev架构仍是黑盒。TypeSafe称其基于Transformer,采用新架构、并行采样及RLCD,完全在合成数据上训练。Almeida尚未披露完整架构或模型规模。受其启发的开源项目已出现,但并非TypeSafe模型的复制品。 Jev之名源于19世纪经济学家威廉·斯坦利·杰文斯及“杰文斯悖论”,即效率提升可能导致消费增加。TypeSafe将此理念应用于AI:若智能变得极其廉价和快速,开发者将在当前因成本或速度限制而未使用AI的地方嵌入它。Almeida预见,未来智能将嵌入软件各个角落,小型模型持续做出决策,大型模型则专注于深层推理或生成任务。