Jev:定位与机制

TypeSafe推出的新型“System One”分类模型Jev,灵感源自丹尼尔·卡尼曼《思考,快与慢》中的快速直觉思维概念。与大语言模型(LLM)这类“系统二”不同,Jev及其前身Laya属于“系统一”决策模型。

传统LLM基于Transformer架构,输出自由文本,难以直接处理分类任务中的类型确定性(如整数或浮点数)。Jev则在通用预训练Transformer后端附加分类器,无需针对特定任务微调即可利用新上下文,输出带概率分布的类型化决策。其运行成本极低,系列实验总花费不足4.00美元。

校准度测试:表现不佳

为检验Jev输出概率分布的准确性,测试选取了高斯、洛伦兹、麦克斯韦-玻尔兹曼等10种具有明确物理意义的分布。通过GPT-6 Astra和Claude Opus 5.5生成提示模板,在1000个设置中进行评估,以总变异距离(TV)评分,TV=0表示完美一致。

结果显示Jev校准效果糟糕。若完全回避答案并均匀分布概率,平均TV得分为0.546,而Jev得分为0.518。在均匀分布测试中,Jev得分高达0.77,远差于随机猜测的0.39。其主要故障模式表现为过度自信:倾向于生成过于尖锐的分布,并在尾部赋予非零权重,即便正确概率接近于零。

进一步分析发现,Jev往往直接复制提示词中给出的峰值参数,而非通过计算得出。对于峰值需衍生计算的分布(如麦克斯韦、瑞利),Jev仅在约20%的设置中找到正确峰值,且分布平坦。更甚者,在本应均匀的分布上,Jev竟输出了接近狄拉克函数的尖锐分布。

文献佐证与数学能力瓶颈

既有研究也指出Jev在均匀分布上的过度自信问题。Kanta Hayashi和Yu Xi Chau的测试显示,在面对公平骰子或硬币时,Jev会以极高概率(83%-93%)固执地选择单一结果,准确率仅为随机水平。Gu等人指出LLM普遍不擅长采样概率分布,而Baldelli等人发现微调虽可改善校准,但可能损害算术推理等下游能力。

测试证实,Jev能准确识别适用的分布类型,但在生成具体概率时失败。分层数学测试表明,Jev在处理单步或简单运算时表现尚可,但在涉及多步算术(尤其是指数跟踪和单位换算组合)时迅速崩溃。这归因于Transformer架构缺乏思维链支架来保存中间结果,导致其在内部执行复杂多步计算时能力不足。

LLM辅助实验的陷阱

本次实验首次尝试由前沿模型(Opus 5.5和Astra 6)协助设计。它们在抽象层面表现优异,但在实现细节上存在严重缺陷:多数初始实验将答案隐含在提示词中,导致测试从“校准评估”异化为“复制能力测试”,虚假提升了校准数据。

这一现象揭示了当前前沿模型的普遍弱点:缺乏必要的自发元认知能力,无法反思实验设计是否偏离初衷。尽管AI辅助提升了效率,但人类专家的科学训练在识别此类致命逻辑错误方面仍不可或缺。