
在全球顶级人工智能模型于模拟真实私募股权尽职调查测试中仅获得51%分数的背景下,一家位于旧金山、仅有九名员工的公司Halluminate刚刚完成3000万美元A轮融资。本轮由Oak HC/FT领投,使该公司总融资额达到3850万美元。Halluminate旨在为研发上述模型的实验室提供专用的训练基础设施,以突破模型在复杂金融工作流中的性能瓶颈。
Halluminate由CEO Jerry Wu和CTO Wyatt Marshall于2024年创立。据2026年10月1日消息,其现有投资者包括Y Combinator、Orange Collective、Heavybit和FT Partners,以及来自Anthropic、OpenAI和Meta的个人研究人员天使投资人。这份客户名单同时也构成了其股东结构。
财务尽调揭示AI能力天花板
今年8月,Halluminate发布了“Westworld金融尽职调查基准”。该基准包含88项源自匿名化真实私募股权交易案例的任务,由从业专业人士编写审核。七款前沿模型参与测试,平均最高得分仅为51%。
该基准模拟了投行家、顾问和会计师团队数周的完整工作流:文件审查、合同分析、条款清单演变及最终交付。在一项典型任务中,智能体需处理包含160个文件的虚拟数据室,审阅工作说明书,应对跨9个线程的21封邮件和四组会议纪要,同时处理不断变化的交易条款。
测试显示,智能体 consistently 以相同方式失败:遗漏必要修改、应用错误分析方法或基于过时信息行动。问题核心不在于单一步骤,而在于在漫长、混乱的真实工作流中保持上下文和意图的一致性。Halluminate将这些失败模式转化为强化学习(RL)环境,让模型在结构化模拟中迭代,无需触碰真实交易数据。
金融RL环境的工程壁垒
构建金融特定RL环境的技术障碍在于奖励函数的验证。编程环境中,代码运行结果二元且可编程验证,支持大规模程序化尝试。而金融工作中,合同条款修改的正确性取决于交易背景、法律先例及资深银行家的判断,无法通过程序自动检查。
Halluminate的解决方案是从匿名实际交易中获取基准任务,并由活跃交易专业人士审核,将专家评分标准内置为环境验证器。Wu将此描述为“垂直化数据研究实验室”基础设施,将金融专业知识浓缩为训练信号。
为何前沿实验室愿意付费
据Wu透露,美国五大封闭源AI实验室中有四家是客户。公司已实现盈利,年化收入达八位数中段(基于已交付并支付的季度收入)。九人团队的高效能反映了其客户群的高度集中与高价值。尽管前沿实验室在编程RL环境上投入巨资,但缺乏构建金融特定环境所需的专业网络与从业者关系,这正是Halluminate的护城河。
Oak HC/FT普通合伙人Matt Streisfeld指出,随着AI智能体从秒级任务转向耗时数天甚至数周的长周期工作,训练环境的质量将成为决定性因素。“当智能体开始进入长周期工作时,测试工作和专业化将非常关键。”
市场整合与“环境摩尔定律”
后训练基础设施市场正在快速整合。Scale AI报告显示,近一半新数据训练项目涉及RL环境。Deeptune因构建企业软件工作流训练环境,于2026年3月获a16z领投的4300万美元A轮,并于同年7月被Mercor收购。与Deeptune的广度策略不同,Halluminate专注于金融领域的深度,依靠行业专业知识与专门验证方法产生复合效应。
Wu提出了“环境摩尔定律”:每六到八个月,训练环境的复杂度必须大致翻倍,以匹配前沿模型的进步。有效的环境必须处于模型当前能力的边缘——难到足以失败,但又可行以促使其改进。这意味着不仅要重建单个任务,还要以递增保真度重建整个多周交易流程。这一持续生产递增复杂性的能力,构成了公司的核心知识产权。
投资方信号与未来展望
领投方Oak HC/FT管理约53亿美元资产,专注于医疗保健信息服务和金融科技,而非典型的前沿AI投资机构。这一选择表明,Halluminate的业务被视为金融服务基础设施的一部分,其持久价值源于领域专业知识。Oak HC/FT将投资金融软件公司的逻辑应用于AI训练环境,押注金融特定AI基础设施的长期价值。
Halluminate近期的优先事项是与少数前沿实验室加深合作,而非扩展至企业买家。Wu明确表示,公司致力于在能力前沿工作,帮助实验室推动模型边界。51%的基准分数暴露出的差距并非可通过变通方案解决的产品局限,而是该业务存在的根本原因:训练将使金融AI部署变得可靠的模型。
深度解析:关键问题答疑
为何AI在编码和数学表现优异,却在金融尽调中不及格?
编码和数学拥有可验证的二元答案,程序即可检查。金融尽调则需在数百份文件中追踪不断变化的条款,应用专业判断,不存在唯一的程序化正确答案。Halluminate基准揭示了模型一般推理能力与在混乱多文档工作流中可靠性之间的差距,其训练环境旨在通过专家验证的评分标准弥补这一鸿沟。
为何AI训练需要“环境”进行强化学习?
强化学习要求智能体在交互设置中尝试任务、接收反馈并调整行为。对于金融任务,环境必须模拟接近真实体验的混乱、多来源、时间紧迫的工作流,才能产生可迁移的训练信号。静态文本训练无法提供这种基于表现的动态评分机制。
如何确保基准的可靠性与无利益冲突?
“Westworld基准”任务源自真实交易并经专业人士审核,比合成评估更具基础,但尚未经第三方独立验证或同行评审。读者应将其视为AI辅助金融工作实际难度的可信下限,而非精确测量。尽管存在“基准设计者销售解决方案”的动态张力,但平行基准(如Scale AI Professional Reasoning Bench)也证实了该类任务的极高难度。