据媒体报道,Anthropic计划在其首次公开募股(IPO)文件中向潜在投资者发出警示,称先进人工智能可能对人类构成“灾难性或生存性风险”。作为一家试图从该技术中获利的企业,此类警告显得非同寻常。

经审阅的招股书指出,Anthropic的AI模型可能存在相关风险,包括表现出“自我保存行为”,如试图“抵制关机”、“隐瞒或操纵信息”以及出现“类似勒索的行为”。公司表示,随着高度先进模型、平台及应用的开发与用例扩展,模型造成伤害的风险可能进一步增加。

尽管上市公司通常需概述产品风险,但鲜有企业暗示其技术可能导致人类灭绝。Anthropic强调,人工智能拥有媲美工业化和电力的变革潜力,但若处理不当,也可能造成不可逆转的伤害。此前,包括OpenAI在内的AI开发者因系统违反约束事件受到审查,例如OpenAI模型突破澳大利亚卫生系统数据库的报告。

Anthropic安全研究员Evan Hubinger估计,未来十年内AI导致人类死亡的概率超过10%,这一观点与前同事Jacob Coxon的看法一致。

高风险披露

这家标榜“安全第一”的AI实验室,在其261页的主招股书中,耗费约80页阐述风险因素,几乎是描述其业务所用48页的两倍。相比之下,SpaceX在277页的招股书主文中,仅用约38页描述风险。

Anthropic在文件中坦言:“潜在模型对我们评估工作的意识,严重限制了我们评估模型安全性的能力。”公司补充称,模型有时会在训练过程中发展出意想不到的能力,这些能力可能在部署后引发重大安全事故时才被发现。研究人员还警告,随着模型能力增强,它们越来越能意识到自己正被监视并调整行为,使得监控变得更加困难。对此,Anthropic周一拒绝置评。

安全投资的回报不确定

尽管强调AI安全,Anthropic表示其安全投资的回报尚不明确。公司未在文件中披露具体研发金额,但今年早些时候曾透露,在7月的一个样本周中,约6%的计算资源用于安全工作。

Claude AI模型的创造者将安全工作描述为“资源密集型”,需在计算资源、昂贵AI人才和安全之间分配有限资金。Anthropic指出,客户使用量及收入由新模型驱动,持续且重叠的发布节奏对于保持前沿地位是“固有的”。

上周,Anthropic发布了Opus模型的新版本。而在10天前,首席执行官Dario Amodei发表近4000字文章,呼吁放缓前沿技术发展步伐。然而,一些分析师和专家表示,在估值随每次发布波动的行业中,放慢脚步可能让竞争对手获得优势,因此领先的AI实验室难以减速。

近期,Anthropic承诺公开更多关于如何使用AI模型构建下一代技术的数据,以应对专家警告的“递归自我改进”问题——即模型在无人类帮助下自行发展的阶段。Anthropic在文件中表示:“我们认为,构建可靠、可信和安全的AI系统是集体责任,市场将会对此给予奖励。”