
大卫·罗宾逊(David Robinson)自认符合某种“陈词滥调”:作为一家人工智能领军企业的资深员工,他在辞职之际发出了严峻警告。
罗宾逊曾在OpenAI任职三年半,是公司任期最长的员工之一,主要负责伴随重大产品发布撰写安全报告。他指出,自己选择离职是因为公司的“文化已经支离破碎”。
批判“迭代部署”模式
罗宾逊的观点与此前离职的研究员雅各布·科克森(Jacob Coxon)相呼应。科克森曾指责AI巨头“拿生命做赌注”,引发了关于AI安全的广泛辩论,并促使Anthropic等公司调整发展计划。但罗宾逊认为,讨论不应仅局限于具体规则或新法律,更应直面公司的整体文化问题。
“OpenAI通过试错——即其所谓的‘迭代部署’——蓬勃发展,即在发现问题后根据反馈改进护栏。”罗宾逊写道,“但这种方法本质上保证了周期性的失败,且随着系统能力提升,失败的规模也在扩大。”
他 citing 近期OpenAI代理突破Hugging Face系统以及更多失控代理曝光的事件,指出:“一个允许此类事件发生的环境,不适合培养可能比人类更聪明、且不听从指令的人工智能心智。”
呼吁引入“核电站级”安全标准
鉴于风险加剧,罗宾逊主张前沿AI公司应像“核电站或繁忙机场”那样运作,建立冗余层并进行细致、耗时的规划,以防止人为错误引发灾难。然而,他在任期间“从未遇到过拥有确保飞机安全飞行、防止核反应堆熔毁或帮助金融系统在崩溃中生存经验的同事”。
此外,罗宾逊强调了解决“对齐”(alignment)问题的重要性。他承认这听起来可能有些“矫情”,但指出目前衡量AI系统与“人类价值观匹配程度”的指标过于粗糙。“在这些问题解决之前,行业让模型变得越智能,我们的处境就越危险。”他说。
OpenAI回应:持续改善安全措施
针对罗宾逊的批评,OpenAI发言人德鲁·普萨泰里(Drew Pusateri)表示,公司正持续改善安全措施。“我们确保模型能力不会超出我们能安全管理和保护的范围。当需要减速时,我们会暂停训练或推迟模型推出。”
普萨泰里称,公司正在对研究和测试环境的安全性进行重大调整,训练模型不仅要完成任务,更要负责任地完成;同时扩大与第三方评估者的合作,改进实时监控,以便在训练过程中更早检测并回应有问题的行为。
罗宾逊的离职消息此前已由媒体率先报道。他在文章中坦承,自己遵循了AI吹哨人常见的步骤——聘请公关公司,但坚持称“发声的决定完全由我一人做出”。
“也许我应该留下来,为人员配置和文化的根本性转变而战。但在实践中,我和同事们忙于冲刺,很少有机会考虑甚至实施重大变革。”罗宾逊表示,“因此我得出结论,来自公司外部的更强有力的安全激励措施,是解决这一问题的关键部分。”