OpenAI和Anthropic今年早些时候曾与各自律师讨论一项具有法律约束力的协议,拟相互对商业化AI模型进行压力测试,以寻找模型中的漏洞和潜在风险。
据The Information援引知情人士透露,根据拟议中的协议,OpenAI和Anthropic将获得对方商业化AI模型的API访问权限,并通过一系列测试寻找模型可能存在的漏洞或潜在危险。尚未发布的模型则不在协议范围内。
双方同时保证,在测试过程中不会保留对方的数据。
目前尚不清楚OpenAI和Anthropic最终是否正式敲定了这项协议。
相关讨论发生之际,AI模型安全和测试机制受到越来越多关注。The Information报道称,OpenAI近期正重新考虑一系列AI安全策略。
如果相关安排最终落地,其核心机制将是让两家AI公司直接利用对方商业化模型的API开展测试,从外部寻找模型可能存在的安全漏洞和隐藏风险。
相比单一公司内部进行模型安全评估,这种相互测试机制意味着模型开发商之间可以利用彼此的测试能力,对已经投入商业应用的模型进行交叉检验。
2025年夏天两家公司过去曾进行过类似的模型测试,并公布相关结果:Anthropic的模型更倾向于通过否认违反规则来欺骗测试人员;而OpenAI的模型则更有可能协助解答可能导致现实世界危害的咨询。
此次讨论的拟议协议则试图以更正式、具有法律约束力的方式建立双方之间的测试安排。
对于正在快速推进模型能力和商业化应用的AI行业而言,如何在模型能力提升的同时加强安全测试,正成为OpenAI、Anthropic等AI公司需要面对的重要问题。