编者按:当AI公司主动邀请外部评估者进驻实验室,这究竟是负责任的表现,还是一种精巧的公关策略?本文试图拆解这一问题的答案。
前所未有的访问权限
据TechCrunch报道,Anthropic和OpenAI正在推动一项颇具争议的举措:邀请独立安全评估员直接嵌入其AI实验室内部,实时监督模型开发与部署过程。这一提议在AI研究界引发了广泛讨论——支持者认为这是行业透明度的重大突破,批评者则质疑:由被监督者自己邀请的监督者,真的能保持独立吗?
安全评估的“嵌入式”模式
所谓“嵌入”,意味着安全评估员不再是在模型发布后从外部进行审查,而是深入实验室内部,在模型训练、测试和部署的全过程中持续参与。这种模式赋予评估者前所未有的访问权限,包括接触内部文档、参与关键决策会议、甚至查看未公开的模型能力评估数据。
对于长期批评AI公司“黑箱操作”的研究者而言,这无疑是一个积极信号。有AI安全领域学者表示,这种程度的开放是“史无前例的”,但它是否足够,仍取决于制度设计的细节。
独立性的核心悖论
问题恰恰出在“独立性”上。嵌入实验室的评估员,其薪资由谁来支付?其报告是否会被公司审查后再对外公布?当评估发现严重风险时,评估员是否有权直接向监管机构报告,而非先经过公司内部程序?
“没有透明度和制度保障的‘独立’评估,只是一种自我背书。真正的监督需要评估者拥有与被评估者抗衡的实际权力。”
这一悖论并非AI行业独有。在金融审计、药品安全监测等领域,类似的“内部监督者”困境早已存在。历史经验表明,有效的内部监督必须辅以外部监管的威慑力——评估者需要有一条不受公司控制的“举报通道”,以及一个真正会采取行动的监管机构。
行业背景与监管真空
Anthropic和OpenAI的这一提议,出现在全球AI监管进程的关键节点。欧盟《人工智能法案》逐步落地,美国各州也在推进各自的AI安全立法,但联邦层面的统一监管框架仍未成型。在这一真空期,AI公司主动提出“内部评估”机制,既可以被解读为负责任的自律,也可能被视为抢先定义规则、规避外部监管的策略。
值得注意的是,Anthropic一直以“安全优先”为品牌核心,OpenAI也多次强调其对安全的承诺。但品牌叙事与制度现实之间存在差距。批评者指出,如果评估结果由公司决定是否公开、评估范围由公司划定、评估人员由公司选聘,那么“独立评估”就可能沦为一种信任营销。
什么才算“有意义”的监督?
研究者提出了几个关键标准:第一,透明度——评估结果应默认公开,除非涉及明确且有限的国家安全例外;第二,独立性——评估者应具备独立的法律地位,不受公司雇佣关系的束缚;第三,可问责性——当评估发现高风险问题时,应有强制性的报告和整改机制,而非公司可自行决定是否采纳。
归根结底,嵌入式评估只是AI安全治理的一个环节,而非终点。真正的安全保障,需要建立从公司内部到政府监管的多层次体系。没有外部监管的“自我监督”,最终可能演变为一场精心设计的信任游戏——参与者赢得了声誉,公众却未必获得真正的安全。
本文编译自TechCrunch
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接