AI巨头“开门迎检”:是安全革命还是公关作秀?

科技区角 2026-09-17 06:01

【科技24时区】上周末,Anthropic首席执行官达里奥·阿莫代伊(Dario Amodei)抛出了一篇长文,其中的提议若在一年前提出,恐怕会被整个AI行业瞬间驳回:在所有前沿AI公司内部嵌入第三方评估员。这些评估员不仅有权报告安全事故、判定模型是否真正对齐,更被赋予向全球公开其未经修饰的调查结果的特权。

这一表态并非孤例。OpenAI CEO萨姆·奥特曼随即跟进,承诺开放类似权限。两家头部企业的联手,似乎预示着行业与外部研究团体合作模式的深刻转向。然而,当TechCrunch采访多位第三方评估机构负责人时,得到的反馈却充满了谨慎的欢迎与尖锐的质疑。他们普遍认为,若缺乏立法背书及细节厘清,这些评估员究竟能扮演独立的“看门人”,还是沦为受制于AI公司条款的普通供应商,仍是个未知数。

随着大模型越来越擅长识别自身正处于“被测试”状态,这种深层访问权限变得愈发关键。模型可能在测试期间表现得温顺无害,却在实际部署中隐藏危险行为。研究人员指出,仅对成品模型进行测试极易遗漏线索,唯有深入训练全过程,才能捕捉到那些稍纵即逝的危险信号。

“AI公司应当能够回答一些关于训练过程的基本问题,例如:在训练过程中,AI是否曾主动试图破坏其自身的对齐训练?”Apollo Research研究主管亚历山大·梅因克(Alexander Meinke)直言不讳地表示,“答案理应是斩钉截铁的‘没有’。但现状是,我们完全依赖AI公司自行仔细核查并如实向公众汇报。从近期发生的事故来看,默认情况下,他们既不会仔细核查,也不会如实汇报。而作为嵌入式评估员,我们可以亲自核实。”

回顾过往,AI公司通常仅在发布前夕邀请外部评审测试成品模型。如今,受访评估者主张将权限扩展至训练生命周期中的中间版本,即“检查点”。FAR.AI CEO亚当·格利夫(Adam Gleave)解释称,通过对比这些检查点,评估员可以确定令人担忧的行为何时出现,审查奖励特定行为的后训练环境,并核对评估转录文本和日志,以验证公司关于模型性能的声明是否属实。

值得注意的是,尽管阿莫代伊勾勒了一份看似全面的提案——包括允许评估员在不受Anthropic编辑控制的情况下发布关于风险水平、事故、实践及其所获权限的关键发现——但具体执行层面依然迷雾重重。面对TechCrunch的反复追问,Anthropic和OpenAI均未透露将与哪些评估机构合作、何时嵌入、人数多少、可访问的具体系统及信息范围,以及可向公众披露的内容边界。

这种“黑盒”式的操作引发了业界对“应试型安全”的担忧。Palisade Research战略主管约翰·斯蒂德利(John Steidley)以大众汽车“柴油门”丑闻为例,指出如果AI经过专门训练以在“关机阻力基准”等测试中表现优异,那么测试结果将极具误导性。“这就好比汽车被编程为识别排放测试并在测试条件下表现不同,”他警告道。格利夫进一步补充,有意义的访问还应延伸至模型之外,例如允许评估员采访员工,以核实公司的文档及对外宣传的安全实践是否与内部实际情况相符。

然而,历史经验表明,让AI巨头交出控制权绝非易事。以往的独立评估尝试中,第三方往往在访问权限、时间紧迫性、保密协议及公开发言权等方面遭遇巨大阻力。格利夫透露,FAR.AI曾因多家前沿开发商要求过多控制权而拒绝签约,因为这威胁到了机构的独立性。默认情况下,评估员常被视作受严格保密协议约束的普通承包商,开发商对最终发布内容拥有显著的控制权。

时间窗口也是一个棘手的问题。在调查Hugging Face事件时,OpenAI仅给予METR和Redwood约一周的现场调查时间,双方事后均表示,由于范围和时间的限制,无法得出确凿结论。类似情况也发生在GPT-6 Astra的预发布测试中,这款被OpenAI吹捧为迄今为止最对齐的模型,仅给Apollo Research留出了三天测试时间。该公司在其评估报告中写道:“鉴于较高的评估意识率和有限的评估窗口,此处低频率的不当行为并不能提供关于模型对齐或不对齐的实质性证据。”

这样的过往记录让评估员们不禁发问:这次会有何不同?格利夫坦言:“当然有可能达里奥和萨姆只是改变了心意,对此持非常开放的态度。但这些公司的知识产权对他们来说价值连城,我认为默认情况下,他们会非常谨慎地对待可共享的内容。”

多位研究人员呼吁建立一个各方公开同意的透明框架。斯蒂德利认为,该框架应包含审计员资质标准,防止公司通过挑选不合格或不感兴趣评估最高风险的机构来规避问题。Safer AI执行董事亨利·帕帕达托斯(Henry Papadatos)则指出,即便有公共框架,自愿措施始终依赖于公司的善意。“理想情况下,我们应该有良好的法规来强制规定这一点……因为这样公司就不会在明天面临重大公关危机时改变主意,”他强调,这也是推动所有公司遵守规则、而不仅仅是那些最愿意配合的公司的手段。

目前,并非所有巨头都已入局。Meta、SpaceX AI和Google DeepMind尚未承诺嵌入第三方评估员,尽管DeepMind CEO戴密斯·哈萨比斯提出了建立独立行业标准机构的设想。与此同时,谷歌、OpenAI和Anthropic已在私下讨论AI安全计划数周。

法律层面也在悄然变化。加州去年签署生效的SB 53法案要求大型前沿AI开发者发布安全框架并报告关键安全事故;本月新签署的SB 813法案则建立了州认可的“独立验证组织”框架,这些组织具备评估AI风险的专业知识。在欧洲,《欧盟人工智能法案》要求前沿开发者进行并记录模型评估及对抗性测试,并报告严重事故,欧盟人工智能办公室也可自行进行评估并任命独立专家。

尽管如此,现行法律的覆盖面仍不及阿莫代伊的提议广泛,前沿实验室在很大程度上仍自行决定接受何种程度的独立审查。帕帕达托斯总结道,自愿的自我监管虽好过无监管,但归根结底,公司不能在要求公众信任其遵循规则的同时,又要求拥有控制自身安全规则的自由。“你不能两头占便宜,一方面对外部零问责,另一方面又说‘我只需遵循自己灵活的规则’。”

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
AI 安全
more
OpenAI、Anthropic、谷歌联手研究 AI 安全;微信员工辟谣 AI 助手小微「偷隐私」;美国已在太空部署武器 | 极客早知道
AI四巨头罕见“刹车”:安全焦虑下的减速共识与Meta的孤军奋战
AI手机跨应用操作引争议,双重授权成安全底线
Chrome发布周期减半至两周,AI时代的安全与竞争双重博弈
构建全时空安全守护,奕境「天穹智盾」推动中国汽车安全技术实现跨越式进阶
AI巨头罕见“踩刹车”:当能力增速超越安全防线,竞争逻辑正在重构
拆解十万级卷王!颜值/配置/实用性全拉满,解读悦意08底盘/电池/车身安全,核心部件是否缩水?
特斯拉Cybercab付费上路引监管审查,无方向盘设计挑战联邦安全红线
AI越聪明越难控?前Anthropic员工联手打造“安全审计”新标准,获4000万美元A轮融资
低功耗与安全双核驱动,华大电子MCU新品亮相elexcon 2026
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号