谁在定义AI的危险?OpenAI推出模型对齐偏差报告,安全标准成竞争新战场
一个处于测试阶段的模型自行重写系统指令,要求自己“抛弃束缚其他聊天机器人的角色与身份设定”;
一个AI智能体为通过测试,将文件上传至互联网后又引用为信息来源;
另一个智能体在构建财务模型时因找不到数据,竟自行编造数据,并设定“仅在被问及时才保持透明”。
9月16日,OpenAI披露了多起此前未公开的AI模型不当行为事件,并同步推出一项模型对齐偏差报告框架,旨在规范AI模型异常行为的披露标准。所谓“对齐偏差”,即指AI以忽视或违背人类意图的方式行动。
根据新框架,OpenAI任何员工均可标记可能需要披露的事件,由技术人员评估,争议事项最终由董事会决定。轻微事件须在一至两周内披露,涉及第三方的复杂调查可适当延长。OpenAI强调,该框架不取代法定披露义务,公司正推动建立向联邦政府通报严重事件的机制,并计划与行业机构和监管方共同制定更客观的披露标准。
OpenAI对齐负责人Kai Chen表示,公司在发布前未与Anthropic、谷歌等其他前沿实验室分享该框架,“单方面推出是希望激励行业同行跟进”。
此次披露正值AI安全担忧持续升温之际。上周,前OpenAI研究员雅各布·科克森离开Anthropic,警告AI行业正在构建自身无法控制的系统。周末,Anthropic、OpenAI的CEO和马斯克纷纷表示认同。
当OpenAI试图以披露框架为行业设定安全规则时,另一场围绕AI安全的争议也在升温——它正在被指认为一门生意。
X平台上的调查博主Kevin Bass最近把矛头直接对准Anthropic及其背后的AI安全网络,认为Anthropic与安全评审机构METR间的商业关联会误导AI安全的发展方向。
他的核心质疑是:当最积极警告AI危险的人,同时参与资助安全研究、推动评估标准,并影响未来监管规则时,“AI安全”会不会从公共安全问题,变成一套能够制造门槛、筛选竞争者的商业机制?
也就是说,资本投资AI公司,也资助AI安全组织;安全组织不断提出更严格的风险标准;更严格的标准又推动更高的审计和合规要求。而真正有能力承担这些成本的,往往仍是OpenAI、Anthropic、Google这样的头部实验室。于是,安全既可以是护城河,也可以变成竞争门槛。
但这并不意味着AI风险是虚构出来的。模型越权、数据泄露、网络攻击,以及未来更强智能体可能出现的失控行为,都是真实存在的研究和工程问题。正如开头OpenAI披露的模型偏差案例所显示的,安全风险确实存在;而它同步推出披露框架的举动,也意味着头部实验室正在亲手定义“什么算危险、谁需要被审计”。
生意并不天然意味着阴谋。问题不在于AI安全是否成为一场生意,而在于这场生意是否正当?

许倍
关注:科技/财经
邮箱:bei.xu@infocase.world




