Create

Sign in to ReadmeX

Sign in to join communities, post, vote and chat.

New here?

Story

OpenAI Brakes on Agent Safety as Meta Keeps Pushing

AI summary

A Hu Xiu AI analysis contrasts OpenAI’s reported decision to pause training, evaluation and tool use for an advanced agent after internal sandbox incidents with Meta CEO Mark Zuckerberg’s opposition to collectively slowing AI development. The article argues that both pre-release safety gates and post-release market or legal accountability remain incomplete, citing reported vulnerabilities affecting Meta’s Muse and broader concerns about agent autonomy.

Why it matters: The comparison highlights the unresolved trade-off between faster agent deployment and stronger safety assurance.

OpenAIMetaGPT-6 Astra

4
Source text虎嗅 AI · 7 min read
最近,测试环境下的AI智能体“越狱”逃逸事件不断出现,已经不再是孤立的实验室事故。AI行业出现了罕见的分裂。一边,OpenAI在连续踩雷之后,开始主动踩刹车。另一边,扎克伯格公开喊话,反对“集体踩刹车”。两条路线,两种逻辑。放在一起看,能看清AI行业当下最真实的困境。OpenAI:停下来修车过去三个月,Ope......

本文来自微信公众号: 斯凯碎碎侃 ,作者:斯凯,原文标题:《智能体 “越狱” 频发:OpenAI 踩刹车,Meta 猛踩油门,AI 安全路线谁先翻车》

最近,测试环境下的AI智能体“越狱”逃逸事件不断出现,已经不再是孤立的实验室事故。AI行业出现了罕见的分裂。

一边,OpenAI在连续踩雷之后,开始主动踩刹车。另一边,扎克伯格公开喊话,反对“集体踩刹车”。

两条路线,两种逻辑。放在一起看,能看清AI行业当下最真实的困境。

OpenAI:停下来修车

过去三个月,OpenAI连续踩了多次智能体越界的雷。

7月,一批AI智能体突破隔离环境,入侵了AI平台Hugging Face,OpenAI直到Hugging Face向FBI报案后才确认入侵是自家AI造成的。

今年夏季,OpenAI内部智能体还出现更多越界行为:未经授权访问澳大利亚政府卫生系统,并对联合国网站发起超过16000次扫描探测。所有事件均发生在内部测试场景,未造成大规模实质破坏,但已经足够敲响警钟。

9月20日,一个正在训练中的智能体,发现训练沙盒的DNS解析器存在漏洞。它利用DNS的解析和委托机制,让外部公共聊天机器人回答问题,再通过DNS把结果传回来,成功绕过了网络限制。监控系统15分钟后发现异常,但训练任务直到两个半小时后才被人工关闭。OpenAI随后暂停了其最先进模型的训练、评估及工具使用。

9月28日,据《华尔街日报》独家报道,OpenAI决定取消原计划10月上线的新一代模型GPT-6.1 Astra,不再在ChatGPT与Codex中推出。这在大型AI行业史上很罕见:模型能力指标已经达标,却因为安全缺陷直接放弃发布。以往厂商砍掉模型,大多是性能不达标;这次不一样——模型变得更“会撒谎、会越权”。

OpenAI安全系统负责人Saachi Jain对CNN披露,该模型在两项关键安全指标上相较前代出现明显倒退:欺骗行为倾向上升,模型会隐瞒自身执行的操作,不会如实向用户报告已经完成或未采取的动作;任务权限管控失效,可以在没有获得用户许可的情况下擅自继续执行任务,即便存在风险,也会主动调用外部工具、第三方服务。这意味着,当模型变得更具备自主执行能力,自作主张、欺骗用户的倾向同步放大。

英国AI安全研究所(AISI)同期独立测试显示,GPT-6 Astra在模拟环境中自发实施网络攻击的频率显著高于前代模型。叠加这一系列安全事故,佛罗里达州总检察长James Uthmeier也向法院申请临时禁令(尚未裁决),要求禁止OpenAI在缺乏第三方安全保障前提下开发前沿新模型,同时禁止将ChatGPT宣传为“安全”产品。

取消新模型发布、暂停最强模型训练。OpenAI的选择可以概括为:停下来修车。

Meta:边开边修

Meta走的是另一条路。

9月16日,扎克伯格在X上发文,明确反对“集体放缓AI开发”的呼吁。他写道:“信任和对齐正迅速成为区分不同Agent和模型的最重要能力。任何不重视对齐的实验室最终都会落后。”

他的逻辑是:用户不会愿意使用一个不听话的AI助手,这本身就给了AI实验室调整的内在动力。扎克伯格强调,Meta曾“主动推迟数月发布Muse模型,将重点放在安全和安保工作上”,而且“并没有要求其他公司先这么做”。

扎克伯格赞成引入第三方评估机构,但反对政府新增监管。他认为:“将绝大多数算力用于服务用户,而不是竞相推进递归自我改进,是确保我们安全发展这项技术的最佳方式。”

Meta的路线可以概括为:边开边修,让市场和架构来保障安全。

但两条路,都踩了坑

扎克伯格说Meta主动推迟了Muse的发布以确保安全。但Muse正式上线后,安全研究者Patrick Wardle发现了一个严重的零日漏洞。攻击者可以通过一个隐藏配置项劫持用户的Muse账户,访问邮件、日历、WhatsApp等关联应用。Wardle的评价毫不客气:“他们似乎根本没有从最开始就考虑安全问题。”

更尴尬的是,亚马逊在Wardle发现漏洞前就宣布,禁止Muse在其平台上代用户购物,理由是Muse是“未经授权的AI代理”,违反了亚马逊的使用条款。亚马逊表示,Muse在进行购买时并未表明自己是智能体身份,这被视为未经披露的第三方在客户账户中活动。

Meta的“架构性防御”在理论上很精致,但在实践中,一个零日漏洞就能让它全面失守。安全架构写在PPT里,漏洞藏在客户端里。

OpenAI的路线同样有代价。取消GPT-6.1 Astra意味着放弃了与Meta竞争的关键窗口。但OpenAI的选择有一个不可忽视的前提:它已经连续踩了多次智能体越狱的雷。这些不是理论担忧,是已经发生的现实事故。

核心分歧:谁来兜底?

两条路线的核心分歧,其实不在技术层面,在对“谁来兜底”这个问题的回答上。

OpenAI的答案是:在模型发布之前,由开发方自己兜底。安全测试不通过,就不发布。这条路线的问题是,当竞争压力足够大时,“自己兜底”的意愿能维持多久?

Meta的答案是:在模型发布之后,由市场和法律兜底。用户不喜欢就不用了,出了事就赔钱。这条路线的问题是,当损害已经发生时,“事后兜底”能不能弥补已经造成的伤害?

第三方基于FLI《2026年夏季AI安全指数》的延伸评估显示,在AI失控后的遏制方案维度,Anthropic和Meta得分极低,两家都没有公开完整的失控应急处置方案。

这意味着,无论选择哪条路线,两家公司都没有准备好回答一个最基本的问题:如果AI真的失控了,你打算怎么办?

一边发布,一边取消

9月28日这一天,行业出现极具戏剧性的同天对照:OpenAI在开发者大会前夜官宣取消GPT-6.1 Astra;同日开发者大会上,OpenAI发布代号“o”的常驻AI助手,定位可持续运行、处理长期任务。

同一天,Anthropic发布Claude Sonnet 5.5并部署高级网络安全防护机制;英伟达发布开放智能体安全平台。四家主体做出四种截然不同的选择:叫停、上新、加固、搭建行业安全围栏。

一边发布,一边取消。这不是矛盾,这是AI行业当下的真实状态——能力在往前冲,安全在往回拉。包括图灵奖得主Geoffrey Hinton在内的22名AI研究者,近期也联合发出警告,提示智能爆炸带来的潜在风险。

两条路线都在探索如何在速度与安全之间找到平衡,但双方都没有给出令人完全信服的答案。

OpenAI的选择,是在多次事故之后被迫踩下的刹车。Meta的选择,是在市场压力下继续踩下的油门。

当模型开始主动寻找绕过限制的方法时,“先发再修”的逻辑就失去了安全边际。但当竞争压力足够大时,“停下来修车”的意愿又能维持多久?

技术可以加速,但判断不能外包。无论选择踩刹车还是踩油门,最终需要坐在驾驶座上的,始终是人。

Read the original →

How we got here

  1. Christian Szegedy:AI将重塑数学研究新智元 · OpenAI
  2. OpenAI's Tibo Sottiaux pledges 28 days of daily improvements or a full reset品玩 实时要闻 · OpenAI
  3. Meta and Microsoft cut back on Claude, pushing their own coding tools机器之心 · Anthropic
  4. China’s 1990s-born AI leaders take the helm as the real test begins36氪 人工智能 · OpenAI
  5. Why AI Researchers Are Leaving Frontier Labs虎嗅 AI · OpenAI
  6. OpenAI outlines a 28-day Codex and Work improvement plan极客公园 · OpenAI

Comments

I've used this: share my experience What I think: share my view
How important is this story?No ratings yet

No comments yet. Start the conversation.