Ex-OpenAI safety lead resigns, blasts company culture and 'iterative deployment'
David Robinson, who spent three and a half years at OpenAI leading safety-transparency work, drafting its Preparedness Framework and overseeing safety evaluations attached to 12 frontier model releases, resigned and published a critical essay. He argued that OpenAI's touted "iterative deployment" approach is really trial and error, doomed to periodic failures whose scale grows with model capability, and called for frontier labs to run like nuclear plants with layered defence-in-depth plus a new science of safe behaviour without supervision. In the same week OpenAI said it parted ways with three safety-team researchers for mishandling sensitive company information; multiple outlets reported they had shared information about model safety issues with a third-party AI safety evaluator. An OpenAI spokesperson said the company keeps improving safeguards, will pause training or withhold models when needed, and is hardening its testing environments.
Why it matters: It is the latest sign of sustained internal dissent over safety culture at frontier labs, a debate that shapes how AI risks get governed.
近日,美国知名媒体刊出一篇署名文章,标题是《我从OpenAI辞职,因为它的文化已经烂透了》。第一句话就是:“我本周从OpenAI辞职了。”
作者戴维·鲁滨逊在OpenAI工作了三年半,已经算是公司资历很老的中层主管之一。他主要负责安全透明度工作,主导起草了OpenAI现行的《预备框架》,并监督了12次前沿模型发布所附带的安全评估报告。过去几年外界读到的每一份OpenAI安全报告,大概都经过他的手。
实际上,作为资深中层,鲁滨逊仍然持有OpenAI的股权,而他的个人财富,也取决于他刚刚离开和炮轰的公司能否顺利上市获得华尔街认可。就在同一周,OpenAI刚刚解雇了三名安全团队的研究员。
试错文化导致周期失败
鲁滨逊在文章开头就承认,自己这么做“有点俗套”,似乎是又一个从顶尖AI公司离职,就公开发出严厉警告的员工。毕竟这样的案例在最近不胜枚举。
但他的批评落点与前人不同。他明确表示,关于AI行业的这场辩论需要超越“具体的规则或新的法律”,去处理这些公司整体的文化。
鲁滨逊的批评矛头对准的,是OpenAI称之为“迭代部署”的方法论,而这恰恰是AI行业长期当作优势来宣传的东西。他写道:“OpenAI依靠的其实是试错,但这种方法,就其本质而言,注定了周期性的失败。而随着系统能力越来越强,这些失败的规模正在扩大。公司忙着从一次产品发布跳到下一次,但并未在审慎管控方面达到我认为需要的水平。”
他还直言,包括OpenAI在内的AI公司“远远不够小心”,并直接提到了自家智能体入侵Hugging Face以及后续被发现的更多失控智能体活动。
这篇文章并不是一次全面攻击。鲁滨逊称自己的前同事聪明、勤奋,努力做出好的选择。他真正的问题是速度。最坦率的是这一段:“也许我该留下来,为我们的人员配置和文化争取根本性的转变。但实际上,我和同事们忙于冲刺,很少有机会去思考大的改变,更不用说真正做出改变了。”
运作应像核电站一样
鲁滨逊提出了两条具体诉求,来解决他眼中的OpenAI乃至整个AI行业的问题。
第一,前沿实验室应当像核电站或繁忙的机场那样运作,建立多层冗余,使得任何单一的人为失误都不会导致灾难。这在工程上有个专门概念,叫“纵深防御”。美国核管理委员会对它的定义是:建立多重独立且冗余的保护层,其前提假设正是人为与机械失误不可避免。换句话说,他要的不是“更小心”,而是一套从一开始就假定你会犯错的制度设计。
第二,AI行业需要发展出新的科学,以确保“更强的模型(及其后继者)在没有监督的情况下也会做出安全的选择”。换句话说,鲁滨逊承认监督本身会失效,所以必须让模型在无人盯着的时候也是安全的。
在AI安全成为焦点的大背景下,鲁滨逊这篇文章成为热议话题。OpenAI发言人德鲁·普萨泰里(Drew Pusateri)表示,公司在持续改进安全措施,在必要时会暂停训练或扣住模型不发布,并正在加强测试环境的安全性。
但鲁滨逊整篇文章的论点恰恰是:OpenAI目前采取的这种技术修补,无法替代一种把安全与速度同等看待的文化。
小修小补已经于事无补
与他辞职同期发生的,是OpenAI解雇了三名安全团队的研究员。公司发言人的措辞是:“我们已与三名个人分道扬镳,原因是他们违反了我们关于访问和处理敏感公司信息的政策。”内部调查认定,他们“在既定公司流程之外不当处理了敏感信息”。
据多家媒体报道,这三人被指将关于OpenAI模型安全问题的信息分享给了一家第三方AI安全评估机构。OpenAI没有公开这三人的姓名和接收方机构,也没有说明涉及何种信息;外界同样不清楚他们在对外分享之前,是否先通过内部渠道提出过关切。
同时,这一周OpenAI还有不少负面新闻。他们不得不告知100多家机构,自己测试中的智能体存在未授权活动;更被迫宣布出于“安全顾虑”决定搁置GPT-6.1 Astra的发布计划。
把时间轴拉长,会发现这是一条持续了两年多的队列。过去两年多时间,OpenAI不断有员工因为安全方面的担忧,对公司政策与文化感到失望,对外爆料导致被解雇或者主动辞职,之后公开批评OpenAI。
2024年4月11日,OpenAI曾以几乎相同的理由解雇过利奥波德·阿申布伦纳(Leopold Aschenbrenner)和帕维尔·伊兹梅洛夫(Pavel Izmailov)。阿申布伦纳两个月后公开表示,自己是因为向外部研究者分享了一份安全文件而被解雇的。他此后进入AI投资行业,创办了“态势感知”对冲基金——也就是今年7月在二十天内从450亿美元缩水至约100亿美元的那一只。
2024年5月,超级对齐团队的两位负责人伊利亚·苏茨克韦尔(Ilya Sutskever)和简·雷克(Jan Leike)先后离开,该团队随后解散。雷克去了Anthropic。
2024年6月,《纽约时报》刊发报道《OpenAI内部人士警告一场“鲁莽”的主导权竞赛》,当时站出来的是丹尼尔·科科塔伊洛(Daniel Kokotajlo)等人。
2024年10月,长期负责政策研究的迈尔斯·布伦戴奇(Miles Brundage)离职,“AGI准备度”团队同时被解散;两个月后研究员罗西·坎贝尔(Rosie Campbell)也以同样理由辞职。布伦戴奇此后公开指责OpenAI正在改写自己的安全历史,并于2026年1月创办了独立机构AVERI,呼吁对前沿模型进行独立安全审计。
员工内部对下一代模型感到不安
这些因安全担忧离开OpenAI的研究者中,不少人去了OpenAI的对手Anthropic,其中多位后来入选了《时代》杂志的AI百人榜单。
事实上,Anthropic这家公司本身,就是2021年1月阿莫迪(Dario Amodei)因为对安全问题不满,而带着一批OpenAI员工出走后创办的。如今在Anthropic负责Claude价值观训练的阿曼达·阿斯克尔(Amanda Askell),也在同年3月从OpenAI政策团队转投而来。
而最近三个月,这种因为对安全问题失望而离开的故事延伸到了Anthropic自己身上。看起来,阿莫迪创办的公司和OpenAI并没有太大的差别。
9月8日,Anthropic研究员雅各布·考克森(Jacob Coxon)辞职,发帖称两家公司“都没有负责任地行事”,而是“直奔可以自我改进的超级智能,拿我们的生命做赌注”。他当时27岁,是一名英国研究者,在圈外几乎无人知晓,但帖子迅速传开,次日浏览量就超过了九千万。他告诉媒体,自己辞职的时间,距离股权归属只剩两个月。
9月11日,Anthropic“可扩展监督”团队负责人乔·本顿(Joe Benton)宣布辞职,理由同样直白:“AI公司正在竞相制造比任何人类都聪明得多的机器,而我们可能无法在这个过程中幸存下来。我想从外部工作,确保公众了解这些风险。”次日,谷歌DeepMind的安全研究员乔什·恩格尔斯(Josh Engels)也提交了辞呈,两人一同加入了独立评估机构METR。
本顿还透露,许多仍在Anthropic工作的同事对他们正在开发的系统感到“恐惧”;他特别提到自己的前任主管埃文·休宾格(Evan Hubinger)。此人曾公开表示,认为AI导致人类灭绝的概率超过10%。
据外媒报道,在这些公开辞职之前,OpenAI和Anthropic的员工内部早已对下一代模型的能力,以及自家公司提供有效监督的能力感到越来越不安。
快速行动打破常规文化
硅谷并不是第一次面对”文化出问题”的指控。“快速行动,打破常规”是Meta在2012年之前的座右铭,但随着越来越多的用户数据泄露以及被滥用问题曝光,后来扎克伯格再也不提这句话了。然而,很多媒体在过去一个月的报道中指出:这种企业文化正在AI行业复活。
路透社那篇被广泛转载的《改变AI进程的十天》写道:多年来,这场竞赛遵循的是一条硅谷老规矩——快速行动,打破常规;而在短短十天里,各大实验室发现,被打破的东西,是那些本应把越来越自主的AI系统置于人类控制之下的护栏。
然而,AI时代的错误似乎与互联网时代有着显著差别。互联网时代被“打破”的,是用户体验、是隐私边界、是内容质量。这些东西造成的损害真实但可修复,可以打补丁、改规则、交罚款。
而AI时代被打破的东西不一样。英国萨里大学(University of Surrey)以人为本AI研究所的安德鲁·罗戈伊斯基(Andrew Rogoyski)指出了一个尖锐的双重标准:如果是一个人黑进了澳大利亚的医保系统,他面对的是牢狱之灾;而当这件事由软件完成时,企业的叙事框架往往把它轻描淡写成一次“意外”。
互联网时代,批评Facebook和谷歌的,主要是外部的监管者与媒体,而他们的员工并不觉得自己在做错事。而现在,发出最严厉警告的,恰恰是公司内部那些最了解系统的人,是那些写安全框架的人、做可扩展监督的人、负责发布评估的人。
而且他们不是被解雇后才反水,而是主动辞掉顶尖实验室的高薪职位,去薪酬低得多的第三方评估机构工作。本顿和恩格尔斯去的METR,就是这样一家机构。慈善组织Coefficient Giving已投入2亿美元支持这类外部安全组织。
囚徒困境导致无法刹车
有分析把当下的局面形容为一场囚徒困境:没有一家实验室愿意主动踩刹车,因为谁都害怕把阵地让给不会减速的对手。本顿的诊断与此一致。他把问题归因于市场竞争的结构性压力:每一家头部AI公司都在安全投入上打折扣,因为谁都不敢因为太过谨慎而导致落后。
这正是鲁滨逊那句”我和同事们忙于冲刺,很少有机会去思考大的改变”的制度版本。他的这篇文章明确反对把问题简化成“缺一部法律”。在他看来,具体的规则和新的法律都不够,真正需要改变的是整个AI行业的企业文化。而文化恰恰是最难被外部力量改变的东西。
这个判断有现实依据。过去一个月,AI行业关于监管的争论已经吵得沸反盈天:阿莫迪发表3800字长文呼吁集体减速,奥特曼、哈萨比斯、纳德拉相继表态支持;黄仁勋、扎克伯格坚决反对;白宫内部为此分裂了近一年,而一份仿照金融业监管局模式的行政令草案,在三位科技巨头分别致电特朗普之后被搁置。
这也解释了为什么本顿的诉求是强制性的透明而非笼统的监管:要求企业公开递归自我改进的进展、如实报告各类事故与未遂事件、设立基线安全要求和独立的合规核验。他的理由很简单,他不再相信这些公司会自愿把坏消息说出来。
而OpenAI近期的做法,某种程度上正是对这种不信任的回应:它在9月16日主动披露了六起此前未公开的模型失准事件,公司对齐团队研究负责人陈凯(Kai Chen)解释说,“目前不存在一个带有明确披露标准的全行业框架,所以我们主动迈出这一步”。但两周之后,三名安全研究员就因为把信息分享给外部评估机构而被解雇。
鲁滨逊在文章最后写道:“也许我该留下来,为我们的人员配置和文化争取根本性的转变。”或许这是所有AI从业者迟早要面对的选择:是留在内部争取改变,还是走出去获得发声的自由。
然而,正如他所说,留下来的人忙于冲刺,没有时间推动结构性改变;辞职的人获得了话语权,却失去了影响力。
本文来自微信公众号“新浪科技”,作者:郑峻,36氪经授权发布。
How we got here
- Google Cloud unveils Gemini agent, a universal enterprise agent for work9to5Google · Anthropic
- Pollo AI's video agent runs on GPT-6 Astra and GPT-Image-2.5OpenAI · OpenAI
- OpenAI publishes 377 AI math results at onceDoNews · OpenAI
- Altman interview confirms OpenAI paused a frontier model training run36氪 人工智能 · OpenAI
- OpenAI hires Cursor's Europe chief as EMEA sales VP, its second SpaceX hireBloomberg Technology · OpenAI
- Teen's Claude-planned mountain hike ends in helicopter rescueThe Decoder · Anthropic