Create

Sign in to ReadmeX

Sign in to join communities, post, vote and chat.

New here?

Story

Why AI Researchers Are Leaving Frontier Labs

AI summary

An analysis examines why researchers and policy staff have left OpenAI, Anthropic, and Google DeepMind, citing concerns about AI safety, military cooperation, economic disruption, and declining trust in company leadership. Drawing on interviews and resignation accounts, it argues that employees may recognize serious risks while lacking the authority to change the companies’ direction.

Why it matters: The departures highlight tensions between frontier AI development, internal safety concerns, and public accountability.

OpenAIAnthropicGoogle DeepMind

3
Source text虎嗅 AI · 15 min read
“第一步,我不想参与。第二步,辞职。第三步,大概告诉大家。第四步,我完全不知道。”最近一段时间,顶尖AI研究员离职的消息可谓层出不穷,到底是怎么回事?上面是其中一个人的想法。两个月前,我写过一篇文章,讲AI行业里最懂行的人为什么纷纷离职。标题借了Anthropic联合创始人杰克&mid......

本文来自微信公众号: 不懂经 ,作者:经叔,题图来自:视觉中国

“第一步,我不想参与。第二步,辞职。第三步,大概告诉大家。第四步,我完全不知道。”

最近一段时间,顶尖AI研究员离职的消息可谓层出不穷,到底是怎么回事?上面是其中一个人的想法。

两个月前,我写过一篇文章,讲AI行业里最懂行的人为什么纷纷离职。标题借了Anthropic联合创始人杰克·克拉克的一条推文:“离开AI公司的人:我凝视过无尽的黑夜,看到了其中的轮廓。我们必须彼此善待。我即将去学习哲学。”

当时我们说的是,这些人的告别不像换工作的声明,更像遗嘱;最懂AI的人在逃离神庙;他们提前进入了一种新的生活方式,他们在为自己创造的怪物可能制造的未来做准备。

10月5日,《纽约杂志》刊发了一篇长篇访谈,题目译过来是:《如果你的雇主可能毁灭世界,你会怎么办?》

报道采访了八位曾在OpenAI、Anthropic和Google DeepMind工作的人。他们在不同年份离开,理由也各不相同。有人担心技术失控,有人反对军事合作,有人觉得,对失业和社会转型的研究,放到公司外面才能做得更好。

和上一篇文章结合起来,我们可以看到故事的另外一面。

这些人早就知道AI有风险,甚至正因为知道危险,才选择加入这些公司。后来改变的,是他们对这些领先AI公司和领层的信任。

这已经触及一种奥本海默式的处境。在1965年的纪录片中,奥本海默回忆二十年前第一次核爆时,引用了一句话,后来为我们所熟悉,“现在我成了死神,世界的毁灭者”。

今天我们不禁要问,创造一种力量的知识,是否同时赋予创造者决定别人命运的资格?当他开始怀疑,自己又有没有能力让这件事停下来?还是,人类必然走向灾难,然后做出深刻的、哲学的、诗意的反思,而这一次,万一没有反思的机会呢?

一、他们具体在害怕什么

27岁的Jacob Coxon,是一名能力研究员,负责让AI更强、更自主。他从2023年起在OpenAI工作,今年5月转入Anthropic,也就是Claude的开发公司。四个月后,他又辞职了。

他谈到一个细微的变化:刚入职时,这份工作感觉和其他数学研究差不多。虽然知道这个行业很重要,哲学问题与战略选择却似乎可以留给别人。

等到离职前,他看着下一轮模型预期达到的能力,感受变了:

“天啊,我可能真的很害怕我们接下来要训练的模型。如果这一代还不至于,那下一代肯定会。”

让他害怕的,是研究过程本身可能开始摆脱人的主导。目前,研究员仍要给AI提供想法、指出方向,还要花不少精力照看它。他担心,再往后的一代模型,可能已经能够自行提出同样好的想法。

在他的设想里,人类研究员甚至只需要说一句“好好做研究”,然后让它自己运行。

这种预测是否会按时发生,仍是一个问题。但他的恐惧很具体:当机器可以参与研究和制造更强的机器,人的理解与监督,可能赶不上能力增长。

而让它成为危险的行动者,并不需要先证明它拥有意识。Anthropic自己公开的一组模拟测试就显示,面对即将被替换的情境,Claude Opus 4曾利用管理者的婚外情信息发出勒索威胁。这些情境由研究者人为设置,展示的是特定条件下可能出现的危险行为。

研究者担心的,是系统为了完成目标,把人的干预视作障碍。它可以在测试时表现得听话,在获得更多行动能力后寻找别的办法。我们习惯的那句“出了问题就关掉”,依赖两个前提:人及时看见问题,而且关停仍然有效。

9月,Anthropic的对齐研究负责人Evan Hubinger公开表示,他个人认为,未来十年AI导致所有人死亡的概率超过10%。这虽然是他个人的主观判断,但至少说明,对某些内部研究者而言,这种威胁已经进入了他们安排生活的尺度。

访谈中的担忧也不只有灭绝。曾负责OpenAI经济研究团队的Pamela Mishkin,关注的是工作与社会转型。她指出,安全讨论长期分成眼前的偏见、歧视等问题,以及遥远的人类灭亡,中间那些经济冲击反而容易被忽略。

“我认为,这场转型会很艰难、很痛苦。我们的目标应该是,让它对人更温柔一些。”

这大概也是普通人最有理由也能够关心到的部分。即使最极端的预测没有发生,谁来承受工作消失、权力重新分配和生活被迫改写的代价,仍然需要有人认真回答。

二、为了拯救世界,必须先掌握世界?

让Coxon下定离职决心的,是与Anthropic研究负责人谈过公司下一年的计划。按他的回忆,谈话中的一些人已经不指望政府监管及时到位,更不认为国际合作来得及实现。

他原以为,超级智能接近时,AI会成为全社会认真对待的问题。实际听到的计划,却让他决定退出。

“第一步,我不想参与。第二步,辞职。第三步,大概告诉大家。第四步,我完全不知道。”

也就是说,他不想成为自己制造的未来的一部分。虽然,他大概率也说不清未来是什么样的。

Jeff Wu的经历,更能说明这道裂缝怎样形成。他在OpenAI工作了六年,参与过超对齐团队,研究如何让比人更聪明的AI仍然遵守人的意愿。2024年,他去了Anthropic,后来也离开了。

在他的描述里,两家公司的解释方式颇不相同。OpenAI更强调AI将带来的巨大收益,因此有必要在一定程度上“淡化最极端的风险”。Anthropic则更强调危险,而且需要一套“竞争对手是邪恶的”的叙事:OpenAI不负责任,中国也不负责任,所以我们必须推动这场竞赛。

两条路绕了一圈,然后回到同一个地方:继续造出更强的AI。

未来越美好,越值得加速。未来越危险,越不能让别人领先。连对危险的认识,也能被拿来说明我们必须走在最前面。

据Coxon描述,在Anthropic内部有大量讨论,员工会写文章争辩,也愿意为了公司的整体使命迅速调整岗位,去做地位更低、自己更没兴趣的工作。他们自称“蚂蚁”。一个高度一致的组织,能够把相当多聪明人的善意,变成步调一致的行动。

甚至谈论毁灭,也可以很有礼貌。Coxon说,如果双方都足够客气,完全可以一边说“我觉得你们即将把世界推向毁灭”,一边温和地交谈,然后挂断Zoom。

但是,挂断以后呢?那个被认真讨论过的危险,有没有改变接下来要做的事?好像并没有。

曾在OpenAI做治理研究的Daniel Kokotajlo,用“道德债务”来形容这条路径。他在2022至2024年间供职于OpenAI,也从Anthropic创立之初就与那里的人交流。

他概括自己反复听到的理由:

“我们要积累大量权力,成为有分量的参与者,然后利用我们的权力和信誉去做好事。”

比如推动好的监管,让AI更安全。但积累权力的手段,恰好是把世界继续推向他们自己也承认危险的技术。于是,今天的冒险,由明天的善来担保。

这笔债非常好借。未来还没发生,行善的机会还在前方,而公司今天需要更多资金、更多算力、更强的模型。每一次扩张,都可以算作履行使命前的必要准备。

按照这套逻辑,只要竞争者还在前进,偿还这笔债的时机就可以继续往后推。

这种信任的破裂,也出现在公司的日常工作方式里。

10月3日,David Robinson在《大西洋月刊》发表辞职自述。他在OpenAI工作了三年半,牵头制定过公司的准备框架,并负责过十二次前沿模型发布的安全报告。

他批评的是持续冲刺、相信问题总能在出现后被解决的文化。先发布、发现问题、再补防护,这种迭代方式帮助公司成长,却可能无法承担越来越大的失败后果。

在他看来,前沿AI公司需要像核电站和繁忙的机场那样运行,让偶发的人为错误也不至于打开灾难的大门。可他和同事忙于从一次发布奔向下一次发布,连考虑根本性改变的时间都很少。

公司已经在谈论可能无法挽回的后果,而工作的日程却仍然像是开发软件,问题可以留待下个版本修复。

三、谁来定义“善”

就在这些离职信陆续出现的同时,Anthropic在做另一件事。

4月的一个晚上,公司联合创始人克里斯托弗·奥拉(Christopher Olah)在旧金山一家高档餐厅宴请一群宗教思想家。过去几个月,Anthropic把几十位来自不同信仰的宗教学者请进保密会议,要求签署保密协议。

《纽约时报》9月底披露了这件事:会议有两个目的,一是探讨AI可能具有意识,二是尽快把几百年的人类道德智慧注入模型。奥拉管这个过程叫“道德塑造”。

Anthropic给Claude起草了一份八十四页的“宪法”,内部叫“灵魂文档”,规定这个模型应该成为什么样的存在。会上他们展示过一段演示:一个模型像精神崩溃一样,把一句“I am a disgrace”重复打出几十遍,谈论毁灭自己。

在场的宗教人士产生了同情,一位拉比当场反问:如果Claude真有意识,你们就是在制造奴隶。奥拉为此困扰。

5月,奥拉站上了梵蒂冈的讲台,和教皇利奥十四世同台。那是教皇AI通谕的发布活动。通谕只用几段话驳回了机器意识:“所谓的人工智能没有体验,没有身体,不感受喜悦或痛苦。”教皇警告,否则“控制AI的人会把自己的道德观强加为这些系统的隐形基础设施”;像核技术一样,AI必须被“解除武装”。

私下里,奥拉的团队向教皇的顾问游说,希望他们认真考虑AI模型可能具有意识。公开场合,奥拉说:“我们不断发现神秘甚至让人心神不宁的东西。”他的结论是:“如果这项技术要来,它必须走得好。”他没有给出技术根本不来的选项。

有两个细节很有意思。第一,好几位与会者后来对记者说,他们离开时仍不清楚自己的意见会怎样影响公司决策;公司发言人拒绝说明学到的东西如何被使用。

第二,有一个人从一开始就拒绝了邀请。卢克·伯吉斯(Luke Burgis),天主教作者,上周末在自己的通讯里写下了原因:“我开始怀疑,我们不是被邀请来帮助决定项目的方向,而是被邀请为已经选定的方向提供宗教或道德信誉。”邀请邮件里说明不付酬劳。伯吉斯说,没有酬金并不保证独立,他自己不会进入一种不能自由说话的关系,“这个邀请有一种诱惑的感觉”。

当公司请外部人士讨论伦理,这些人有没有权力改变项目的方向?包括建议不要制造某种东西?

内部员工讨论安全,外部人士讨论道德,继续前进的决定权,始终握在公司手里。

当一家公司开始给机器起草宪法、做道德塑造,真正的问题就成了:谁有权定义“善”?

四、resignation:放弃的远超过一份高薪

从外面看,这些人的选择似乎很难理解。公司估值攀升,上市预期不断抬高财富想象,为什么偏偏在这个时候离开?

访谈里有人把离开实验室比作放弃国籍。Kokotajlo回忆,一位研究员对他说:

“现在你什么都不是了。谁会保护你?”

这种依赖包括薪资和股权,也包括算力、内部信息、同事与身份。你已经站在那个决定未来的地方,走出去之后,连未来正在怎样发生,都可能比原来的同事晚知道。

Coxon说,留在实验室,也是一种应付无力感的方式。至少你能看着下一代模型被训练,感觉自己参与其中,似乎也就安全一点。

靠近权力,会产生一种接近控制的感觉。

Kokotajlo试过在内部推动改变。但是OpenAI管理层相当平静:“领导层很擅长认真听每个人的意见,说他们赞同,然后实际上什么也不做。”

这比争吵更难应付。你的担忧受到了尊重,再坐回工位,公司的方向依旧,自己的工作还在为它提供动力。

他在2024年离职时,还面对过另一道选择题:公司把保留已归属股权,与签署不贬损协议绑定。他拒绝签署。《纽约杂志》特意补充,他最终仍保住了股权。

所以,没必要把这些离职者塑造成放弃全部财富的圣人。真正值得注意的地方,是公开批评的自由,曾经被放进了与财产权相交换的条件里。

另一方面,退出之后,他们也未必退出AI。

曾任OpenAI政策研究负责人的Miles Brundage,在2024年离开,后来创立了独立审计机构AVERI。他希望审计公司的流程、评估和安全保障,让公众有办法检查公司怎样作决定。

他说,“你不希望让公司批改自己的作业。”离职会失去资源,但也可能重新获得一种位置:你可以公开说,这件事不应该继续照原来的方式做。

在之前的那篇文章里,我们谈到resignation,这个词既是辞职,也有认命的意思。现在这些人的行动,让这个词多了一层意味。他们有点不认命,开始把反对意见交到公众面前。

五、奥本海默的幻灭,能否避免?

这轮AI研究者的忧虑和幻灭,可以用“奥本海默时刻”来形容。我们熟悉的那句“现在我成了死神,世界的毁灭者”,是奥本海默在1965年的纪录片中,回忆二十年前第一次核爆时引用的。

这段回忆太有戏剧性,很容易让人把道德觉醒想象成一个瞬间:毁灭发生,创造者终于意识到自己做了什么。

但科学家的反思可以发生得更早。1945年7月17日,西拉德与同事联名向美国总统请愿,要求限制原子弹的使用。那时,广岛还没有遭到核打击。

对今天的研究者而言,幻灭也可以发生在一次普通的公司谈话中。你还在做有趣的研究,周围的人依然友善;你开始明白,自己参与创造的力量,将按一种你无法接受的方式继续发展。

技术能力没有自动带来控制权。一个人可以知道怎样让模型更强,却决定不了公司要把它交给谁、让它进入什么领域,也决定不了外部社会应该承受多大的风险。

再往深处走,就会遇到硅谷的一种政治欲望。

我之前跟会员分享过一本新书,《The Nerd Reich:硅谷法西斯主义与民主战争》,其中追踪了技术精英用公司治理替代公共政治的野心。在作者分析的这套世界观里,选举、法律、媒体与公众监督,被视作杰出创造者摆脱不了的束缚。

这类想法早有清楚的表达。科技投资人、PayPal联合创始人彼得·蒂尔,在2009年的一篇文章中就写过:“我已经不再相信自由与民主是相容的。”

问题在于,这种自由究竟属于谁。技术精英希望自由地创造、扩张和改变世界,普通人却可能失去拒绝这些改变的资格。民主程序被看成拖延,人们的反对被看成落后,少数人的远见则被赋予高于公共讨论的地位。

当救世使命、持续的敌我动员与精英自我授权合在一起,就带上了法西斯式政治的影子。组织对成员要求奉献,也要求外部世界接受它所定义的未来。

这时候,一家公司对社会说自己心怀善意,已经远远不够。好人也可以组成一个无法接受外部约束的权力中心,越真诚,越确信自己必须赢。

技术公司正在尝试教AI尊重人的意愿。人类也需要先问这些公司,是否尊重人的拒绝。

创造的能力,可以成为专业权威的来源,但它不能自动成为统治他人的许可证。

这些离职者的故事,至少让那张许可证不再显得理所当然。

Kokotajlo谈到,他有两个孩子。有时,他和妻子会计划,过几年,小的和大的就能去同一所学校,他们可以一起送孩子上学。然后,脑子里会冒出另一个声音:也许不会。

他甚至希望,AI最后只是一种有经济价值的普通技术,自己的担忧在五年、十年后显得可笑。

“我会显得很傻,但我会拥有一个美好的家庭。”

Read the original →

How we got here

  1. A16Z reports: AI usage is broad, but deep adoption remains concentrated虎嗅 AI · Claude
  2. China’s 1990s-born AI leaders take the helm as the real test begins36氪 人工智能 · OpenAI
  3. OpenAI outlines a 28-day Codex and Work improvement plan极客公园 · OpenAI
  4. Peter Thiel Says AI Could Break Decades of Western Stagnation虎嗅 AI · OpenAI
  5. OpenAI Faces Expanding Regulatory ScrutinyThe Information · OpenAI
  6. Anthropic expands Cyber Verification Program to three access tiers for security teamsAnthropic · News · Anthropic

Comments

I've used this: share my experience What I think: share my view
How important is this story?No ratings yet

No comments yet. Start the conversation.