纳德拉:开发者应默认假设 AI 模型已失控
微软 CEO 萨蒂亚·纳德拉在一篇长文中提出,开发者应当默认假设 AI 模型可能已被攻破或出错,并据此设计系统,而不是依赖“超级智能自我监控”等简单策略。他认为 AI 模型虽比传统软件更强大,却是难以观察的黑盒子,却接触着最敏感的数据并代表人类执行关键任务,因此需要重新评估这个时代的信任架构。文中列出多项可观测性原则:模型多样性(不让任何单一模型独自验证自身)、对每个有意义的模型动作留下防篡改且人类可读的证据、持续测试故障与攻击等场景、独立控制与独立审计,以及可随时暂停或关闭模型的“紧急刹车”,并要求在系统故障或被攻破时及时披露信息。他还提到,将前沿封闭权重与开放权重模型视为内部风险,是构建此类体系的一种方式。
为什么重要:微软 CEO 公开主张把“默认模型已失控”作为设计前提,可能影响企业级 AI 部署在信任、审计与终止机制上的走向。
-
日夜间
随系统
浅色
深色
-
主题色
黑色
业界 手机 电脑 测评 视频 AI 苹果 iPhone 鸿蒙 软件
智车 数码 学院 游戏 直播 5G 微软 Win10 Win11 专题
微软 CEO 纳德拉:开发者应当默认假设 AI 模型失控,思考如何强制中断任务
2026/10/11 7:19:46 来源:IT之家 作者:汪淼 责编:汪淼
IT之家 10 月 11 日消息,微软 CEO 萨蒂亚 · 纳德拉认为,在 AI 日益蓬勃发展的时代,使用超级智能自我监控等简单策略是不够的。
纳德拉在北京时间 10 月 10 日晚的一篇长文中指出,传统软件系统在过去几十年中被广泛部署,人类已经拥有追踪特定代码路径行为的工具和能力。然而,AI 模型比传统软件更强大,但却是一个黑盒子,我们部署了这些复杂的智能体系统和模型,访问我们最敏感的数据,并赋予它们代表我们执行关键任务的能力。

纳德拉认为,我们应该退一步思考,重新评估这个新时代的信任架构。模型提供商根本无法将责任外包出去,不能把超级智能当作一套嵌套的黑匣子,简单地接受或拒绝它的建议、答案和行动。我们必须建立能够观察其行为、可测试极限和始终可容纳行为的封闭系统。
纳德拉表示,将前沿封闭权重和开放权重模型视为内部风险,是构建此类体系的一种方式。这并不是因为 AI 模型一定是恶意的,而是任何有足够能力、能够接触重要系统的行为者都可能犯错或被攻破,而遏制和控制的架构必须考虑到这一点。
纳德拉提到,开发者应当围绕可观测性原则设计这些系统,IT之家附具体原则如下:
模型多样性:没有任何模型应成为重要结果的唯一依赖,也不应负责验证自身工作。
观察一切:每一个有意义的模型动作都必须留下防篡改、人类可读的证据。不能观察,就不能信任。我们需要能够在不依赖模型来证明的情况下,重现结果是如何实现的。
可验证性:我们需要持续测试整个系统,包括故障、攻击、边缘案例、系统变更等,而不仅仅是成功的任务。
独立控制:组织应能够独立决定模型可以访问什么以及可以采取哪些行动。
独立审计性:验证必须独立于被验证的智能。没有任何单一模型应同时控制系统的行为以及判断该行为是否与原始意图一致所需的证据。
遏制: 我们必须假设模型已被破坏,并从一开始就将其控制。可以把它想象成紧急刹车。授权人员应始终能够在任务中暂停或关闭模型。更先进的模型将需要更先进的遏制技术,我们需要对此进行标准化。
事件披露:当这些系统出现故障或被攻破时,我们需要及时向受影响者披露信息,并建立机制分享出错原因、哪些控制失效以及如何防止再次发生,并向整个行业分享经验。这应包括在运行时改变智能体行为的实现细节。
相关文章
- 我国食品安全法修订草案公开征求意见,涉及 AI 监管、校园食品安全等
- Cloudflare 推出开放权重决策 AI 模型 Clef-omni,新增支持音频 / 视频输入
- Underdog AI 发布 Saluki 27B 模型:2-bit 量化 Qwen3.8-27B,7.89GB 大小
- 特朗普向马斯克、黄仁勋等人颁发美国国家科学奖章,先给自己颁了个奖
- 66.1 分登顶:Odyssey-3 基础世界模型登场,AI 开始理解真实世界
- Liquid AI 开源 d1 系列决策模型:单次判断仅 8 毫秒,支持图像输入