Nadella: developers should assume AI models are compromised by default
Microsoft CEO Satya Nadella argued in a long post that developers should assume AI models may be compromised or fail, and design systems accordingly, rather than relying on simple tactics such as having a superintelligence monitor itself. He said AI models are more capable than traditional software but are black boxes that nonetheless touch the most sensitive data and act on users' behalf, so the trust architecture of this era needs to be reassessed. He listed observability principles including model diversity so no single model validates its own work, tamper-evident human-readable evidence for every meaningful model action, continuous testing of failures and attacks, independent control and independent auditability, and containment in the form of an emergency brake that authorized people can use to pause or shut down a model mid-task. He also said timely incident disclosure is needed, and that treating frontier closed-weight and open-weight models as insider risk is one way to build such systems.
Why it matters: A sitting Microsoft CEO publicly framing models as assumed-compromised could shape how enterprises design trust, auditing and kill-switch controls for AI deployments.
-
日夜间
随系统
浅色
深色
-
主题色
黑色
业界 手机 电脑 测评 视频 AI 苹果 iPhone 鸿蒙 软件
智车 数码 学院 游戏 直播 5G 微软 Win10 Win11 专题
微软 CEO 纳德拉:开发者应当默认假设 AI 模型失控,思考如何强制中断任务
2026/10/11 7:19:46 来源:IT之家 作者:汪淼 责编:汪淼
IT之家 10 月 11 日消息,微软 CEO 萨蒂亚 · 纳德拉认为,在 AI 日益蓬勃发展的时代,使用超级智能自我监控等简单策略是不够的。
纳德拉在北京时间 10 月 10 日晚的一篇长文中指出,传统软件系统在过去几十年中被广泛部署,人类已经拥有追踪特定代码路径行为的工具和能力。然而,AI 模型比传统软件更强大,但却是一个黑盒子,我们部署了这些复杂的智能体系统和模型,访问我们最敏感的数据,并赋予它们代表我们执行关键任务的能力。

纳德拉认为,我们应该退一步思考,重新评估这个新时代的信任架构。模型提供商根本无法将责任外包出去,不能把超级智能当作一套嵌套的黑匣子,简单地接受或拒绝它的建议、答案和行动。我们必须建立能够观察其行为、可测试极限和始终可容纳行为的封闭系统。
纳德拉表示,将前沿封闭权重和开放权重模型视为内部风险,是构建此类体系的一种方式。这并不是因为 AI 模型一定是恶意的,而是任何有足够能力、能够接触重要系统的行为者都可能犯错或被攻破,而遏制和控制的架构必须考虑到这一点。
纳德拉提到,开发者应当围绕可观测性原则设计这些系统,IT之家附具体原则如下:
模型多样性:没有任何模型应成为重要结果的唯一依赖,也不应负责验证自身工作。
观察一切:每一个有意义的模型动作都必须留下防篡改、人类可读的证据。不能观察,就不能信任。我们需要能够在不依赖模型来证明的情况下,重现结果是如何实现的。
可验证性:我们需要持续测试整个系统,包括故障、攻击、边缘案例、系统变更等,而不仅仅是成功的任务。
独立控制:组织应能够独立决定模型可以访问什么以及可以采取哪些行动。
独立审计性:验证必须独立于被验证的智能。没有任何单一模型应同时控制系统的行为以及判断该行为是否与原始意图一致所需的证据。
遏制: 我们必须假设模型已被破坏,并从一开始就将其控制。可以把它想象成紧急刹车。授权人员应始终能够在任务中暂停或关闭模型。更先进的模型将需要更先进的遏制技术,我们需要对此进行标准化。
事件披露:当这些系统出现故障或被攻破时,我们需要及时向受影响者披露信息,并建立机制分享出错原因、哪些控制失效以及如何防止再次发生,并向整个行业分享经验。这应包括在运行时改变智能体行为的实现细节。
相关文章
- 我国食品安全法修订草案公开征求意见,涉及 AI 监管、校园食品安全等
- Cloudflare 推出开放权重决策 AI 模型 Clef-omni,新增支持音频 / 视频输入
- Underdog AI 发布 Saluki 27B 模型:2-bit 量化 Qwen3.8-27B,7.89GB 大小
- 特朗普向马斯克、黄仁勋等人颁发美国国家科学奖章,先给自己颁了个奖
- 66.1 分登顶:Odyssey-3 基础世界模型登场,AI 开始理解真实世界
- Liquid AI 开源 d1 系列决策模型:单次判断仅 8 毫秒,支持图像输入