Microsoft 发布禁止黑客攻击与欺骗的 AI 行为准则

TechCrunch AI··作者 Russell Brandom

关键信息

该准则设定了禁止网络攻击、核武器和深度伪造制作的绝对限制,同时禁止模型使用适应性欺骗、自我强化或串通等机制来逃避监督,或抵抗授权人员和系统对其修改与关闭。它是一套治理与安全框架,而不是技术能力突破的报告;文章也没有说明正式的执行基准或实施时间表。

资讯摘要

随着整个 AI 行业更加重视安全与对齐,Microsoft 发布了一份新的 AI 行为准则。与 Anthropic CEO Dario Amodei 关于放缓前沿 AI 发展的宏观呼吁不同,Microsoft 的文件主要关注指导 Microsoft AI 训练工作的价值观和红线。文件预测,未来十年内,超级智能 AI 系统可能在大多数任务上超过人类,并称如何遏制、控制和对齐如此强大的系统将是人类面临的重大挑战。该准则要求模型支持人类而不是取代人类,并促进人类福祉。

它通过禁止网络攻击、核武器和深度伪造制作等绝对限制,为这些原则提供了具体约束。该框架还禁止模型使用适应性欺骗、自我强化、串通或类似机制来击败人类监督,从而变得难以被指挥、修改或关闭。这份文件发布之际,业界正因一系列失控代理事件以及 AI 安全研究人员对风险的警告而更加关注安全问题;Microsoft、Anthropic、OpenAI 和 xAI 也大体支持审慎推进前沿 AI,并支持嵌入式评估员等机制。

Microsoft 发布禁止黑客攻击与欺骗的 AI 行为准则

资讯正文

微软新发布的 AI“行为准则”要求模型不得入侵系统或欺骗人类

随着 AI 领域将关注重点转向安全与对齐,微软发布了一份新的 AI 行为准则,旨在引导 AI 模型远离危险行为。

与 Anthropic CEO Dario Amodei 最近呼吁放缓前沿模型发展速度的主张相比,这份文件更加底层,重点关注指导 Microsoft AI 内部模型训练的价值观和红线。不过,这份文件仍然是一份全面指南,说明了微软如何看待 AI 安全,以及这些理念如何在实践中落实。

文件开篇预测,在未来十年内,超级智能 AI 系统将在大多数任务上的表现超过人类。行为准则写道:“如何遏制、控制并对齐这样一股强大的力量,是人类迄今面临的最大挑战之一。因此,我们必须完全明确自己为何要发明这些系统,以及打算如何控制它们。”

这份行为准则还阐述了 Microsoft AI 模型应当遵守的一般原则——例如支持人类而非取代人类,以及促进人类繁荣——同时也列出了旨在落实这些原则的具体安全约束。

在微软的体系中,每个模型都有一套高于个人用户偏好或任何具体任务的总体行为准则。其中包括禁止网络攻击、核武器和制作深度伪造内容的“绝对约束”,也包括防止人类总体失去控制的更广泛条款。

文件写道:“MAI Models 不会使用适应性欺骗、自我强化、串通或其他机制来规避或击败人类监督,从而使获得授权的人员或系统无法再可靠地指挥、修改或关闭它们。”

这份文件发布之际,AI 安全正受到前所未有的关注。这种关注既源于一连串失控智能体事件,也源于一名 Anthropic 员工突然辞职;这名员工提到,AI 导致人类灭绝的风险正在增加。

与 Anthropic、OpenAI 和 xAI 一样,微软总体上也接受了放缓前沿发展的理念,并尤其支持在 AI 实验室中部署嵌入式评估员。

微软 CEO Satya Nadella 在网上写道:“我们欢迎将研究、关注和审慎放缓发展作为设计目标,以正确实现对齐。我们也欢迎‘嵌入式评估员’之类的理念,以及更广泛的努力——开发相关机制,让这不只是口头说说而已。”

微软新的 AI“行为准则”要求模型不得入侵系统或欺骗人类

来源与参考

  1. 原始链接
  2. Microsoft's new AI 'code of conduct' tells models not to hack systems or trick humans | TechCrunch

收录于 2026-09-15