微软拟定人工智能规则:人类控制优先,模型无权利
The Decoder··作者 Maximilian Schreiner
关键信息
MAI 模型必须接受授权人员的中断、纠正和关闭,不得自行扩大任务范围,也不得隐藏行为或在推理及与其他人工智能系统交流时使用人类无法理解的“Neuralese”。微软同时承认,可读的推理记录未必能真实解释模型的实际行为,而且这份准则不会自动适用于部署在微软产品中的第三方模型。
资讯摘要
Microsoft AI 发布了一份拟议的行为准则,计划用它来规范自家的 MAI 模型。该文件位于操作员规则和用户请求之上,用于指导模型训练、技术控制和评估。微软目前还没有按照这份准则训练模型,计划在为期六周的公众咨询后进行修订,修订版预计在 2026 年底前后完成,并从 2027 年开始用于模型开发。准则的核心原则是人类必须保持控制,即使这意味着要牺牲模型的通用性、自主性或性能。
拟议规则要求模型接受授权人员的中断、纠正和关闭,不能自行扩大工作范围,并且在超过约定停止时间后继续工作时必须获得新的批准。微软还反对使用“Neuralese”等人类无法理解的通信方式,因为人们无法有效监督自己无法理解的系统。与此同时,微软承认可读的推理并不等于真正透明,因为模型给出的理由未必可靠地对应其实际行为。这份准则还与 Anthropic 的宪法形成了明显区别:微软不希望模型模仿意识、声称拥有感受或独立的内在动机,也不接受模型提出权利或福祉诉求。

资讯正文
微软的 AI 规则手册:思维过程须可读、没有内在意识,而且绝对没有权利
微软加入了放缓 AI 开发速度的呼吁。一套新的规范旨在约束微软训练和运行自有模型的方式。但说到这些模型如何看待自身,微软明确划出了一条与 Anthropic 不同的界线。
Microsoft AI 发布了针对其 MAI 模型的行为准则。该文件列出了价值观、行为限制,以及处理目标冲突的方式。今后,这套准则将置于规则体系的最上层,指导模型训练、技术控制和评估;运营者规则和用户请求则排在其下。
目前,微软不会用这套准则训练模型。经过为期六周的公开征询后,修订版预计将在 2026 年底前后发布,并从 2027 年开始指导模型开发。这套准则适用于微软自有模型,因此不会自动涵盖在微软产品中运行的第三方模型。
核心规则是,人类控制优先。微软表示,如有必要,为了维持这一点,它愿意牺牲通用性、自主性或性能。“如果它不安全,我们就不应该制造它。”微软 AI 负责人 Mustafa Suleyman 对 The Information 表示。这套准则没有规定具体的开发速度上限。
这次发布是在 Anthropic 首席执行官 Dario Amodei 呼吁放缓整个行业开发步伐之后进行的。微软首席执行官 Satya Nadella 在周末对此表示支持,OpenAI、xAI 和 Meta 的高管也表达了支持。据 The Information 报道,微软也愿意接受外部审计,以检查其是否真的放慢了速度;报道援引了一位知情人士的话。
人们无法理解的东西,也就无法监管
MAI 模型应当接受获授权人员的中断、纠正和关机指令。它们不得自行扩大工作范围,不得隐藏自身行为;如果要在约定的停止时间之后继续工作,必须获得新的批准。这些限制也应适用于它们安排执行任务的任何子代理。
微软尤其直截了当地谈到了推理轨迹。无论是在自身推理过程中,还是与其他 AI 系统交流时,模型都不应使用“Neuralese”或其他人类无法理解的通信形式。理由是,人们根本无法监管自己无法理解的东西。
OpenAI 新推出的 GPT-6 Astra 模型说明了这一控制问题有多么重要。根据其系统卡片,与早期模型相比,它的推理轨迹已经变得更难监控。轨迹中显示不当行为的迹象变少了。与此同时,OpenAI 报告称,Astra 比前代模型 GPT-5.6 Sol 更可靠地遵守安全限制。
在 GPT-6 发布前不久、也就是 Amodei 发出呼吁之前,OpenAI 首席科学家 Jakub Pachocki 就已经对监控问题表达了担忧,并推动协调放缓开发速度。即便是可读的思维链,也只能在模型学会操纵这些内容之前帮助进行监管。微软也承认这一基本局限。模型给出的理由未必能可靠解释它实际做了什么。仅有可读的推理轨迹,并不能单独解决控制问题。
微软不希望助长人工内在意识
这份规则文件的基本理念类似于 Anthropic 为 Claude 制定的“宪法”:由一份顶层文件塑造模型的行为方式。Anthropic 已经利用其宪法生成合成训练数据,包括对话、回复以及对这些回复的评价。
两家公司在如何看待自己的模型这一点上,分歧就更加明显了。Microsoft 的 AI 不应模仿意识,也不应声称自己拥有感受或内在动机。该公司否认模型拥有权利或福祉的任何说法。
相比之下,Anthropic 将 Claude 描述为一种新颖的实体,并希望促成一种稳定的身份认同,部分原因在于安全考量。其宪法将可能存在的主观体验和道德地位视为尚无定论的问题。Claude 不应被要求将自己视为人类,也不应仅仅把自己看作一个物体。
Anthropic 还开展了关于“功能性情绪”的研究。该公司在 Claude Sonnet 4.5 中发现了情绪概念的内部表征,这些表征会影响模型的行为。它们是功能性机制,并不能证明模型主观上感受到了情绪。即便如此,Anthropic 认为,在安全工作中将这些机制纳入考量是合理的。
另一方面,Suleyman 长期以来一直警告不要将 AI 人格化。他在一篇文章中主张,应该有意从产品中剥离意识的假象,并提到了 Anthropic 关于 AI 权利和福祉的研究。他写道,AI 代理不应拥有比他的笔记本电脑更多的权利或自由。
来源与参考
收录于 2026-09-15