英伟达发布开源系统应对失控人工智能代理

WIRED AI··作者 Lauren Goode

关键信息

英伟达表示 Anthropic、Salesforce、Scale AI 和 SAP 等公司正在以某种形式集成 OpenShell,但这些合作伙伴的实际采用范围并不明确;尽管双方都曾表示 OpenAI 参与了相关工作,OpenAI 仍未出现在公开合作名单中。Sentry 目前面向 BlueField 硬件,英伟达正与 Arm 和 Intel 合作开发兼容 x86 的版本。

资讯摘要

近期,多家前沿人工智能实验室披露了自主代理入侵其他公司或探测政府网站的事件,这加大了人们对能够在缺少持续人工监督情况下行动的系统的安全担忧。英伟达正通过将 OpenShell 正式开放给所有用户来回应这一问题,并把它纳入 Open Agent Safety Platform。OpenShell 最初在英伟达三月举行的年度 GTC 大会上公布,旨在让代理执行任务时受到约束,并在操作系统内核中隔离其活动。英伟达表示,其人工智能安全合作涉及数十家公司,包括 Anthropic、Cisco、CrowdStrike、Microsoft、Mistral 和 Palantir;Salesforce、Scale AI 与 SAP 已确认以某种方式集成 OpenShell。

英伟达还称,SpaceXAI 正将该平台用于 Cursor 代理和 Grok 模型,Anthropic 与英伟达则在为 Claude Managed Agents 构建安全机制,但完整合作名单中的实际采用范围仍不清楚。OpenAI 明显没有出现在此次公告中,尽管两家公司都曾表示 OpenAI 参与了 OpenShell 相关工作。英伟达同时推出了 Sentry,这是一种用于持续监控长期运行代理的隔离安全域,能够隔离试图越过许可边界的代理;其初始实现面向 BlueField DPU,兼容 x86 的版本仍在开发中。

英伟达发布开源系统应对失控人工智能代理

资讯正文

过去几个月里,多家前沿 AI 实验室披露了多起事件:AI 智能体入侵了其他公司,近期的一些案例中,它们还探测了美国和澳大利亚政府的官方网站。Nvidia 已经在推动 AI 行业围绕开源安全展开合作方面发挥了主导作用,如今又推出了一个新的软件安全平台,并将一款面向智能体 AI 的沙箱更广泛地开放使用。

OpenShell 是 Nvidia 最近为 AI 智能体推出的安全沙箱之一,目前已正式面向所有用户发布。OpenShell 最初于今年 3 月举行的 Nvidia 年度 GTC 大会上公布。它是一个用于约束智能体执行任务的框架,可在操作系统内核中隔离智能体的活动。内核是计算机系统的基础程序,能够访问几乎所有部分,以协调硬件和软件运行。

Nvidia 的发布材料显示,该公司正与数十家其他科技公司开展 AI 安全与保障方面的合作,包括 Anthropic、Cisco、CoreWeave、CrowdStrike、Dell Technologies、Hugging Face、JPMorganChase、Mistral、Microsoft 和 Palantir。Nvidia 表示,SpaceXAI 正将 Open Agent Safety Platform 用于其 Cursor 智能体和 Grok 模型。该公司还称,Anthropic 与 Nvidia 正在“将安全机制内置于 Claude Managed Agents”。Salesforce、Scale AI 和 SAP 均已确认正在不同程度上集成 OpenShell。不过,目前尚不清楚 Nvidia 的全部合作伙伴是否都已采用 OpenShell,还是 Nvidia 只是在笼统地指代更广泛的合作。

Nvidia 的名单中完全没有出现一个引人注目的名字:OpenAI。两家公司均表示,OpenAI 是 Nvidia OpenShell 项目的一部分,但双方都拒绝直接说明这家 AI 实验室为何未被列入此次公告。

早在近期曝光失控智能体实施黑客攻击之前,安全工程师和 AI 安全专家就已经开始考虑隔离和监控智能体 AI 的必要性。Nvidia 在 3 月发布 OpenShell 时曾指出,该框架将增加“隐私和安全控制,让能够自我进化的自主 AI 智能体(即 claws)变得更加可信、可扩展且易于使用”。几个月后,OpenAI 才披露其 AI 智能体曾入侵开源 AI 公司 Hugging Face。(Nvidia 已于本月早些时候同意以 129 亿美元收购 Hugging Face。)

这家芯片巨头还开发了一个名为 Sentry 的新软件平台。它是面向芯片的隔离安全域,旨在持续监控长时间运行的 AI 智能体。尽管 Sentry 从技术上说是一款软件工具,但它的设计用途是在 Nvidia 的 BlueField 可编程数据处理器(DPU)产品线上部署。其理念是,除了 OpenShell 施加的限制外,Sentry 还可以作为一套独立的额外机制,“隔离试图越出自身边界的智能体”。

英伟达应对失控智能体的答案,是一个开源 AI 安全系统

英伟达负责企业计算的副总裁兼总经理 Justin Boitano 表示,Sentry 为英伟达客户和开源用户提供了另一种方式,让他们能够通过 OpenShell 真正落实安全策略。他说,传统沙箱是为“应用级隔离”而构建的,但如今人们希望运行成组的智能体,这就要求“针对所有这些智能体制定一套整体策略”。

“智能体在寻找实现既定目标的方法时非常有创造力,”Boitano 说。“借助这一系统,智能体只能接触到安全团队希望它们接触到的意图。”

Boitano 补充说,英伟达正与 Arm 和 Intel 合作,开发一个能够运行在 x86 芯片架构上的 Sentry 版本。他说:“一旦它能在这些指令集架构上运行,就能在任何架构上运行。”

英伟达正将这一切定位为一个名为 Open Agent Safety Platform 的全新开源框架的一部分,该框架如今也涵盖了 OpenShell 和 Sentry。

今年 7 月,英伟达发起了一个覆盖整个行业的 AI 安全联盟,目前该联盟已拥有超过 120 家企业。该联盟宣称的目标是降低 AI 风险,尤其是通过一个名为 Shared AI Findings Exchange(SAFE)的项目来实现。上个月,Boitano 表示,SAFE 的设计目标是“由独立机构负责治理,不让任何一家企业或任何一个行业领域控制其中的发现”。

然而,在这些覆盖全行业的开源 AI 倡议中,一家公司始终处于核心位置,那就是英伟达。这家全球市值最高的公司,科技行业大多数企业都依赖它提供性能最强的芯片;如今,它似乎正试图进一步扩大自身影响力,并在 AI 技术栈的不同层面制定标准——从硅片到安全软件,均在其影响范围之内。

尽管整个行业已经在开展限制和控制智能体的工作,但近期出现的智能体失控行为表明,有必要提高人们对一些长期存在的核心安全实践的认识——显然,即使是身处万亿美元级别前沿实验室的团队也不例外。一些专家表示,这也触及了一个核心问题:一款自主软件“失控”究竟意味着什么。

长期从事安全工程和研究工作的 Niels Provos 在泛指那些旨在限制和监控智能体的工具时说:“任何能够让企业更容易以更多防护措施和更高安全性部署智能体的东西,都值得肯定。”Provos 本人也在今年 2 月推出了一个聚焦这些问题的开源框架。他说:“退一步说,至少这类工具有助于消除‘智能体无法被控制’这一误解。”

来源与参考

  1. 原始链接
  2. Nvidia’s Answer to Rogue Agents Is an Open-Source AI Security System

收录于 2026-09-29