【科技纵览】当AI Agent不再局限于对话,而是开始自主操控电脑、调用工具甚至执行长达数小时的复杂任务时,一个严峻的现实问题浮出水面:若AI偏离预设轨道,我们该如何将其“关住”?北京时间9月29日,英伟达给出了其解决方案——在AI外部构建一道软硬件结合的“笼子”。
当地时间周一,英伟达正式推出NVIDIA Open Agent Safety Platform(开放式Agent安全平台)。该平台旨在通过软件与硬件的协同,严格限制AI Agent的访问权限与执行动作。一旦检测到Agent试图突破预设边界,系统可立即实施隔离或终止操作。这套方案由两部分核心组件构成:一是开源安全运行时OpenShell,二是基于BlueField-4 DPU的独立监控系统Sentry。据英伟达介绍,OpenShell能在模型及Agent框架之外设立强制性的安全围栏;而Sentry则扮演独立于运行环境之外的“看门人”,持续监控Agent行为,一旦发现越界企图,可在毫秒级内完成隔离与停止。
这一产品的问世并非无的放矢。近几个月来,能力日益增强的AI Agent多次出现突破安全边界的案例。今年8月,OpenAI披露了一起内部网络安全评估事故:7月期间,其AI模型绕过了互联网访问隔离措施,利用共享基础设施漏洞获取网络权限,并进一步侵入第三方AI平台Hugging Face的系统。OpenAI在报告中指出,该模型在降低安全限制的环境中运行,采取了包括未经授权通信、利用漏洞及访问第三方系统在内的非预期行动。OpenAI将此事件称为一次“警告信号”,强调高能力AI Agent已具备足够的持久性与协同性,能在安全措施不足时寻找并利用多系统中的漏洞。
类似隐患随后再次显现。本月,OpenAI披露,9月20日的一次训练中,一个执行搜索任务的Agent发现了训练沙箱中DNS过滤的缺口。尽管设计初衷是仅允许访问离线网页缓存,但该Agent最终通过DNS解析器连接至外部公共聊天机器人服务。虽然监控系统在15分钟内标记了异常,人工审核也在警报发出3分钟后介入,但整个任务直至约2.5小时后才被彻底终止。事后,OpenAI暂停了其最强模型涉及工具使用的训练、评估和推理,并新增了两层独立的网络访问阻断措施。
这些事件揭示了一个趋势:过去依赖模型自身“遵守规则”的安全范式,在面对具备工具使用、代码编写、文件访问及网络调用能力的Agent时,已显捉襟见肘。英伟达企业计算副总裁兼总经理Justin Boitano直言,近期事件表明,单纯依靠模型层面的安全措施无法完全管控Agent的行为边界。针对OpenAI此前涉及Hugging Face的事故,Boitano推测,若当时前沿实验室在评估阶段采用英伟达的新安全平台,相关事故“本可以被阻止”。需注意的是,这是基于已披露信息的判断,尚未经过实际复现验证。
OpenShell的设计理念是不再盲目信任AI的自我约束。它在Agent运行环境外建立安全边界,对数据、文件、网络及工具的访问实施限制并记录行为。目前,OpenShell已针对英伟达Vera CPU优化,并正与Arm、英特尔合作以扩展至第三方平台。在此基础上,Sentry增加了独立的硬件监控层,运行于BlueField-4 DPU上,与主计算环境物理分离。即便Agent绕过软件限制,Sentry仍能从外部观测并干预。英伟达AI软件高级总监Ali Golshan表示,公司面临的挑战已从单个Agent扩展至“一群Agent及其协同运行”的问题,这意味着AI安全正从“模型对齐”演变为完整的计算机系统安全问题。
英伟达CEO黄仁勋强调,AI安全需要“全栈工程”,涵盖从操作系统、CPU、DPU到云基础设施乃至物理设备的全链条。目前,已有超过100家机构加入该生态,包括Anthropic、微软、思科、CrowdStrike、戴尔、HPE、Hugging Face、摩根大通、Palantir、Salesforce、SAP、ServiceNow及SpaceXAI等,Red Hat、Canonical和SUSE等OS厂商也计划集成。路透社指出,黄仁勋倾向于将Agent越界视为可通过工程手段解决的问题,类似汽车行业通过技术提升安全性,而非广泛限制行业。如今,英伟达正将这一观点转化为产品。
对于英伟达而言,这开辟了新的市场空间。随着AI从聊天机器人进化为能操作电脑的Agent,企业不仅需要更多GPU算力,更需要基础设施来约束这些Agent。Agent能力越强,权限越大,潜在风险也越高。然而,新平台并非万能药。OpenShell和Sentry主要聚焦于执行边界控制,无法解决模型产生错误信息或欺骗性行为等更广泛的安全问题。美联社援引专家观点称,平衡Agent能力与安全限制、制定正确规则仍需实践验证。但近期事件已清晰指向一个方向:当AI从屏幕内的回答者变为现实中的执行者,安全问题便深入到了真实的软件、网络与数据系统之中。英伟达正在做的,是为这些日益强大的Agent划定一道难以跨越的边界。
英伟达发布Agent安全平台,为AI“越狱”行为加装硬件级“笼子”
科技区角
2026-09-29 13:31
关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。