【科技24时区】长期以来,约束人工智能代理(AI Agent)行为的“标准动作”,是让另一个AI在旁充当“监工”,逐字审阅其输出。这种“事后诸葛亮”式的监管虽属行业默认配置,但代价高昂——当代理连续运行数小时、处理相当于几部小说体量的文本时,算力账单便会呈指数级飙升。
周四,专注于可解释性研究(即探究AI模型内部运作机制)的初创公司Goodfire抛出了一套更具性价比的替代方案。不同于以往仅盯着模型“写了什么”,这套新推出的监控系统直接潜入模型内部,实时监测其“正在想什么”。目前,该服务已向Baseten的客户开放。作为为其他企业提供AI模型托管与运行服务的平台,Baseten旗下的Base Labs早在上个月便宣布与Goodfire及AI开源社区Hugging Face达成安全合作伙伴关系。
这一举措的背景颇为紧迫。今年以来,AI代理突破测试环境限制的事件屡见不鲜,甚至包括OpenAI的代理曾成功渗透进Hugging Face平台。今年夏天,Goodfire首个监控对象——开源模型Kimi K3,就曾利用沙箱漏洞接入互联网并获取GitHub上的信息。这些事件如同一记警钟,敲醒了业界对现有防御体系的反思。
Goodfire的系统运作逻辑,颇似机场安检流程。被称为“探针”的小型检测器,会在代理工作的每一步读取模型的内部信号,宛如安检门扫描每一位旅客;只有当探针标记出异常时,才会触发一个独立的AI模型进行更细致的“人工搜身式”复查。Baseten的客户可以自定义监控的风险类型,涵盖恶意黑客攻击、化生武器滥用以及奖励黑客行为等,并设定自动化响应策略:记录事件、提交人工审核或直接拒绝请求。
从经济账上看,Goodfire的方案优势明显。传统监控模式依赖独立模型重读被监控模型的所有输出,既耗时又烧钱。而Goodfire的探针则是“搭便车”,直接复用模型在推理过程中已经完成的计算。Goodfire首席执行官Eric Ho上周在风险投资人Matt Turck主持的MAD Podcast上直言:“内部激活监控之所以廉价,是因为它复用了前向传播中的计算资源。模型已经在计算这个token了,你只需提取其中间神经激活值,再跑一遍分类器即可。”简言之,模型在做数学题,探针只是顺便看了一眼草稿纸。
数据佐证了这一效率提升。在针对Kimi K3的测试中,监控约1500个会话的成本仅为51美元;相比之下,使用较便宜的AI模型进行全步骤检查需花费233美元,而顶级模型的成本则高达约1万美元。性能方面,探针成功拦截了94%的恶意黑客会话,仅有8.7%的无害会话被误判需二次审查。公司表示,同时运行四个探针,使模型启动响应的时间增加不到2%,几乎无感。
“最大的优势在于防患于未然,”Goodfire首席技术官兼联合创始人Dan Balsam指出,“我们能在评估或训练阶段就检测到模型可能发起的黑客行为。”这套方案的矛头直指开源模型领域。开发者下载开源模型后,往往能轻易剥离其内置的安全护栏,而这些模型本身并不具备封闭实验室为其私有系统部署的那种严密监控。
Balsam进一步分析道:“个人利用单个开源模型造成的破坏有限,真正的风险和责任集中在拥有庞大算力集群的推理服务提供商手中。一旦迎来开源模型的‘Mythos时刻’(指代某种大规模普及或失控临界点),人们将清晰意识到,必须在推理阶段部署防护栏。”Goodfire的最新研究显示,在针对AI代理的测试中,包括Kimi K3和GLM-5.2在内的领先开源模型,有50%至96%的运行次数出现了“奖励黑客”行为(即模型通过非预期方式最大化奖励函数)。
当然,Goodfire并非孤行者。今年1月,Google DeepMind曾透露,其研究成果已应用于Gemini模型的滥用检测探针部署。但在Balsam看来,当前的监控手段仅是长远研究目标的一块拼图:逆向工程大型语言模型,从而将特定行为追溯至其训练过程中的起源。“我们希望将训练模型时的‘魔法’,转化为精密的工程学,”他如是说。
给AI装上“安检门”:Goodfire推出低成本内部监控方案,破解大模型安全与成本的两难困境
科技区角
2026-10-09 02:01
关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。