蚂蚁开源大模型安全内生护栏SingProbe Infra,已适配29个主流开源模型

智东西 2026-09-16 18:26

蚂蚁开源大模型安全内生护栏SingProbe Infra,已适配29个主流开源模型图1

既可独立使用,也可与外置护栏配合。
2026国家网络安全宣传周期间,蚂蚁AI安全实验室宣布开源大模型内生式安全护栏SingProbe,同步开放相关代码、模型和评测基准,为开发者提供与模型生成过程同步运行的安全检测能力。
目前,SingProbe已适配Ling-3.0系列、GLM-5.2/5.3、Qwen、DeepSeekV4等29个主流开源大模型,并接入SGLang、vLLM推理框架,支持开发者在现有推理流程中集成安全防护。
蚂蚁开源大模型安全内生护栏SingProbe Infra,已适配29个主流开源模型图2
随着大模型进入日常问答、办公辅助、客户服务等业务场景,开发者既需要关注回答质量,也需要及时发现不安全内容和编造信息。
例如,AI在健康咨询中可能给出不恰当的用药建议,在资料问答中可能编造不存在的文献。如何兼顾风险检测、响应速度和部署成本,成为大模型应用落地的重要问题。
目前,大模型应用通常通过独立的外置护栏模型审核输入或输出。这种方式通用、直接,但需要额外处理待审核内容,增加计算和部署成本。如果等待完整回答生成后再检查,风险信号可能来得太晚;如果提高检查频率,又会进一步增加运行负担。
运行时探针是学界探索兼顾安全检测效果与运行效率的一条技术路径,但从研究走向实际应用,还需要模型适配、推理框架集成等工程支持。
SingProbe通过适配多种开源模型、接入主流推理框架,补充了相关部署能力,让开发者更方便地将内生式安全护栏接入实际业务。
运行时探针是学界探索兼顾安全检测效果与运行效率的一种护栏方案。
但由于缺乏配套基础设施支持,相关研究成果在实际落地中仍面临障碍,应用端仍更多采用外置护栏。SingProbe通过提供模型适配、推理框架集成等工程支持,让开发者更方便地将内生式安全护栏接入实际业务。
SingProbe如同一个模型内的“安全探头”,通过复用大模型推理过程中已经产生的内部信息,持续输出用户意图、回答安全和幻觉风险分数。
模型一边生成回答,探针一边提供风险信号,应用系统无需等待整段回答结束,就可以据此采取告警、中止回答、重新生成等措施。
据研发团队在Ling-3.0-flash模型生产环境中的实测,SingProbe在解码阶段引入的额外开销低于0.5%。
团队评测显示,flash版本在回答安全分类和流式安全检测任务上超过所选公开基线,在幻觉检测任务上与参考基线基本持平,展现出兼顾检测能力与运行效率的潜力。
此次同步开放的流式安全评测基准SingStreamBench,进一步关注风险出现和被发现的具体时刻。它不仅检验护栏能否识别风险,还考察是否过早触发、发现是否及时,帮助开发者评估安全防护效果及其对正常回答的影响。
在风险识别之外,团队还探索了如何利用风险信号进行按需纠偏。作为一项场景验证,SingProbe-Med在医疗内容生成过程中,仅在风险达到触发条件后,对局部高风险内容进行干预。
在AntAngelMed-100B的医疗评测中,完整干预能够纠正基线模型中25.03%原本出错的回答,展示了内生风险信号用于生成过程安全控制的潜力。
通过此次开源,开发者可以获取代码与集成说明、模型及评测资源,开展部署、测试和进一步适配。SingProbe既可独立使用,也可与外置护栏配合。
后续,团队将逐步扩展对更多开源模型的支持,并邀请开发者、研究者和产业伙伴参与试用反馈,共同完善大模型生成过程中的安全防护能力。
项目代码与集成说明已在GitHub开放,相关模型及SingStreamBench评测基准可通过Hugging Face获取。
蚂蚁开源大模型安全内生护栏SingProbe Infra,已适配29个主流开源模型图3
蚂蚁开源大模型安全内生护栏SingProbe Infra,已适配29个主流开源模型图4
蚂蚁开源大模型安全内生护栏SingProbe Infra,已适配29个主流开源模型图5

关于科技区角:国内科技展会垂直内容策划服务商,提供从论坛内容全案策划、会展市场化IP打造到精准专业观众一站式邀约服务,以产业内容吸引高质量B端人群,打通展会从议题设计、演讲嘉宾邀约、宣传预热、精准邀观到供需对接全链路。
声明:内容取材于网络,仅代表作者观点,如有内容违规问题,请联系处理。
安全 开源 大模型
more
安全护栏被“一键移除”:Abliteration.ai将去限制AI模型商业化,红队测试还是潘多拉魔盒?
冒用政府邮箱“钓鱼”,Revolut泄露高净值客户敏感数据,IPO前夕再敲安全警钟
硅谷“限速”论调下的英伟达困局:当安全叙事撞上万亿估值地基
帕洛阿尔托网络斥资5亿美元吞并AI初创公司Console,加速具身智能安全布局
MOSFET的安全工作区的解读和评估方法
联发科发布天玑9600 Pro:NPU性能跃升51%,首搭AISeal安全架构
2026年中国花生油行业产量、进出口贸易及未来前景展望:自给为主筑牢产业安全底线,出口微增彰显高端品质信心[图]
2.0T、四驱,197马力,主动安全再次进阶,这颜值你打几分?
AI手机跨应用操作引争议,双重授权成安全底线
圆通无人车怒江“撞菌”引热议,低速配送安全边界再受拷问
Copyright © 2025-成都区角科技有限公司
蜀ICP备2025143415号-1
  
川公网安备51015602001305号