蚂蚁开源大模型安全内生护栏SingProbe Infra,已适配29个主流开源模型

9月16日,蚂蚁AI安全实验室正式宣布开源大模型内生式安全护栏SingProbe,同步开放项目代码、集成说明、适配模型及专属评测基准,为大模型应用落地提供可与生成过程同步运行的安全检测能力,解决传统外置护栏成本高、响应滞后等痛点。

蚂蚁AI安全实验室国家网安周期间开源SingProbe内生式安全护栏

随着大模型落地日常问答、办公辅助、客户服务等多元场景,开发者不仅需要关注回答质量,还需及时发现不安全内容与编造信息。当前行业普遍采用的独立外置护栏方案,需要额外处理待审核内容,既增加计算与部署成本,若等待完整回答生成后再检查,风险信号可能已经太晚,提高检查频率又会进一步加重运行负担。
学界此前提出的运行时探针是兼顾安全检测效果与运行效率的技术路径,但相关研究成果长期缺乏工程化基础设施支持,难以落地应用。此次蚂蚁开源的SingProbe正是填补了这一空白,让内生式安全护栏可以更方便地接入实际业务场景。

SingProbe做模型内“安全探头”实现边生成边风险识别

SingProbe如同嵌入大模型内部的“安全探头”,可复用大模型推理过程中已经产生的内部信息,持续输出用户意图、回答安全、幻觉三类风险分数。模型生成回答的同时,探针同步提供风险信号,应用系统无需等待整段回答结束,即可据此采取告警、中止回答、重新生成等措施,大幅压缩风险响应时长。
据研发团队在Ling-3.0-flash模型生产环境中的实测,SingProbe在解码阶段引入的额外开销低于0.5%。团队评测显示,其flash版本在回答安全分类、流式安全检测任务上超过所选公开基线,在幻觉检测任务上与参考基线基本持平,为兼顾检测能力与运行效率提供了新的技术路径。

已适配29款主流开源模型支持SGLang、vLLM等主流推理框架

目前SingProbe已完成29个主流开源大模型的适配,覆盖多类主流架构,具体包括:

  • Ling-3.0系列
  • GLM-5.2/5.3
  • Qwen系列
  • DeepSeekV4
    等热门开源模型,同时已接入SGLang、vLLM两大主流推理框架,支持开发者在现有推理流程中快速集成安全防护。该方案既可作为独立的内生护栏使用,也可与外置护栏配合,灵活适配不同业务的安全防护需求。

    全链路资源同步开源还将持续扩展模型适配范围

    此次开源开放了全链路配套资源:项目代码与集成说明已在GitHub平台开放,相关适配模型及SingStreamBench流式安全评测基准可通过Hugging Face获取。其中SingStreamBench专门针对流式生成场景设计,关注模型从正常回答转向风险内容的具体时刻,不仅检验护栏的风险发现能力,还考察是否会出现过早触发、发现不及时的问题,更贴近实际业务的应用场景。
    此外,研发团队还在医疗生成场景落地了SingProbe-Med方案,持续监测生成过程中的医疗风险,仅在达到触发条件后对局部高风险内容进行解码干预。据团队在AntAngelMed-100B上的医疗评测,完整干预能够纠正基线模型中25.03%原本出错的回答,展示了内生风险信号用于生成过程安全控制的潜力。
    后续,SingProbe团队将逐步扩展对更多开源模型的支持,同时邀请开发者、研究者和产业伙伴参与试用反馈,共同完善大模型生成过程中的安全防护能力。

蚂蚁开源大模型安全内生护栏SingProbe Infra,已适配29个主流开源模型

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。