蚂蚁开源 SingProbe:以轻量探针实现大模型生成风险实时拦截,计算开销不足 0.5%

7月13日,蚂蚁AI安全实验室在继开源智能体安全护栏SingGuard-NSFA、多模态安全护栏SingGuard之后,正式推出并开源全新轻量级探针产品SingProbe,聚焦大模型生成环节的风险实时拦截需求,以极低的计算开销填补了行业大模型全链路安全防护的关键空白。

蚂蚁开源 SingProbe:以轻量探针实现大模型生成风险实时拦截,计算开销不足 0.5%

蚂蚁开源SingProbe破解生成环节安全拦截难题

随着大模型应用从问答场景向自主执行、内容生成等深度场景落地,生成环节的安全风险日益凸显:模型可能在生成过程中被诱导输出违规有害内容、泄露敏感信息、生成恶意代码,或是被植入隐藏的跨模态攻击 payload,传统的事后内容审核、静态输入输出护栏无法对生成过程中的动态风险进行实时拦截,一旦风险内容生成流出,就会造成实际危害。而全量接入安全检测模块又会大幅增加计算开销,影响模型推理效率,难以适配高并发的公共服务场景需求。SingProbe正是针对这一行业痛点设计,以轻量探针的形式嵌入大模型生成流程,在不影响原有推理性能的前提下,实现生成风险的实时前置拦截。

轻量探针架构实现毫秒级低开销风险检测

SingProbe采用探针式轻量架构,无需对大模型原有权重和结构进行任何改动,可直接适配主流开源及商用大模型推理框架,在生成过程中逐 token 进行风险扫描,一旦识别到违规、敏感、恶意等异常生成倾向,立即中断生成流程并返回合规结果,单次检测延迟控制在10毫秒以内,整体计算开销不足0.5%,相较于传统全量安全检测方案动辄10%以上的计算开销,几乎不会影响原有模型的吞吐量和响应速度。
依托蚂蚁集团二十余年安全技术积累的风险特征库,SingProbe可覆盖文本、代码、多模态等全类型生成场景的风险,支持133种语言的检测,风险识别准确率达96%以上,覆盖包括违规内容生成、敏感信息泄露、恶意代码输出、提示词注入攻击等在内的数千种风险场景,同时可与此前开源的SingGuard系列护栏能力打通,形成输入-生成-输出全链路的防护体系。

灵活部署适配全场景安全防护需求

SingProbe提供0.1B、0.5B、1B三种不同规格的探针模型,其中0.1B轻量版本可部署在端侧设备,满足手机、IoT设备等端侧AI应用的实时安全检测需求;1B完整版本可部署在云侧,支持每秒上百次请求的高并发场景,满足企业级大模型服务、公共服务智能系统等场景的防护要求。同时SingProbe支持运行时动态加载安全规则,无需重启服务即可完成风险库的迭代更新,可快速应对新出现的安全威胁,适配规则持续演进的业务场景。

蚂蚁持续完善AI安全开源生态赋能行业合规发展

此次SingProbe开源,是蚂蚁集团持续推进AI安全技术开放的重要布局。此前蚂蚁AI安全实验室已先后开源面向智能体行为安全的SingGuard-NSFA、面向多模态交互的SingGuard,以及和清华大学联合开源的OpenClaw智能体全生命周期安全插件ClawAegis,此次SingProbe的加入,进一步补全了大模型生成环节的实时防护能力,和现有产品形成覆盖“输入-生成-输出”全链路、覆盖“内容-行为-系统”全维度的AI安全防护矩阵。
目前蚂蚁的AI安全能力已在阿福智能客服、AI版支付宝“阿宝”、支付宝“AI付”等自有业务场景中得到规模化应用,累计完成超过百亿次大模型交互的安全检测。中国信通院人工智能研究所安全治理部相关负责人表示,大模型应用的规模化落地需要全链路的实时安全防护作为基础,蚂蚁持续开源AI安全核心技术,有助于降低中小开发者的安全防护门槛,推动行业合规有序发展。