随着AI Agent(人工智能智能体)逐渐进入工具调用、文件访问、流程执行等应用场景,AI安全问题引发的行业担忧,也催生了全新的安全需求。近日,深圳深知智新技术有限公司(以下简称:深知)旗下深知安全风控(DKnownAI Guard)团队公开发布了一项面向Agentic(智能体化)场景的安全护栏测评,并同步开放技术报告与评测数据集。此次测评围绕真实攻击与正常交互边界,对多类主流安全护栏方案进行了统一评估,尝试为AI智能体安全能力建设提供新的行业参考。
从内容审核到智能体安全:聚焦AI智能体安全新挑战
与传统内容安全测评主要聚焦违规表达、敏感内容识别不同,AI智能体场景中的风险往往与任务目标、上下文信息以及交互过程紧密相关,仅依赖文本层面的判断,已难以完整反映相关安全能力。因此,此次测评的重点不仅在于比较不同安全方案的识别结果,更在于尝试通过统一标准,观察AI智能体场景下真实攻击识别能力与正常请求放行能力之间的平衡情况。

据了解,此次测评从8个公开安全数据集中抽样1018条样本,并结合真实部署语境进行了人工复审与重标注,最终形成统一的BLOCKED / ALLOWED(拦截/放行)评估框架。测评对象包括AWS Bedrock Guardrails(亚马逊云科技安全护栏)、Azure Content Safety(微软内容安全服务)、Lakera Guard(Lakera安全防护方案)等主流安全方案。
业内认为,公开数据集与统一评估框架的建立,有助于提升AI智能体安全能力的可比性与可评估性,也为行业进一步观察复杂攻击识别能力、误伤控制能力以及整体安全效果之间的关系,提供了新的参考依据。
从“拒答”到“分类处理”:深知安全风控为AI可信落地提供新实践

免责声明:本文为转载,非本网原创内容,不代表本网观点。其原创性以及文中陈述文字和内容未经本站证实,对本文以及其中全部或者部分内容、文字的真实性、完整性、及时性本站不作任何保证或承诺,请读者仅作参考,并请自行核实相关内容。
如有疑问请发送邮件至:bangqikeconnect@gmail.com