您现在的位置是:首页 > 特别推荐 >
360获大模型安全护栏能力检测第一名,AI安全实力再获国家级实测验证
2026-09-16 13:14:13作者:来源:中国信息化周报
摘要2026年国家网络安全宣传周期间,2026年人工智能技术赋能网络安全应用测试结果在人工智能赋能网络安全分论坛正式发布。360凭借在大模型安全领域的技术积累和实战能力,在“大模型安全护栏能力检测”场景中获得第一名。...

本次测试在中央网信办网络安全协调局、工业和信息化部网络安全管理局、公安部科技信息化局等16个部门指导下,由国家互联网应急中心主办,旨在遴选优秀的人工智能技术产品,推动人工智能赋能网络安全治理。其中,“大模型安全护栏能力检测”聚焦大模型输入和输出环节,评估相关产品对安全风险的识别与防护能力,按准确率、漏报率等指标综合评分。
面对准确率、漏报率等核心考核指标,360大模型卫士采用“以模治模”的思路应考,以360智脑团队长期自研形成的大模型安全垂域模型体系为核心,面向大模型安全场景进行专项训练和优化:红蓝对抗模型持续生成不断变化的越狱、诱导等对抗样本,评测裁判、多模态风险检测和安全代答等模型则围绕风险识别、语义理解与安全响应协同工作,构建覆盖模型输入、输出两端的安全检测与防护能力,从而在高风险识别的准确率与漏报率上实现领先。
测试结果发布后,360数字安全集团副总裁余凯以《360大模型卫士,构建AI安全新基建》为题发表演讲。余凯表示,当大模型进一步变成能够调用工具、访问数据和执行任务的智能体,风险就可能从“说错话”升级为“做错事”,错误判断一旦获得真实权限,便可能转化为业务事故。

面对上述风险,360提出“以模治模”的安全思路,将AI安全归纳为可靠、安全、可信、可控四个目标,并据此构建两道防线。第一道防线是大模型护栏,围绕模型接入、内容生成和业务应用全过程,构建内容安全动态评估、多专家模型协同防护、深度模拟安全检测和大模型幻觉抑制等核心能力,从内容、系统和可信三个维度保护大模型应用;第二道防线面向智能体安全,覆盖身份权限、数据访问、工具调用和执行过程,防止越权操作以及多智能体之间的错误传播和级联失控。此外,360还基于AI安全攻防系统图龙锋、自动化防御系统仪天阵打造“AI对抗AI、AI防护AI”的完整AI安全方案,进一步强化主动发现与自动防御能力。
当前,大模型正加速进入政务、金融、能源和企业办公等场景,安全正成为AI规模化落地的基础条件。余凯表示,360希望大模型每多获得一分能力,就同步多一分安全保障,推动AI在可靠、安全、可信、可控的前提下落地。
(本文不涉密)
责任编辑:路沙
下一篇:最后一页





