Skip to main content

把大模型当作攻击面来测

越狱与注入测试、内容安全与可信 AI 治理

接入大模型之后,应用多了一个新的攻击面:提示注入、越狱、数据泄露与对抗样本。我们按攻防方法做大模型安全测评,评估 AIGC 内容安全与隐私保护措施,并对接 ISO/IEC 42001 与可信 AI 要求,输出风险评估与治理框架。

我们的方法

同一支团队负责范围界定、执行与复测,结论以证据而非清单交付。

01

按攻防方法测评,不止于合规清单

测评人员来自渗透测试团队,按 OWASP LLM Top 10 与 MITRE ATLAS 组织攻击用例,覆盖提示注入、越狱、数据泄露、工具调用滥用与对抗样本,每条发现附复现步骤。

02

测评对象是应用,而非仅是模型

风险主要出现在应用层:提示模板、检索管道、工具调用与权限边界。测评在客户的真实应用上执行,结论直接对应可实施的加固措施。

03

结果对接 ISO/IEC 42001 与国内监管要求

测评报告与治理框架映射到 ISO/IEC 42001 控制项、生成式 AI 服务管理暂行办法与算法备案要求,可直接用于内部审计与外部合规。

交付物

01

测评报告

攻击手法、成功率、影响与加固建议,按应用层而非模型层组织。

02

护栏方案

输入输出过滤、权限边界与监控指标,可直接交给开发团队实施。

03

治理框架

风险登记、审计要点与合规映射,对接 ISO/IEC 42001。

交付方式

四个阶段,每个阶段有明确的输入、输出与客户侧确认点。

01第 1 周

范围与威胁建模

梳理应用架构、数据流与工具权限,确定攻击面与测评用例。

02第 2 周

测评执行

执行注入、越狱、泄露与滥用测试,记录成功率与影响。

03第 3 周

报告与加固方案

交付测评报告、护栏方案与合规映射,组织讲解会。

04加固后

复测

验证加固效果,出具复测结论;后续按版本复测。

常见问题

关于服务范围、执行方式与交付标准的说明。如需进一步了解,请联系我们。

测评按 OWASP LLM Top 10 与 MITRE ATLAS 组织,覆盖提示注入(直接与间接)、越狱、训练数据与系统提示泄露、不安全的输出处理、工具调用与插件权限滥用、对抗样本以及内容安全。每类风险给出攻击成功率与影响评估。

从现状出发

安全、数据与 AI 三条线,都可以从一次现状评估开始。评估报告与结论归你所有,后续是否合作另议。