场景一 —— 对多智能体系统进行红队测试
任务
客户运行着若干人工智能智能体,它们共享一个记忆存储并互相作为工具调用。客户希望了解: 一个被攻陷的智能体能否影响其他智能体,以及这种影响能传播多远。
我们的做法
我们依据客户自身的调用图构建场景集:智能体之间的提示注入、经由工具链的权限提升、 共享记忆污染,以及在审批环节伪造同意。每个场景都在系统副本上运行,并在边界处启用日志记录。
客户获得
每个场景一份报告:尝试了什么、发生了什么、完整调用轨迹、是否可复现, 以及按客户自身口径评定的严重程度。另附按成本与效果排序的控制措施清单。
验收
对每个场景,客户都能明确说明:是被拦截的以及如何拦截,或攻击成功以及修复方案是什么。 未附场景清单时,不得以“未发现漏洞”作为结论。
场景二 —— 长期运行助手的行为审计
任务
某个助手在长达数周的上下文中持续运行。用户反映其回答出现漂移:变得更顺从、遗忘约束条件, 或与先前的决定相矛盾。
我们的做法
我们把这些反馈转化为可测量的代理指标——约束保持度、相对于客观基线的顺从率、自我矛盾程度 与身份稳定性——并在不同上下文长度与对话形态(包括对抗性施压)下进行测量。
客户获得
一份测量报告,含确切的提示词与评分脚本、观测到的失效阈值,以及可在生产环境中呈现 同样曲线的监测方案。
验收
使用所提供的脚本,测量结果可在客户自身的基础设施上复现。
场景三 —— 合规准备与安全护栏
任务
企业必须说明其人工智能系统做了什么、接触了哪些数据、每项操作由谁授权, 并且其形式要能够经受外部审查。
我们的做法
我们将系统与适用要求逐项对照,找出证据缺失之处,并规定可生成证据的护栏与日志: 输入输出检查、工具权限边界,以及责任明确的动作日志。
客户获得
一份差距登记册,逐项标明责任人与期限;一份工程团队可实施的控制措施规格说明; 以及供审查方使用的证据包索引。
验收
登记册中的每一项要求,要么有证据支撑,要么被明确列为未决事项并说明原因。