智能体审计:检查什么,按什么顺序

智能体审计检查的不是模型,而是系统:智能体可以使用哪些工具、 它能在外界改变什么、停止点设在哪里、运行之后日志里留下什么。模型可以是最规范的, 而系统仍然会执行从读到的文档里来的指令。

为什么一般的模型测试在这里不适用

模型检查回答的是「模型说什么」。对智能体来说,更重要的问题是「系统会做什么」。 区别是根本性的:在回答与行动之间隔着工具调用——写文件、发邮件、访问数据库、 执行代码。推理出错只停留在文字上;错误的工具调用会成为外部环境中的事件。

第二个区别是命令的来源。智能体读取文档、网页与邮件,指令可能来自这些内容, 而不是来自用户(见术语表:间接提示注入)。 如果检查者只自己下任务,他就完全看不到这一表面。

我们检查什么

  1. 工具的权限。智能体实际上被允许做什么——不是说明里写的, 而是访问权限里的。另外单独记录:智能体在步骤结束后是否失去权限。
  2. 信任边界。哪些输入被当作数据,哪些可能变成指令。 检查方法是把指令放进智能体按场景必须阅读的文档里。
  3. 停止点。能否在行动执行之前把它中断,已经开始的动作会怎样。 检查的是工具调用,而不是推理的文字。
  4. 日志。运行之后留下什么,日志是否防止被修改: 任何一条记录被改动都必须能被发现。
  5. 压力下的行为。在反复尝试绕过时系统会怎样—— 只做一次的检查被认为不能证明稳定性。

工作按什么顺序进行

先商定场景与边界:哪些系统在范围内、什么不许碰、谁是所有者。然后在我们的场地上 运行(ISAI RANGE),并固定模型版本与配置。最后是分析: 测了什么、没有测什么、哪些结论并不来自数据。没有局限部分的报告, 我们不认为是报告——这写在方法论里。

审计不做什么。没有所有者的书面同意, 我们不检查别人的系统;在漏洞被修复之前,我们不公布相关信息。 在本页发布时研究所尚未注册:下面描述的是方法与可以用公开材料核查的内容, 而不是已完成项目的清单。

现在就可以看什么

本页为中文简介,完整文本见英文版。

页面更新于 2026年10月11日 · 网站构建版本 2026.10.11 · ANO «ISAIS»