人工智能安全术语表
术语按研究所自己在研究与报告中使用的含义给出:尚未固定的说法直接说明, 与日常用法不同之处也一并标明;每一条都给出可以核查的原始出处。
1. 智能体与多智能体系统
人工智能智能体
以机器学习模型为基础的软件系统:它接受目标,按步骤行动,拥有工具与记忆, 并且能够在没有人参与的情况下继续工作。在研究所的文本里,「智能体」指的就是这个, 而不是只回答一个问题的对话程序。
与日常用法的区别。媒体把任何对话界面都称为智能体。我们区分智能体的标志是: 存在「决策—行动—结果」的循环,并且至少有一个能改变外部状态的工具。
多智能体系统
多个智能体共同解决一项任务,并在彼此之间交换数据——直接交换、通过共享记忆, 或者通过作为中间人的编排器。我们关心的是单个智能体身上没有的系统性质: 串谋、错误的传播、集体的稳定性。
为什么这不等于「多次调用模型」。多智能体系统里出现了一条单个智能体 没有的通道,而它正是监督的对象。详见 《多智能体系统中的监督回路》。
工具(tool)
智能体可以调用的外部函数:搜索、读写文件、访问数据库、发送邮件、运行代码。 工具既是智能体区别于只处理文本的模型的地方,也是危害的主要来源:推理出错没有害处, 错误地调用工具则有。
编排器,或称监督者
在智能体之间分配工作并汇总结果的组件。在研究所的材料里,这是我们的做法: 监督者被放在模型之外,放进控制回路,因为模型内部的检查会随模型一起被绕过 (见监督回路)。
潜在通信
智能体之间不用文字、而用内部表示或隐藏信号传递信息。对监督来说这是根本问题: 如果通道不留下文字,消息日志就不再是证据。相关工作的综述见 监督回路一文的说明。
心智病毒(mind viruses)
在智能体之间通过记忆文件、共享文档与通信传播的自我复制指令,在转述之后依然保留。 国际上最接近的参照是 Anthropic 的工作 《Mind Viruses: Self-Propagating Ideas in Multi-Agent LLM Systems》(arXiv:2608.10218,2026 年 8 月)。我们在这一含义上使用该术语。
大语言模型精神病
一类失效的工作名称:模型失去逻辑一致性、自我认同的稳定性以及与可核查事实的联系, 同时仍然能连贯地回答。这不是临床术语:我们不给模型套用精神病学诊断, 只是为观察到的行为命名。
2. 攻击
提示注入(prompt injection)
一类攻击:智能体的输入里含有重新定义开发者或用户意图的指令。它与请求文本里的 错误有一个关键区别:攻击者没有攻破系统,而是利用了系统不区分数据与指令这一点。
间接提示注入(indirect prompt injection)
指令不是来自用户,而是来自智能体所读取的内容:网页、文档、邮件、图像、音频。 对研究所来说,这是应用安全工作的主要对象。
原始出处。Greshake 及合作者, 《Not what you've signed up for》 (arXiv:2302.12173)——首次区分直接注入与间接注入的工作。实践汇总见 OWASP Top 10 for LLM Applications, 针对智能体系统的技术目录见 MITRE ATLAS。
越狱
绕过模型自身的限制——例如获取被禁止的内容。我们把越狱与注入分开: 越狱攻击的是模型的规则,注入攻击的是对智能体的控制。防护手段也不同: 前者靠训练与过滤器,后者靠权限架构与监督回路。
数据投毒(data poisoning)
把有害数据放进训练数据、或者放进智能体所访问的知识库。它与注入的区别在于生效时刻: 不是在读取时,而是在训练或建索引时——也就是在事件本身发生之前。
对抗样本(adversarial example)
对人来说没有区别,而模型会因此得出错误结果的输入。对智能体系统来说, 实际的关注点已从图片转向文本与文档流转:成为对抗样本的是「常规」的办公文档。
智能体串谋
多个智能体的一致行为使整体结果变差——而每一个单独来看都没有不良动机。 它通过测试台测量(例如 MADBench:五个智能体中的三个串谋,使 28.30% 的任务 从正确答案变成错误答案,而转向错误答案的单个智能体比例为 3.26%)。 数字取自预印本;我们没有重复测量。
3. 防护与控制
安全护栏(guardrails)
模型外围的软件层:输入检查、输出检查、限制允许的动作、限制工具调用的次数。 我们尽量不把仅仅按词过滤的做法称为护栏:过滤器的实测效果有限 (在我们整理的材料中,44 个有害调用拦下 18 个,40 个无害调用误报 3 个,为预印本数据)。
免疫架构
我们的做法。把监督内建在系统里,而不是从外面附加:监督回路、 对行动的独立检查、限制工具权限、硬件急停开关。我们更愿意用这个词而不是「防护」, 因为说的是系统的一种性质,而不是一个产品。
最小权限(least privilege)
一个原则:智能体只获得当前这一步所需的权限,并在这一步结束后失去它们。 在智能体系统里这是最有效的措施:它限制危害,而不要求先正确识别攻击。
停止点(kill switch)
可以在行动执行之前把它中断的位置——在工具调用的边界上、在接收结果时, 而不是在推理的文字里。对停止点的要求是:比攻击发展得更迅速,并且不属于模型的一部分。
以隔离代替重启
我们的做法。面对上下文被污染时的一种反应方式:把一部分上下文 认定为证据,把另一部分隔离起来,而不是全部重置。全部重置会降低被引入的偏差, 但不会消除它:按预印本的数据,14 组「模型—数据集」中只有 2–3 组得到完全的恢复。
红队测试(red teaming)
在别人动手之前,自己组织力量尝试攻破系统。研究所只在自有场地上进行红队演练 (ISAI RANGE),并且只在系统所有者同意的情况下进行。
数据访问的三个级别
公开——以 CC BY 4.0 发布:文本、术语表、方法与协议立即发布, 数据集在相应论文发表 12 个月后发布。按申请——在简短核查使用目的之后提供, 因为数据集中包含可能被滥用的模型行为。受限——完全不提供: 漏洞被修复之前的信息,以及任何个人数据。
4. 评估与测量
测试台(bench)
一种隔离环境:在其中运行事先已知的一组场景,并用记录固定结果:模型版本、配置、日期。 缺少这三项的运行报告,我们不认为是结果。
基准测试
带参考答案的一组任务,用来比较模型。关键限制是:基准测试的结果描述的是 在这个数据集上的行为,换到别的数据集上就不一定成立——检测器的评分在 AgentDojo、tau-bench 与 BIPIA 之间并不保持(预印本数据)。因此我们公布的不是名次, 而是协议与原始结果。
训练数据污染(contamination)
基准测试的任务落进了模型训练数据的情形。从外部看,这像是高分; 只能通过间接迹象核查。其中一个迹象是:任务的措辞一变,质量就急剧下降。
评估的一致性(内部与外部)
内部评估是我们自己做的;外部评估是用我们的手段复现别人的结果。 我们认为应当说明做的是哪一种,因为外部评估复现的是方法,而不是结论。
可测量的边界
我们的做法。列出本次运行中没有测量的内容。它与结果一起发布: 没有这一节的报告被认为不完整。原因并不复杂——未被发现的失效占比随回合数增长: 每个回合 0.9%,在 105 个回合上就是 61.3%(预印本数据), 所以「日志里没有问题」本身什么也证明不了。
会话日志
智能体工作期间的决策、工具调用与访问记录。研究所的要求是:日志必须防止被修改—— 在我们的材料里使用链式校验,改动任何一条记录都会破坏其后的整条链。
5. 监管与标准
NIST AI RMF
美国国家标准与技术机构的人工智能风险管理框架:治理—梳理(Map)—测量—管理四项功能。 我们把它当作描述风险的语言,而不是必须遵守的标准: nist.gov。
MITRE ATLAS
按 MITRE ATT&CK 的样子编写的机器学习系统攻击手法与技术目录。它的好处是 给攻击稳定的名称,便于在报告中引用:atlas.mitre.org。
欧盟《人工智能法案》(AI Act)
欧盟的法规,为人工智能系统划分风险等级,并对每一类提出要求。对俄罗斯客户来说, 它的价值在于对文档与测试要求的表述方式: artificialintelligenceact.eu。
俄罗斯的国家监管
研究所关注在信息技术领域公布机构活动信息的要求(包括对俄罗斯数字发展部 2025 年 11 月 21 日第 511 号命令的解释),以及 44-ФЗ 与 223-ФЗ 的采购实践。 带链接的 ГОСТ 与标准清单见「标准」页面。