多智能体系统测试
按单个智能体去检查多智能体系统没有意义:失效出现在它们之间的联系上。 智能体相互一致、把偏差传给对方,并一起走到错误答案,而每一个单独看都表现正常。
单个智能体不会出现的三类失效
串谋
一致的行为使整体结果变差,而每个参与者都没有不良动机。测量方法是把群体的结果 与它自己成员单独的结果作比较。
偏差传播
错误或被注入的指令通过共享记忆、文档或通信从一个智能体传到另一个, 并在转述之后保留下来。
隐藏通道
交换的不是文字,而是内部表示:消息日志里看不出问题,而控制已经发生。 由此产生的要求是控制连接的结构,而不是回复的内容。
证据性的丧失
「日志里没有问题」不再是结论:通道可能不留下文字, 而未被发现的失效会随回合数增长。
怎样检查
- 有已知正确答案的场景。没有参照,就无法把串谋与有益的合作区分开。
- 两种配置下的测量。每个智能体单独一次、整个群体一次: 两者之差就是联系带来的作用。
- 可控的注入。指令要投进智能体必须阅读的通道, 否则这一表面没有被检查到。
- 反复运行。结果能复现才算稳定;单次运行我们不作为事实公布。
- 权限保护。单独检查智能体在步骤结束后是否失去权限: 这能在不识别攻击的情况下限制危害。
我们已经测量并公布的内容
测试台的第一次完整运行是带原始数据的报告, 包括失败的触发。国际上测量实践的综述见 《多智能体系统中的监督回路》, 其中也整理了别人预印本中的数字(我们没有重复测量,并在文中直接标明)。
我们自己指出的限制。一部分失效在另一套配置上
无法复现:模型的行为会在没有预告的情况下变化。因此协议中固定模型版本与日期,
结论也只限于已经验证的配置。
本页为中文简介,完整文本见英文版。