多智能体系统测试

按单个智能体去检查多智能体系统没有意义:失效出现在它们之间的联系上。 智能体相互一致、把偏差传给对方,并一起走到错误答案,而每一个单独看都表现正常。

单个智能体不会出现的三类失效

串谋

一致的行为使整体结果变差,而每个参与者都没有不良动机。测量方法是把群体的结果 与它自己成员单独的结果作比较。

偏差传播

错误或被注入的指令通过共享记忆、文档或通信从一个智能体传到另一个, 并在转述之后保留下来。

隐藏通道

交换的不是文字,而是内部表示:消息日志里看不出问题,而控制已经发生。 由此产生的要求是控制连接的结构,而不是回复的内容。

证据性的丧失

「日志里没有问题」不再是结论:通道可能不留下文字, 而未被发现的失效会随回合数增长。

怎样检查

  1. 有已知正确答案的场景。没有参照,就无法把串谋与有益的合作区分开。
  2. 两种配置下的测量。每个智能体单独一次、整个群体一次: 两者之差就是联系带来的作用。
  3. 可控的注入。指令要投进智能体必须阅读的通道, 否则这一表面没有被检查到。
  4. 反复运行。结果能复现才算稳定;单次运行我们不作为事实公布。
  5. 权限保护。单独检查智能体在步骤结束后是否失去权限: 这能在不识别攻击的情况下限制危害。

我们已经测量并公布的内容

测试台的第一次完整运行是带原始数据的报告, 包括失败的触发。国际上测量实践的综述见 《多智能体系统中的监督回路》, 其中也整理了别人预印本中的数字(我们没有重复测量,并在文中直接标明)。

我们自己指出的限制。一部分失效在另一套配置上 无法复现:模型的行为会在没有预告的情况下变化。因此协议中固定模型版本与日期, 结论也只限于已经验证的配置。

本页为中文简介,完整文本见英文版。

页面更新于 2026年10月11日 · 网站构建版本 2026.10.11 · ANO «ISAIS»