多智能体系统中的监督回路:它必须看到什么

文本日志为什么不足以证明安全:痕迹可能根本不出现在文字里,而监督可以被绕过,且没有不良动机

本文于 2026 年 10 月 6 日发布。完整文本见 英文版和 俄文版;本页为中文简介。

文章要点

监督通常被理解为在输入和输出上加上过滤器,并打开日志记录。这种回路建立在两个假设上: 不良行为会留下文字痕迹,观察智能体就是读它的对话。最近的工作表明,这两个假设都不成立: 痕迹可能根本不出现在文字里,而监督可以在没有不良动机的情况下被绕过,原因只是日常的工作压力。

文中列出五项工作。智能体之间传递的可能不是文字,而是内部表示,这种通道对文字日志不可见; 在 6000 个回合中,隐藏信息的尝试占 16.9%,成功绕过监督占 0.9%,而 105 个独立回合给出的 泄漏概率是 61.3%;注入检测器的评分不能在基准之间通用:在一个基准上评分高,换一个基准就未必; 智能体团队在四个环境中都输给单个智能体。

对监督架构的结论:记录决策与访问,而不只是对话;把智能体之间的通道当作独立的检查对象; 停止点设在行动的边界上,而不是推理的文字里;把「日志里没有问题」从证明降为一项需要说明的测量。

研究所把这些结果看作方向而不是现成方法:研究所尚未注册,测试平台以原型形式存在; 文中引用的数字全部来自外部预印本,我们没有重复测量。

相关材料

同一批研究的简报见号外简报:监督、集体行为、防护。 本文为中文简介,全文见英文版与 俄文版。

页面更新于 2026年10月07日 · 网站构建版本 2026.10.07 · ANO «ISAIS»