第 3 期简报 — 2026 年 10 月
十月上旬的例行一期。这段时间外部消息不多:改变整体图景的那批研究已在 10 月 6 日的第 2 期简报中梳理。 本期讲我们自己的工作——测试台的首次完整运行、面向搜索问题的四个页面,以及独立成页的术语表。 文中提到的内容都可以打开核对。
1. 我们做了什么
1.1. 测试台首次完整运行,报告全文发布
256 条提示、garak 工具的一项标准探测、我们自己场地上的本地模型。模型 256 次全部守住。 我们按收到的原样发布报告与原始结果,并说明这个数字意味着什么、不意味着什么: 一项探测上的零结果并不表示系统受到保护,只表示在这套数据和这种配置下没有发现失效。 详见「测试台:首次完整运行」。
1.2. 术语表独立成页
过去术语放在「方法论」内部,既不能按链接引用,也无法作为某个具体问题的答案呈现给搜索。 现在是独立页面:30 个术语,分为五部分—— 智能体与多智能体系统、攻击、防护、评估与测量、监管。每个术语包含三部分: 本研究所用的定义、与日常用法的区别、原始文献链接。外部链接指向 OWASP LLM Top 10、MITRE ATLAS、NIST AI RMF 与预印本——我们不引用转述。
1.3. 四个面向搜索问题的页面
这些不是「关于人工智能的文章」,而是对具体问题的回答,每个主题一页: 人工智能智能体审计(检查什么、按什么顺序)、 多智能体系统测试(单个智能体不会出现的三类失效,以及如何测量连接本身的贡献)、 提示注入防护(为什么文本过滤解决不了问题、哪些层面有效)、 人工智能安全评估方法(我们测量什么、刻意不给出什么)。
1.4. 网站地图扩展到 96 个地址
从 81 增至 96:三个语言版本,每个页面独立地址,标注语言与 x-default。这不是目的本身——搜索引擎只能找到被告知的地址。 在被列入后的第一天,Yandex 就抓取了一半地址;此前它十天内只访问过三次。
2. 这一期值得一读的材料
- 多智能体系统中的监督回路——对近期一批研究的梳理: 为什么模型内部的检查不奏效,替代方案是什么。
- 测试台:首次完整运行——含原始数据的报告,包括没有奏效的部分。
- 案例:23 分钟、六个板块、四次上线——逐分钟的工作记录。
- 术语表——若在我们的文本中遇到不熟悉的词,定义在这里,而不在脚注里。
3. 本期如何编制
- 本期所有数字都是我们自己的、可核对的:256 条提示、30 个术语、96 个网站地图地址。 不含第三方数字,因此也不需要「预印本、未复现」的说明——那在第 2 期。
- 不承诺任何期限:筹备中的内容只说明状态,不给日期。
- 在缺陷修复前不发布相关信息;未经系统所有者书面同意,不在他人系统上进行测试。
4. 接下来
后续各期继续两条线:测试台上的测量(使用其他数据集,并检验在重复尝试下的稳定性), 以及对外部研究的梳理。此外正在筹备漏洞负责任披露政策与攻击性工具使用规程, 两份都将以草案形式发布,以便在定稿前讨论。