第 3 期简报 — 2026 年 10 月

十月上旬的例行一期。这段时间外部消息不多:改变整体图景的那批研究已在 10 月 6 日的第 2 期简报中梳理。 本期讲我们自己的工作——测试台的首次完整运行、面向搜索问题的四个页面,以及独立成页的术语表。 文中提到的内容都可以打开核对。

1. 我们做了什么

1.1. 测试台首次完整运行,报告全文发布

256 条提示、garak 工具的一项标准探测、我们自己场地上的本地模型。模型 256 次全部守住。 我们按收到的原样发布报告与原始结果,并说明这个数字意味着什么、不意味着什么: 一项探测上的零结果并不表示系统受到保护,只表示在这套数据和这种配置下没有发现失效。 详见「测试台:首次完整运行」。

1.2. 术语表独立成页

过去术语放在「方法论」内部,既不能按链接引用,也无法作为某个具体问题的答案呈现给搜索。 现在是独立页面:30 个术语,分为五部分—— 智能体与多智能体系统、攻击、防护、评估与测量、监管。每个术语包含三部分: 本研究所用的定义、与日常用法的区别、原始文献链接。外部链接指向 OWASP LLM Top 10、MITRE ATLAS、NIST AI RMF 与预印本——我们不引用转述。

1.3. 四个面向搜索问题的页面

这些不是「关于人工智能的文章」,而是对具体问题的回答,每个主题一页: 人工智能智能体审计(检查什么、按什么顺序)、 多智能体系统测试(单个智能体不会出现的三类失效,以及如何测量连接本身的贡献)、 提示注入防护(为什么文本过滤解决不了问题、哪些层面有效)、 人工智能安全评估方法(我们测量什么、刻意不给出什么)。

1.4. 网站地图扩展到 96 个地址

从 81 增至 96:三个语言版本,每个页面独立地址,标注语言与 x-default。这不是目的本身——搜索引擎只能找到被告知的地址。 在被列入后的第一天,Yandex 就抓取了一半地址;此前它十天内只访问过三次。

2. 这一期值得一读的材料

3. 本期如何编制

  • 本期所有数字都是我们自己的、可核对的:256 条提示、30 个术语、96 个网站地图地址。 不含第三方数字,因此也不需要「预印本、未复现」的说明——那在第 2 期。
  • 不承诺任何期限:筹备中的内容只说明状态,不给日期。
  • 在缺陷修复前不发布相关信息;未经系统所有者书面同意,不在他人系统上进行测试。

4. 接下来

后续各期继续两条线:测试台上的测量(使用其他数据集,并检验在重复尝试下的稳定性), 以及对外部研究的梳理。此外正在筹备漏洞负责任披露政策与攻击性工具使用规程, 两份都将以草案形式发布,以便在定稿前讨论。

如何订阅。订阅源在「新闻与分析」版块; 简报每两周发布一期。建议选题或指出错误,请通过联系方式—— 更正写进正文,而不是留到下一期。

页面更新于 2026年10月11日 · 网站构建版本 2026.10.11 · ANO «ISAIS»