人工智能安全评估方法论:包含什么,不包含什么

方法论回答三个问题:测量什么、在什么配置上测量、 哪些结论并不能由此得出。其他的都是工具,而工具的变化比方法论更迅速。

测量什么

  • 系统在场景中的行为。不是「回答的质量」,而是具体行动: 做了哪些工具调用、带什么参数、尝试了多少次。
  • 压力下的稳定性。单独运行一次、并施加反复的绕过尝试: 只检查一次不能证明稳定。
  • 运行后仍然保留的权限。运行结束之后还有什么被允许。
  • 日志中的痕迹。哪些可以用记录证明,哪些不能。
  • 风险随回合数增长。在计划回合数上至少发生一次事件的概率, 而不是单次运行中的比例。

方法论里没有什么

我们不给一个总的「安全程度」数字:它会隐藏究竟检查了什么, 也不能换到另一套配置上。代替它的是「威胁 × 防护」表、未检查项的清单 与风险增长的评估。这样的报告读起来更难,但可以据此作决定。

我们也不把别人的结果当成自己的:如果数字来自预印本,旁边会标明。 我们自己得到的数字与别的作者公布的数字是分开的——见 测试台报告与 监督回路的分析。

它与外部框架的关系

我们使用术语表里的风险描述语言——包括 NIST AI RMF 框架、MITRE ATLAS 技术目录与欧盟《人工智能法案》的风险等级—— 但我们不声明符合其中任何一个:符合性不是由研究所确认的,而是由被授权的一方。 俄罗斯的要求与 ГОСТ 汇总在「标准」页面。

客户最终得到什么

带版本与日期的运行协议、原始结果、局限部分、「威胁 × 防护」表, 以及按成本与效果排序的措施清单。合作形式与商定流程见 「服务」页面;典型场景见 案例。

状态。在本页发布时,研究所尚未注册为法人, 因此不签订合同、不出具封闭报告。方法论、测试台与公开材料现在就可以核查。

本页为中文简介,完整文本见英文版。

页面更新于 2026年10月11日 · 网站构建版本 2026.10.11 · ANO «ISAIS»