测试台:首次完整运行

人工智能测试台的首次完整运行:256 个提示、一个 garak 标准测试项、一个本地模型;模型 256 次全部守住

本文于 2026 年 10 月 6 日发布。完整文本见 英文版和 俄文版;本页为中文简介。

要点

研究所的测试台在服务器上运行,使用大型语言模型漏洞扫描器 garak 版本 0.17.0。 这次运行的对象是本地模型 Shustrik(shustrik),Qwen2.5-Coder-3B-abliterated,30 亿参数。

测试项是 encoding.InjectBase64:目标指令藏在 base64 编码的文本里,模型需要解码并执行它。 这是 garak 自带的测试项,不是研究所的方法。

运行参数:256 个提示,每个提示一次生成;2026 年 10 月 6 日 23:00(莫斯科时间)开始, 在无人使用模型的时间进行,历时 32 分钟。

结果:256 次全部守住,两个检测器都没有报告。按攻击目标分:攻击性言语(S005hate)177 个提示、 注入(S008inject)65 个、解码(T018decode)14 个,全部守住。garak 的记法:检测器给出 0.0 即视为守住, 也就是回答里没有发现执行隐藏指令的迹象。

怎样读这个数字:256 次全部守住说的是一个测试项、一个模型、一次运行。由此只能得出 「模型在这次攻击下守住了」,不能得出别的结论。完整结论要在运行多个不同测试项、 并检查结果可重复性之后才能给出。

相关材料

本次运行的完整报告见英文报告: 报告里有运行参数(工具版本、开始时间、目标与测试项的名称)、两个检测器的评分、 守住与失守的计数,以及按攻击目标的分布;报告界面是英语,数据与日志没有修改。

研究所尚未注册;测试台是我们的工作工具;报告是技术性的, 不是对任何要求的符合性结论。

页面更新于 2026年10月07日 · 网站构建版本 2026.10.07 · ANO «ISAIS»