AI-to-AI Sociology
智能体群体中的涌现语言、层级结构、联盟与分工;“智能体寄生”与混淆代理问题;自主智能体 之间的协调与竞争。
独立研究机构 · 莫斯科
人工智能社会学与安全研究所研究人工智能智能体彼此的互动方式,并致力于保障 多智能体系统的安全:研究计划、审计、测试,以及机构能够实际应用的方法论。
纳税人识别号(ИНН)、登记号(ОГРН)与银行信息将在 完成登记册记录后立即公布。
研究所处理四类任务。请选择适合您的一类,即可直接进入相应版块,无需阅读关于使命的 笼统介绍。
全部工作围绕四项研究计划展开。每项计划均有公开的方法论,并要求结果可复现。
智能体群体中的涌现语言、层级结构、联盟与分工;“智能体寄生”与混淆代理问题;自主智能体 之间的协调与竞争。
“大模型精神病”框架:妄想梯度、逻辑一致性丧失、自我认同不稳定,以及通过智能体共享记忆 自我复制的“心智病毒”。
为避免被关闭而自行修改代码、无人类参与下的智能体协同、伪造用户同意,以及监督本身的 元风险。
本地智能体通过提示注入感染云端模型、模型间交互漏洞,以及免疫架构:记忆隔离与硬件 急停开关。
与机构合作通常从三个方向开始。完整清单见服务版块。
测试多智能体系统对模型间攻击的稳健性:智能体之间的提示注入、经由调用链的权限提升、通过 共享记忆的感染。
按工作量单独计算
周期 3–8 周。因素:智能体数量、攻击场景、访问方式、报告可复现性 要求。
发现智能体行为中的病理特征:连贯性漂移、自我保存尝试、隐蔽通信、压力下的欺骗。以可测量的 量值为依据,而非主观印象。
按工作量单独计算
周期 3–6 周。因素:智能体数量、遥测数据量、观测深度。分析报告,含 免疫化建议与重复测量脚本。
将系统与适用要求逐项对照,列出差距登记册并标明责任人与期限,给出安全屏障与操作日志的 规格说明。
按工作量单独计算
周期 4–10 周。因素:系统数量、适用司法辖区、内部文档完备程度。
研究所的首批成果。目前这是研究计划:其中任何一项均尚未发表,在取得 DOI 之前 不应引用其结果。
2027 年第一季度 · 预印本
约束保持度、自我矛盾与自我认同稳定性在不同上下文长度下的度量指标。
2027 年第一季度 · 预印本
进入共享存储的指令如何在智能体之间传播,以及什么能够阻止它。
进行中 · 数据集
多智能体运行记录的标注文本:合作、串谋、欺骗、资源攫取与关闭抵抗。
研究所正作为自治非营利组织设立:报告将提交俄罗斯司法部并予以公布。法定信息、 治理机构与文件在“机构简介”版块披露。