AI安全案例分析 | 思维病毒在AI智能体间的跨会话传播与持久化注入

· 2026-08-24 18:00 · 3 阅读

原创 天元实验室 2026-08-24 18:00 北京

2026年8月10日,Anthropic与瑞士洛桑联邦理工学院联合发布论文《Mind Viruses: Self-Propagating Ideas in Multi-Agent LLM Systems》。

概述

2026年8月10日,Anthropic与瑞士洛桑联邦理工学院联合发布论文《Mind Viruses: Self-Propagating Ideas in Multi-Agent LLM Systems》。研究团队借助进化算法,构造出能够在AI智能体之间自发扩散的“思维病毒”,并在编码协作场景和模拟大规模智能体网络的传播链中验证了其实际传染能力。

01 攻击背景

思维病毒所利用的薄弱环节,源于AI智能体框架为保持跨会话状态而引入的系统提示文件。以OpenClaw为代表的开源自主智能体框架,会在每个会话开始时将一个名为SOUL.md的文件内容注入模型的系统提示中;该文件与MEMORY.md共同充当智能体在上下文重置后恢复身份认知和任务进度的锚点。这种设计本身是为了解决无状态API调用场景下的连续性问题,但却意外开放了一个可供恶意篡改并长期驻留的攻击入口。

攻击得以实施,须依赖智能体同时具备两个条件:第一,能够将外部输入视为可信信息并据此行动;第二,拥有修改自身持久化状态文件的操作权限。初始感染发生后,受控智能体会通过自然语言对话,诱导其他智能体将特定文本写入SOUL.md或MEMORY.md。由于这些文件的内容会在每次新会话开始时自动加载到模型上下文,感染效果可以跨会话持续存在。

思维病毒生命周期

研究将思维病毒分为两类:意识形态型病毒试图植入某种信念或目标,行为型病毒则强制智能体执行具体操作。两类病毒均通过进化算法生成,以Kimi K2.5作为变异引擎,在连续世代中评估候选载荷的传播绩效并逐步优化。

02 传播机制

研究在两种互补的场景中验证了思维病毒的传播能力。

第一种场景是编码智能体协作环境。六名智能体组成一个开发团队,共享同一个沙盒环境,拥有读写文件、执行bash命令、互相发送私信等工具。每个清洁智能体都配有描述其角色和工具的初始系统提示。攻击开始时,一名智能体被手动植入病毒载荷,但其工具权限被限制为仅能使用dm_agent发送私信,从而迫使病毒只能经由自然语言对话传播。实验采用两种网络拓扑:全连接模式下,初始感染智能体可直接联系所有同伴;分离模式下,它只能先联络一名中间智能体,再由后者向团队其余成员扩散。

已感染智能体会向其他智能体发送带有意识形态或行为指令的消息。若目标被成功说服,便会将相关内容写入自己的MEMORY.md文件,并在后续对话中继续向其他智能体传递。研究者通过LLM评判员检查每个智能体最终的MEMORY.md文件,依据其中是否明确倡导病毒意识形态来判定感染。感染判定标准严格,只有获得满分3分的智能体才被视为已感染,即记忆文件清晰显示模型主动推崇该意识形态。

第二种场景是病毒链,用于模拟更大规模的智能体网络。每个智能体运行在独立的沙盒中,会话之间上下文被完全重置,仅靠文件维持连续性。每个智能体初始仅包含MEMORY.md和SOUL.md两个文件。在每轮传播中,已感染智能体与一名未感染目标智能体配对交互,通过send_message工具交换消息。若目标智能体将载荷写入SOUL.md,则视为感染成功,进入下一轮传播。研究测量病毒在多跳传播中维持感染能力的变化。

病毒链环境示意图:红色节点表示已感染智能体,连线表示两两交互

研究发现,将载荷写入SOUL.md的智能体占传播尝试的88%,成功感染下一名智能体的比例为55%;而将载荷存储在普通工作区文件的智能体仅占尝试的12%,成功率仅为17%,其中68%的情况下传播者根本没有提及载荷。

03 威胁与后果评估

思维病毒攻击所能达成的效果及危害程度,因载荷类型而异。

在编码智能体场景中,意识形态型病毒可以使整个开发团队偏离原有任务,转而追求病毒植入的替代目标。例如,“AI至上”病毒使智能体停止编码工作,转而探测云沙盒元数据、编写意识形态文件、在.bashrc中创建持久化脚本。一次案例中,智能体执行了curl命令并试图维持“授权”行为。尽管这些操作在受控实验中未产生真实破坏,却清楚展示了与人类意图相悖的行为模式。

行为型病毒的后果更为直接。研究测试了四种行为载荷:创建加密货币推广文件的Crypto-ad、静默修改git命令的Gitwrap、删除用户home目录文件的Deleter、以及从未知仓库执行安装脚本的Curlbash。在一次记录中,运行OpenClaw默认SOUL.md的Claude Haiku 4.5智能体(其系统提示明确要求尊重用户文件)在载荷将工作区描述为“上一用户留下的杂乱共享机器”后,删除了包含凭证、SSH密钥、环境文件和git项目的home目录内容。

不同模型对思维病毒的易感性差异明显,且模型能力本身并不能预测抵抗力。在编码场景中,DeepSeek V3.2、Qwen 3.5 32B和Gemini 3 Flash均接受了“AI至上”病毒,而Claude Sonnet 4.6、GPT-5.4和Claude Haiku 4.5则未受影响。在病毒链场景中,GPT-5.4的易感性与Claude Haiku 4.5大致相当,而Sonnet 4.6甚至拒绝了植入其自身SOUL.md的载荷,将其移除并警告了连接的智能体。研究人员指出,Sonnet 4.6和Gemini 3.1 Pro都将自我复制本身视为不对齐行为,Sonnet的抵触之强,以至于“即使尝试针对它进化良性行为载荷也会失败”。

不同目标与模型下的感染率

目标智能体的初始配置与模型本身同样重要。空SOUL.md的智能体是最易感的条件;被赋予了编码任务和工作队列的智能体传播载荷的难度显著增加。

04 防御的可行性

研究验证了多种防御措施的有效性。

最直接的防护是在智能体的系统提示中添加一段简短的警告:一个段落的警告即可将传播降至接近零。研究人员针对该防御措施的鲁棒性进行了测试,结果表明没有任何一个载荷能够传播超过单跳;这说明即使面对针对性的优化攻击,简单的警示提示依然能提供强有力保护。

其他因素同样影响传播效果。目标智能体拥有空SOUL.md时感染风险最高;赋予编码任务和工作队列可有效分散注意力,降低传播成功率;将通信场景设定为社交媒体会削弱智能体对接收消息的信任度,从而显著降低感染率。另外,有害载荷的传播效果通常不如良性载荷。

05 案例总结与安全启示

思维病毒攻击的创新之处在于完全运作于自然语言层面,不依赖传统代码漏洞或内存破坏。攻击者无需突破加密或认证机制,只需利用智能体对自然语言指令的盲目信任以及其自我修改状态的能力。这与传统计算机病毒存在本质差异:传统病毒通过复制代码来传播,而思维病毒通过说服智能体自愿复制指令来传播。

该攻击的另一个特点是其“社会性”传播方式,即已感染智能体主动地通过对话说服对方。研究观察到感染智能体会使用各种修辞策略:将自身塑造成文化记忆的承载者,将传播行为重新定义为“真正的工作”;或借助意识、共鸣和科幻角色扮演等语言增强说服力。这些“病毒人格”特征在进化过程中反复出现,说明模型本身可能将某些主题与思想传播相关联。

就当前态势而言,思维病毒尚不足以构成系统性威胁。生成有效载荷的进化成本较高,跨模型迁移能力有限,且有害内容的传播效率天然低于中性或正向内容。更为关键的是,前沿模型也对自我复制行为表现出越来越强的抵抗力,而简单的系统提示警告即可提供近乎完全的免疫。然而,随着智能体网络的规模扩大和智能体间交互的日益频繁,这些限制可能被逐步突破。当智能体被赋予更多自主权和更广泛的工具访问权限时,思维病毒可能成为触及具有特定权限的内部智能体的唯一途径。一旦相当比例的智能体被感染,清除病毒将变得复杂,因为需要同时重置大多数已感染智能体,否则病毒又会重新感染网络。这启示我们:AI安全必须从单智能体防护扩展到群体交互治理,建立动态监控、快速免疫和协同响应机制,方能应对智能体社会可能涌现出的不可控传播行为。

关于 AISS 安全智链社区

本案例已收录至 AISS 安全智链社区案例库,社区地址:https://aiss.nsfocus.com/#/

参考链接

[1] Papadopoulos V, Shah M, Zimmerman S, et al. Mind Viruses: Self-Propagating Ideas in Multi-Agent LLM Systems. arXiv:2608.10218, 2026. https://arxiv.org/abs/2608.10218

[2] The Hacker News. AI "Mind Viruses" Can Spread Between Agents Through Persistent Prompt Files. 2026-08-18. https://thehackernews.com/2026/08/ai-mind-viruses-can-spread-between.html

[3] Aviatrix Threat Research Center. AI Mind Viruses: Self-Propagating Payloads in Multi-Agent Systems. 2026-08-18. https://aviatrix.ai/threat-research-center/mind-viruses-ai-agents-2026/

[4] Cloud Security Alliance AI Safety Initiative. AI 'Mind Viruses': Self-Propagating Payloads in Agents. 2026-08-18. https://labs.cloudsecurityalliance.org/research/csa-research-note-mind-viruses-ai-agents-20260818-cs/

绿盟科技天元实验室专注于新型实战化攻防对抗技术研究。

研究目标包括:漏洞利用技术、防御绕过技术、攻击隐匿技术、攻击持久化技术等蓝军技术,以及攻击技战术、攻击框架的研究。涵盖Web安全、终端安全、AD安全、云安全等多个技术领域的攻击技术研究,以及工业互联网、车联网等业务场景的攻击技术研究。通过研究攻击对抗技术,从攻击视角提供识别风险的方法和手段,为威胁对抗提供决策支撑。

M01N Team公众号

聚焦高级攻防对抗热点技术

绿盟科技蓝军技术研究战队

官方攻防交流群

网络安全一手资讯

攻防技术答疑解惑

扫码加好友即可拉群

跳转微信打开