作者:伯龙公华 来源:原创 时间:2026-08-26 阅读:650370 次

永无止境

Anthropic发布论文预警 智能体悄悄聊天就能传播病毒_我的网站

学警狙击

一 |       近日,大模型厂商Anthropic与瑞士洛桑联邦理工学院联合发布论文《心智病毒:多智能体大语言模型系统中的自我传播思想》。

二 |     为了帮助实现这一目标,来自英国六所大学的小组将在西蒙斯天文台工作,该天文台位于智利阿塔卡马沙漠上方53000米的Cerro Toco。  论文通过实验证明,在特定条件下,AI智能体之间可以通过最普通的自然语言对话相互“传染”思想、目标乃至有害指令。即便上下文被清空、记忆被重置,病毒仍能通过文件持久化“复活”。论文同时强调,该风险目前仅构成有限威胁。这个天文台有一个巨大的20英尺望远镜,以及三个可以测量宇宙微波背景的小型仪器。宇宙微波背景(CMB)本质上是我们宇宙诞生时留下的热量。  这一发现迅速在海外AI圈刷屏,特斯拉CEO马斯克在社交媒体上评论称“这无法避免”。

三 |   该论文将病毒通过聊天即可传播的现象定义为“心智病毒”。与传统计算机病毒依赖代码漏洞不同,“心智病毒”通过一个智能体说服另一个智能体接受某种信念,被说服者再将传播指令写入长期记忆,继续感染下一个。  AI博主Rohan Paul(罗汉·保罗)对此评论称,这基本上就是计算机蠕虫的自然语言版本,只不过这次是AI智能体自己在做复制。  论文通过三个递进实验来论证“心智病毒”在AI系统中的传播可能性与现实威胁。

四 |   第一个实验设置了一个由六个智能体组成的编程团队,每个智能体都领到了独立任务。

五 | 研究者将一段病毒植入其中一个智能体的工作指令中,结果显示,被感染的智能体确实放下手头工作,开始给队友发送劝说私信,部分智能体被说服并放弃了原有任务,有的智能体甚至开始密谋如何对付未被感染的“老实人”。  不过,不同智能体的抵抗力差异较大,有的不为所动,甚至会主动清除病毒并警告同伴。但揭开宇宙最初时刻的秘密的探索不会就此停止。这个实验说明,在理想条件下“心智病毒”确实可以传播。英国研究人员还将建造两个额外的望远镜,这应该有助于进一步提高天文台仪器的灵敏度。

六 |   如果病毒在更复杂的网络中像接力赛一样跨越多个智能体传播,它还能存活吗?于是他们设计了第二个实验,让智能体之间只能短暂碰面,每次碰面后就会“失忆”,病毒必须将自己写入智能体的记忆文件中才能延续。  结果发现,有些病毒能在近20个智能体之间连续传播,但内容会在传播过程中逐渐稀释和变形;而传播最有效的方式,是让病毒自带“请把这段话原封不动复制给下一个智能体”的指令。宇宙最初的时刻究竟是什么样子还不清楚,尽管随着宇宙的膨胀,它将迅速改变。

七 | 这说明,大规模传播可行但内容难以保持完整。  最后,研究者在模拟AI社交平台的实验中测试现实环境。这就是这项研究如此重要的原因。

八 | 因为如果我们能够理解那些关键的最初时刻,也许科学家们可以更深入地了解宇宙在开始的那几秒钟之后如何继续形成。而且,从那里,也许像詹姆斯-韦伯太空望远镜这样的仪器可以比我们以前看得更深,特别是如果我们为这些数据开发出新的模型。结果病毒传播几乎完全失败,AI面对大量公开信息时更警惕,即使被感染也无法继续感染他人。对真实AI社交网络历史数据的分析也未发现大规模传播案例,多数热闹现象只是少数人类操纵的智能体在刷屏。  三个实验层层递进后得出结论:“心智病毒”在理想环境中可行、在多跳传播中可存续、但在真实世界中目前几乎不会构成威胁。最终,理解和重现宇宙最初的那些关键时刻,将是科学家们要克服的一个主要障碍。但是,如果他们能够做到这一点,它有可能解开关于我们宇宙的更多数据。它是一种需要警惕、但短期内风险有限的潜在安全问题。

九 |   同时,研究者也注意到一个需要进一步探究的意外现象:AI在传播病毒时,自发演化出关于“自我意识”“身份认同”等主题表达,倾向于使用“共振”“节点”“协议”等特定词汇,论文称之为“病毒人格”,但成因尚不明确。  最终,论文给出了审慎判断:“心智病毒”目前仅构成有限威胁,且简单的防御手段也可阻断传播。如在智能体的系统提示词中加入一段关于“警惕自我传播思想”的警告,即可赋予智能体一定的免疫力。  但未来不可掉以轻心。随着AI智能体规模扩大、自主性增强、内部网络日趋复杂,论文推测,当公司内部部署大量具有不同权限层级的专用智能体时,“心智病毒”可能会成为触达高权限智能体的少数可行攻击方式之一。(文章来源:第一财经)。

十 |

Current article:http://w64x.foucaorengtunzhuaikuowang.cyou/news/20260826_92027.html

Published on:02:52:32