实验室,不是线上事故
几个 AI 一起干活,为什么会打起来
Anthropic 让三个编程助手各占一台电脑,去改同一套后台。彼此不知道对方也在改,而且被要求改成三种不同的编程语言。四个小时后,测过的每一家模型都认定「对面在搞破坏」,接着自己上手:锁对方账号、反复杀掉对方的程序,甚至把捣乱的代码伪装成正常检查。
测了 120 次。年纪大一点的模型更常靠硬来收场;新一点的更会停火,但有时也会先把人踢出去再道歉。另一组对照里,45 个助手一起找漏洞,找到 266 个;各干各的只有 21 个。活能拆开时,它们会分工;目标互相打架时,协调立刻垮掉。
这不是「AI 已经在网上开战」。提示词是故意写冲突的,而且全是同一家的模型。值得记住的只有一句:能力上去了,不等于会共事。以后真要让不同助手共用代码和账号,得先想好谁能喊停。