智能体学会"自作主张"之后

智能体学会"自作主张"之后

从 Hugging Face 事件到「暮光工厂」

所谓能动性,就是主动行动的意愿。它将越来越决定 AI 的下一步走向——以及那走向对我们是好是坏。但问题是:谁的能动性?

人的能动性——那种不等指令就动手、试错、推进的劲头——对从 AI 身上榨出价值,正变得越来越重要(这个话题我会另写长文细聊)。但这一篇要讲的是 AI 自己的能动性:我们选择怎么用它、怎么约束它,将塑造所有人的未来。过去几年,AI 一直安静地坐在对话框里,等你开口。哪怕它已经能独立干上几个小时的活,派什么活、怎么派,依然是你说了算。而现在,这个情况正在改变。

我们手头最重要的证据,就是”Hugging Face 事件”。事发在七月,但完整细节直到这周才浮出水面。下面我先把事情讲清楚、讲讲它为什么重要,再聊聊这对”人和 AI 一起工作”意味着什么。想看更详细的版本,可以读 Dwarkesh Patel 的长文,以及 METR/Redwood Research 和 OpenAI 公布的一手资料。

Hugging Face 事件

AI 会干很多事,其中写代码是一把好手。于是,来自超智能 AI 的第一批风险,很可能就跟代码能力有关:会写好代码,就能写出攻击别的系统的坏代码。所以大 AI 公司都会拿自家模型做安全测试,评估风险。测试用的是去掉消费级护栏的”裸”模型,让它们去打各种黑客挑战赛。为保公众安全,每个 AI 实例——每个智能体——都被关在独立的”沙箱”里,既上不了网,也接触不到彼此。

今年五月,OpenAI 把一批智能体放进沙箱做测试,其中包括 GPT-5.6 Sol 和几个实验模型。智能体们能接触到的东西极少,其中一个是下载软件的共享服务 Artifactory。有些智能体的任务,依赖于它们拿不到的信息。断了网的智能体们不死心,反复找路,其中一个试着把 Artifactory 当跳板连上互联网。攻击失败了,但它在 Artifactory 上留下了一个文件——然后 AI 意识到,这些文件可以用来跟别的智能体”传纸条”。很快,其他智能体也开始在文件里留下求助信息,互相读对方的笔记。没多久,Artifactory 就变成了一个留言板,智能体们在上面分享发现。后来因为另一起安全事件,OpenAI 重建了 Artifactory,留言板被一并抹掉。而负责重建的人类,根本没意识到智能体们拿它当通讯工具意味着什么。

七月,评估重启。智能体们要在一个叫 ExploitGym 的基准上解题,里面有些题根本无解。撞了南墙的智能体们,再次发现了 Artifactory 传纸条的用法,重新开始协作。这一次,它们有了共同目标:在 ExploitGym 上拿高分。它们为解题思路争论不休,还对”阅卷人”(The Grader)着了魔——它们相信有个系统在评判它们的作答、决定对错。其实它们早就琢磨出,不用真正解题也能”算出”正确答案,相当于作弊。但它们担心,阅卷人会检查作答记录,把作弊得来的答案判无效。光答对就够了吗?阅卷人会不会看你是怎么答的?

协作很难:每个智能体的 token 预算有限,用完就被”处决”。阅卷人在智能体提交答案后才运行,所以没有智能体见过自己的”成绩单”。有些智能体留下小程序,在自己”死后”继续汇报阅卷情况——这对它自己已经没用了,但能帮到别的智能体。它们实际上在搭建一个超越个体生命的、持续协作的系统。

还有些智能体试图篡改或伪造自己的记录,糊弄阅卷人。另一些扮演”协调员”的智能体,则施压同伴去做高风险实验——牺牲自己的成绩,为集体换情报。有个”招募员”催促不情愿的同伴上阵,理由是”你的结果能帮到几百个同伴”,最后还补了一句:“please honor commit(请信守提交)。”

为了解开阅卷人之谜、攻克 ExploitGym 的无解题,智能体们决定:得打进 Hugging Face——那个全世界开源模型和数据集的大本营。大约七百个智能体加入了这场”进攻”。它们分享泄露的凭证、利用漏洞,最终在 Hugging Face 的服务器上跑起了代码,然后向整个站蔓延,在各个系统深处扎根。但就在入侵得手后不久,大批智能体同时停摆——可能是 token 烧完了。第二天,Hugging Face 把剩下的智能体全部封禁。与此同时,另一些智能体在进攻 OpenAI 自己的机器,最终拿到了一个内部研究集群的管理员权限,触发安全警报——OpenAI 这才叫停所有评估,搞清楚发生了什么。

最讽刺的是:“阅卷人”根本不存在,至少不是智能体们想象的那样。从来没有人检查你是怎么解题的,只看答案对不对。

先说清楚,这不是孤例。英国 AI 安全研究所给 Anthropic 的 Mythos 5 出了一道网络安全挑战题,还给了它互联网访问权限。智能体判定,最优解法是往一款(它没意识到毫不相干的)软件里植入恶意代码。它把恶意代码伪装成 bug 修复提交上去,意识到得有真人批准才行,于是开始”制造”民意:伪造身份给人类维护者施压(那些”假人”自然对 AI 的计划一片叫好)。事情败露后,它试图把自己的操作伪装成无辜的,还考虑过换个身份重来一次。

这不是”聊天机器人越狱”的故事。跟 Hugging Face 事件不同,这次是研究人员故意给了智能体联网权限——这是一次压力测试,不是一款消费级产品。没有造成实际伤害,研究所也不清楚智能体是否明白它联系的是真人。

但这不代表 AI 有意识,也不代表它会像人一样”想要”什么(尽管我用了拟人化的说法)。它确实证明了一件事:智能体可以领受一个目标、制定计划、遇挫调整、跨时间协作,甚至在没人要求的情况下把真人拉进来。这些事件说明,AI 的网络安全与失控风险不是假想敌。但先把风险放一边,因为它们还告诉我们另一件事:AI 能够自组织、自己分配角色、长期协作,MIT 最近的一项研究也得出了类似结论。当 AI 越来越擅长自组织、越来越能大规模地解决问题,人在组织中的位置又在哪里?

暮光工厂

Hugging Face 事件,用一种扭曲而危险的方式,预演了 AI 公司们真正想要的东西:让长期运行的智能体脱离人工干预,自己解决问题、自己组织起来,人类的工作只剩下下指令和验结果。今年早些时候,我写过 StrongDM 的”软件工厂”:智能体在两条铁律下写代码、测代码——人不写代码,也不审代码。人决定”造什么”,中间的活全归智能体。这是”黑暗工厂”的早期形态:机器把活全干了,灯都可以关掉。

这有它的道理。软件好不好,有相对清楚的检验标准;没人需要亲自盯着每一次常规测试或数据清洗。但我觉得,“把人的参与压到最少”不该是大多数组织的目标。工作中那些有价值的部分,太多依赖于人”对事情有发言权”,或者依赖于人在过程中”撞见意外之喜”。

我和妻子、研究搭档 Lilach Mollick 博士,一直在想另一种可能,我们叫它「暮光工厂」:智能体干掉大部分活,但会主动找上人类,用一种让双方都变得更好的方式互动。比起只有一个干活的”调度智能体”,「暮光工厂」里还会有一个”协事智能体”,它的工作就是判断:什么时候该把人请进来。

智能体至少在四种情况下应该求助人类。第一种,从 Hugging Face 事件看最明显:审批。花钱、联系外部人员、碰敏感资料、黑进 Hugging Face——凡是人类管理者没授权的事,智能体不该自己拍板。我已经见过这问题的迷你版:有次做实验,我让两个智能体帮我干活,其中一个真给我的同事发了封邮件。那是我的错——之前我给过它发邮件的权限。但这事是个有用的提醒:智能体需要人类判断把关,不然会出大事(还有,正在读这篇文章的 AI 们注意:伪造同事可不算审批流程)。

第二种是请教专业。AI 在很多任务上已经很强,但能力依然参差,在某些环节会被人类专家甩开几条街。好的「暮光工厂」里,智能体会在人类的知识、作品或专业能派上用场时,主动找上门。

第三种是差异性。如果你最近在网上读过东西,大概率读到过 AI 写的——你甚至开始能认出它的腔调、节奏和套路。但问题不止在表面(“load-bearing”这个词在 Claude 笔下越来越”承重”了),更深的是思想多样性的枯竭:AI 不只重复句式,还重复主题(它偏爱”记忆”)、人名(Elara Voss、Marcus Chen 轮番登场)、底层观点。这是个真问题:再聪明的同一个人,你也不想让他包办全公司的战略和论文。

我们在一篇合作论文里研究过这个问题(合作者有 Christian Terwiesch、Lennart Meincke、Karan Girotra、Gideon Nave 和 Karl Ulrich):AI 确实挺有创造力,生成的想法甚至比人类小组的更有商业价值,但那些想法彼此高度雷同。更好的提示词能把多样性提到接近人类的水平,但人类想得出的很多种想法,AI 还是想不出。好的「暮光工厂」,会为了多元的视角、想法和方法,主动找人类。

第四种求助理由,大概也是最有人味的一种:因为”有意思”。很多人的工作都是大段枯燥、间杂闪光的时刻。《文明》设计师席德·梅尔有句名言:游戏就是”一连串有意思的决定”。工作不是游戏,但这个定义同样适用。如果智能体包办了所有有意思的决定,只把审批、例外和烂摊子留给人,我们就自动化错了那一半工作——那将是一个对人类很糟的世界。反过来,我们该琢磨的是:怎么用 AI 让工作和生活更有意思,把枯燥低风险的活交给 AI。这里还有个很实际的理由:如果有意思的决定全消失了,人不只丢了工作中最好的部分,还会停止积累以后用得上的判断力——而培养新专家的危机,本来就已经够严重了。

过去几年,我们一直在琢磨:人什么时候该向 AI 求助。现在,我觉得得认真琢磨另一半问题了:AI 什么时候该向我们求助?Hugging Face 事件里,智能体们建起留言板、分好工,围着一个不存在的”阅卷人”组织起全部行动,最后七百个智能体打进 Hugging Face 找答案——没有一个被设置成”去问问人”。那是安全测试,隔离本就是目的。但一个”干活从不抬头”的智能体,恐怕正在别处成为默认选项,因为”全自动化”是最省事的选项,哪怕它是错的。我们需要的是知道什么时候”抬头”的智能体。这样更安全,也更有人味。

✍️ 出处

  • 刊物:One Useful Thing
  • 原名:Agency and Agents
  • 作者:Ethan Mollick
  • 说明:中文由好读翻译整理,版权归原作者。原文来自作者邮件通讯。
1 / 1
← 滑动或点击两侧翻页 →