AI 安全,该搭大帐篷还是小帐篷?
最近几周,关于 AI 安全冒出了两种叙事:要么 AI 末日风险真实且迫在眉睫,要么 AI 领袖和吹哨人的这类说法言不由衷——是一场“心理战”、炒作,或者某种变了形的监管俘获。
很少有人考虑第三种可能:末日警告是真诚的,但只是错了,而且对 AI 安全适得其反。仿佛所有人都想当然地认定,敲警钟的人都是天才,唯一的问题只是他们是善良的那种还是邪恶的那种。
我们两种叙事都不认同。在我们关于 AI 安全的写作中,我们一贯试图认真对待那些论点,同时反驳许多我们认为不成立的主张,并指出我们认为真实存在的安全关切。这篇文章是这一路线的延续。
我们确实在系统性地对灾难性和系统性风险投入不足
先把 AI 安全和有效利他主义(EA)的一部分论点往最强的方向说。说到我们为灾难性风险投入了多少防御,这个世界确实有很深的问题,安全社区和 EA 社区在这一点上是对的。把超级智能完全拿掉也一样成立:基于证据的风险论证已经提了多年,却没有换来相称的政策回应。
最有名的例子是没能为大流行病做好准备。我们有多年的警告和量化估算。一份由世卫组织/世界银行在新冠之前召集的 2019 年报告,开篇就说存在“非常真实的威胁……一种呼吸道病原体可能杀死 5000 万到 8000 万人,并抹去全球近 5% 的经济”。它估算,充足的准备成本对大多数国家来说不过每人每年 1 到 2 美元。
自 2009 年 H1N1 大流行以来,至少 11 个高级别专家组和委员会提出过改善全球大流行准备的具体建议,然而“大多数建议从未被落实”。更令人惊讶的是,即使在新冠之后,所需资金也只落实了一小部分。同一个独立专家组在 2024 年写道:“在危机期间提供大量即时资源有一种犬儒式的吸引力,而不是主动预防危机。然而历史表明,这不会有好下场。”根源似乎是:选民奖励的是救灾支出,而不是防灾支出。
说清楚,大流行准备不足绝不是 EA 独有的洞见,更不是 AI 安全独有的。但 EA 确实因倡导此事而值得肯定。同样真实的是,EA 以期望效用计算为核心的结果主义道德框架,在揭示和量化我们的准备不足方面非常有效。这个框架争议很大,但我们不认为它本身或它在生物风险等领域的应用有什么错。不过,我们确实强烈反对它向长期主义和 AI 末日风险的延伸。我们也反对把“AI 放大生物风险”这类问题重新包装成“AI 安全”问题、再用对齐之类的方法去解决。我们的看法是:AI 是既有系统性风险的放大器。
准备不足的问题在网络安全领域也成立——实际上更糟。与大流行或金融不同,网络安全社区没有为系统性或灾难性风险建模的文化。我们在上一篇文章里描述的经济学方法,成功地把日常攻击的预期损失控制在可管理的水平,但市场出了名地不会为尾部风险和外部性正确定价。
保险公司很清楚这一点。劳合社相当直白地说,“损失有可能远远超过保险市场能够吸收的程度”,并且不承保严重的国家支持的网络攻击(那是 2022 年)。
再说一次,这与 AI 最近的能力关系不大。五年前,AI 还没进入图景时,阿文德在普林斯顿教本科信息安全课就强调:级联故障和灾难性风险是可能的,可能导致整个互联网长时间瘫痪,带来潜在的文明级后果。(回看我幻灯片里的讲者备注,我当时还为在一门讲基础的本科课上讲原创研究道歉,但解释说,这是因为安全社区对这个关键话题近乎完全忽视,我别无选择。—— A.N.)
换句话说,达里奥·阿莫迪关于智能体蜂群可能“接管整个互联网”的说法,虽然措辞有些夸张,但并非显然超出可能性范围,至少值得研究。网络安全社区有做这件事的技能,可惜他们似乎觉得这事甚至不值得想。
也有一些系统性风险是弥散而渐进的,而不是灾难性的。想想聊天机器人正在对新闻流量做的事——点击率远低于传统搜索,加速了传统新闻业的衰落。这种转变的二阶社会效应要过很久才会显现。而这只是几十种悄然蔓延的制度衰败中的一种。阿图莎·卡西尔扎德提出了“累积风险”的概念,来描述这种社会韧性的渐进侵蚀。这里的不作为心理学与大流行相反:不是因为事件太罕见以至我们能把它从记忆里抹掉,而是因为衰败太无处不在、太渐进,以至我们对它麻木了。
简而言之,完全基于有根据而非臆测的因果路径,有理由相信政策制定者在保护社会免受 AI 风险方面投入严重不足,也很难不对那些想把话说得更重的人产生同情。
当然,问题是:更急迫的公开警告,是否真能带来更好的政策。
科克森事件说明,扭曲的媒体环境如何把末日风险抬高到更有根据的关切之上
这份通讯在很大程度上是一次换位思考。让我们先把 AI 泡泡内外的人们总是鸡同鸭讲的首要原因说清楚。
对 AI 圈内人来说——无论关不关心安全——很难理解世界上还有什么别的事重要。计算机科学家斯科特·阿伦森在《奇迹与恐怖的时代》里这样说:“是的,我们余生会是什么样还有巨大的不确定性,但据我看,已经不再有任何真正的不确定性:这一切大多将围绕 AI 展开,以及我们能否成功把它的力量导向人类繁荣。”
这篇文章在社区里广为流传,因为这种视角确实被广泛共享。连我们两个——最出名的就是反驳这种观点的某些成分——也认为 AI 重要到早早决定把职业生涯投入其中。“AI 作为常态技术”的立场是:AI 的影响“只会”和工业革命相当。
AI 圈外的人理解不了 AI 社区这种视角的强度——那是一个 AI 的世界,我们都只是生活在其中。
但还有另一面——AI 圈内人大大高估了公众对 AI 的关心程度。在盖洛普民调中,把 AI(或“计算机/技术的进步”)列为最重要议题的人,比例约为 0.5%。这些人大多想的可能是相对日常的事,比如社区里要建一个数据中心。把 AI 视为我们这个时代决定性议题的圈外人,比例小到无法理解。
AI 圈内人之所以意识不到这一点,是因为对 AI 这个话题,显著性与关切是脱钩的。人们对 AI 的关切很高(即许多人认为 AI 重要,或在被具体问到时表示担忧),但显著性很低(即很少有人把它排在其他议题之前)。
无论如何,这一切铺垫只是为了说明:尽管有许多我们同意世界急需行动的、由 AI 放大的灾难性和系统性风险,它们往往还是突破不到公众意识里。
今年夏天智能体蜂群黑客事件曝光后,出现了一阵零星的头条,但量级比科克森辞职及其末日预测后来引发的媒体关注和公众 awareness 低了几个数量级。
安全社区对这些关切没能突破到公众那里表示惊讶和挫败。这让整个社区都紧绷起来。作为社区的观察者,我们感觉社区的焦虑水平与过去任何时刻都有质的不同。
AI 网络风险为什么没得到更多头条并不难解释:AI 是低显著性话题,黑客事件天天上新闻,而这一次甚至没有已知地伤害到普通人。普通人为什么应该关心,远不清楚。相比之下,末日风险是直击本能的,而科克森辞职让 AI 安全终于突破了。可以肯定,末日警告以前说过很多次,但这次有两个不同。第一,有一个等着被点燃的火药桶:安全社区渴望在出现新闻钩子时与媒体对话、放大担忧。这种回应如此全力以赴、如此一致,以至人们得出结论:这一定是协调一致的行动,但我们不这么认为。
这次不同的第二个原因是:许多高管自称有很高的“末日概率”(p(doom)),却仍继续竞相建造超级智能,这选择在公众看来鲁莽且不可理解。当然,AI 领袖们有一套复杂的自我开脱 来解释他们为什么别无选择,但传到公众耳朵里的不是这些。也许更大的脱节是:这一切底层是一套公众并不认同的功利主义价值体系。
为什么末日叙事对 AI 安全政策可能适得其反
回顾到这里,关于 AI 安全意味着什么,有两簇信念。任何二分都会漏掉一些细微差别,但我们认为它准确得够用。
- 有一些具体的(可能灾难性但低于末日级别的)风险,早于 AI 存在、被 AI 放大,我们急需通过预防和韧性来防御。
- AI 发展本身就是末日风险——要么因为超级智能建成后下游风险太多防不住,要么因为未知的未知——我们要么得搞清楚如何让超级智能安全(比如通过对齐),要么阻止它被建成。 关键在于,由于信息环境,正在驱动公众关切和大量政策讨论的,是末日叙事,尽管可信的因果路径还没有被清楚阐述出来(而那些尝试至少可以说毫不令人信服)。
那么接下来会发生什么?一个乐观的可能是,当前时刻的部分能量被导入建立一套广泛的防御(也许伴随 AI 发展的放缓,尽管在我们看来这远没那么重要)。
但这条路在我们看来不太可能。更可能的结果是,末日叙事的主导地位正在实际上适得其反,主要有两个原因。
极化与党派化。 末日叙事一直具有极化性,因为我们许多人对它完全不信服,但现在这种极化开始沿着党派界线分裂。党派化对安全政策是坏事,因为它导致不作为、高不确定性和政策的党派性反复。更糟的是,当人们发现“10% 灭绝风险”预测背后没有任何量化模型时,他们会觉得被误导,从而对安全政策产生更强的反弹,尤其是在一方本就怀疑专家在编故事的极化环境里。此外,让公众恐慌是适得其反的,因为它把解决方案空间限制在那些最钝、最能提供情绪慰藉的方案上,而这些往往不是最有效的。
误导(misdirection)。 我们反驳过针对末日关切的“转移注意力”论——如果我们担心失业和安全,我们可以两者都管,它们不会互相转移。但这不是转移的问题:两种安全观是对同一个问题的两种不同诊断。它们很可能会争夺资源。我们称之为误导,以区别于转移。特别是,一个笼统的末日威胁只容许一种政策——禁止。用概率来表述威胁更把我们往那个方向推。“如果我们发展出超级智能,就有 10% 的灭绝风险”这句话,让人觉得唯一的干预杠杆就是停止发展。不幸的是,禁止超级智能在定义上含糊到近乎 incoherent。而且 AI 安全仍然不是模型的属性。暂停数据中心建设之类的其他潜在干预,作为安全措施极其无力。最重要的是,禁止发展对既有 AI 系统带来的灾难性和系统性风险毫无作用。应对这些风险需要的回应要无聊得多,这反过来意味着,为此建立的运动与针对超级智能的运动截然不同:是一百项分散的、加固防御和韧性的干预,而不是把努力和注意力集中在竖起一堵巨大的、醒目的墙。我们担心两种 AI 安全叙事正在竞争,正是这个原因。我们希望我们错了!
结论:大帐篷还是小帐篷的 AI 安全运动?
我们所说的“大帐篷安全”有三个主要特征。
- 信念。 大帐篷运动会包括不担心末日风险的成员(而且和我们一样,可能不认为超级智能是威胁)。他们可能关心网络风险、生物风险和其他具体的灾难性风险,各种累积风险,以及建立社会韧性的需要。
- 价值观与运动建设。 这个社会运动必须在价值观上、而不只是信念上是多元的,认识到 EA / 安全主义的道德框架并不受公众欢迎。对公众的号召应该不靠恐慌,而是描绘积极的愿景。
- 政策。 大帐篷运动会认识到,尽管信念有分歧,政策上有大量共识(尽管如果只盯着末日风险,这些政策会显得不够)。两簇这样的政策已经清晰起来:透明与责任。嵌入式评估迫在眉睫,建造和使用 AI 的组织应该为它们造成的负外部性系统性地负责。大帐篷安全政策聚焦于摘这些低垂的果实,同时为更强的干预(比如禁止完全自主的递归自我改进)练肌肉。但后者应该做说服怀疑者的苦工,而不是搞恐慌式政策。 相比之下,小帐篷安全在信念、价值观和政策目标层面都更窄。它奖励意识形态的同质性(同时声称相反)。这有可能陷入纯度螺旋,逐渐把大帐篷的人挤出去。小帐篷安全把防御“只是”灾难性(!)风险的支出排在后面。最后,这样的运动认识不到自己与公众在价值观和 AI 安全显著性上的差距。结果,它严重高估了自己手里的牌,冒着反弹的风险。
说点个人的:我们常常纳闷,为什么我们的工作有时被 AI 安全社区欢迎、有时被攻击,我们认为大帐篷与小帐篷的区分很好地抓住了这一点。
让我们搭一顶更大的帐篷。
(感谢阿比·奥尔维拉、乔舒亚·萨克斯和罗希特·克里希南对初稿的反馈。)