AI 末日概率,依然靠不住

AI 末日概率,依然靠不住

两年前,我们写过一篇长文,专门拆解 p(doom),也就是“AI 末日概率”。我们当时的说法很简单:这个数字的主要作用,是把模糊的直觉和恐惧,套上一层量化的外衣,洗成看起来很严谨的样子。今天重发这篇,是因为 p(doom) 这种话,正在驱动公共讨论和政策注意力,力度比以前还大。不意外,今天这些 AI 末日概率,也没比 2024 年的更严谨。

先说清我们不是什么意思。我们不是说预测者想误导人。他们没这个意图。但效果仍然是误导的。

一般来说,做预测时用数字是好事。阿文德还给预测研究所的“长期专家 AI 面板”当顾问,他觉得那项工作很有价值。问题不在预测本身。问题在 AI 末日风险这个特定题目:它建不出有用的量化模型。

我们发这篇,不是想劝 AI 安全倡导者别用概率说话。劝也劝不动。我们真正希望的,是看数字的人,尤其是政策制定者,能明白一件事:这些数字和其他量化预测不一样。它们不是某个验证过的方法算出来的。

还有一层意思。整个 p(doom) 文化,代表了一种特定的 AI 安全观。它把末日风险和超级智能放在中心。我们认为,这种放法,对更宽的安全理解,反而有害。过几天我们会发后续文章,展开讲,并主张办一个“大帐篷”式的 AI 安全运动。

以下为原文。

AI 末日概率,靠不住到不能用来指导政策

研究者之间没有共识。政府该多认真对待 AI 的末日风险?一方面,末日风险本来就带推测。等有了硬证据,可能已经晚了。另一方面,政府得排优先级。它们也不怎么担心外星人入侵。

AI 安全圈很依赖一个数字:人类因 AI 灭绝的概率,限定某个时间范围。这个数字用来支持决策和政策。比如说,未来几十年是 10%,那显然够高,足以成为全社会头等大事。

我们的核心主张只有一句:AI 末日概率预测,太不可靠,不能用来指导政策。而且,它很误导。

先看看幕布后面

假设我们两人说,未来十年外星人登陆地球的概率是 80%。你会认真对待吗?当然不会。你会让我们拿证据。道理很直白。可在 AI 末日争论里,大家好像忘了:概率本身没有权威。概率通常来自某个有根基的方法。所以我们有个思维习惯:量化的风险,看起来就比定性的说法更可信。但概率也可能只是猜的。这篇文章讲的,就是这一点。

预测肯塔基德比赛马,我们可以不给理由。你爱信不信。但政策制定者不一样。他们要拿预测者的数字去行动,就得能向公众解释这个数字。解释必须来自预测者本人。理由,是政府合法性的根。自由民主有个核心原则:国家不能基于有争议的信念,去限制人们的自由。合理的人可以不接受那些信念。

政策代价越大,解释就越重要。代价分摊不均时,更重要。一个例子是限制 AI 模型开源。政府能不能说服受益于开源的人和公司,让他们为一个推测性的未来风险做牺牲?

这篇文章要做的,就是检验一件事:政策讨论里引用的那些具体末日概率,有没有什么依据。我们不反对把末日预测当学术活动。预测对公司和私人决策者也许有用。我们质疑的,只是它用在公共政策上。

预测者要说服怀疑者,已知的方法基本只有三种:归纳、演绎、主观估计。下面逐个看。三种方法都要求双方先同意一些关于世界的基本假设。这些假设本身不能被证明。区别在于,概率怎么从假设里推出来。

归纳法:没有可比的先例

大多数风险估计是归纳的。它们基于过去的观察。比如保险公司预测某人出车祸的风险,用的是类似司机的历史数据。用来估概率的那组观察,叫参照类。车险里,合适的参照类可以是同城司机。有更多信息,比如年龄、车型,还能再细分。

AI 末日风险没有参照类。它是前所未有的事。

这是一个程度问题,不是种类问题。从来没有唯一正确的参照类。选哪个,靠分析者的直觉。预测准不准,要看一件事:生成被预测事件的过程,和生成参照类事件的过程,像不像。这是一个光谱。掷硬币,过去经验极可靠。车祸,用不同历史数据,估计可能差 20% 左右,保险公司够用了。

再往后是地缘政治事件。参照类就更模糊了。预测专家 Philip Tetlock 说过:希腊退欧在 2015 年看像独一无二,因为没国家退过欧元区。但它也可以是谈判失败的一个例子,或者国家退出国际协议的一个例子,或者强制货币转换的一个例子。他还说,就连苏联解体、阿拉伯之春这种黑天鹅,也可以放进参照类。归纳法在那种事件上,也有用。

在 Tetlock 的光谱里,那种事件已经是“独一无二”的顶峰了。对地缘政治来说也许是。但它们还是远不如 AI 灭绝独特。看看人们给 AI 末日风险找的参照类:动物灭绝,拿来比人类灭绝;工业革命,拿来比 AI 带来的社会转型;大规模死亡事故,拿来比全球灾难事故。说实话,这些都告诉不了我们两件事:超级智能 AI 能不能造出来,造出来后会不会失控。而这两件,正是 AI 末日预测里最大的不确定性。

一句话,人类因 AI 灭绝,离过去发生过的任何事都太远。用归纳法“预测”它的概率,不成立。我们可以从过去的技术突破和灾难里得到定性的启发。但 AI 风险差得太多,量化估计给不出政策合法性需要的依据。

演绎法:没有可靠的理论

柯南·道尔的小说《六座拿破仑像》里,福尔摩斯在蹲守前说,抓到嫌疑人的概率正好是三分之二。听着很怪。人的行为,怎么能有这么精确的概率?

原来他推出了背后的链条。嫌疑人在找一颗宝石。宝石藏在六座拿破仑半身像中的一座里。像分属伦敦一带六个不同的人。嫌疑人不知道在哪座里,侦探也不知道。嫌疑人其余的行为,全都可以预测。所以不确定性,正好可以量化。

关键是:如果我们有一个可靠的世界模型,哪怕不用过去观察,也能用逻辑推出风险。当然,小说之外,世界没这么整齐。往远期推,就更不整齐。

末日风险里,有一个例外:小行星撞击。它能算,是因为它是个纯物理系统。归纳加演绎,真能估出概率。但这套方法,推广不到其他末日风险。

它怎么算?关键是建模:小行星的大小,或者说撞击能量,和撞击频率之间的关系。我们观测过成千上万次小撞击。可以往外推,推出从没直接观测过的大撞击频率。也能估出造成全球灾难的门槛。

AI 不一样。它的未知在技术进步和治理上,不在物理上。数学上怎么建模,不清楚。

还是有人试。比如预测一个假想的 AGI 需要多少算力。有几项研究假设,AI 系统需要的计算量和人脑差不多。再假设人脑需要多少计算。这些假设,比小行星建模脆弱得多。而且,它们连失控问题都还没碰。

主观概率:感觉穿上了数字的衣服

没有参照类,也没有扎实的理论。预测就只能变成“主观概率”。那就是预测者凭判断猜的数字。不意外,它们差出几个数量级。

主观概率绕不开依据问题。它只是让预测者不用解释。解释很难。人很难说清自己的直觉是怎么来的,不管那直觉是归纳的、演绎的,还是混的。说到底,没依据时,预测者只能编一个数字。而编出来的数字,满天飞。

看“末日风险说服锦标赛”(XPT)。那是预测研究所 2022 年办的。我们认为,它是至今做得最细、执行最好的末日风险预测活动。参加的有 AI 专家,也有预测专家,就是图里的“超级预测者”。到 2100 年 AI 灭绝风险,AI 专家的估计,中位数是 3%。高的那头,75 分位是 12%。低的那头,25 分位是 0.25%。预测专家更低。中位数只有 0.38%。75 分位也只有 1%。25 分位在图上几乎贴着零。换句话说,AI 专家的 75 分位,和超级预测者的 25 分位,差了至少 100 倍。

给出这些数字的,都是这行里的深专家。他们还参加了几个月的锦标赛,互相说服。如果这还不够极端,记住一件事:这只是一拨人,在一个时间点做的。换到今天重做,或者问题换个问法,数字可能又不一样。

最说明问题的是他们给出的理由。报告里写得很细。想坏结果在强 AI 出现后有多大可能时,他们没用量化模型。大多数时候,他们的推测和普通人聊超级智能时没区别。也许 AI 用超人的说服力接管关键系统。也许 AI 为了让计算机跑得快,想降低全球温度,顺手灭了人类。也许 AI 去太空找资源,不在地球上,我们不用那么担心。这种推测没错。但要说清:谈 AI 末日风险时,预测者没有特殊的知识、证据或模型。他们的直觉,不比你我的更可信。

“超级预测者”这个词,来自 Tetlock 二十年的预测研究。他也是 XPT 的组织者之一。超级预测者受过训练。方法包括整合多方信息、减少心理偏差。这些方法在地缘政治上被证明有效。但没有有用的证据可依时,训练再多也没用。

就算预测者真有可信的量化模型,他们也不得不算上“未知的未知”。也就是模型本身可能错的可能。末日风险哲学家 Nick Bostrom 说过:我们对风险的一阶评估,本身就有不确定性,容易出错。在做总概率判断时,必须把这一层算进去。在低概率、高后果的风险上,这一层常常占主导。特别是风险涉及理解很差的自然现象、复杂的社会动态,或者新技术时。或者用别的话说,难评估时。

这个看法合理。AI 末日预测者也很在意评估的不确定性。但后果是:按这个原则做,预测注定是猜的,不是模型算的。没有任何模型,能估出模型自己错的概率。更别说模型错了,风险是多少。

独特事件,没法检验预测水平

总结一下:主观 AI 风险预测差出几个数量级。但如果我们能看预测者的历史战绩,也许能判断该信谁。这就和前两条路不同。预测者不用解释数字,只需要证明:我过去测得准。

这条路在地缘政治上极有价值。预测圈花很多力气测水平。方法很多:校准、Brier 分数、对数分数,或者预测网站 Metaculus 用的 Peer 分数。

但不管用哪种,到了末日风险上,测主观概率的水平,有好几道坎:没有参照类、基础概率太低、时间线太长。逐个看。

参照类问题,困扰预测者,也困扰评估者。回到外星人的例子。一个预测者,以测选举极准出名。他忽然说,没给任何证据,外星人一年内会登陆。我们不会因为他的战绩,就改信外星人要来。选举预测和外星人登陆,差得太远。我们不认为他的本事能迁移过去。AI 末日风险也一样。它和过去测过的任何事件,都差得太远。没有任何证据表明,某个预测者擅长估 AI 末日风险。

就算没有参照类问题,还有别的坎。灭绝风险是“尾部风险”,来自罕见事件。假设预测者 A 说 AI 末日概率是 1%。预测者 B 说是百万分之一。该信谁?可以看战绩。假设 A 的战绩更好。也不等于该更信 A。因为水平评估,对高估尾部风险不敏感。A 可能总分更高,只是因为他在日常事件上校准稍好一点。到了百万分之一这种罕见风险,他可能系统性地高估几个数量级。没有任何评分规则,能充分惩罚这种错。

一个思想实验能说明这点。两个预测者 F 和 G,测两组不同的事件。两组事件的真实概率,都在 0 到 1 之间均匀分布。我们非常乐观地假设,F 和 G 都知道每个事件的真实概率 P。F 每次都报 P。G 稍保守,从不报低于 1% 的值。P 大于等于 1% 时,他报 P。小于时,他报 1%。

按构造,F 是更好的预测者。但看战绩,能看出来吗?要测多少个预测,才有 95% 的把握让 F 赢过 G?用对数分数,大约要一亿个。用 Brier 分数,大约要一万亿个。假设可以商量,但结论不变:如果一个预测者系统性地高估尾部风险,这件事在经验上测不出来。

最后一道坎:长期预测要等太久才能评估。灭绝预测当然更没法评估。这个坎也许能绕。研究者搞了一种“互惠评分”:预测者按他们预测彼此预测得有多准来拿奖励。他们在真实场景里验证过,比如预测新冠政策的效果。在那些场景里,互惠评分做出的预测,和传统评分一样好。没错。但互惠评分绕不开参照类问题,也绕不开尾部风险问题。

风险数字为什么容易被系统性抬高

回顾一下:归纳和演绎都不成立,主观预测满天飞,也没办法判断谁更可信。于是,有些研究者转向聚合方法,把很多预测者的数字合到一起,想得到更可靠的估计。一个有名的努力是 AI Impacts 的《AI 进展调查》。但它被批评方法有严重问题,包括无回应偏差。更重要的是,聚合为什么能提高准确率,不清楚。毕竟,多数预测者可能有同样的偏差。而且,他们本来就没有可靠预测的依据。

预测者系统性高估 AI 末日风险的理由有很多。第一个是选择偏差。拿 AI 研究者说。相信 AI 能改变世界,是很多人入行的主要动机。进了这个圈子,这个说法天天被强化。如果一个人相信这项技术强得可怕,那他觉得它改变世界时偏向负面,也完全理性。

AI 安全这个小圈子更封闭,回声室效应震耳欲聋。宣称自己 p(doom) 高,似乎成了一种表态方式。表明身份,也表明对事业的忠诚。

预测专家这边,有一种稍不同的选择偏差。预测圈和有效利他主义高度重叠,也关心末日风险,尤其是 AI 风险。这不代表每个预测者都有偏差。但 p(doom) 高的人,可能更愿意来做预测。所以整个群体的构成,天生偏向担心末日风险的人。

预测者擅长根据证据更新信念。但问题是,和小行星撞击不同,AI 末日风险没什么证据能让人往哪边改。所以我们怀疑,预测受进入圈子时的先验信念影响很大。XPT 报告说:“在 XPT 期间,很少有人改变想法。最活跃的参与者也是这样。哪怕有说服别人的金钱激励。”后续研究发现,很多分歧来自世界观的根本差异,不只关乎 AI。

再强调一次,我们说的偏差,只针对 AI 末日风险。如果有个选举预测圈系统性偏向在任者,几场选举下来,和现实一比就露馅了。但 AI 末日风险不一样。我们前面说过,水平评估对高估尾部风险不敏感。

有意思的是,水平评估对低估尾部风险极其敏感。如果你给一个罕见事件报 0,而它真发生了,用对数分数,你会被扣到无限。这正是 Metaculus 采用对数分数的主要原因之一。

现在想一个没有精确估计的预测者。面对 AI 末日风险这种多维不确定的问题,没有人有精确估计。在这种不对称的惩罚下,理性做法是往自己估计范围的高处报。

而且,估计高度不确定时,预测者到底报的是什么,也不清楚。他们也许不理会评分函数的激励。毕竟长期预测短期内不会见分晓。回到 XPT,它的激励其实是预测彼此的预测,好绕开时间太长的问题。互惠评分那篇论文说,这会激励预测者交出真实的、用力的估计,还讨论了各种反对意见。他们的辩护靠两个关键假设:一是预测者越用力,越接近真实估计;二是预测者没有更好的办法去预测别人会怎么报。

要是这两个假设不成立呢?我们整篇都在说,对 AI 末日风险,不该指望证据能改变预测者的先验。所以第一个假设可疑。XPT 又已经办过一轮,公布的中位数成了一个强锚点。用博弈论的话说,是个“焦点”。未来用互惠评分的预测者,可能拿现有中位数当起点,只为新信息做小调整。估计范围可能变窄,因为旧估计成了新估计的锚。一句话绕回来就是:能依据的真证据越少,群体思维的风险就越大。

小心帕斯卡赌注:效用最大化的危险

顺带说,上面是 XPT 的两组中位数:AI 灭绝风险,以及次一级的灾难风险。我们重申:这些数字都不该太当真。它们反映的,更多是不同样本的参与者对 AI 有多焦虑,仅此而已。

和前面一样,预测专家和 AI 专家的估计,差一个数量级以上。真要给哪组一点信任,该给预测专家的,不是 AI 专家的。过去研究有个重要发现:领域专家不如受过训练的预测专家。那些训练教人整合信息、减少偏差。但我们前面说过,就连他们的预测,也可能高估得离谱。我们就是没法确定。

那有什么大不了的?政策制定者把某个时间段的风险当成 1%,而不是 0.01%,又怎样?两个听起来都挺低!

要看他们拿这个数字去干什么。大多数时候,这些估计只是个信号:一组专家觉得风险重要。如果只是这样,那也就罢了。但不清楚的是,为了发这个信号,搞这么复杂的量化,到底有没有帮助。因为同一串数字,不同的人解读起来差很远。

比如联邦贸易委员会主席 Lina Khan 说,她对这个问题是技术乐观派,因为她的 p(doom) 只有 15%。专家听完都困惑了。说句公道话,那个数字比我们能接受的“技术乐观”标签,高了大约一千倍。要在决策里正确处理极小或极大的数字,需要很多量化训练,不能简单把它们归进“小到可以忽略”那一类。大多数人没受过这种训练。

简单说,现在发生的事是这样:专家模糊的直觉和恐惧,被翻译成伪精确的数字。然后政策制定者再把数字,翻译回模糊的直觉和恐惧。我们不如把量化的戏法省了!

AI 安全中心那份《AI 风险声明》在这点上,坦率得令人佩服。当然,它的实质内容我们强烈不认同。

在决策里用概率,有种原则性的量化办法:通过成本收益分析做效用最大化。想法很简单:一个结果有个主观价值,叫效用 U,可正可负。它有 10% 的概率发生。我们就当它一定发生,价值是 0.1 乘以 U。然后把每个选项的成本收益加起来,选期望效用最大的。

问题就在这里出来了。第一,有些人可能认为灭绝的负价值大到无法想象。因为它排除了一切未来可能出生的人类生命,物理的或者模拟的。逻辑结论就变成了:末日风险应该永远是所有人的头等大事!这让人想起帕斯卡赌注。那个论证说,信上帝是理性的。因为哪怕上帝存在的机会极小,不信的代价也是无限的。永恒的地狱对永恒的幸福。所以期望效用也是无限的。幸运的是,政策制定者不太买涉及无限的决策框架。但这个想法已经牢牢抓住了 AI 安全圈,驱动一些人坚信,AI 末日风险应该是全社会的头等大事。

就算我们只谈灾难风险,不谈灭绝。那也是几十亿条命。所以哪怕 1% 的风险,期望成本也极高。政策含义就变得很激进:政府应该把 AI 末日风险应对的支出增加几个数量级,还要考虑停掉 AI 发展这种严厉措施。这正是为什么必须弄清一件事:这些估计没有任何方法支撑。基于这么少的证据,去做改变世界的政策决定,极不明智。

里程碑预测:结果太含糊

预测在 AI 政策里有没有位置?我们认为有。只是不要测末日风险。测 AI 里程碑更有意义。比如某些能力基准的表现,或者经济影响。如果一个预测者证明过自己能准测里程碑何时到达,那真能说明他以后也测得好。我们不再谈独特或罕见事件了。而考虑代价较低的政策干预时,比如为潜在的经济扰动做准备,而不是防杀手机器人,预测的依据也不用让每个合理的人都满意。

预测圈在里程碑预测上花了很多力气。在 Metaculus 上,有个问题:“2040 年前会出现人机智能持平吗?”基于一千三百多名预测者,聚合预测是 96%。这很惊人!如果我们同意这个预测,我们也会主张,安全过渡到 AGI 应该是全球优先事项。我们为什么不同意?

答案在小字里。AGI 这种模糊概念,没有公认定义。就算定一个定义,判断它算不算达成,也可能很难,甚至不可能。做有效预测,极要紧的一点是避免结果含糊。预测圈绕开这点的办法,是把问题定在相对狭窄的技能上,比如考试表现。

Metaculus 上那个智能持平问题,定义用的是数学、物理、计算机科学研究生考试的表现。按这个定义,我们同意 96% 的预测。但我们认为,定义已经被稀释到这个地步,对政策没多少意义。先不说末日风险,我们以前写过,AI 的考试表现构念效度太低,连 AI 会不会替代工人都预测不了。

其他基准也好不到哪去。一句话,预测 AI 能力时间线很难,因为基准和现实影响之间有一条大鸿沟。幸运的是,更好的基准正在开发。它们反映有后果的真实任务。除了基准,我们还需要自然情境的评估,哪怕成本更高。一种是测人们用 AI 辅助后,工作方式怎么变。直接预测经济、社会、政治影响,比如劳动力市场转型,或者军方在 AI 上的支出,也许更有用。只是更难无歧义地定义和衡量。

结语

避免在政策里误用概率,责任在政策制定者。我们不是在呼吁预测者停止发布预测,好“保护”政策制定者不被误导。话虽如此,我们认为,预测应该附上清晰的说明:用了什么过程,考虑了什么证据。这样政策制定者才能做知情判断:给出的依据,是否达到了他们能接受的门槛。XPT 是透明的好例子。那篇不是讲末日风险的论文也是。另一面,只调查一帮研究者,把汇总数字摆出来,会误导人。政策制定者应该忽略它。

那政府对 AI 末日风险到底该做什么?我们的看法不是什么都不做。但他们应该拒绝那种在末日风险显得紧急又严重时,看起来很有说服力的政策。最典型的,是限制 AI 发展。正如本系列后续文章会论证的,这类政策不光没必要,还可能增加末日风险。相反,政府应该采取与多种风险估计都兼容的政策。就算风险微不足道,这些政策整体上也有好处。幸运的是,这种政策是存在的。政府也应该改政策制定流程,让它对新证据更灵敏。这一切,后面再细说。

延伸阅读材料略。致谢略。

✍️ 出处

出处

  • 刊物:AI as Normal Technology
  • 原名:AI existential risk probabilities are (still) too unreliable to inform policy
  • 作者:Arvind Narayanan 与 Sayash Kapoor
  • 说明:中文由好读整理,版权归原作者。原文来自作者邮件通讯。
1 / 1
← 滑动或点击两侧翻页 →