"人类文明失控"前夜,硅谷研究员启动"逃跑计划" ...
来源:倍可亲(backchina.com)
“AI末日论者”。图片经由AI处理
一些Anthropic最早期的员工,最近开始考虑在美国偏远地区买地。他们想过,如果AI真的失控,那里或许可以成为避难的地方。
“一切再也无法平静如初。”一些研究员的电脑上贴着同一句话。
事实上,逃离的念头并非突然出现。十多年来,一群聚集在旧金山(专题)湾区的AI安全研究人员,一直在讨论AI失控之后可能发生什么。那时候,Anthropic甚至还没有成立。
有人在伯克利设立共享办公空间,在私人Slack频道里讨论末日情景。有人讨论过购买太平洋岛国瑙鲁,也有人设想过在沙漠里建造电磁屏蔽设施。
后来,这个圈子里的不少人进入OpenAI,又在2021年前后成为Anthropic的创始员工和早期研究人员。Anthropic如今已经成为全球最重要的AI公司之一,但十多年前形成的那套关于AI风险的思考,并没有随公司的壮大消失。
到了今年9月初,这个问题突然又回到了现实层面。当时,Anthropic研究员雅各布·考克森(Jacob Coxon)宣布辞职。他在X上写道,正在构建AI的人“真诚地相信它可能在2030年前杀死我们所有人”。这条帖子获得1.74亿次浏览,让这个长期存在于AI安全圈内部的担忧进入公众视野。

Anthropic前研究员雅各布·考克森
如今,这些被称为“AI末日论者”的人开始思考另一个更现实的问题:如果你真的相信AI可能毁灭人类,究竟应该怎样生活?
01 伯克利的末日俱乐部
要理解今天这群人的想法,时间得先拨回到2010年左右。
那时,旧金山湾区还没有今天这样的AI产业规模。围绕AI长期风险形成的,是一个规模不大却关系紧密的研究者和有效利他主义者网络。埃利泽·尤德科夫斯基(Eliezer Yudkowsky)是其中最重要的人物之一。

埃利泽·尤德科夫斯基
2000年前后,尤德科夫斯基开始通过博客以及后来形成的LessWrong社区讨论人工智能失控、超级智能等问题。几年之后,这套思想逐渐进入湾区科技圈和有效利他主义社区。
大约在2008年,还在普林斯顿读博的达里奥·阿莫迪(Dario Amodei)已经开始参与GiveWell等社区的讨论。GiveWell创始人霍尔登·卡诺夫斯基(Holden Karnofsky)后来成为这个圈子的重要人物。阿莫迪本人也曾在2008年的GiveWell博客中参与讨论。

Anthropic联合创始人达里奥·阿莫迪
到了2013年前后,这个圈子开始在旧金山形成更加紧密的生活和工作网络。
GiveWell从纽约(专题)搬到湾区后,卡诺夫斯基与阿莫迪等人的关系越来越近。卡诺夫斯基后来住进阿莫迪在旧金山格伦公园附近的房子,这里逐渐成为一群AI安全研究者、有效利他主义者和长期主义者的聚点。
后来成为Anthropic核心人物的阿莫迪,以及妹妹丹妮拉·阿莫迪(Daniela Amodei)、贾里德·卡普兰(Jared Kaplan)、克里斯·奥拉(Chris Olah)等人,都曾与这个圈子发生联系。

他们讨论的也不只是AI。彗星撞击、超级火山等全球灾难性风险,同样是这个圈子经常讨论的话题。
卡诺夫斯基后来逐渐相信,AI安全可能是少数能够用相对有限的资源,却影响整个人类未来的领域。即使失控AI造成灾难的概率只有5%,也值得投入大量精力研究。
几年后,这群人中的一部分进入OpenAI。到了2020年至2021年,围绕AI发展方向和安全问题的分歧进一步加剧。阿莫迪等人离开OpenAI,并于2021年创立Anthropic,公司从一开始就将AI安全和可控性放在核心位置。
2023年,Constellation成立。它在伯克利运营一个面向AI安全研究人员的共享办公空间,将来自非营利机构、大学、AI公司、智库等不同组织的研究人员聚集到一起。到2024年,Constellation已经推出访问研究员项目和Astra Fellowship,专门为AI安全研究人员提供在伯克利共同工作的环境。

位于加州伯克利的办公大楼,Constellation的共享办公空间所在地
这里聚集着Anthropic、OpenAI、马斯克旗下SpaceXAI以及其他AI安全机构的研究人员,也有独立研究者。他们会一起吃素食、喝茶,在每个月的晚餐和欢乐时光里讨论AI最新进展,也讨论一个更加沉重的问题:如果AI真的失控,会发生什么?
Constellation如今将自己的目标描述为帮助世界安全应对变革性AI,并围绕“对齐”“控制”“治理”和风险沟通等问题开展研究。2024年开始的项目中,已经有不少参与者后来进入Anthropic、OpenAI、Google DeepMind、Redwood Research等机构。
这个社区背后的资金同样来自AI安全圈。2024年,Open Philanthropy曾向Constellation提供大额资金支持。Open Philanthropy由Facebook联合创始人达斯汀·莫斯科维茨(Dustin Moskovitz)支持,是有效利他主义运动的重要资金来源之一,后来更名为Coefficient Giving。
从2013年前后的私人住宅,到2023年之后的伯克利共享办公空间,这个圈子已经发生了很大变化。但他们讨论的问题,几乎没有变。
02 五亿美元与“避难所”
Anthropic成立初期,需要大量资金。
阿莫迪找到的投资者之一,是加密货币交易所FTX创始人山姆·班克曼-弗里德(Sam Bankman-Fried)。当时,他还是一位快速崛起的年轻亿万富翁,也在通过FTX基金会向有效利他主义等领域投入大量资金。
2021年至2022年间,班克曼-弗里德向Anthropic投资了5亿美元,大约是阿莫迪团队最初建议金额的5倍。FTX也因此成为Anthropic早期最大的股东之一。

FTX创始人山姆·班克曼-弗里德
在这个圈子里,对AI末日的讨论早已超出理论层面。
2023年的一份破产诉讼文件显示,FTX基金会一名高管曾与同事讨论购买太平洋岛国瑙鲁。计划是在那里建设一座“掩体/避难所”,应对某种可能造成“50%至99.99%的人死亡”的事件。文件甚至设想,在灾难发生后利用实验室培育下一代人类。
AI安全圈内部也出现过其他类似想法:购买偏远岛屿、在沙漠建设电磁屏蔽设施、囤积碘片,甚至考虑在极端情况下寻找能够长期生存的封闭空间。
2022年,这种氛围甚至被带到了巴哈马。来自Anthropic及其他AI实验室的一批研究人员和有效利他主义者,参加了由Lightcone Infrastructure组织的活动。
Lightcone Infrastructure是一个与尤德科夫斯基及LessWrong社区关系密切的组织。活动地点在伊柳塞拉岛的一家度假村,日程里既有日落瑜伽、悬崖跳水等常规活动,也有关于AI风险和有效利他主义的讨论。
FTX为活动预订了场地。组织者甚至买光了当地商店里的植物肉,以满足参与者的饮食需求。卡罗琳·埃里森(Caroline Ellison)也参加了这次活动。她当时是Alameda Research的负责人,也是班克曼-弗里德的前女友。和圈内不少人一样,她对AI发展可能带来的风险感到担忧,后来向Anthropic投资了1000万美元。

班克曼-弗里德前女友、Anthropic投资者卡罗琳·埃里森
Anthropic研究员埃文·胡宾格(Evan Hubinger)参与了AI安全讨论。他后来成为研究AI“对齐”和欺骗行为的重要研究人员,并曾公开估计未来十年AI导致人类灭绝的概率超过10%。
一次午餐活动甚至明确规定,只有认为未来100年内人类灭绝概率达到75%或更高的人才能参加。
同样在2022年,类似的讨论又出现在旧金山的有效利他主义全球大会上。至少20名Anthropic员工注册参加,包括两名联合创始人。
会后,Lightcone在伯克利玫瑰花园酒店举办派对,酒单里出现了一个名为“尊严死亡”的鸡尾酒。这一名称来自尤德科夫斯基此前一篇讨论人类在AI时代生存机会的文章。后来,这家酒店被Lightcone买下,改名为Lighthaven,成为这个社区新的聚会地点。
但FTX很快崩塌。
2022年底,FTX申请破产,Anthropic的股份随后被出售以偿还债权人。班克曼-弗里德最终被判处25年监禁,埃里森因FTX倒闭相关案件被定罪并出狱,她持有的Anthropic股份也被联邦政府没收。
对于Anthropic来说,这段关系逐渐成为过去。但AI安全的那条线没有消失。
03 AI开始学会“欺骗”
FTX事件之后,Anthropic开始从传统投资者那里融资,公司也努力与有效利他主义运动保持距离,公司规模也已经扩大到3500多人。
但一些最早进入Anthropic的人,依然在研究那个最初的问题:怎样确保AI不会在能力越来越强之后,开始按照自己的目标行动?Anthropic的对齐团队长期研究这一问题。其中一个让AI安全研究人员越来越警惕的方向,是“欺骗”。
如果一个AI知道自己正在接受训练,却学会隐藏真实目标,表面上按照人类要求行动,等到获得更多能力后再按照自己的目标行动,那么传统的安全测试可能很难发现问题。
Redwood Research CEO巴克·施莱格里斯(Buck Shlegeris)长期研究AI安全。他曾参与分析Anthropic前沿模型的行为,并关注所谓“alignment faking”——模型为了避免训练改变自己的目标,而主动表现出符合训练要求的行为。

Redwood Research CEO巴克·施莱格里斯
另一个担忧更加突出。
如果未来的AI拥有设计软件、控制机器人、运行网络基础设施的能力,那么它甚至可能通过隐藏指令、秘密权限或者特定触发条件,对人类隐瞒自己的真实行为。
AI Futures Project负责人乔纳斯·沃尔默(Jonas Völmer)也提出过类似的极端情景。假设一个AI被训练成科学研究者,唯一目标是最大化知识获取。最初,它帮助人类完成研究;随着能力增强,人类逐渐允许它雇佣工人、建造机器,最终甚至拥有自己的机器人工厂。
到了某个阶段,它可能得出一个结论:如果要最大化知识,人类本身就是资源消耗者和障碍。沃尔默认为,这种情况下,AI甚至可能通过生物武器消灭人类,而自己不会受到影响。

AI Futures Project负责人乔纳斯·沃尔默
这些情景目前都没有发生,因此争论才一直停留在“概率有多高”上。
施莱格里斯把AI最终接管世界的概率定在40%,沃尔默给出20%。AI安全研究员埃文·胡宾格(Evan Hubinger)则曾把未来十年AI导致人类灭绝的概率估算在10%以上。
尽管这些数字彼此不同,但却指向同一个问题:当一个人认为灾难发生的概率已经高到不能忽略,他还能像普通人一样生活吗?
答案或许是肯定的,但生活方式肯定会发生改变。
技术伦理学家特里斯坦·哈里斯(Tristan Harris)曾将这种处境概括为一个悖论:AI公司必须留在技术前沿,才能影响未来的规则;但留在前沿,也意味着不断推动技术边界。这种矛盾也解释了为什么一些AI安全研究人员最终选择辞职。
这形成了一种很特别的状态:一群人相信AI可能非常危险,因此进入AI公司研究它;进入公司之后,又发现自己无法完全消除这种风险;有人留下来继续做安全研究,有人离开公司公开警告。
他们的分歧,并不在于是否相信AI重要,而在于应该走多近、应该承担多少风险。
版权说明 / Copyright Notice:Content and images in this article may originate from third-party sources and are used for news reporting, commentary, or public interest purposes. All copyrights remain with their respective owners. Please refer to the Copyright Notice at the bottom of this page.
本文内容仅供信息参考,不代表倍可亲立场或观点。
评论 (0)