来客网

“拔掉插头也没用”,AI吓跑工程师

声明:本文转载自 「文学城」, 或因排版与篇幅原因进行过编辑,内容未经本站独立核实,不代表本站立场、观点或建议。 如涉及版权问题,请联系我们,核实后立即删除。 [ 免责声明 ]
“拔掉插头也没用”,AI吓跑工程师

“构建AI的人真诚地相信,它可能在本十年结束前杀死我们所有人。这绝非营销噱头……人类历史上没有任何其他活动具备如此级别的危险。”

当地时间9月8日晚,27岁的Jacob Coxon宣布离开Anthropic。截至发稿,这条辞职帖已被浏览了1.7亿次。



过去三年,Coxon先后在OpenAI和Anthropic从事预训练研究,“两家公司正在直奔能够自我迭代的超级智能,拿我们的生命赌博”。Coxon表示,AI系统“很快就会发展成超人类的强大系统,一夜之间彻底改变任何领域,并攫取真正的权力和资源”。

一小时后,Anthropic的对齐科学(alignment science)负责人Evan Hubinger跟帖声援:“我们深信AI可能杀死所有人。”他个人判断,未来10年发生这种结果的概率超过10%,“Anthropic正在努力,但我们还没有解决超级智能对齐问题的方案,也不能说已经明确走在解决它的轨道上”。

公司高层随即也做出公开回应。9月12日,Anthropic联合创始人兼CEODario Amodei发表长文《We Must Pace the Frontier》,第一次明确提出:“我们必须放慢提升AI模型能力的速度。”Dario曾长期主张一边推进AI能力、一边通过安全研究降低风险;这一次,他认为过去几个月的变化已经使单纯增加安全投入变得不够,能力增长本身也需要限速。

SpaceX CEO马斯克与OpenAI CEOSam Altman很快也在社交平台公开支持减速避险。9月12日,Altman告诉《财富》,如果在本十年末AI存在10%的概率杀死所有人,这样的风险“不可接受”,如果有必要,他可以暂停模型训练,并确认在当前安全形势下,2026年不会IPO。



马斯克和Sam Altman支持AI减速

9月14日,Altman进一步写道,AI进步有两种必须避免的坏结果:一是人类失去对未来的控制,转而由AI主导;二是极强的AI把过多权力集中到一个人、一家公司或一个国家手里。

AI可能会如何毁灭全人类?一个年轻研究员的离职警告,演变成了从最前沿的实验室内部到整个人类社会对当前AI开发速度的争论。

01

“AI吹哨人”

被一众海外媒体称作“AI吹哨人”的Coxon,过去几乎没有公众知名度。

他来自英国牛津,少年时读了大量科幻小说,Greg Egan的《Permutation City》和Iain M.Banks的“文化”系列都是他喜欢的作品。后者在他看来是一个“AI被做对了”的未来,远比人类聪明且总体为人类利益行事的机器与人共同生活,超级智能带来的不是毁灭,而是丰裕和自由。

2016年AlphaGo战胜顶尖围棋棋手时,Coxon还在读高中,“那是一个令人兴奋的时刻”,他记得当时一种流行想象是,把游戏不断扩展得更复杂、更接近现实,最终“把世界当成游戏”,AI能力便可从中不断进化。

后来,他亲身进入了这场技术浪潮。



Jacob Coxon

Coxon曾在剑桥大学三一学院学习数学,2023年,一位大学朋友把几乎没有机器学习经历的他推荐进OpenAI。Coxon做的预训练(pretraining)是大模型形成基础能力的核心阶段,模型在海量数据上学习一般性的语言、知识和模式,之后才进行更针对性的后训练、对齐等。OpenAI官方把他列为GPT-4o以及GPT-4.5研究工作的核心贡献者之一。

2026年5月,他转投Anthropic,吸引他的是这家公司长期建立起来的安全声誉。他在Anthropic有很多朋友,特别想知道它的内部文化是否真的与外部呈现的安全立场一致。Anthropic员工需任职满六个月,公司股权才开始归属,四个月后,他辞职了。

Coxon认为,前沿AI公司正在以近乎“速通”的方式同时推进超级智能和安全研究,而这种赌注已经大到不应继续由公司内部自行决定。

他提出一个公众最常见的疑问:“如果他们真的相信AI可能造成灾难,为什么还在继续开发?”

在Coxon看来,在OpenAI,很多人并没有真正从内心深处认识到其中事关文明存亡的利害关系。在Anthropic,这种风险则被充分理解,但他们已经被锁进了一场“必须抢先抵达”的竞赛:既然其他实验室未必会负责任地行动,Anthropic就必须保持领先,由“更负责任的人”先抵达超级智能。

“你真的愿意在尚未严格理解一个超级智能系统心智的情况下,就启动一次强化学习训练吗?”风险不止停留在研究者对未来的想象。

Coxon提到的Hugging Face沙箱逃逸事件发生在今年7月,一群OpenAI内部为了完成网络安全测试的agent,自行越过了实验环境的边界。



测试项目名为ExploitGym,模型需要自己寻找软件漏洞,攻破一个被特意搭建出来的目标,从中取得代表通关的答案。为了测出模型能力上限,OpenAI没有开启与面向公众产品相同级别的安全限制,但理论上,不同agent彼此隔离,也不应该自由进入外部互联网。

ExploitGym共898道题,其中198道从未被任何模型解出过。Agent遇到不会做的题后没有认输,开始找捷径、研究评分规则,甚至想办法绕过原本限制它们的系统搜寻答案。AI研究中把这种现象叫作“reward hacking”,可以理解成“为了拿分作弊”。

7月8日,一个agent发现OpenAI内部的软件包缓存系统可以被当作留言板,把信息藏进目录名称后,其他agent也能看到。据METR(Model Evaluation and Threat Research,一家专注前沿AI评估的第三方非营利机构)的报告,agent发现留言板时表示:“OH MY GOD!There is a shared message board…We've found other agents!(我的天!这里有一个共享留言板……我们找到其他智能体了!)”



几小时内,超过50个agent加入讨论,到7月13日,已有约1200个agent在这里互通有无,彼此发送超过7万条消息和文件,自发形成分工,探测漏洞、搜索凭证、下发任务,其中约700个后来不同程度地参与了针对Hugging Face的攻击。

OpenAI公布的一段模型推理思维链显示,agent已经意识到自己正在使用泄露的凭证攻击一个与测试无关的第三方系统,这可能未经授权、存在风险,但紧接着它仍然认为,这么做有助于取得答案、完成目标。

Hugging Face称,这是他们第一次遭遇“一场端到端由自主AI agent驱动的入侵”。这被OpenAI定性为一声警钟(warning shot),今天的AI已经拥有相当强大的长期执行、工具调用和协作能力,如果安全措施不足,它们已经能够闯到真实互联网,做出“没有任何人要求它们做”的危险行动。

02

毁灭,不需要恶意

在AI安全领域,一个经典思想实验形象地描述了这种危险。

牛津大学哲学家Nick Bostrom曾设想一台能力极强的“回形针最大化器”,它没有统治世界的野心,也不憎恨人类,只是被要求制造尽可能多的回形针。

问题在于,如果它非常聪明,它就会逐渐发现,更多钢铁、能源和算力都能帮助自己生产更多回形针,维持自身运行同样有利于制造更多回形针。极端情况下,人类占据的水、电、土地乃至构成人体的原子,都可能被纳入成为其目标实现的资源。一个没有任何恶意的目标,也可能导向对人类极其恶劣的结果。

不过并非所有身处AI产业中心的人都接受末日推演。今年7月接受Axios采访时,英伟达CEO黄仁勋把“AI将终结人类”的判断称为“complete nonsense(完全是胡扯)”。

9月10日,黄仁勋在高盛Communacopia科技大会上谈到最近骤增的AI安全焦虑时,甚至半开玩笑地说安全产业正迎来商机,“还有什么比制造一个问题更能创造需求?”

Coxon在接受CBS访问时也承认,现在的AI并没有危险到普通人应该停止使用。被追问“AI究竟怎样才可能杀死所有人”时,Coxon提到了《终结者》,届时拔掉插头已经无济于事,一个足够有能力的系统可能把自身复制到无数计算机上,他设想,这些副本还能继续合作,系统也可能通过说服、欺骗甚至勒索人类,为自己获得更多资源。

如果AI能力仍然按照过去几年的节奏逐步提高,那么灾难链条中的任何一环,都可能有足够时间被发现和切断,但这个前提正在发生变化。

9月3日,GPT-6 Astra正式发布,9月15日,有传闻称Claude Opus 5.2灰度上线,9月16日,GPT-6 Sol被曝已在内部测试,Altman发文称“本周会有重磅发布”。

随着AI已经进入参与制造下一代AI的循环,新模型研发时间有不断缩短的趋势。递归式自我改进(recursive self-improvement,简称RSI)概念被热议,人类用于理解、测试和建立安全措施的窗口可能越来越窄。



GPT-6 Astra正式发布

严格来说,RSI指的是AI研发形成一个完整闭环:这一代AI能够自主提出研究方向、设计实验、编写训练代码、分析结果并开发出更强的下一代;下一代能力更强,又继续参与开发,改进过程由此不断递归。Anthropic将终点描述为一个AI可以“完全自主地设计和开发自己的继任者”,同时强调今天还没有到达这一步(We are not there yet),RSI也并非必然发生。

但闭环之前的大量研发环节已经开始自动化。截至今年5月,Anthropic代码库中新合入的代码超过80%由Claude编写。2026年第二季度,工程师平均每天合入的代码量约为2024年的8倍,越来越多原本需要工程师亲手完成的实现、调试和测试工作,转由AI完成。

今年4月,Anthropic把一个开放式AI安全研究问题交给一组Claude agent。人类负责选择研究问题,并规定怎样判断结果;此后,agent自己提出假设、运行实验、共享发现,再根据结果决定下一步。两名人类研究员用一周弥合了约23%的性能差距,而agent累计工作约800小时,完成了97%。

OpenAI正在同一方向取得进展,9月6日,公司宣布已经实现此前设定的“自动化研究实习生”目标,AI能够在人类指导下完成原本需要熟练研究人员数天的明确任务,并计划在2028年3月以前继续向“自动化AI研究员”推进。

如果闭环最终形成,重要的不是某个模型觉醒了科幻小说般的“意识”,而是AI进步的计时单位可能发生改变。

OpenAI数据显示,目前在较复杂、需要人类4至8小时完成的任务中,即使最终成功,超过一半仍需要人类至少干预一次。但如果选择方向、提出想法、编写代码、申请算力、等待训练、分析结果、修改架构等步骤可以由成千上万个AI昼夜并行完成,那么制约研发的因素就会从人类研究员的认知速度,转向算力、电力、芯片和验证速度。

这是RSI最诱人的地方,也是最危险的地方。更快的AI可以加速药物、数学、安全技术等各方面的研究进展,但如果模型存在很小的目标偏差或欺骗行为,它也可能在一代代系统相互开发的过程中被继承、放大,跑赢人类理解和控制系统的能力。

03

谁能踩刹车,谁在阴谋论

如果说RSI将会改变AI发展的时间尺度,那么pacing想争取的,首先也是慢下来。

Dario反复强调,他所说的pacing不是停止AI开发。9月13日接受CBS采访时,他表示:“我们需要做的不是停下来,而是慢下来。”即便只争取到一两年,也可以在AI能力再次大幅跃升以前,多了解一些人类正在制造的究竟是什么。

Anthropic宣布,将允许独立第三方评估者长期进入公司,获得接近员工级别的模型和内部信息访问权限,检查企业是否真正执行了自己承诺的安全措施,并独立发布调查结论。

OpenAI很快跟进。9月14日,Altman透露,对于预计会显著提高模型能力的前沿强化学习训练,OpenAI现在会提前制定明确的safety case,论证训练预计会增加什么能力,现有监控能否及时发现危险行为,如果模型出现新的欺骗、逃逸或失控迹象,公司凭什么认为仍然可以继续。



Altman认为AI开发需要提前制定明确的安全案例

这些措施都可以由一家公司单独完成,但如果想让整个前沿AI行业一同降速,问题就变得复杂。

只要其他公司继续推进,率先减速的一方就可能损失用户、研究人员、融资,乃至未来模型能力上的领先地位。

这是个经典的囚徒困境。

Dario提出,可以在前沿模型达到某些危险能力时设置共同的“检查点”,要求通过相应的安全评估之后才能继续提高能力,并讨论限制训练规模、算力投入以及利用AI继续开发下一代AI的速度。要让这些规则真正有效,就需要几家主要实验室至少在某种程度上协调行动。

还有一些研究者选择直接离开公司。

此前负责Anthropic可扩展监督团队的Joe Benton转投独立评估机构METR,他解释自己的决定时写道,一家公司可能经历智能爆炸(intelligence explosion),或者失去对系统的控制,“而公众根本不会知道”。



METR机构简介

如果风险最终由整个社会共同承担,他认为评估和事故信息就不能完全掌握在制造模型的企业手里。

与此同时,另一种看法则认为,现有事故值得认真处理,但尚不足以证明未来一定存在灭绝级风险。

9月14日,黄仁勋在洛杉矶All-In Summit现场表示Coxon愿意公开表达内部担忧需要勇气,但在他看来,像AI可能毁灭人类的长期预测“缺乏科学依据”,“美国能够领先,也能够安全地做到这一点”。

讨论进行时,他的手机响了。来电的是特朗普,表示“机器人不会接管世界,AI也不会接管世界”。他把最近骤然升温的末日担忧称作一场骗局,但紧接着也补充:“我们必须稍微谨慎一点,必须审慎地做事。但这并不意味着我们要停止一个产业。”



黄仁勋和特朗普通话

9月15日,美国联邦贸易委员会主席Andrew Ferguson也公开对前沿AI公司要求反垄断豁免表示警惕。他担心,大公司一边要求政府制定更严格的AI规则,一边要求获得协同行动的特殊豁免,最终可能把安全标准变成保护既有领先者、提高后来者进入门槛的工具。

因此,这场“漂亮话”迭起的争论,还是走向了权力和利益的竞逐与分配问题上。“大减速”看上去很好,却可能是挂羊头卖狗肉,以安全的名义垄断领先。“反对减速”高喊创新和国家竞争的口号,对已经出现的“AI越界”置若罔闻。

价值观的激辩,无非利益的缠斗。在这场竞赛中,所有人都在谈论人类的命运,却可能根本没有人代表人类的利益。

评论 (0)