Claude开始训练Claude了!
时薪4美元,干赢时薪150美元的人类研究员。
在Anthropic最新发布的研究中,Claude自己查论文、提方案、造数据、训练模型,一口气攻克了10类AI安全问题。
部分任务上,它交出的方案甚至比28名人类安全研究员更好。
更刺激的是,较弱的Claude已经开始反向参与训练更强的Claude。
AI「自己改进自己」的那一天,好像真的越来越近了…
4美元一小时,Claude跑赢人类研究员
在这篇题为《自动化研究员能够有效缓解AI对齐失败》的研究中,Anthropic直接把Claude送进了实验室。
具体而言,他们基于Claude Opus 4.8,搭建了一套名为AAR的自动化对齐研究员系统。
拿到一个具体的模型安全问题后,Claude会自己搜索相关论文,从中寻找可用方法,再提出新的训练方案、生成数据、微调模型,最后跑一遍安全和通用能力测试。
从提出假设到完成验证,一套较完整的AI研究闭环,就这样交到了Claude手里。
效果不好,方案扔掉;成绩有所提升,就沿着这个方向接着试。
0
评论 (0)