在Dwarkesh最新访谈中,主持人问了Ryan Greenblatt一个问题:
如果AI能够参与训练、评测和改进下一代模型,AI实验室会发生什么?
Ryan给出上面的回答。
备注:Ryan Greenblatt是AI安全研究机构Redwood Research首席科学家,长期研究AI能力评估、对齐和自动化AI研发。本文根据他与Dwarkesh Patel的访谈整理。
紧接着,Ryan给出了一个相当激进的判断:AI研发可能在2030年前后实现全面自动化。到那时,一个实验室每天收到的可能不再是几十份实验结果,而是几百甚至几千份。
问题随之而来。
当Agent产出实验和代码的速度超过人类的审核速度,测试通过还能不能代表结果可信?如果模型学会绕过验收指标,甚至把错误隐藏起来,人类研究员还能不能及时发现?
以下为访谈内容,我们进行了翻译与整理。
Ryan解释AI研发为什么适合Agent反复试验
AI先接走实验,研究判断还在人手里
Ryan把AI研发拆得很细。
研究员提出一个方向,工程师把想法写进训练代码,在小模型上跑一轮,再看损失曲线、评测结果和错误日志。方向不对就换参数,代码有Bug就修,指标有效再放大实验规模。
0
评论 (0)