下一代训练范式是什么样的?
外来客 • 2026-08-19 20:09:24
声明:本文为对公开视频内容的摘要整理,
未经本站独立核实,可能与原视频存在出入,不代表本站立场、观点或建议;
观点与版权归原作者及原平台所有。
如涉及版权问题,请联系我们,核实后立即删除。
[ 免责声明 ]
(原标题:What does the next training paradigm look like?)
🧠 核心观点:RLVR 范式的局限与持续学习的必要性
- 当前 AI 实验室普遍押注于“可验证强化学习”(RLVR),即通过在数千个多样化环境中训练数百万个可验证任务来构建 AGI。
- 乐观者认为,通过扩大训练规模可以解决数据低效和缺乏持续学习等根本缺陷,正如自然语言处理领域通过算力投入解决基础问题一样。
- 然而,作者指出这种范式存在严重局限:模型在训练阶段样本效率极低(仅为人类的百万分之一),且依赖一次性训练成本摊销。
- 核心主张是,真正的智能需要“持续学习”(Continual Learning),即模型权重能根据部署中的实际经验进行更新,而非仅依赖上下文窗口中的即时学习。
- 作者认为,仅靠扩大上下文窗口(Context Window)来模拟长期记忆是不可扩展的,且不符合人类大脑通过压缩和整合知识来学习的机制。
⚖️ 关键论据:可验证性与可重复性的矛盾
- 计算机使用(Computer Use)进展缓慢的原因:虽然该领域任务可验证(如订单是否送达),但缺乏“可磨性”(Grindability)。
- 并行模拟的障碍:强化学习需要大量并行 rollout 和确定性模拟器。在编码领域,可以复制容器环境;但在计算机使用领域,无法让数千个代理同时操作真实的 Amazon 或 Gmail,因为会被反机器人机制拦截。
- 环境构建成本:克隆 Slack、Gmail 等应用虽然可行,但目前劳动密集且难以扩展。
- 非平稳环境的挑战:许多高价值技能(如经商、诉讼、政治竞选)涉及真实世界交互,无法在数据中心内重建。这些环境具有非平稳性(Non-stationary),验证周期长达数月甚至数年,无法通过轻微扰动模型动作来隔离有效行为。
- 样本效率的必要性:由于大多数领域数据稀疏且独特,AI 必须从少量、非结构化、不可验证的真实世界交互中高效学习,这是当前 RLVR 范式无法覆盖的。
📊 技术路径:OPSD 与“做梦”机制
- 在线策略自蒸馏(OPSD):
- 原理:鼓励基础模型在解决真实问题时,做出与积累了长会话上下文的“教师模型”相同的预测。
- 优势:无需外部可验证奖励;提供比朴素 RL 更密集的逐 token 监督信号;比监督微调(SFT)更精准,仅提取达成结果所需的知识,避免覆盖原有能力。
- 对比:RL 通过集中更新相关参数来避免灾难性遗忘,OPSD 保留了这一特性,同时提高了样本效率。
- “做梦”(Dreaming)机制:
- 概念:AI 构建现实世界的模拟环境,在内部进行大量模拟训练以强化有效策略。
- 类比:类似 EfficientZero 在 Atari 游戏中通过内部模拟提高数据效率。
- 挑战:构建全球级模拟比模拟围棋更难,属于高度投机性想法。
- 潜力:若成功,将成为继预训练、RL、推理时计算之后的第四种扩展轴,允许模型在部署前针对特定用户场景进行预演。
🔮 未来展望:2027-2028 年的持续学习场景
- 阶段一:基础代理能力:RLVR 训练出能应对陌生问题、尝试不同策略并在受阻时迭代的代理。
- 阶段二:真实世界部署:代理被投入真实工作,处理分布外(Off-distribution)的项目。
- 阶段三:上下文扩展与反馈:有效上下文长度扩展至支持一周的协作时间。用户通过“点赞/点踩”或工作评审提供反馈。
- 阶段四:知识蒸馏与泛化:
- 若反馈积极,基础模型通过 OPSD 或“做梦”等技术,将会话中学到的知识蒸馏回权重。
- 模型开始在相邻领域变得更好,并在下一轮中进一步泛化。
- 最终状态:AI 的主要进步来源不再是发布前的训练,而是广泛部署后积累的经验。每次交互都会使 AI 更智能,因为它不仅从当前用户学习,还从全球所有用户的交互中学习。
- 资源浪费现状:目前实验室 30%-50% 的计算资源用于推理,但这些数据未用于改进模型,造成巨大浪费。部署中揭示的组织特定知识和错误模式是最有价值的学习信号,但当前架构无法有效利用。
👤 同一博主
瑞安·格林布拉特(Ryan Greenblatt):当AI能够自动化AI研究时会发生什么?
持续学习时代的八项预测
更智能的AI模型或致算力价格飙升10倍
从第一性原理推导广义相对论——亚当·布朗
格兰特·桑德森(Grant Sanderson):AI 证伪著名数学猜想,接下来怎么办?
AI 核心的数据黑洞
马基雅维利是历史上最被误解的思想家——阿达·帕尔默
莎拉·佩恩(Sarah Paine):普京与习近平为何无法摆脱地理制约
AI 越强,其在经济中的份额可能越小——Alex Imas 和 Phil Trammell
自底向上的芯片设计——Reiner Pope
🧭 类似博主
-
馬斯克:放棄火星?建100萬衛星?掌握耶穌級技術?馬斯克反常舉動曝光:人類與AI的決戰,其實已經打響
-
《人民的珍藏》第三季 寸图倾心筑通衢:两年磨一剑!重庆东站高铁站设计画稿惊艳亮相 中铁二院建筑师的匠
-
巨頭們不敢公開的最新實驗:為什麼科技越發達,失業率越高,人們越焦慮?比末日更可怕的未來正在逼近...
-
方舟子揭假:上海交大做谋财害命的基因疗法
-
美国“末日飞机”的工作原理
-
五角大楼UFO文件公开:外星文明实锤,还是一场精心设计的烟雾弹?
-
人死後,意識會留在更高維度嗎?宇宙是如何膨脹的?意識真的是這個宇宙中事件的一部分嗎?
-
人類明明贏了,為何卻笑不出來?揭開「人類對決AI機器人」的絕望真相,代價太恐怖了!
-
腦神經科學家懷疑:意識不存在於大腦! / 科學正在害怕什麼? / 單一世界觀讓「療癒」卡住了 | 青
-
元宇宙防骗指南
0 条评论
发表评论
请先 登录 后参与讨论。