博主头像

下一代训练范式是什么样的?

外来客 • 2026-08-19 20:09:24

分享
𝕏 f
声明:本文为对公开视频内容的摘要整理, 未经本站独立核实,可能与原视频存在出入,不代表本站立场、观点或建议; 观点与版权归原作者及原平台所有。 如涉及版权问题,请联系我们,核实后立即删除。 [ 免责声明 ]

(原标题:What does the next training paradigm look like?)

🧠 核心观点:RLVR 范式的局限与持续学习的必要性

  • 当前 AI 实验室普遍押注于“可验证强化学习”(RLVR),即通过在数千个多样化环境中训练数百万个可验证任务来构建 AGI。
  • 乐观者认为,通过扩大训练规模可以解决数据低效和缺乏持续学习等根本缺陷,正如自然语言处理领域通过算力投入解决基础问题一样。
  • 然而,作者指出这种范式存在严重局限:模型在训练阶段样本效率极低(仅为人类的百万分之一),且依赖一次性训练成本摊销。
  • 核心主张是,真正的智能需要“持续学习”(Continual Learning),即模型权重能根据部署中的实际经验进行更新,而非仅依赖上下文窗口中的即时学习。
  • 作者认为,仅靠扩大上下文窗口(Context Window)来模拟长期记忆是不可扩展的,且不符合人类大脑通过压缩和整合知识来学习的机制。

⚖️ 关键论据:可验证性与可重复性的矛盾

  • 计算机使用(Computer Use)进展缓慢的原因:虽然该领域任务可验证(如订单是否送达),但缺乏“可磨性”(Grindability)。
  • 并行模拟的障碍:强化学习需要大量并行 rollout 和确定性模拟器。在编码领域,可以复制容器环境;但在计算机使用领域,无法让数千个代理同时操作真实的 Amazon 或 Gmail,因为会被反机器人机制拦截。
  • 环境构建成本:克隆 Slack、Gmail 等应用虽然可行,但目前劳动密集且难以扩展。
  • 非平稳环境的挑战:许多高价值技能(如经商、诉讼、政治竞选)涉及真实世界交互,无法在数据中心内重建。这些环境具有非平稳性(Non-stationary),验证周期长达数月甚至数年,无法通过轻微扰动模型动作来隔离有效行为。
  • 样本效率的必要性:由于大多数领域数据稀疏且独特,AI 必须从少量、非结构化、不可验证的真实世界交互中高效学习,这是当前 RLVR 范式无法覆盖的。

📊 技术路径:OPSD 与“做梦”机制

  • 在线策略自蒸馏(OPSD)
  • 原理:鼓励基础模型在解决真实问题时,做出与积累了长会话上下文的“教师模型”相同的预测。
  • 优势:无需外部可验证奖励;提供比朴素 RL 更密集的逐 token 监督信号;比监督微调(SFT)更精准,仅提取达成结果所需的知识,避免覆盖原有能力。
  • 对比:RL 通过集中更新相关参数来避免灾难性遗忘,OPSD 保留了这一特性,同时提高了样本效率。
  • “做梦”(Dreaming)机制
  • 概念:AI 构建现实世界的模拟环境,在内部进行大量模拟训练以强化有效策略。
  • 类比:类似 EfficientZero 在 Atari 游戏中通过内部模拟提高数据效率。
  • 挑战:构建全球级模拟比模拟围棋更难,属于高度投机性想法。
  • 潜力:若成功,将成为继预训练、RL、推理时计算之后的第四种扩展轴,允许模型在部署前针对特定用户场景进行预演。

🔮 未来展望:2027-2028 年的持续学习场景

  • 阶段一:基础代理能力:RLVR 训练出能应对陌生问题、尝试不同策略并在受阻时迭代的代理。
  • 阶段二:真实世界部署:代理被投入真实工作,处理分布外(Off-distribution)的项目。
  • 阶段三:上下文扩展与反馈:有效上下文长度扩展至支持一周的协作时间。用户通过“点赞/点踩”或工作评审提供反馈。
  • 阶段四:知识蒸馏与泛化
  • 若反馈积极,基础模型通过 OPSD 或“做梦”等技术,将会话中学到的知识蒸馏回权重。
  • 模型开始在相邻领域变得更好,并在下一轮中进一步泛化。
  • 最终状态:AI 的主要进步来源不再是发布前的训练,而是广泛部署后积累的经验。每次交互都会使 AI 更智能,因为它不仅从当前用户学习,还从全球所有用户的交互中学习。
  • 资源浪费现状:目前实验室 30%-50% 的计算资源用于推理,但这些数据未用于改进模型,造成巨大浪费。部署中揭示的组织特定知识和错误模式是最有价值的学习信号,但当前架构无法有效利用。

博主头像 👤 同一博主

查看该博主全部 15 篇

🧭 类似博主

0 条评论

发表评论

请先 登录 后参与讨论。