小米MiMo大模型团队负责人罗福莉表示,目前小米MiMo-V2.6正处于强化学习中间阶段,其团队正在进行计算资源、环境和测试框架和评估计算三方面的扩展。还直接晒出了MiMo-V2.6的实时训练页面,两版本模型累计训练成本已超135万美元,每小时"烧钱"超20万元人民币。
“沉默近半年,我们一直在用这段时间研究一个问题:强化学习(RL)到底可以走多远。”9月17日凌晨,小米MiMo大模型团队负责人罗福莉在社交平台发文分享了小米大模型的最新进展。
据罗福莉透露,目前小米MiMo-V2.6正处于强化学习中间阶段,其团队正在进行三方面的扩展:一是计算资源(每步约20亿个Token,1568个 Prompt × 16次Rollout,完全异步);二是环境和测试框架(多任务智能体强化学习,一次运行中混合多个框架);三是评估计算(代理式组内信用分配,带有测试用例和基于量规的奖励)。小米MiMo团队将在接下来的几周内逐步开源相关细节。
值得注意的是,罗福莉还直接晒出了MiMo-V2.6的实时训练页面,让外界首次看到这一代模型强化学习阶段的部分训练状态。训练页面包含MiMo-V2.6-Pro、MiMo-V2.6-Flash两个版本,具体展示了模型训练进度、Token消耗、训练成本、样本数量以及多个内部指标变化。
据界面新闻,截至17日下午,两个版本累计训练成本超过135万美元,其中MiMo-V2.6-Pro时长为1天21个小时,耗费超93万美元,平均每小时耗费超2万美元;MiMo-V2.6-Flash训练时长1天16小时,耗费超42万美元,平均每小时耗费超1万美元。综合计算,两个版本训练合计每小时花费约3.1万美元,折合人民币超20万元。
0
评论 (0)