🌐 外来客网

大模型万亿参数曾是行业走的弯路

声明:本文转载自 「Popyard」, 或因排版与篇幅原因进行过编辑,内容未经本站独立核实,不代表本站立场、观点或建议。 如涉及版权问题,请联系我们,核实后立即删除。 [ 免责声明 ]
01

智谱创始人唐杰表示,单纯堆砌万亿参数是行业走过的弯路。他以GLM-5.3作为控制变量实验,证明在保持基座与753B参数不变的前提下,通过强化后训练即可实现显著能力跃升。参数量仅是Scaling的一个维度,未来突破需综合考量推理成本、MoE激活机制及后训练等多重变量。

智谱人工智能创始人唐杰19日在X平台发文,系统阐述其对Scaling Law的最新理解,并以GLM-5.3作为"控制变量实验"佐证这一判断。这篇帖子的发布,恰好回应了外界对智谱未训练全新基座模型的质疑。

唐杰在文中指出,参数量从来不是评估模型能力的唯一维度,数据规模、算力分配与推理部署条件同样不可或缺。他表示,GLM-5.3与上一代GLM-5.2共用相同基座、相同架构、相同的753B总参数与40B激活参数,差异仅在于增加了一个月的长时域环境训练与强化学习(RL)后训练——而由此带来的能力提升"并非微小"。在AA评测指数中,GLM-5.3获得60分,较GLM-5.2的53分提升7分。

这一实验结论的核心在于:当基座模型参数规模已足以承载足够的知识,额外的能力提升往往来自"拨动其他旋钮"——尤其是后训练阶段,而非继续堆砌参数。这一判断对当前整个AI行业如何分配训练资源,具有直接的参考价值。

0

评论 (0)