来客网

DeepSeek V4.1重回国产一哥

声明:本文转载自 「Popyard」, 或因排版与篇幅原因进行过编辑,内容未经本站独立核实,不代表本站立场、观点或建议。 如涉及版权问题,请联系我们,核实后立即删除。 [ 免责声明 ]
01

DeepSeek V4.1 Flash上线,跑分重回国产一哥!

而且这次,是完全重新训练的非对称模型新架构。

552B参数的MoE模型,采用了全新的Causal-Encoder-Decoder结构,输入和输出不对称,输入激活只有8B,输出激活16B。

这种架构成本显著低于已知的同尺寸模型,难怪这两天测试感觉速度飞快,原来不光是因为用的人少。

这次重新预训练、用了新的数据、强化学习后训练规模更大,训练过程还与新版DeepSeek Harness v0.1.5深度结合。

所以Flash打败自家Pro(除了知识容量),昨天还觉得离谱,今天一下子合理了起来。

0

评论 (0)